3,583 papers
arXiv:2610.12341 70 8 окт. 2026 г. PRO

Adversarial Heuristic Learning (AHL): агент улучшает свой код по итогам прогонов против соперников, веса модели не меняются

КЛЮЧЕВАЯ СУТЬ
Агент без единого изменения весов модели обошёл сотни программ, написанных людьми. Метод AHL (состязательное эвристическое обучение) позволяет поручить агенту довести до ума код, у которого есть измеримый счёт. Он сам гоняет проверки, сам читает результаты и сам чинит. Фишка: учится не модель, а код и заметки в рабочей папке. Агент читает реплеи (записи партий) и журналы запуска, находит общий узор в проигрышах и делает точечную правку. Если стало хуже, он откатывается к лучшей версии. Итог на 12 играх против 1 920 программ людей: первое место в 6 играх из 12.
Адаптировать под запрос
📋 Дайджест исследования

Контент доступен только для PRO подписчиков

Чтобы получить доступ к дайджесту этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Контент доступен только для PRO подписчиков

Чтобы получить доступ к концептам этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO
📖 Простыми словами

Контент доступен только для PRO подписчиков

Чтобы получить доступ к упрощённому объяснению этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с