3,583 papers
arXiv:2610.01415 81 1 окт. 2026 г. FREE

PoS (Progression of States): явное «состояние убеждений» агента вместо пересказа истории

КЛЮЧЕВАЯ СУТЬ
Проблема: к 50-му шагу агент уже не знает, какие факты ещё живы. Записал, что микроволновка открыта, потом закрыта, и в голове остались оба факта. Метод PoS позволяет вести долгие агентные задачи без потери картины мира и без хождения по кругу. Фишка: история хранит, что случилось, а не как всё выглядит сейчас, поэтому на каждом шаге агент переписывает короткий «паспорт ситуации». В паспорте записаны сущности, их состояния, цель и два списка пробелов: что неизвестно и что ещё сделать. Каждое обновление проверяет отдельный «контролёр», а диагностика застревания ловит топтание на месте и накладывает запрет на следующий ход.
Адаптировать под запрос
⚡

TL;DR

PoS — фреймворк для долгих агентных задач. На каждом шаге агент не просто копит историю действий, а переписывает короткий «паспорт ситуации»: что сейчас известно о мире, чего он ещё не знает и что ещё нужно сделать. Каждое обновление паспорта проверяет отдельный «контролёр». Отдельно система следит, не топчется ли агент на месте, и при застревании накладывает ограничения на следующие действия.

Главная боль длинных задач: агент к 50-му шагу уже не понимает, какие факты ещё актуальны. Он записал, что микроволновка открыта, потом закрыта, и в голове остались оба факта. Он повторяет одно и то же действие, ходит по кругу или собирает данные, которые ничему не помогают, пока бюджет шагов не кончится. Причина простая: история хранит что случилось, но не как всё выглядит сейчас. Сжатие истории часто делает хуже, потому что часть нужных деталей теряется.

Суть метода в трёх частях. Первая — паспорт ситуации: сущности, их состояния, связи, цель и два списка пробелов. Вторая — проверка каждого обновления паспорта на противоречия с самим собой и с последним наблюдением. Третья — диагностика застревания по двум осям и точечное «лекарство». Ось «как застрял»: стоит на месте, ходит по кругу или дрейфует в сторону. Ось «что заблокировано»: знание или действие.

🔬

Схема метода

ШАГ 1: Построить паспорт → Мир (сущности–состояния–связи, с уверенностью и источником)
                           + Цель + Пробелы знания + Пробелы достижения
ШАГ 2: Выбрать ОДИН активный пробел → действие выбирается под него
ШАГ 3: Выполнить действие → получить наблюдение
ШАГ 4: Черновик нового паспорта → Контролёр ищет противоречия
        (внутри паспорта и с наблюдением) → правка → фиксация
ШАГ 5: Здоровье: пробел не закрывается + нет прогресса / состояния повторяются?
        → если да, диагноз: Застыл / Круг / Дрейф  ×  заблокировано знание / действие
ШАГ 6: Ограничение на следующий ход (по диагнозу), пока здоровье не восстановится

В оригинале это несколько отдельных вызовов модели плюс числовые метрики в коде. В чате или файле инструкций те же шаги можно описать словами (см. шаблон).

🚀

Пример применения

Задача: Интернет-магазин на Битрикс. С 03:00 ночи часть оплат через ЮKassa падает. Вы запускаете Claude Code с доступом к логам и репозиторию. Вручную такая диагностика часто превращается в хождение по кругу: перечитали тот же лог, опять проверили тот же webhook.

Промпт:

Ты расследуешь инцидент. Работай по протоколу «Паспорт ситуации».

Цель: найти причину, почему с 03:00 МСК часть оплат через ЮKassa
не доходит до статуса «оплачен» в нашем магазине, и предложить фикс.
Критерий готовности: названа причина с подтверждающим доказательством
из логов или кода + описан фикс.

Протокол — на КАЖДОМ шаге:
1. Покажи «Паспорт»: сущности, их состояния (с уверенностью
   высокая/средняя/низкая и источником), связи, пробелы знания
   (что ещё не выяснено) и пробелы достижения (что ещё сделать).
2. Выбери ОДИН активный пробел и объясни выбор в одну строку.
3. Сделай одно действие под этот пробел.
4. После наблюдения напиши черновик нового Паспорта и проверь его:
   — нет ли двух несовместимых состояний у одной сущности;
   — не противоречит ли что-то последнему выводу из логов.
   Исправь и только потом зафиксируй.
5. Оцени здоровье: закрылся ли активный пробел или изменилась ли
   уверенность хоть в чём-то? Если 3 шага подряд нет — это застревание.
   Диагноз: Застыл / Круг / Дрейф; заблокировано: знание или действие.
6. При застревании следующий шаг подчиняется ограничению:
   Застыл → запрещено повторять последнее действие;
   Круг → запрещено повторять любое действие из цикла;
   Дрейф → вернись к активному пробелу, действия вне него запрещены;
   заблокировано знание → действие обязано дать новое различающее
   свидетельство; заблокировано действие → действие обязано изменить
   состояние хотя бы одной сущности.

Результат: Агент на каждом шаге будет выдавать компактный паспорт с двумя списками пробелов, одним выбранным пробелом и одним действием. Видна будет и строка с проверкой на противоречия. Если агент зациклится на одном логе, он сам напишет диагноз вроде «Круг, заблокировано знание» и сменит тактику, например пойдёт в другой источник данных. Итоговый ответ опирается на зафиксированные и подтверждённые записи паспорта, а не на смутную память о 40 предыдущих шагах.

🧠

Почему это работает

Слабость: длинная история смешивает старые факты, промежуточные догадки и устаревшие наблюдения. Модель каждый раз заново «выуживает» из неё текущую картину и может выудить неверную. Сжатие помогает не всегда: на сильных моделях с длинным контекстом пересказ часто теряет важное и бывает хуже сырой истории.

Сильная сторона: модель хорошо ведёт структурированные записи, сверяет два текста друг с другом и подчиняется явному ограничению («нельзя повторять X»). Если картина мира записана в одном месте и пересматривается на каждом шаге, ошибка видна сразу, а не копится.

Как метод это использует: паспорт заменяет «воспоминание» текущим состоянием. Разделение пробелов на «узнать» и «сделать» убирает смешение: агент не пытается действовать, пока не выяснил, и не копает бесконечно, когда пора действовать. Контролёр ловит собственные галлюцинации модели до того, как они попадут в решения. А диагноз застревания превращает расплывчатое «агент тупит» в конкретную команду.

Рычаги управления: - Окно застревания (в шаблоне «3 шага») → короче для дорогих действий, длиннее для шумных задач. - Один активный пробел → если агент разбрасывается, сузьте до одного. Если слишком узко, разрешите два. - Контролёр → пусть проверяет только добавленные и изменённые записи, это дешевле и в статье так и делается. - Уверенность и источник у каждого факта → убрав их, вы теряете возможность отличить проверенное от догадки. - Ограничения восстановления → можно добавлять свои под задачу, например «запрещено читать больше 200 строк лога за раз».

📋

Шаблон промпта


Ты ведёшь долгую задачу по протоколу «Паспорт ситуации». Решения принимаешь
ТОЛЬКО на основе актуального паспорта, а не на основе пересказа истории.



{цель}
Критерий готовности: {критерий_готовности}



  
    Сущности: {объекты и участники задачи}
    Для каждой — Состояние (естественным языком), уверенность
    (высокая/средняя/низкая), источник (шаг или наблюдение).
    Связи: Сущность→Сущность, Состояние→Состояние, Сущность→Состояние.
    Включай только то, что влияет на возможные действия,
    оценку результата или достижение цели.
  
   что ещё неизвестно или не подтверждено 
   чем текущее состояние отличается от цели 



Для каждого шага:
1. Покажи актуальный Паспорт.
2. ActiveGap = один самый ценный пробел сейчас. Объясни выбор в одну строку.
3. Выбери одно действие под ActiveGap. Если действует  — подчинись ему.
4. Получи наблюдение.
5. Составь ЧЕРНОВИК нового Паспорта. Затем -проверка.



Проверь только новые или изменённые записи:
— Внутреннее противоречие: у одной сущности несовместимые состояния?
— Внешнее противоречие: запись расходится с последним наблюдением
  или другими свидетельствами?
— Есть ли у вывода источник? Выводы без источника помечай «низкая уверенность».
Перечисли найденные проблемы, исправь черновик по свидетельствам,
только потом зафиксируй Паспорт.



После каждого шага ответь:
— Закрылся ли ActiveGap или сильно изменилась уверенность в чём-то важном?
— Повторяются ли состояния мира, относящиеся к ActiveGap?
Если за последние {окно} шага(ов) прогресса нет — объяви «Застревание».



Диагноз по движению:
  Застыл — мир не менялся → запрещено повторять последнее действие.
  Круг — состояния и действия повторяются по циклу → запрещено повторять
         действия из цикла.
  Дрейф — мир меняется, но ActiveGap не продвигается → вернись к ActiveGap;
          действия вне него запрещены.
Диагноз по пробелу (какой тип застрял больше):
  Знание → следующее действие обязано дать НОВОЕ различающее свидетельство.
  Действие → следующее действие обязано изменить состояние хотя бы одной
             сущности, важной для цели.
Выбери один пункт из каждого диагноза и объедини ограничения.
ActiveGap не меняй. Ограничение снимается, когда прогресс возобновился.



Каждый шаг: Паспорт → ActiveGap → Действие → Проверка Контролёра → Здоровье.
В конце — итог со ссылкой на записи паспорта, подтверждающие вывод.

Что подставлять: {цель} и {критерий_готовности} — чем конкретнее, тем лучше агент определяет пробелы. {окно} — обычно 3. В {объекты и участники задачи} пишите то, что реально есть в вашем домене: сервисы и логи для разработки, гипотезы и клиенты для расследования.

🚀 Быстрый старт — вставь в чат:

Вот шаблон протокола «Паспорт ситуации». Адаптируй под мою задачу: [твоя задача].
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит про цель, критерий готовности, какие сущности участвуют и какие действия доступны агенту. Это нужно, чтобы паспорт был про реальные объекты задачи, а ограничения восстановления опирались на реально существующие действия.

⚠️

Ограничения

⚠️ Нужна инженерия для полной версии: в оригинале паспорт, контролёр, подсчёт «здоровья» (расстояния между состояниями, пороги, окна) и ограничения реализованы кодом с несколькими вызовами модели на шаг. В чате или файле инструкций вы получаете словесную версию. Она проверена не так, как оригинал, и числовые пороги заменены вашим «на глаз».

⚠️ Цена: паспорт и проверка на каждом шаге — это больше токенов и времени. Для коротких задач в пять-десять шагов затея не окупится.

⚠️ Контролёр — та же модель: он проверяет работу модели, а не независимого эксперта. Если модель ошиблась и сама этого не видит, проверка может не сработать.

⚠️ Эффект неравномерный: проверка согласованности сильнее всего помогла в задачах с физическим миром и многими объектами. В диагностических задачах она добавила совсем мало, там важнее оказалось восстановление после застревания.

⚠️ Нет универсальной победы над сырой историей: несколько методов сжатия контекста часто проигрывали простой полной истории. Если задача короткая и модель держит длинный контекст, начните с простого.

🔍

Как исследовали

Команда проверила метод на четырёх бенчмарках двух типов. ALFWorld и LOCA-Bench — задачи на исполнение: нужно довести мир до нужного состояния. RCA-100 и ClinDiag — диагностика: нужно собирать улики и выбирать между гипотезами. Всё прогнали на трёх моделях при температуре 0. Сравнивали с пятью подходами: сырая история, ACON и PACE (разные способы сжатия истории), HiAgent (иерархическая память по подцелям) и LongHorizon-Harness (аудируемая запись состояния задачи).

Первая находка — для практики. Умная организация истории не гарантирует выигрыша у сырой. PACE на LOCA-Bench просел на 24–28 пунктов против полной истории, а на ClinDiag с одной из моделей ни один метод управления контекстом не обогнал её. Информация теряется при сжатии, а современные модели и так читают длинное.

Вторая: PoS оказался лучшим на всех четырёх бенчмарках со всеми тремя моделями. Относительный прирост над сильнейшим соперником доходил до 22,7% на ALFWorld и 37,9% на RCA-100, а на LOCA-Bench был скромнее, до 7,5%.

Третья — абляции, самая полезная для практики. Без проверки согласованности результат падает на 14,9 пункта на ALFWorld и 11,8 на LOCA-Bench: там много объектов и состояний, ошибки накапливаются. Без диагностики застревания и восстановления просадка 4,9–6,8 пункта на RCA-100 и 2,7–4,0 на ClinDiag. Логика такая: явный паспорт нужен, но без проверки и без выхода из ступора он не спасает. Часть анализа (паттерны застревания, рост контекста, расход токенов) в доступной версии текста обрезана, поэтому о ней не судим.

💡

Адаптации и экстраполяции

🔧 Техника: паспорт в файл → переживает сессии и сжатие контекста

Добавьте в CLAUDE.md / AGENTS.md: «Паспорт ситуации хранится в файле PASSPORT.md. После каждого значимого шага перезаписывай его целиком, а не дополняй. Перед любым действием читай его». Так паспорт не потеряется, если агент сожмёт или обнулит контекст. Это моё удобное применение метода, в статье паспорт хранится в контексте агента.

🔧 Техника: убрать «источник и уверенность» → короче паспорт

Для простых задач оставьте только состояние и цель. Вы теряете возможность отличать проверенное от догадки, зато экономите токены.

Экстраполяция: независимый контролёр. Это моя идея, в статье не проверялась: чтобы снять ограничение «контролёр — та же модель», отдайте проверку другой модели или новому чату.

Ты — аудитор. Ниже Паспорт ситуации, обновлённый агентом, и последнее
наблюдение. Найди: (1) несовместимые состояния у одной сущности,
(2) записи, противоречащие наблюдению, (3) выводы без источника.
Верни список проблем, ничего не исправляй.

Паспорт: {паспорт}
Наблюдение: {наблюдение}
🔗

Ресурсы

  • Название работы: Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States (PoS — Progression of States)
  • Авторы: Yu Luo, Jiamin Jiang, Yimin Zuo, Xidao Wen, Rongchen Gao, Yongqian Sun, Shenglin Zhang, Guiyang Liu, Cheng Zhang, Fang Situ, Qi Zhou, Dan Pei
  • Организации: Nankai University, Alibaba Group, Tsinghua University
  • Проект: https://luoyu100.github.io/projects/progression-of-states/project/
  • Код: https://github.com/luoyu100/PoS
  • Связанные работы из статьи: ReAct, ACON, PACE, HiAgent, LongHorizon-Harness, ReflAct, StateAct; бенчмарки ALFWorld, LOCA-Bench, RCA-100, ClinDiag.

📋 Дайджест исследования

Ключевая суть

Проблема: к 50-му шагу агент уже не знает, какие факты ещё живы. Записал, что микроволновка открыта, потом закрыта, и в голове остались оба факта. Метод PoS позволяет вести долгие агентные задачи без потери картины мира и без хождения по кругу. Фишка: история хранит, что случилось, а не как всё выглядит сейчас, поэтому на каждом шаге агент переписывает короткий «паспорт ситуации». В паспорте записаны сущности, их состояния, цель и два списка пробелов: что неизвестно и что ещё сделать. Каждое обновление проверяет отдельный «контролёр», а диагностика застревания ловит топтание на месте и накладывает запрет на следующий ход.

Принцип работы

Агент не вспоминает, а читает актуальный паспет. Точнее, паспорт, а не пересказ 40 предыдущих шагов. Цикл простой: 1. Выбрать один активный пробел. 2. Сделать одно действие под него. 3. Написать черновик нового паспорта. 4. Контролёр ищет противоречия внутри паспорта и с последним наблюдением. 5. Правка, потом фиксация. Пробелы делятся на «узнать» и «сделать»: агент не действует вслепую и не копает бесконечно, когда пора действовать. Если прогресса нет, ставится диагноз по двум осям. Первая ось: Застыл, Круг или Дрейф. Вторая ось: заблокировано знание или действие. Каждому диагнозу соответствует жёсткий запрет. Это как штурман, который не просит «ехать лучше», а говорит: «на этот перекрёсток больше не сворачиваем».

Почему работает

Длинная история смешивает старые факты, догадки и устаревшие наблюдения. Модель каждый раз заново выуживает из неё текущую картину и может выудить неверную. Сжатие истории не спасает: пересказ теряет нужные детали, и на сильных моделях с длинным контекстом он часто хуже сырой истории. Модель при этом хорошо ведёт структурированные записи, сверяет два текста и подчиняется явному «нельзя повторять X». Когда картина мира лежит в одном месте и пересматривается каждый шаг, ошибка видна сразу, а не копится до 50-го шага. Расплывчатое «агент тупит» превращается в конкретную команду: «Круг, заблокировано знание, ищи новое свидетельство». Уверенность и источник у каждого факта нужны, чтобы отличать проверенное от догадки. Контролёр проверяет только новые и изменённые записи, так дешевле.

Когда применять

Долгие задачи агента → расследование инцидентов, отладка по логам и коду, исследование с десятками шагов → особенно когда агент перечитывает один и тот же лог и проверяет одно и то же по кругу. Помогает и в задачах с физическим миром и многими объектами: там проверка согласованности дала больше всего. НЕ подходит для коротких задач в 5-10 шагов: паспорт и проверка съедят токены и время, а выгоды не будет. Если модель и так держит длинный контекст, начните с простой полной истории. Контролёр здесь та же модель, и свою слепую зону она может не заметить. В чате вы получаете словесную версию без числовых порогов оригинала, она проверена слабее. В диагностических задачах проверка согласованности добавила мало, там важнее оказалось восстановление после застревания.

Мини-рецепт

1. Задай цель и финиш: одной фразой, что искать, и по какому признаку задача закончена. Чем конкретнее, тем лучше агент найдёт пробелы.
2. Заведи паспорт: сущности (сервисы, логи, гипотезы), их состояния, уверенность (высокая/средняя/низкая), источник и связи. Пиши только то, что влияет на действия или цель.
3. Раздели пробелы на два списка: «что неизвестно» и «что ещё сделать».
4. Выбери один активный пробел: агент объясняет выбор одной строкой и делает одно действие под него.
5. Включи контролёра: после наблюдения агент пишет черновик паспорта и ищет двойные состояния у одной сущности. Ещё он сверяет черновик с последним выводом и помечает выводы без источника как «низкая уверенность».
6. Проверяй здоровье: 3 шага подряд ни пробел не закрылся, ни уверенность не изменилась? Это застревание. Для дорогих действий окно сократи, для шумных задач увеличь.
7. Назови диагноз и наложи запрет: Застыл: нельзя повторять последнее действие. Круг: нельзя повторять действия из цикла. Дрейф: вернись к активному пробелу. Заблокировано знание: нужно новое различающее свидетельство. Заблокировано действие: нужно изменить состояние хоть одной сущности.
8. Добавь свои запреты под задачу: например, Запрещено читать больше 200 строк лога за раз.
9. Быстрый старт: вставь шаблон в чат и напиши Адаптируй под мою задачу: [задача]. Задавай вопросы, чтобы заполнить поля.

Примеры

[ПЛОХО] : Найди, почему с 03:00 часть оплат через ЮKassa падает. Смотри логи и код. Результат: агент перечитывает один лог, снова проверяет то же уведомление от ЮKassa (webhook) и к 40-му шагу путает, что уже проверено.
[ХОРОШО] : Ты расследуешь инцидент по протоколу «Паспорт ситуации». Цель: найти причину, почему с 03:00 МСК часть оплат через ЮKassa не доходит до статуса «оплачен». Готово, когда названа причина с доказательством из логов или кода и описан фикс. На КАЖДОМ шаге: 1) покажи Паспорт: сущности, состояния, уверенность, источник, пробелы знания и пробелы достижения. 2) Выбери ОДИН активный пробел. 3) Сделай одно действие под него. 4) Напиши черновик Паспорта и проверь его на противоречия с последним выводом из логов. 5) Если 3 шага нет прогресса, дай диагноз (Застыл / Круг / Дрейф; заблокировано знание или действие) и подчинись запрету: нельзя повторять действия из цикла. Результат: на каждом шаге компактный паспорт, один пробел и одно действие. Зациклился на одном логе? Агент сам пишет «Круг, заблокировано знание» и идёт в другой источник. Итог опирается на подтверждённые записи паспорта, а не на смутную память о 40 шагах.
Источник: Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States
ArXiv ID: 2610.01415 | Сгенерировано: 2026-10-05 19:51

Проблемы LLM

ПроблемаСутьКак обойти
В долгой задаче модель путает старые и актуальные фактыИстория шагов хранит, что случилось. Но не хранит, как всё выглядит сейчас. К 50-му шагу в ней лежат и «открыто», и «закрыто». Модель каждый раз заново выуживает картину из истории. Может выудить устаревшую. Страдают любые многошаговые задачи: отладка, исследование, работа с файламиВеди отдельную запись «что известно сейчас». Переписывай её на каждом шаге, а не дописывай. Решения принимай по ней, а не по пересказу истории. См. метод «Паспорт ситуации»
Агент топчется на месте и не замечает этогоАгент повторяет одно действие, ходит по кругу или собирает данные, которые не продвигают к цели. Сам он этого не видит. Бюджет шагов уходит впустую. Просьба «не зацикливайся» почти не помогаетВведи явную проверку прогресса после каждого шага. При застревании ставь конкретный запрет на следующий ход. См. метод «Диагноз застревания»

Методы

МетодСуть
Паспорт ситуации — текущее состояние вместо историиНа каждом шаге модель пишет короткий «паспорт»: 1) объекты задачи и их состояние, у каждого уверенность (высокая/средняя/низкая) и источник; 2) связи между объектами; 3) цель; 4) два списка пробелов: «что ещё не выяснено» и «что ещё нужно сделать». Затем модель выбирает ОДИН активный пробел и делает действие только под него. После наблюдения она пишет черновик нового паспорта. Потом сверяет его: нет ли двух несовместимых состояний у одного объекта и не расходится ли запись с последним наблюдением. Исправляет, и только потом фиксирует. Выбери ОДИН активный пробел. Сначала черновик паспорта, потом проверка, потом фиксация. Почему работает: картина мира лежит в одном месте и пересматривается каждый раз. Ошибка видна сразу и не копится. Модель хорошо ведёт структурированные записи и сверяет два текста. Уверенность и источник отделяют проверенное от догадки. Когда да: задачи от ~15 шагов, много объектов, физический мир или код. Когда нет: короткие задачи на 5–10 шагов, лишние токены не окупятся. Слабое место: проверку делает та же модель. Если она не видит свою ошибку, проверка не сработает
Диагноз застревания — расплывчатое «тупит» превращается в запретПосле каждого шага спроси: закрылся ли активный пробел, изменилась ли уверенность хоть в чём-то? Если 3 шага подряд нет, это застревание. Поставь диагноз по двум осям. Как застрял: «Застыл» (ничего не меняется), «Круг» (действия повторяются циклом), «Дрейф» (мир меняется, но цель не ближе). Что заблокировано: знание или действие. Каждому диагнозу соответствует запрет. Застыл: нельзя повторять последнее действие. Круг: нельзя повторять действия из цикла. Дрейф: вернись к активному пробелу, действия вне него запрещены. Знание: действие обязано дать новое различающее свидетельство. Действие: оно обязано изменить состояние важного объекта. Застревание = нет прогресса {N} шагов. Выбери по одному пункту из каждой оси и объедини запреты. Почему работает: модель хорошо подчиняется явному запрету «нельзя X». Размытое «пробуй иначе» она игнорирует. Настройка: окно 3 шага. Короче для дорогих действий, длиннее для шумных задач. Можно добавлять свои запреты, например «не читать больше 200 строк лога за раз». Ограничение снимай, когда прогресс вернулся

Тезисы

ТезисКомментарий
Разделяй «что узнать» и «что сделать»Если смешать эти два списка, агент ведёт себя плохо. Либо действует, не выяснив главного. Либо копает бесконечно, когда пора действовать. Два отдельных списка пробелов снимают путаницу. Один выбранный пробел на шаг держит фокус. Применяй: в запросе для долгой задачи требуй два списка: «пробелы знания» и «пробелы достижения цели». Если агент разбрасывается, оставь один активный пробел. Если слишком узко, разрешай два
📖 Простыми словами

Beyond Memory: Harnessing Long-HorizonAgentswith Explicit Belief States

arXiv: 2610.01415

AI-агенты на длинных дистанциях тупеют не от недостатка ума, а от информационной каши. Когда задача требует десятков шагов, агент без разбора валит в контекст гипотезы, ошибки и старые логи. Модель захлёбывается в этой простыне, начинает путать было и стало, после чего уверенно скатывается в галлюцинации. Банальное сжатие контекста не спасает: при пересказе нейронка стабильно теряет критические детали.

Это как расследовать сложное дело и вместо краткой сводки каждый час перечитывать все 500 страниц протоколов с самого начала. Формально память работает, но на сотом шаге следователь начисто забывает, что алиби подозреваемого уже проверили, и идёт опрашивать его по второму кругу. В итоге агент просто топчется на месте, бесконечно открывая один и тот же файл.

Фреймворк PoS выкашивает эту проблему через три инструмента: паспорт ситуации, внешний контролёр и детекцию застревания. На каждом шаге агент не копит простыню логов, а начисто переписывает короткую карточку: что уже известно, чего не знаем и куда копать дальше. Контролёр отсекает галлюцинации в этой карточке, а система мониторинга циклов рубит повторные действия на корню, если агент начинает буксовать.

Тестировали на синтетике, но подход жизненно необходим в любом сложном продакшене — от DevOps-траблшутинга до написания тяжелого кода. Когда в три часа ночи падают оплаты через ЮKassa, обычный ассистент потратит все токены на хождение кругами вокруг одного вебхука. С явным состоянием мира он локализует сбой за несколько шагов без бесполезного зацикливания.

Короче: хватит уповать на бездонное контекстное окно — оно превращает агентов в забывчивых идиотов. Сырая история действий — это тупик, сложным агентам нужен жесткий внешний учет текущих фактов. Кто первым внедрит контроль состояний, получит автономные системы, реально решающие задачи бизнеса. Остальные продолжат жечь бюджет, пока их сетка в десятый раз перечитывает один лог.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с