3,583 papers
arXiv:2608.21265 78 21 авг. 2026 г. FREE

Memory-Augmented Compression: краткая схема рассуждения вместо примера-образца — секрет короткого, но точного ответа

КЛЮЧЕВАЯ СУТЬ
Просишь модель отвечать короче — она режет рассуждение на середине. Выдаёт промежуточное число за финальный ответ, а это и есть обрыв логики. Метод позволяет получать короткие точные ответы на повторяющихся задачах без потери критического шага. Вместо полного примера-решения модели дают сжатую схему — тип задачи, критическая операция, частая ошибка. Парадокс: такой чек-лист работает лучше полного примера-решения (few-shot).
Адаптировать под запрос

TL;DR

Когда просишь модель отвечать короче, она часто обрывает рассуждение на полпути и выдаёт промежуточный результат за финальный ответ. Метод решает это так: перед тем как просить короткий ответ, модели дают не полный пример решения, а сжатую выжимку — какие переменные важны, какая операция критична, что нельзя забыть.

Исследователи заметили конкретную боль: если сжать цепочку рассуждений (Chain-of-Thought), точность рушится — модель, например, считает общее количество карточек, но забывает вычесть использованные, и выдаёт 42 вместо правильных 30. Причина не в том, что модель "меньше думает" — она теряет именно контрольные точки: шаги, которые нельзя пропустить, но которые не видны в сжатом виде.

Метод даёт модели заранее краткую абстрактную схему: тип задачи + критическая операция + типичная ошибка. Это работает как чек-лист, а не как образец для копирования — и, что удивительно, работает лучше, чем полный пример решения (few-shot).


🔬

Схема метода

ШАГ 1 (заранее, один раз): Вытащить из решённых примеров абстрактную схему
   → тип задачи, ключевые переменные, критическая операция, частая ошибка

ШАГ 2 (при новом запросе): Вставить релевантную схему в промпт + просьба отвечать кратко
   → модель рассуждает по шаблону, но короче

Оба шага можно выполнить в одном промпте — просто заранее сформулировать схему и вставить её вместе с задачей.


🚀

Пример применения

Задача: Считаешь юнит-экономику партии товара на Wildberries — сколько реально заработаешь с продажи, учитывая закупку, комиссию площадки и логистику. Модель часто "радостно" называет выручку и забывает вычесть расходы.

Промпт:

Вот схема для задач на расчёт прибыли:
- Ключевые переменные: выручка, закупочная цена, комиссия площадки, логистика
- Критическая операция, которую нельзя пропустить: 
  Прибыль = Выручка − (Закупка + Комиссия + Логистика)
- Частая ошибка: остановиться на выручке и назвать её "прибылью"

Реши задачу по этой схеме. Отвечай коротко — только итоговое число и краткий расчёт, без длинных пояснений.

Задача: продал 100 футболок по 1200 руб. Закупка — 400 руб/шт, 
комиссия Wildberries — 20%, логистика — 60 руб/шт. Сколько чистой прибыли?

Результат: Модель выдаст короткий расчёт (2-4 строки), но пройдёт все вычеты по порядку — выручка, закупка, комиссия, логистика — и не остановится на промежуточной цифре как на финальном ответе.


🧠

Почему это работает

Модель, когда её просят быть короче, срезает цепочку рассуждений там, где первое похожее на ответ число появляется — и выдаёт его как финал. Это и есть "коллапс рассуждения" при сжатии.

Зато модель отлично считывает и следует явной структуре, если её дать заранее в контексте. Обработка контекста (то, что уже написано в промпте) для модели гораздо "дешевле", чем генерация нового текста по шагам.

Метод использует эту разницу: вместо того чтобы заставлять модель самой заново выстраивать всю логику по шагам (дорого и хрупко при сжатии), ей дают готовый скелет рассуждения — и она просто "прошивает" через него, не теряя критический шаг.

Рычаги управления: - Уровень абстракции подсказки → более общая схема для разных задач одного типа, более конкретная — для узкой задачи - Количество схем-примеров → не увеличивай без нужды: избыток подсказок в контексте (больше 5-10) ухудшает точность, особенно на сложных задачах - Summary vs полный пример → всегда выбирай краткую выжимку, а не полное решение целиком — это ключевая деталь, которая даёт основной эффект


📋

Шаблон промпта

Вот схема для задач типа «{тип_задачи}»:
- Ключевые переменные: {переменные}
- Критическая операция, которую нельзя пропустить: {формула_или_шаг}
- Частая ошибка при сжатом ответе: {типичная_ошибка}

Реши задачу по этой схеме. Отвечай кратко, но обязательно 
выполни критическую операцию до конца.

Задача: {текст_задачи}

Подставляй: {тип_задачи} — категория задач, с которыми часто работаешь (расчёт бюджета, юридический чек-лист, план проекта); {переменные} — что вводится в расчёт; {формула_или_шаг} — то самое действие, которое модель обычно пропускает; {типичная_ошибка} — что она обычно путает вместо финального ответа.

🚀 Быстрый старт — вставь в чат:

Вот шаблон для точных коротких ответов на однотипные задачи. 
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какой у тебя тип задачи повторяется и какую ошибку модель обычно допускает при коротких ответах — потому что именно это определяет содержание схемы. Дальше она сама заполнит шаблон под твою задачу.


⚠️

Ограничения

⚠️ Избыток подсказок вредит: если добавить слишком много схем-примеров сразу, точность падает вместо роста — особенно на сложных задачах. Держи 1-3 релевантные схемы, не больше.

⚠️ Полный пример решения работает хуже схемы: если вместо краткой выжимки вставить целый пример-решение (few-shot) — эффект будет отрицательным. Это не "дай пример", это "дай чек-лист".

⚠️ Нужна повторяемость задач: метод раскрывается на однотипных, повторяющихся запросах (расчёты, задачи с чёткой структурой). Для разовой творческой задачи эффект слабый — схему просто не из чего строить.


🔍

Как исследовали

Команда протестировала метод на математических задачах (GSM8K, MATH), логических (BBH) и научных вопросах (MMLU-Sci) на моделях Qwen2.5-7B, LLaMA-3.1-8B и через API (DeepSeek, o4-mini). Сравнивали обычный длинный CoT, агрессивно сжатый CoT (Chain-of-Draft) и сжатый CoT + память.

Сжатие само по себе роняло точность драматично — иногда на 20-30 пунктов. Добавление краткой схемы восстанавливало почти всю потерянную точность, при этом ответ оставался в разы быстрее полного рассуждения.

Самое любопытное — отдельный тест форматов подсказки: полный пример решения и длинная цепочка рассуждений ухудшали результат по сравнению с базовой линией, а краткая абстрактная выжимка давала ощутимый прирост. Это прямое доказательство: работает не "больше контекста", а именно правильный тип контекста — сжатая структура, а не демонстрация.


📋 Дайджест исследования

Ключевая суть

Просишь модель отвечать короче — она режет рассуждение на середине. Выдаёт промежуточное число за финальный ответ, а это и есть обрыв логики. Метод позволяет получать короткие точные ответы на повторяющихся задачах без потери критического шага. Вместо полного примера-решения модели дают сжатую схему — тип задачи, критическая операция, частая ошибка. Парадокс: такой чек-лист работает лучше полного примера-решения (few-shot).

Принцип работы

Модель дорого думает по шагам, но дешево читает готовую структуру. Дай ей скелет рассуждения заранее — она просто пройдёт по нему, не срезая углы. Это как выдать студенту не готовое решение, а список нужных формул — применять их придётся самому, но забыть формулу уже не получится.

Почему работает

Модель срезает рассуждение там, где первое похожее на ответ число появилось — и выдаёт его как финал. Пример из исследования: считает общее число карточек, забывает вычесть использованные — 42 вместо правильных 30. Читать готовую структуру в контексте для модели дешевле, чем строить новую логику с нуля — вот почему схема-подсказка держит точность там, где просьба «думай короче» её теряет.

Когда применять

Повторяющиеся расчётные задачи → бюджеты, юнит-экономика, юридические чек-листы — везде, где есть один критический шаг, который легко пропустить. Особенно ценно, когда нужен короткий ответ без длинных пояснений, но с гарантией точности. Не подходит для разовых творческих задач — схему просто не из чего строить.

Мини-рецепт

1. Собери схему: возьми 3-5 решённых похожих задач, вытащи тип задачи, ключевые переменные, критическую операцию и частую ошибку.
2. Вставь схему в промпт: перед текстом задачи, как чек-лист — не как образец полного решения.
3. Попроси короткий ответ: прямо укажи «отвечай кратко, но выполни критическую операцию до конца».
4. Не перегружай контекст: держи 1-3 схемы максимум — больше 5-10 подсказок разом портят точность, особенно на сложных задачах.

Примеры

[ПЛОХО] : Посчитай прибыль с продажи 100 футболок. Ответь коротко, одним числом.
[ХОРОШО] : Вот схема: Прибыль = Выручка − (Закупка + Комиссия + Логистика). Частая ошибка — назвать выручку прибылью. Реши по схеме кратко: продано 100 футболок по 1200 руб, закупка 400 руб/шт, комиссия площадки 20%, логистика 60 руб/шт. Сколько чистой прибыли?
Источник: Memory Augmentation Unlocks Efficient Chain-of-Thought Reasoning
ArXiv ID: 2608.21265 | Сгенерировано: 2026-08-24 05:22

Проблемы LLM

ПроблемаСутьКак обойти
Короткий ответ = обрыв рассуждения на полпутиПросишь модель отвечать короче. Она обрывает цепочку рассуждений на первом числе похожем на ответ. Выдаёт промежуточный результат как финальный. Теряет именно контрольные шаги — те, что нельзя пропустить, но их не видно в сжатом виде. Проблема касается любых многошаговых расчётов и задач с чёткой структуройПеред запросом дай модели краткую схему: тип задачи, критическая операция (что нельзя пропустить), типичная ошибка. Не полный пример решения — только выжимку

Методы

МетодСуть
Абстрактная схема вместо полного примера — короткий и точный ответЗаранее сформулируй схему: тип задачи + ключевые переменные + критическая операция + типичная ошибка. Вставь схему в промпт вместе с просьбой отвечать кратко. Модель следует схеме как чек-листом, а не копирует пример. Почему работает: обработка уже написанного в контексте дешевле для модели, чем генерация логики с нуля. Когда схема уже есть, модель "прошивает" через неё, не теряя критический шаг. Когда да: повторяющиеся однотипные задачи с чёткой структурой (расчёты, чек-листы). Когда нет: разовая творческая задача — схему не из чего построить. Держи 1-3 релевантные схемы: больше — точность падает

Тезисы

ТезисКомментарий
Краткая схема-чеклист работает лучше полного примера-образцаПолный пример решения задаёт модели готовый шаблон для копирования формата, а не логики. Модель может скопировать вид ответа, пропустив критический шаг, если сжимает вывод. Схема с явным указанием "что нельзя пропустить" действует как контрольная точка, а не образец для подражания. Применяй: вместо few-shot примера с полным решением вставляй сжатое описание — переменные, критическая операция, типичная ошибка
📖 Простыми словами

Memory Augmentation Unlocks Efficient Chain-of-Thought Reasoning

arXiv: 2608.21265

Когда ты просишь LLM рассуждать короче, у неё сносит крышу. Модель не умеет «думать компактно» — она тупо обрывает цепочку рассуждений на первом попавшемся правдоподобном числе и выдаёт черновик за финал. В исследованиях это называют коллапсом рассуждений, а на практике это означает только одно — модель нагло врёт ради экономии места.

Это как торопить риелтора быстро назвать чистую прибыль от сделки, а он радостно выпаливает общую сумму продажи, вообще забыв вычесть налоги, комиссию и ремонт. Формально ответил за секунду и цифра солидная, но бизнес с такой логикой быстро пойдёт ко дну — самое важное действие просто выкинули по дороге.

Чтобы модель не срезала углы, ей дают Memory Augmentation — прокачку рабочей памяти. Вместо гигантских примеров решений ты загружаешь в неё сжатую шпаргалку-якорь: список ключевых переменных, критические формулы и запрет на пропуск финальных шагов. Модель сохраняет всю строгость Chain-of-Thought, но не раздувает контекст и видит конечную цель.

Тестировали механику на расчётах, но принцип универсален. Считаешь юнит-экономику товара на Wildberries, пишешь сложный код или настраиваешь финансового AI-агента — везде, где модель спотыкается на многоходовках, сжатая память решает проблему. Точность сложных расчётов вырастает в разы, а затраты на токены падают.

Короче: забудь про слепую команду «отвечай кратко» — это прямой путь получить уверенную чушь. Зашивай в промпт жёсткий каркас ограничений и обязательных шагов. Получишь максимальную скорость без потери логики, сохранишь бюджет и перестанешь гадать, куда опять пропали расходы.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с