3,583 papers
arXiv:2609.34327 78 28 сент. 2026 г. FREE

Диагностика затыка (FlyBy): «перепроверь» помогает, только если модель уже умеет решить, а при нехватке знаний нужны внешние факты

КЛЮЧЕВАЯ СУТЬ
Просьба «подожди, это точно верно?» не открывает новых решений. Она закрепляет те, что модель и так могла найти. Метод FlyBy от авторов исследования разделяет ошибки на два вида: не хватило аккуратности или не хватило знаний. Если нужного факта в памяти модели нет, сколько ни думай, ответа не будет. Для этого случая нужна не самопроверка, а внешняя подсказка: подсказка по теме даёт заметно больший прирост, чем просьба перепроверить. Саму модель FlyBy дома не повторить, там нужны дообучение и обучение с подкреплением. Зато диагностику можно забрать в обычный чат.
Адаптировать под запрос
⚡

TL;DR

Исследование делит провалы маленьких моделей на два вида. Затык исполнения: правильный путь модели доступен, она просто сбилась, и тогда помогает «подумай ещё». Затык знаний: нужного факта у модели нет, и сколько ни думай, ответа не будет. На основе этого различия авторы обучили модель FlyBy. Она сначала рассуждает сама, потом определяет, чего ей не хватает, и задаёт короткий вопрос более сильной модели. Сильная модель видит только вопрос, а не саму задачу.

Главная находка: просьба «подожди, это точно верно?» не открывает новых решений, а лишь укрепляет те, что модель и так могла получить. Если нужного знания нет, модель десять раз «перепроверит» и десять раз придёт к тому же неверному ответу. При этом сомнение она выражает часто («hmm», «wait»), но в прогресс его не превращает. Подсказка по теме даёт заметно больший прирост, чем просьба перепроверить. Случайная подсказка не даёт почти ничего, значит, работает именно релевантность, а не длина текста.

Саму модель FlyBy читатель повторить не сможет: нужны дообучение и обучение с подкреплением. Но диагностика переносится в обычную работу. Модель ошиблась: сначала определи, чего ей не хватает, умения или фактов. Если фактов, не проси «перепроверить», а дай релевантные данные или задай узкий вопрос сильной модели.

🔬

Схема метода

Оригинал (FlyBy, требует обучения модели):

ШАГ 1: Модель рассуждает сама → черновой ход решения
ШАГ 2: Диагностика: «умения не хватает или знаний?»
ШАГ 3а: Затык исполнения → продолжает думать сама (перепроверка, пересмотр)
ШАГ 3б: Затык знаний → запрос сильной модели (глубина 1/2/3: дешёвая → дорогая)
         Сильная модель видит ТОЛЬКО вопрос, не задачу
ШАГ 4: Модель вставляет ответ в своё рассуждение и доводит решение

Переносимый вывод для чата (в самой статье не проверялся как процедура, это перенос):

Ответ неверный → диагноз: нужен факт или нужно аккуратнее посчитать?
  факт → дать данные / спросить сильную модель / поиск
  счёт или логика → «перепроверь по шагам»
🚀

Пример применения

Задача: Селлер на Wildberries, ИП на УСН «доходы», просит модель посчитать налоговую нагрузку на 2025 год. Модель уверенно выдаёт ответ по старым правилам. Попытка «перепроверь» приводит к тому же ответу с другим оформлением. Это затык знаний: актуальных норм у модели нет.

Промпт (вместо «перепроверь»):

Твой ответ по налогам для ИП на УСН 6% построен на правилах, которые
могли устареть. Прежде чем пересчитывать, определи:

1. Какие именно факты ты взял из памяти и не можешь проверить
   (ставки, пороги, сроки, условия перехода)?
2. Какие из них влияют на итоговую цифру сильнее всего?
3. Сформулируй 2-3 коротких самостоятельных вопроса к актуальному
   источнику (ФНС, КонсультантПлюс). Вопросы должны быть понятны
   без моей задачи.

Дальше я вставлю выдержки из источника. Пересчитай только после этого,
используя именно их, а не свою память.

Результат: Модель перечислит, какие факты взяла «из головы», и отметит самые критичные для итога. Затем выдаст короткие самодостаточные вопросы, которые можно отправить в поиск или более сильной модели. После вставки выдержек она пересчитает налог на основе актуальных данных. Слепого «ещё раз проверил, всё верно» не будет.

🧠

Почему это работает

Слабость. Модель генерирует продолжение по паттернам, которые уже есть у неё в параметрах. «Подумай ещё» запускает ещё одну генерацию из того же состояния. Если правильный путь был достижим, она его, возможно, найдёт. Если нужного факта в параметрах нет, новая генерация его не создаст. Поэтому самопроверка сжимает разброс ответов вокруг уже достижимого, но не расширяет его.

Сильная сторона. Модель хорошо встраивает в рассуждение релевантный контекст. Чем лучше подсказка совпадает с задачей, тем больше эффект: случайные подсказки почти не помогают, подсказки по теме помогают сильно. Самопроверка тоже полезна, но после того, как путь стал достижим: подсказка открывает путь, перепроверка закрепляет его.

Как использовать. Сначала определи тип затыка, потом выбирай операцию.

Рычаги управления: - Тип задачи. Авторы показали, что затыки знаний чаще встречаются в науке и предметных вопросах, реже в олимпиадной математике. Для фактологии и узкой экспертизы сразу готовь внешние данные. - Размер модели. Чем меньше модель, тем чаще она упирается в нехватку знаний и тем хуже использует подсказку. Малой модели подсказку нужно формулировать короче и яснее. - Что видит внешняя модель. В FlyBy сильная модель получает только узкий вопрос, а не всю задачу. Это защита от простого «пусть большая решит за меня». Для практики: формулируй запрос как самостоятельный вопрос. - Глубина запроса. Начинай с дешёвого источника и переходи к дорогому только если не хватило.

📋

Шаблон промпта

В статье готового промпта для практика нет. Есть три «сигнала сомнения», которыми авторы проверяли рефлексию:

Wait, is that correct?
Wait, let me double-check.
Hmm, I'm not sure this is right.

Это антипример: именно такие реплики дали умеренный эффект и мало помогали при затыке знаний. Из статьи также следует схема запроса к внешней модели: вопрос должен быть узким и не содержать условие задачи. Практический промпт на её основе приведён в блоке «Адаптации».

⚠️

Ограничения

⚠️ Сам метод требует обучения: FlyBy получается через дообучение и обучение с подкреплением на тысячах задач. В чате или агенте его не воспроизвести. Переносится только диагностическая логика.

⚠️ Диагноз приблизительный: «затык знаний» определяли тем, что ни одно из восьми продолжений не дало верного ответа. Это практическая оценка, а не доказательство недостижимости. Глубокий диагноз без прогонов в чате дать трудно.

⚠️ Подсказки были «идеальными»: релевантную информацию для проверки писала сильная модель (DeepSeek-V4-Pro), знающая задачу. В реальной работе подсказка может быть неточной, и эффект будет слабее.

⚠️ Малые модели и сложные задачи: результаты получены на малых открытых моделях (Qwen3, Gemma) и сложных задачах по математике и науке. Для больших коммерческих моделей и бытовых задач масштаб эффекта не проверен.

⚠️ Малые модели плохо используют подсказки: чем меньше модель, тем хуже она встраивает полученный факт в рассуждение. Одной подсказки не всегда достаточно.

🔍

Как исследовали

Идея была простой: поймать модель посреди рассуждения и посмотреть, что изменит вмешательство. Команда взяла восемь моделей из двух семейств, Qwen3 (0.6B–14B) и Gemma4 (2B–12B). Задачи: 93 олимпиадные по математике и открытая версия GPQA-Diamond по науке. Каждую задачу прогоняли по 16 раз и оставляли те, что модель решала в 25–75% случаев, то есть не слишком лёгкие и не безнадёжные.

Затем нашли 13,4 тысячи моментов, где модель сама говорила «wait» или «hmm». В этих точках сравнили продолжение с такой фразой и продолжение при запрете подобных слов. Для неверных рассуждений вставляли три вида вмешательства: фразу-сомнение, подсказку по теме (от сильной модели, без выдачи ответа) и случайную подсказку от другой задачи. Всего получилось 272 тысячи продолжений.

Вывод вышел неожиданным. Малые модели не «не замечают сомнений»: они выражают их так же часто. Но самопроверка помогает только в состояниях, где правильный путь ещё достижим. Подсказка по теме работает заметно лучше, случайная почти бесполезна. Ещё одна неожиданность: чем крупнее модель, тем лучше она использует подсказку, то есть малые модели страдают дважды.

После диагностики авторы обучили FlyBy-4B и 8B. Сначала небольшой набор «спасательных» траекторий, где один вопрос превращает провал в успех. Затем 80 шагов обучения с подкреплением, где штраф за стоимость начисляется только за успешные решения, чтобы модель не училась «дёшево проваливаться». На 1158 трудных задачах из шести бенчмарков FlyBy-4B показала 45,96% pass@8 против 41,64% у Qwen3-14B при стоимости в 2,7 раза ниже. FlyBy-8B дошла до 51,81%. Это подтверждает, что вопрос «нужен факт или ещё одна попытка?» можно превратить в навык.

💡

Адаптации и экстраполяции

🔧 Техника: заменить «перепроверь» на «найди пробелы в знаниях» → меньше самоуверенных повторов

Вместо «проверь ещё раз» используй диагностику, которую в статье автоматически делает обученная модель:

Прежде чем отвечать снова, разбери:
— где в твоём рассуждении были факты "по памяти", а не из условия;
— где ты не уверена в цифре, дате, правиле или названии;
— что из этого, если окажется неверным, ломает весь вывод.
Если пробелов в знаниях нет — перепроверь вычисления по шагам.
Если есть — не пересчитывай, а задай мне вопросы.

Это перенос логики статьи, а не проверенный авторами промпт. Работает как практическое правило «сначала диагноз, потом лечение».

Экстраполяция: запрос к внешней модели без условия задачи

Чтобы не отдавать задачу целиком, а получить только недостающий факт, можно использовать связку из двух чатов:

Сформулируй один короткий вопрос к эксперту, который закрывает твой
главный пробел в знаниях. Вопрос должен быть понятен без контекста
моей задачи и не содержать числа из условия.

Полученный вопрос отправь в другую (более сильную) модель или поисковик, а ответ вставь обратно в основной чат. Это ручная версия FlyBy: вопрос уходит наружу, а ответ возвращается в рассуждение.

🔗

Ресурсы

  • Работа: «Knowing When Thinking Is Not Enough: Teaching Small Reasoning Models to Reason Beyond Their Parametric Knowledge»
  • Авторы: Chanuk Lee, Minki Kang, Sangwoo Park, Woongyeong Yeo, Jinheon Baek, Sung Ju Hwang (KAIST, DeepAuto.ai)
  • Код: https://github.com/tally0818/FlyBy
  • Связанные работы, на которые опирается статья: Kim et al., 2026b (рефлексия и эпистемические вербализации); Muennighoff et al., 2025 (s1: сигналы «Wait»); Su et al., 2025 (стоимость вызовов инструментов)

📋 Дайджест исследования

Ключевая суть

Просьба «подожди, это точно верно?» не открывает новых решений. Она закрепляет те, что модель и так могла найти. Метод FlyBy от авторов исследования разделяет ошибки на два вида: не хватило аккуратности или не хватило знаний. Если нужного факта в памяти модели нет, сколько ни думай, ответа не будет. Для этого случая нужна не самопроверка, а внешняя подсказка: подсказка по теме даёт заметно больший прирост, чем просьба перепроверить. Саму модель FlyBy дома не повторить, там нужны дообучение и обучение с подкреплением. Зато диагностику можно забрать в обычный чат.

Принцип работы

Два вида затыка, два разных лекарства. Затык исполнения: путь к ответу у модели есть, она просто сбилась. Тут помогает «подумай ещё» и «проверь по шагам». Затык знаний: нужного факта в памяти нет. Тут помогают только внешние данные. В самой FlyBy это устроено как процесс: модель рассуждает сама, потом понимает, чего ей не хватает, и задаёт короткий вопрос сильной модели. Сильная модель видит только вопрос, а не всю задачу. Так большая модель не решает за малую, а только закрывает дыру в знаниях. Переносим в чат (в статье это как процедура не проверялось): ответ неверный, значит, сначала диагноз. Нужен факт или нужно аккуратнее посчитать? Факт: дай данные, задай узкий вопрос или включи поиск. Счёт или логика: «перепроверь по шагам».

Почему работает

Модель продолжает текст по паттернам, которые лежат у неё в параметрах. «Подумай ещё» запускает новую генерацию из того же состояния. Если путь был достижим, она его, возможно, найдёт. Если факта в параметрах нет, он не появится. Самопроверка сжимает разброс ответов вокруг уже достижимого, но не расширяет его. Прикол: сомнение модель выражает часто, пишет «hmm» и «wait». Но в прогресс оно не превращается, она десять раз «перепроверит» и десять раз придёт к тому же неверному ответу. Подсказка работает иначе. Случайный текст почти ничего не даёт, подсказка по теме помогает сильно. Значит, работает релевантность, а не длина текста. Подсказка открывает путь, перепроверка потом его закрепляет. Есть три рычага. Первый: тип задачи. Затыки знаний чаще встречаются в науке и предметных вопросах, реже в олимпиадной математике. Второй: размер модели. Чем она меньше, тем чаще не хватает знаний и тем хуже она использует подсказку. Третий: глубина запроса. Начинай с дешёвого источника, к дорогому иди, только если не хватило.

Когда применять

Фактология и узкая экспертиза → налоги, законы, технические нормы, свежие версии инструментов, особенно когда модель отвечает уверенно, а «перепроверь» даёт тот же ответ другими словами. Для малых моделей это особенно важно: у них пробелов в знаниях больше. НЕ подходит для случаев, где модель просто ошиблась в арифметике или потеряла шаг в логике. Там хватит обычного «проверь по шагам». Ещё одна оговорка: ошибки диагностики возможны. В статье «затык знаний» определяли так: ни одно из восьми продолжений не дало верного ответа. Это практическая оценка, а не доказательство.

Мини-рецепт

1. Поймай подозрительный ответ: модель уверена, но цифры или нормы кажутся устаревшими.
2. Не проси «перепроверь»: если нужного факта нет, ты получишь тот же ответ в новой обёртке.
3. Заставь выписать факты из памяти: пусть перечислит всё, что взяла «из головы» и не может проверить.
4. Найди самые опасные: какие из этих фактов сильнее всего двигают итоговую цифру.
5. Попроси узкие вопросы: 2-3 коротких вопроса, понятных без твоей задачи. Их можно отправить в поиск или сильной модели.
6. Вставь ответы и пересчитай: пусть опирается на выдержки, а не на память.
7. Только теперь проси перепроверить: когда путь уже открыт, самопроверка его закрепит.

Примеры

[ПЛОХО] Задача: селлер на маркетплейсе, ИП на упрощённой системе налогообложения (УСН «доходы»), считает налоговую нагрузку на 2025 год. : Перепроверь расчёт налога ещё раз, точно всё верно?
[ХОРОШО] : Твой ответ по налогам для ИП на УСН 6% построен на правилах, которые могли устареть. Прежде чем пересчитывать, определи: 1) Какие факты ты взял из памяти и не можешь проверить (ставки, пороги, сроки)? 2) Какие из них сильнее всего влияют на итоговую цифру? 3) Сформулируй 2-3 коротких вопроса к актуальному источнику (ФНС, КонсультантПлюс). Вопросы должны быть понятны без моей задачи. Дальше я вставлю выдержки из источника. Пересчитай только после этого, опираясь на них, а не на свою память. Модель сама покажет, где опиралась на память. Затем выдаст короткие вопросы для поиска или сильной модели. После вставки выдержек она пересчитает налог по актуальным данным. Слепого «проверил, всё верно» не будет.
Источник: Knowing When Thinking Is Not Enough: Teaching Small Reasoning Models to Reason Beyond Their Parametric Knowledge
ArXiv ID: 2609.34327 | Сгенерировано: 2026-10-07 09:00

Проблемы LLM

ПроблемаСутьКак обойти
Просьба «перепроверь» не исправляет ошибку, если модели не хватает фактовМодель дала неверный ответ. Ты просишь: «проверь ещё раз». Она пишет «хм, подожди» и приходит к тому же ответу. Новая попытка стартует из тех же знаний. Если нужного факта в памяти нет, он не появится. Ты получаешь уверенное подтверждение ошибки. Особенно часто это в предметных вопросах: право, налоги, наука, свежие данныеСначала определи тип ошибки. Если модель сбилась в счёте или логике, проси перепроверить по шагам. Если не хватает фактов, дай данные: выдержку из источника, документ, результат поиска. Или задай узкий вопрос внешнему источнику

Методы

МетодСуть
Диагноз ошибки перед исправлением — выбор между «подумай ещё» и «дай факты»Не проси просто «перепроверь». Сначала пусть модель разберёт свой ответ. Шаблон: Какие факты ты взяла из памяти и не можешь проверить? Какие из них сильнее всего влияют на итог? Сформулируй 2–3 коротких вопроса к внешнему источнику. Вопросы должны быть понятны без моей задачи. Потом вставь ответы источника и попроси пересчитать только по ним. Почему работает: Повторная генерация расширяет только то, что уже есть в памяти. Явный список непроверяемых фактов показывает, где нужна внешняя информация. Вопрос без условия задачи заставляет искать факт, а не решение целиком. Когда да: фактологические и предметные задачи, цифры, нормы, даты, узкая экспертиза. Когда нет: ошибка в арифметике или логике. Там хватит обычной перепроверки. Это перенос идеи. Как готовая процедура в чате метод не проверялся

Тезисы

ТезисКомментарий
Перепроверка закрепляет путь, подсказка открывает егоСамопроверка сжимает разброс ответов вокруг того, что модель и так может получить. Новых путей она не создаёт. Подсказка по теме открывает путь, которого не было. Порядок важен: сначала дай данные, потом проси проверить. Применяй: при неверном ответе сначала добавь контекст, а «проверь себя» оставь последним шагом

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с