TL;DR
Исследование делит провалы маленьких моделей на два вида. Затык исполнения: правильный путь модели доступен, она просто сбилась, и тогда помогает «подумай ещё». Затык знаний: нужного факта у модели нет, и сколько ни думай, ответа не будет. На основе этого различия авторы обучили модель FlyBy. Она сначала рассуждает сама, потом определяет, чего ей не хватает, и задаёт короткий вопрос более сильной модели. Сильная модель видит только вопрос, а не саму задачу.
Главная находка: просьба «подожди, это точно верно?» не открывает новых решений, а лишь укрепляет те, что модель и так могла получить. Если нужного знания нет, модель десять раз «перепроверит» и десять раз придёт к тому же неверному ответу. При этом сомнение она выражает часто («hmm», «wait»), но в прогресс его не превращает. Подсказка по теме даёт заметно больший прирост, чем просьба перепроверить. Случайная подсказка не даёт почти ничего, значит, работает именно релевантность, а не длина текста.
Саму модель FlyBy читатель повторить не сможет: нужны дообучение и обучение с подкреплением. Но диагностика переносится в обычную работу. Модель ошиблась: сначала определи, чего ей не хватает, умения или фактов. Если фактов, не проси «перепроверить», а дай релевантные данные или задай узкий вопрос сильной модели.
Схема метода
Оригинал (FlyBy, требует обучения модели):
ШАГ 1: Модель рассуждает сама → черновой ход решения
ШАГ 2: Диагностика: «умения не хватает или знаний?»
ШАГ 3а: Затык исполнения → продолжает думать сама (перепроверка, пересмотр)
ШАГ 3б: Затык знаний → запрос сильной модели (глубина 1/2/3: дешёвая → дорогая)
Сильная модель видит ТОЛЬКО вопрос, не задачу
ШАГ 4: Модель вставляет ответ в своё рассуждение и доводит решение
Переносимый вывод для чата (в самой статье не проверялся как процедура, это перенос):
Ответ неверный → диагноз: нужен факт или нужно аккуратнее посчитать?
факт → дать данные / спросить сильную модель / поиск
счёт или логика → «перепроверь по шагам»
Пример применения
Задача: Селлер на Wildberries, ИП на УСН «доходы», просит модель посчитать налоговую нагрузку на 2025 год. Модель уверенно выдаёт ответ по старым правилам. Попытка «перепроверь» приводит к тому же ответу с другим оформлением. Это затык знаний: актуальных норм у модели нет.
Промпт (вместо «перепроверь»):
Твой ответ по налогам для ИП на УСН 6% построен на правилах, которые
могли устареть. Прежде чем пересчитывать, определи:
1. Какие именно факты ты взял из памяти и не можешь проверить
(ставки, пороги, сроки, условия перехода)?
2. Какие из них влияют на итоговую цифру сильнее всего?
3. Сформулируй 2-3 коротких самостоятельных вопроса к актуальному
источнику (ФНС, КонсультантПлюс). Вопросы должны быть понятны
без моей задачи.
Дальше я вставлю выдержки из источника. Пересчитай только после этого,
используя именно их, а не свою память.
Результат: Модель перечислит, какие факты взяла «из головы», и отметит самые критичные для итога. Затем выдаст короткие самодостаточные вопросы, которые можно отправить в поиск или более сильной модели. После вставки выдержек она пересчитает налог на основе актуальных данных. Слепого «ещё раз проверил, всё верно» не будет.
Почему это работает
Слабость. Модель генерирует продолжение по паттернам, которые уже есть у неё в параметрах. «Подумай ещё» запускает ещё одну генерацию из того же состояния. Если правильный путь был достижим, она его, возможно, найдёт. Если нужного факта в параметрах нет, новая генерация его не создаст. Поэтому самопроверка сжимает разброс ответов вокруг уже достижимого, но не расширяет его.
Сильная сторона. Модель хорошо встраивает в рассуждение релевантный контекст. Чем лучше подсказка совпадает с задачей, тем больше эффект: случайные подсказки почти не помогают, подсказки по теме помогают сильно. Самопроверка тоже полезна, но после того, как путь стал достижим: подсказка открывает путь, перепроверка закрепляет его.
Как использовать. Сначала определи тип затыка, потом выбирай операцию.
Рычаги управления: - Тип задачи. Авторы показали, что затыки знаний чаще встречаются в науке и предметных вопросах, реже в олимпиадной математике. Для фактологии и узкой экспертизы сразу готовь внешние данные. - Размер модели. Чем меньше модель, тем чаще она упирается в нехватку знаний и тем хуже использует подсказку. Малой модели подсказку нужно формулировать короче и яснее. - Что видит внешняя модель. В FlyBy сильная модель получает только узкий вопрос, а не всю задачу. Это защита от простого «пусть большая решит за меня». Для практики: формулируй запрос как самостоятельный вопрос. - Глубина запроса. Начинай с дешёвого источника и переходи к дорогому только если не хватило.
Шаблон промпта
В статье готового промпта для практика нет. Есть три «сигнала сомнения», которыми авторы проверяли рефлексию:
Wait, is that correct?
Wait, let me double-check.
Hmm, I'm not sure this is right.
Это антипример: именно такие реплики дали умеренный эффект и мало помогали при затыке знаний. Из статьи также следует схема запроса к внешней модели: вопрос должен быть узким и не содержать условие задачи. Практический промпт на её основе приведён в блоке «Адаптации».
Ограничения
⚠️ Сам метод требует обучения: FlyBy получается через дообучение и обучение с подкреплением на тысячах задач. В чате или агенте его не воспроизвести. Переносится только диагностическая логика.
⚠️ Диагноз приблизительный: «затык знаний» определяли тем, что ни одно из восьми продолжений не дало верного ответа. Это практическая оценка, а не доказательство недостижимости. Глубокий диагноз без прогонов в чате дать трудно.
⚠️ Подсказки были «идеальными»: релевантную информацию для проверки писала сильная модель (DeepSeek-V4-Pro), знающая задачу. В реальной работе подсказка может быть неточной, и эффект будет слабее.
⚠️ Малые модели и сложные задачи: результаты получены на малых открытых моделях (Qwen3, Gemma) и сложных задачах по математике и науке. Для больших коммерческих моделей и бытовых задач масштаб эффекта не проверен.
⚠️ Малые модели плохо используют подсказки: чем меньше модель, тем хуже она встраивает полученный факт в рассуждение. Одной подсказки не всегда достаточно.
Как исследовали
Идея была простой: поймать модель посреди рассуждения и посмотреть, что изменит вмешательство. Команда взяла восемь моделей из двух семейств, Qwen3 (0.6B–14B) и Gemma4 (2B–12B). Задачи: 93 олимпиадные по математике и открытая версия GPQA-Diamond по науке. Каждую задачу прогоняли по 16 раз и оставляли те, что модель решала в 25–75% случаев, то есть не слишком лёгкие и не безнадёжные.
Затем нашли 13,4 тысячи моментов, где модель сама говорила «wait» или «hmm». В этих точках сравнили продолжение с такой фразой и продолжение при запрете подобных слов. Для неверных рассуждений вставляли три вида вмешательства: фразу-сомнение, подсказку по теме (от сильной модели, без выдачи ответа) и случайную подсказку от другой задачи. Всего получилось 272 тысячи продолжений.
Вывод вышел неожиданным. Малые модели не «не замечают сомнений»: они выражают их так же часто. Но самопроверка помогает только в состояниях, где правильный путь ещё достижим. Подсказка по теме работает заметно лучше, случайная почти бесполезна. Ещё одна неожиданность: чем крупнее модель, тем лучше она использует подсказку, то есть малые модели страдают дважды.
После диагностики авторы обучили FlyBy-4B и 8B. Сначала небольшой набор «спасательных» траекторий, где один вопрос превращает провал в успех. Затем 80 шагов обучения с подкреплением, где штраф за стоимость начисляется только за успешные решения, чтобы модель не училась «дёшево проваливаться». На 1158 трудных задачах из шести бенчмарков FlyBy-4B показала 45,96% pass@8 против 41,64% у Qwen3-14B при стоимости в 2,7 раза ниже. FlyBy-8B дошла до 51,81%. Это подтверждает, что вопрос «нужен факт или ещё одна попытка?» можно превратить в навык.
Адаптации и экстраполяции
🔧 Техника: заменить «перепроверь» на «найди пробелы в знаниях» → меньше самоуверенных повторов
Вместо «проверь ещё раз» используй диагностику, которую в статье автоматически делает обученная модель:
Прежде чем отвечать снова, разбери:
— где в твоём рассуждении были факты "по памяти", а не из условия;
— где ты не уверена в цифре, дате, правиле или названии;
— что из этого, если окажется неверным, ломает весь вывод.
Если пробелов в знаниях нет — перепроверь вычисления по шагам.
Если есть — не пересчитывай, а задай мне вопросы.
Это перенос логики статьи, а не проверенный авторами промпт. Работает как практическое правило «сначала диагноз, потом лечение».
Экстраполяция: запрос к внешней модели без условия задачи
Чтобы не отдавать задачу целиком, а получить только недостающий факт, можно использовать связку из двух чатов:
Сформулируй один короткий вопрос к эксперту, который закрывает твой
главный пробел в знаниях. Вопрос должен быть понятен без контекста
моей задачи и не содержать числа из условия.
Полученный вопрос отправь в другую (более сильную) модель или поисковик, а ответ вставь обратно в основной чат. Это ручная версия FlyBy: вопрос уходит наружу, а ответ возвращается в рассуждение.
Ресурсы
- Работа: «Knowing When Thinking Is Not Enough: Teaching Small Reasoning Models to Reason Beyond Their Parametric Knowledge»
- Авторы: Chanuk Lee, Minki Kang, Sangwoo Park, Woongyeong Yeo, Jinheon Baek, Sung Ju Hwang (KAIST, DeepAuto.ai)
- Код: https://github.com/tally0818/FlyBy
- Связанные работы, на которые опирается статья: Kim et al., 2026b (рефлексия и эпистемические вербализации); Muennighoff et al., 2025 (s1: сигналы «Wait»); Su et al., 2025 (стоимость вызовов инструментов)
