TL;DR
Когда LLM пишет код, она часто сначала оставляет комментарии — и эти комментарии становятся частью контекста для кода, который пишется дальше. Исследователи проверили, что именно в этих комментариях работает: объём текста, стиль, порядок строк или их смысл. Оказалось, что единственное свойство, которое реально двигает качество кода — это содержит ли комментарий правильное решение задачи.
Если просто попросить модель "пиши больше комментариев" или "объясняй свои решения подробнее", это не поднимет качество кода надёжно. Модель послушается на уровне формы — станет писать больше текста, сменит стиль — но код не станет лучше, потому что дело не в форме комментария, а в том, добралась ли модель своим ходом до верной идеи. Хуже того: если комментарий написан не по теме задачи (пусть даже красиво и грамотно), он вредит сильнее, чем если бы комментария не было вообще — модель слепо доверяет тексту перед собой.
Чтобы это доказать, авторы взяли комментарии, написанные сильной моделью для решённой ею задачи, и подставили их в начало ответа слабой модели — та продолжала писать код с этой подсказки. Если исходное решение было правильным — слабая модель решала задачу заметно чаще. Если неправильным — эффекта не было. Порядок строк внутри комментария почти не важен: он работает как набор независимых локальных подсказок, а не как строгая цепочка рассуждений.
Схема метода
ШАГ 1: Сильная модель решает задачу → получаешь план/комментарии с описанием решения
ШАГ 2: План вставляется в начало запроса к слабой/быстрой/дешёвой модели → просишь дописать код по этому плану
Оба шага — отдельные запросы, можно в двух разных чатах или моделях.
Пример применения
Задача: Нужно быстро написать Python-скрипт для парсинга цен конкурентов на Wildberries, но под рукой только бесплатная/быстрая модель (например, дешёвая версия в API или локальная), а платная топовая модель — на счету, и тратить на неё каждый запрос дорого.
Промпт для сильной модели (например, Claude Opus или GPT-5):
Опиши план решения задачи в виде коротких комментариев к коду,
без самого кода. Задача: написать Python-скрипт, который парсит
цены товаров с страницы категории Wildberries и сохраняет в CSV.
Пиши как комментарии, которые обычно ставят перед кодом:
5-10 строк, каждая — конкретный шаг или ключевое решение.
Промпт для слабой/быстрой модели (вставляешь план в начало):
# Использовать requests + BeautifulSoup, так как страница отдаётся
статическим HTML без JS-рендеринга
# Найти карточки товаров по классу product-card
# Извлечь цену из тега с data-атрибутом price
# Обработать случаи скидки — брать финальную цену, не старую
# Сохранить в CSV через pandas, колонки: название, цена, ссылка
Напиши код на Python для этой задачи.
Результат: Слабая модель, получив готовый верный план как "подсказку от старшего", напишет код, который с большей вероятностью реально работает — потому что ей не нужно самой додумывать архитектуру решения, только реализовать уже правильные шаги. Без этого плана та же слабая модель на сложных задачах чаще ошибается в логике.
Почему это работает
Слабая модель часто не может сама дойти до правильной идеи решения — не потому что не умеет писать код, а потому что застревает на этапе "что вообще делать". Если просто просить её "думай тщательнее" или "объясняй свои шаги" — она станет писать больше текста, но не станет умнее: инструкция меняет форму, а не содержание мыслей.
Зато LLM хорошо умеет следовать готовому верному плану — если ей подсунуть текст с правильной идеей решения, она достраивает код вокруг него. Это работает, даже если план дан не строгой последовательностью, а набором разрозненных подсказок — модель берёт из контекста то, что нужно, независимо от порядка строк.
Отсюда рычаг: если задача сложная и слабая/быстрая модель регулярно ошибается — не трать токены на инструкции про стиль рассуждений ("объясняй подробнее", "пиши обоснование"). Вместо этого дай ей реальный план, добытый у более сильной модели. Это работает надёжнее любых промпт-инструкций.
⚠️ Осторожно: если план, который ты вставляешь, сам неверный или не по теме — это хуже, чем не давать плана вообще. Модель слепо доверяет тексту перед собой и идёт по ложному следу активнее, чем если бы решала с нуля.
Шаблон промпта
Шаг 1 — получи план у сильной модели:
Опиши план решения задачи в виде 5-10 коротких комментариев
(каждая строка — ключевой шаг или решение), без кода.
Задача: {описание задачи}
Шаг 2 — вставь план в начало запроса к другой модели:
{план из шага 1, вставленный как текст комментариев}
Напиши код/решение для этой задачи, используя план выше как основу.
🚀 Быстрый старт — вставь в чат:
Хочу использовать план от одной модели в качестве подсказки для другой.
Помоги составить промпт для получения плана и промпт для его использования.
Моя задача: {твоя задача}
LLM спросит, какая модель у тебя "сильная" (для плана) и какая "слабая" (для исполнения) — потому что метод работает именно на переносе верного решения между двумя моделями, а не внутри одной.
Ограничения
⚠️ Не работает как инструкция для одной и той же модели: если попросить модель саму писать больше или другие по стилю комментарии, лучший результат восстанавливает лишь малую часть эффекта от внешнего плана. Модель не может "выдумать" себе правильную идею через инструкцию о стиле.
⚠️ Неверный или нерелевантный план вредит сильнее отсутствия плана: если контент комментария не по теме задачи, качество результата падает заметно ниже базового уровня — модель слепо следует за текстом перед собой.
⚠️ Эффект меньше на простых задачах: если модель и так способна решить задачу без подсказки, внешний план даёт мало прироста — выигрыш концентрируется там, где у модели изначально были трудности.
Как исследовали
Команда сначала посмотрела на 88 моделей и проверила: связано ли количество и стиль комментариев (что пишет модель сама по себе) с качеством кода. Оказалось — никак: у одних топовых моделей комментарии — 0,1% от текста, у других — 71%, а результат одинаковый. Это натолкнуло на мысль, что дело не в форме.
Тогда сделали контролируемый эксперимент: взяли план от сильной модели (Grok, Gemini, Claude Opus) и вставили в начало ответа слабой модели (Gemma, Qwen3-8B, Seed-Coder, CodeGeeX4). Если план описывал верное решение — успех слабой модели рос в среднем на 17%. Если решение было неверным — прироста не было. Если план был "не по теме" — результат падал на 21%, даже хуже случайного текста без смысла.
Отдельно проверили: можно ли добиться того же эффекта простыми инструкциями в промпте (14 моделей, 10 вариантов инструкций про стиль, объём, тип комментариев). Лучший вариант восстановил лишь около 24% от эффекта внешнего верного плана — остальное не компенсируется никакой формулировкой промпта. Вывод логичен: инструкция меняет поведение модели на поверхности, но не даёт ей доступа к идее, которой у неё не было.
