TL;DR
Когда посреди долгой задачи ты переключаешься с дешёвой модели на дорогую (или наоборот), ты передаёшь новой модели не просто задачу, а весь чужой ход мыслей — с его тупиками, неудачными попытками и специфичной логикой. Исследователи проверили, что именно стоит передавать при таком переключении: всю историю целиком, сжатое резюме или вообще ничего, оставив только результат.
Главная находка неприятная: если ты застрял с дешёвой моделью и переключаешься на мощную, просто скопировать весь диалог — плохая идея. Мощная модель тонет в чужих блужданиях и решает в итоге даже не половину того, что решила бы с нуля, а платишь ты в разы больше. Иногда дешевле вообще выбросить старую переписку и начать с мощной моделью заново, чем тащить её через чужую историю.
Правило разное для двух направлений: при повышении модели — не давай полную историю, дай сжатое резюме или вообще только результат. При понижении модели (переходишь на дешёвую, когда сложная часть уже решена) — наоборот, сохраняй полную историю рассуждений мощной модели, иначе дешёвая модель теряет большую часть выигранного качества.
Схема метода
ПОВЫШЕНИЕ модели (дешёвая → дорогая):
ШАГ 1: Дешёвая модель работает, застревает → накопленная история диалога
ШАГ 2: НЕ передавай сырую историю целиком → сожми в короткое резюме (что сделано, где застряли) или вообще выбрось, оставь только результат
ШАГ 3: Дорогая модель продолжает с чистого контекста → выше качество, дешевле
ПОНИЖЕНИЕ модели (дорогая → дешёвая):
ШАГ 1: Дорогая модель решает сложную часть → её рассуждения и выводы
ШАГ 2: Передай дешёвой модели ПОЛНУЮ историю рассуждений — не обрезай!
ШАГ 3: Дешёвая модель доводит задачу до конца, используя готовую логику → сохраняет качество за меньшие деньги
Пример применения
Задача: Предприниматель считает юнит-экономику подписочного сервиса в диалоге с быстрой/дешёвой моделью. Модель путается в расчётах LTV и CAC на сложном сценарии с несколькими тарифами. Пользователь хочет передать это топовой модели.
Промпт (шаг подготовки перед передачей):
Мы считали юнит-экономику подписочного сервиса с тремя тарифами.
Вот весь диалог до сих пор: {вставить историю}
Составь резюме не длиннее 200 слов:
- Какая задача решалась
- Какие цифры и допущения уже приняты
- В чём конкретно застряли или где расчёт пошёл не так
- Что НЕ нужно пересчитывать заново
Не включай пошаговые рассуждения и неудачные попытки — только суть и текущий результат.
Это резюме (а не весь диалог) вставляешь в новый чат с мощной моделью вместе с исходной задачей.
Обратный случай (понижение): мощная модель разработала сложную аргументацию для юридического документа. Дальше нужно только оформить и довести до финального вида — эту часть можно доверить дешёвой модели, но скопировать в неё нужно весь диалог целиком, не сокращая, иначе она не поймёт логику решений.
Результат: В первом случае модель получит компактную вводную и решит задачу точнее и дешевле, чем если бы читала весь путаный диалог. Во втором — дешёвая модель, видя полный ход рассуждений, аккуратно завершит работу без потери качества.
Почему это работает
Модели, которые продолжают чужую цепочку рассуждений, наследуют чужие формулировки и тупиковые ветки — это как продолжать чужую недописанную мысль, которая уже пошла по неверному пути. Мощная модель тратит токены (и твои деньги) на то, чтобы разобраться в логике другой модели, вместо того чтобы применить свою собственную.
При этом модели хорошо умеют работать с чистой, сжатой постановкой задачи — резюме фокусирует внимание на сути, а не на процессе.
Метод использует резюмирование или полное отбрасывание истории как способ «почистить» передачу задачи. При повышении модели это работает, потому что мощной модели не нужны чужие блуждания — ей нужна суть и текущий результат. При понижении — наоборот: дешёвой модели нужна подсказка, как рассуждала мощная модель, потому что сама воспроизвести сложную логику она не может.
Рычаги управления: - Формат передачи (полная история / резюме от передающей модели / резюме от принимающей модели / только результат без истории) — выбирай в зависимости от направления переключения. - Момент переключения — чем раньше переключаешься, тем меньше накопленного контекста и тем менее критичен выбор формата.
Шаблон промпта
🔼 При повышении модели:
Мы работали над задачей: {задача}.
Вот весь диалог/прогресс до сих пор: {история}
Составь краткое резюме (не длиннее 200 слов):
— Что нужно было сделать
— Что уже сделано / какие решения приняты
— В чём именно застряли
— Какие факты и цифры уже установлены и не нужно пересчитывать
Не включай пошаговые рассуждения и тупиковые ветки — только суть и текущий результат.
🔽 При понижении модели:
Вот полный диалог, в котором мы решали сложную часть задачи {задача}:
{вся_история}
Продолжи эту работу и доведи до финала: {оставшаяся_часть_задачи}.
Используй весь контекст рассуждений выше — не пересчитывай и не переосмысляй уже принятые решения.
🚀 Быстрый старт — вставь в чат:
Вот два шаблона для передачи задачи между моделями разной "мощности" —
один для перехода на более сильную модель, другой на более простую.
Адаптируй под мою задачу: {твоя задача}. Уточни, в каком направлении я переключаюсь.
[вставить оба шаблона выше]
LLM спросит, застрял ты (нужна мощная модель) или сложная часть уже решена (нужна экономия) — потому что от направления зависит, сжимать историю или сохранять её целиком.
Ограничения
⚠️ Работает чётче с отдельным "артефактом": эффект сильнее виден там, где есть результат отдельно от истории чата (код, документ, черновик). Если весь результат существует только в переписке, «выбросить историю, оставив результат» не сработает — придётся оставлять хотя бы сжатое резюме.
⚠️ Направление нельзя путать: то, что помогает при повышении модели (выбросить историю), вредит при понижении — и наоборот. Правило одно направление — одна тактика.
⚠️ На простых задачах смена модели может не окупаться: выигрыш чётко виден на сложных задачах, где есть что спасать или экономить. На лёгких задачах переключение часто просто удорожает результат без роста качества.
Как исследовали
Исследователи взяли агентов, решающих реальные баги в открытых проектах (бенчмарк SWE-bench, где можно автоматически проверить — прошёл тест или нет). Использовали пары моделей «дешёвая-слабая / дорогая-мощная» из двух семейств: Claude (Haiku/Opus) и GPT. Масштаб огромный — 58 тысяч запусков агентов, 36 миллиардов обработанных токенов.
Модель переключали в разные моменты задачи и четырьмя способами передавали контекст: целиком, сжато передающей моделью, сжато принимающей моделью, или вообще без истории (только сохранённый код). Самое неожиданное: при повышении модели иногда дешевле и эффективнее выбросить всю прежнюю работу и начать заново с мощной моделью, чем тащить её через чужую историю — это противоречит интуитивному «чем больше контекста, тем лучше».
Ресурсы
Roy Ganz, Mor Shpigel Nacson, Adi Kalyanpur, Ron Litman — AWS, Agentic AI. Бенчмарк SWE-bench Verified. Статья: The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents.
