3,583 papers
arXiv:2608.24358 75 25 авг. 2026 г. FREE

Handoff Tax: что передавать модели при переключении между дешёвой и дорогой версией

КЛЮЧЕВАЯ СУТЬ
Парадокс: копируешь весь диалог в мощную модель, чтобы она 'быстрее вошла в курс дела' — а она решает задачу хуже, чем с нуля, и платишь ты втрое больше. Метод Handoff Tax показывает: при переключении между дешёвой и дорогой моделью важно не что передать, а как — всю историю, сжатое резюме или вообще ничего кроме результата. Правило разное для двух направлений: повышаешь модель — режь историю до сути, понижаешь — тащи все рассуждения целиком, иначе дешёвая модель не удержит логику. Универсального совета 'сжимай всегда' тут нет — решает направление переключения.
Адаптировать под запрос

TL;DR

Когда посреди долгой задачи ты переключаешься с дешёвой модели на дорогую (или наоборот), ты передаёшь новой модели не просто задачу, а весь чужой ход мыслей — с его тупиками, неудачными попытками и специфичной логикой. Исследователи проверили, что именно стоит передавать при таком переключении: всю историю целиком, сжатое резюме или вообще ничего, оставив только результат.

Главная находка неприятная: если ты застрял с дешёвой моделью и переключаешься на мощную, просто скопировать весь диалог — плохая идея. Мощная модель тонет в чужих блужданиях и решает в итоге даже не половину того, что решила бы с нуля, а платишь ты в разы больше. Иногда дешевле вообще выбросить старую переписку и начать с мощной моделью заново, чем тащить её через чужую историю.

Правило разное для двух направлений: при повышении модели — не давай полную историю, дай сжатое резюме или вообще только результат. При понижении модели (переходишь на дешёвую, когда сложная часть уже решена) — наоборот, сохраняй полную историю рассуждений мощной модели, иначе дешёвая модель теряет большую часть выигранного качества.


🔬

Схема метода

ПОВЫШЕНИЕ модели (дешёвая → дорогая):

ШАГ 1: Дешёвая модель работает, застревает → накопленная история диалога
ШАГ 2: НЕ передавай сырую историю целиком → сожми в короткое резюме (что сделано, где застряли) или вообще выбрось, оставь только результат
ШАГ 3: Дорогая модель продолжает с чистого контекста → выше качество, дешевле

ПОНИЖЕНИЕ модели (дорогая → дешёвая):

ШАГ 1: Дорогая модель решает сложную часть → её рассуждения и выводы
ШАГ 2: Передай дешёвой модели ПОЛНУЮ историю рассуждений — не обрезай!
ШАГ 3: Дешёвая модель доводит задачу до конца, используя готовую логику → сохраняет качество за меньшие деньги

🚀

Пример применения

Задача: Предприниматель считает юнит-экономику подписочного сервиса в диалоге с быстрой/дешёвой моделью. Модель путается в расчётах LTV и CAC на сложном сценарии с несколькими тарифами. Пользователь хочет передать это топовой модели.

Промпт (шаг подготовки перед передачей):

Мы считали юнит-экономику подписочного сервиса с тремя тарифами.
Вот весь диалог до сих пор: {вставить историю}

Составь резюме не длиннее 200 слов:
- Какая задача решалась
- Какие цифры и допущения уже приняты
- В чём конкретно застряли или где расчёт пошёл не так
- Что НЕ нужно пересчитывать заново

Не включай пошаговые рассуждения и неудачные попытки — только суть и текущий результат.

Это резюме (а не весь диалог) вставляешь в новый чат с мощной моделью вместе с исходной задачей.

Обратный случай (понижение): мощная модель разработала сложную аргументацию для юридического документа. Дальше нужно только оформить и довести до финального вида — эту часть можно доверить дешёвой модели, но скопировать в неё нужно весь диалог целиком, не сокращая, иначе она не поймёт логику решений.

Результат: В первом случае модель получит компактную вводную и решит задачу точнее и дешевле, чем если бы читала весь путаный диалог. Во втором — дешёвая модель, видя полный ход рассуждений, аккуратно завершит работу без потери качества.


🧠

Почему это работает

Модели, которые продолжают чужую цепочку рассуждений, наследуют чужие формулировки и тупиковые ветки — это как продолжать чужую недописанную мысль, которая уже пошла по неверному пути. Мощная модель тратит токены (и твои деньги) на то, чтобы разобраться в логике другой модели, вместо того чтобы применить свою собственную.

При этом модели хорошо умеют работать с чистой, сжатой постановкой задачи — резюме фокусирует внимание на сути, а не на процессе.

Метод использует резюмирование или полное отбрасывание истории как способ «почистить» передачу задачи. При повышении модели это работает, потому что мощной модели не нужны чужие блуждания — ей нужна суть и текущий результат. При понижении — наоборот: дешёвой модели нужна подсказка, как рассуждала мощная модель, потому что сама воспроизвести сложную логику она не может.

Рычаги управления: - Формат передачи (полная история / резюме от передающей модели / резюме от принимающей модели / только результат без истории) — выбирай в зависимости от направления переключения. - Момент переключения — чем раньше переключаешься, тем меньше накопленного контекста и тем менее критичен выбор формата.


📋

Шаблон промпта

🔼 При повышении модели:

Мы работали над задачей: {задача}.
Вот весь диалог/прогресс до сих пор: {история}

Составь краткое резюме (не длиннее 200 слов):
— Что нужно было сделать
— Что уже сделано / какие решения приняты
— В чём именно застряли
— Какие факты и цифры уже установлены и не нужно пересчитывать

Не включай пошаговые рассуждения и тупиковые ветки — только суть и текущий результат.

🔽 При понижении модели:

Вот полный диалог, в котором мы решали сложную часть задачи {задача}:
{вся_история}

Продолжи эту работу и доведи до финала: {оставшаяся_часть_задачи}.
Используй весь контекст рассуждений выше — не пересчитывай и не переосмысляй уже принятые решения.

🚀 Быстрый старт — вставь в чат:

Вот два шаблона для передачи задачи между моделями разной "мощности" — 
один для перехода на более сильную модель, другой на более простую. 
Адаптируй под мою задачу: {твоя задача}. Уточни, в каком направлении я переключаюсь.

[вставить оба шаблона выше]

LLM спросит, застрял ты (нужна мощная модель) или сложная часть уже решена (нужна экономия) — потому что от направления зависит, сжимать историю или сохранять её целиком.


⚠️

Ограничения

⚠️ Работает чётче с отдельным "артефактом": эффект сильнее виден там, где есть результат отдельно от истории чата (код, документ, черновик). Если весь результат существует только в переписке, «выбросить историю, оставив результат» не сработает — придётся оставлять хотя бы сжатое резюме.

⚠️ Направление нельзя путать: то, что помогает при повышении модели (выбросить историю), вредит при понижении — и наоборот. Правило одно направление — одна тактика.

⚠️ На простых задачах смена модели может не окупаться: выигрыш чётко виден на сложных задачах, где есть что спасать или экономить. На лёгких задачах переключение часто просто удорожает результат без роста качества.


🔍

Как исследовали

Исследователи взяли агентов, решающих реальные баги в открытых проектах (бенчмарк SWE-bench, где можно автоматически проверить — прошёл тест или нет). Использовали пары моделей «дешёвая-слабая / дорогая-мощная» из двух семейств: Claude (Haiku/Opus) и GPT. Масштаб огромный — 58 тысяч запусков агентов, 36 миллиардов обработанных токенов.

Модель переключали в разные моменты задачи и четырьмя способами передавали контекст: целиком, сжато передающей моделью, сжато принимающей моделью, или вообще без истории (только сохранённый код). Самое неожиданное: при повышении модели иногда дешевле и эффективнее выбросить всю прежнюю работу и начать заново с мощной моделью, чем тащить её через чужую историю — это противоречит интуитивному «чем больше контекста, тем лучше».

🔗

Ресурсы

Roy Ganz, Mor Shpigel Nacson, Adi Kalyanpur, Ron Litman — AWS, Agentic AI. Бенчмарк SWE-bench Verified. Статья: The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents.


📋 Дайджест исследования

Ключевая суть

Парадокс: копируешь весь диалог в мощную модель, чтобы она 'быстрее вошла в курс дела' — а она решает задачу хуже, чем с нуля, и платишь ты втрое больше. Метод Handoff Tax показывает: при переключении между дешёвой и дорогой моделью важно не что передать, а как — всю историю, сжатое резюме или вообще ничего кроме результата. Правило разное для двух направлений: повышаешь модель — режь историю до сути, понижаешь — тащи все рассуждения целиком, иначе дешёвая модель не удержит логику. Универсального совета 'сжимай всегда' тут нет — решает направление переключения.

Принцип работы

При повышении модели (дешёвая → дорогая) сожми историю в резюме на 200 слов или выбрось совсем, оставив только результат. При понижении (дорогая → дешёвая) — наоборот, тащи весь диалог рассуждений без сокращений. Одно направление — одна тактика, перепутал — потерял и деньги, и качество.

Почему работает

Мощная модель, читая чужой путаный диалог, наследует чужие тупики и формулировки. Это как продолжать чужую недописанную мысль, которая уже свернула не туда. Модель тратит токены не на решение, а на разбор чужой логики. Дешёвая модель наоборот — сама не воспроизведёт сложное рассуждение, без полной истории мощной модели она теряет большую часть уже выигранного качества. Модель работает хорошо с чистой постановкой задачи, а не с чужим черновиком мыслей.

Когда применять

Работа с LLM-агентами → для длинных задач, где переключаешься между дорогой и дешёвой моделью ради качества или экономии, особенно если есть отдельный результат отдельно от истории чата — код, документ, черновик. Не подходит для простых задач: там смена модели просто удорожает результат без роста качества.

Мини-рецепт

1. Определи направление: застрял с дешёвой моделью — повышение. Сложная часть уже решена — понижение.
2. При повышении: попроси текущую модель сжать историю в резюме на 200 слов — что делалось, что сделано, где застряли, что не пересчитывать.
3. При понижении: скопируй весь диалог целиком, без сокращений — дешёвой модели нужна вся логика рассуждений.
4. Передай дальше: вставь подготовленный текст (резюме или полную историю) в новый чат вместе с исходной задачей.

Примеры

[ПЛОХО] : Вот весь наш диалог на 50 сообщений, продолжи расчёт LTV и CAC (копируешь всё подряд в мощную модель)
[ХОРОШО] : Мы считали юнит-экономику с тремя тарифами. Составь резюме не длиннее 200 слов: какая задача, что уже сделано, где застряли, какие цифры уже приняты и их не нужно пересчитывать. Не включай пошаговые рассуждения и неудачные попытки.
Источник: The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents
ArXiv ID: 2608.24358 | Сгенерировано: 2026-08-26 05:22

Проблемы LLM

ПроблемаСутьКак обойти
Полная история чужих рассуждений мешает более мощной моделиПереключаешься с дешёвой модели на дорогую посреди задачи. Копируешь весь диалог целиком. Дорогая модель тонет в чужих тупиках и неудачных попытках. Тратит токены на разбор чужой логики вместо решения задачи своей. Итоговое качество ниже, чем если бы модель решала с нуля. Деньги при этом уходят в разы большеНе передавай сырой диалог. Сожми в резюме: что сделано, какие цифры приняты, где застряли. Или вообще выбрось историю — оставь только финальный результат. Отдай резюме вместо полного чата

Методы

МетодСуть
Направленная передача контекста при смене моделиПри переходе на более мощную модель — не давай полную историю. Сожми в резюме (до 200 слов): задача, принятые цифры, где застряли, что не пересчитывать. При переходе на более слабую модель — наоборот, передай полную историю рассуждений без сокращений. "Используй весь контекст рассуждений выше — не переосмысляй принятые решения". Почему: мощной модели чужие блуждания не нужны, ей нужна суть — она сама выстроит логику лучше. Слабой модели чужая логика нужна как опора — сама она сложную цепочку рассуждений не воспроизведёт. Когда работает: длинные многошаговые задачи (код, расчёты, документы) с чётким разделением "черновик рассуждений" и "результат". Когда не работает: результат существует только внутри переписки — тогда резюме обязательно, выбрасывать историю целиком нельзя
📖 Простыми словами

The Handoff Tax: Continuing Non-Native Trajectories inLLMAgents

arXiv: 2608.24358

Когда ты начинаешь сложную задачу на дешёвой модели, заходишь в тупик и переключаешься на топовую LLM, происходит эффект заражения контекста. Мощная нейросеть не начинает думать своей головой, а послушно переваривает чужие ошибки, костыли и кривую логику. Это явление назвали handoff taxналог на передачу управления. В итоге ты платишь конский ценник за умную модель, а она просто бьётся лбом в чужой тупик.

Это как позвать сеньора переделывать код за джуном, но запретить ему смотреть на задачу с чистого листа и заставить продолжать писать прямо с места факапа. Формально работа идёт, но эксперт тратит 80% ресурсов на расшифровку чужого бреда, вместо того чтобы решить проблему за две минуты с нуля.

Исследователи протестировали три сценария передачи: сырой лог всей переписки, сжатое резюме и чистый старт с текущим результатом. Выяснилось, что скармливать умной модели полную историю рассуждений предшественника — худшая стратегия. Максимальную точность даёт обнуление траектории или передача сухого факта без промежуточного мусора, что срезает лишние расходы и спасает от наследования ошибок.

Тестировали на агентных пайплайнах, но принцип универсален. Считаешь ли ты юнит-экономику в веб-интерфейсе, строишь сложный каскадный роутинг в API или меняешь модель прямо посреди чата — не тащи за собой чужой мыслительный мусор. Если быстрая модель запуталась в формулах LTV и CAC, сильной LLM нужны только исходные вводные и финальная цель, а не простыня чужих галлюцинаций.

Короче: переключая модель посреди задачи, делай осознанный сброс контекста, а не передавай всю ветку целиком. Чистый перезапуск бьёт длинную историю в большинстве сложных сценариев. Иначе ты просто покупаешь топовой нейросети право наступать на чужие грабли по максимальному тарифу.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с