TL;DR
TTA — техника, которая вместо того чтобы просто повторно спрашивать модель один и тот же вопрос, сначала создаёт несколько перефразированных версий этого вопроса, получает ответ на каждую версию отдельно, а затем выбирает ответ, который встретился чаще всего (голосование большинством).
Модели чувствительны к формулировке: спроси «Какая столица Франции?» и «Назови главный город Франции» — иногда получишь разные ответы на сложных вопросах, потому что модель цепляется за конкретные слова в вопросе, а не за суть. Стандартный приём — self-consistency — просто повторяет тот же самый вопрос несколько раз при высокой температуре, надеясь, что модель хотя бы иногда рассуждает по-другому. Но это лечит только "случайность рассуждения", а не "случайность формулировки".
TTA решает обе проблемы сразу: генерирует k разных формулировок одного вопроса, получает ответ на каждую, а финальный ответ — тот, что победил по голосам. Это как спросить пятерых разными словами одно и то же и взять большинство.
Схема метода
ШАГ 1 (один промпт): Попросить модель сгенерировать k перефразировок вопроса,
сохраняя смысл, формат ответа и все детали → k формулировок
ШАГ 2 (k отдельных запросов): Отправить каждую формулировку отдельно,
получить ответ на каждую → k ответов
ШАГ 3: Посчитать, какой ответ встретился чаще всего → финальный ответ
Пример применения
Задача: Ты руководишь поддержкой на маркетплейсе. Пришёл спорный кейс — жалоба клиента, где неочевидно, кто виноват: продавец или сам покупатель. От решения зависит, возвращать ли деньги.
Промпт:
Вот жалоба клиента:
"Заказал наушники, пришли без коробки, продавец говорит, что упаковку
повредила служба доставки, но на фото коробки нет вообще следов повреждения
— просто голые наушники в пакете."
ШАГ 1: Перефразируй эту жалобу 4 разными способами. Сохрани все детали
и факты, просто меняй формулировку и структуру предложения.
ШАГ 2: Для каждой из 4 версий отдельно реши: виноват продавец или
служба доставки, и почему. Отвечай на каждую версию так, как если бы
видел её первый раз, без оглядки на предыдущие ответы.
ШАГ 3: Посчитай, какой вердикт (продавец/доставка) встретился чаще,
и дай финальный ответ с объяснением.
Результат: Модель покажет 4 перефразированные версии жалобы, под каждой — отдельный вердикт с рассуждением, а в конце — итог: сколько раз выбрано «продавец», сколько «доставка», и финальное решение с аргументацией.
Почему это работает
Модель отвечает не на «смысл» вопроса, а на конкретный текст — набор слов и их порядок. Если задать один и тот же вопрос по-разному, ответ иногда меняется, потому что модель цепляется за случайные детали формулировки, как за подсказку.
Зато модель отлично умеет перефразировать текст, сохраняя смысл — это одна из базовых сильных сторон языковых моделей.
TTA использует эту сильную сторону, чтобы обойти слабость: вместо того чтобы полагаться на одну формулировку, метод создаёт несколько версий и усредняет через голосование. Шум от конкретной фразы гасится, потому что редко все версии собьются в одну сторону одновременно.
Рычаги управления: - Число перефразировок (k) — исследование показало, что 4 версии обычно достаточно, больше — почти не даёт прибавки, только тратит ресурсы - Тип перефразирования — смысловое (сохраняет суть, меняет слова) работает лучше, чем просто «испортить» текст опечатками - Модальность — если в вопросе есть картинка, лучше перефразировать текст, а не саму картинку: перефразирование текста даёт больше выигрыша, а смешивание текстовых и визуальных изменений может всё испортить
Шаблон промпта
Вот вопрос/задача: {вопрос}
ШАГ 1: Перефразируй этот вопрос {число_версий} разными способами.
Сохрани точный смысл, все важные детали, формат ожидаемого ответа.
Меняй только слова и структуру предложения.
ШАГ 2: Ответь на каждую из {число_версий} версий отдельно, как если бы
видел её первый раз — не подглядывай в предыдущие ответы.
ШАГ 3: Посчитай, какой ответ повторился чаще всего среди всех версий.
Дай финальный ответ с кратким объяснением, почему именно он победил.
Что подставлять:
{вопрос} — твоя реальная задача или спорный кейс. {число_версий} — обычно достаточно 4, для простых вопросов хватит 2, для сложных можно взять 6.
🚀 Быстрый старт — вставь в чат:
Вот шаблон Test-Time Augmentation. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, сколько версий генерировать и насколько сильно можно менять формулировку без потери смысла — потому что от этого зависит, будет ли реальная разница между версиями, или они окажутся клонами друг друга.
Ограничения
⚠️ Слабый эффект на топовых моделях: для сильных моделей, которые уже отвечают почти идеально, TTA почти ничего не добавляет — там просто нет пространства для улучшения.
⚠️ Прирост скромный: обычно 1-2 процентных пункта точности. Если задача простая или ответ модели и так стабилен, увеличение стоимости и времени в 2-6 раз может не окупиться.
⚠️ Метод статистический, а не гарантированный: выигрыш заметен на большом количестве вопросов. На одном конкретном вопросе результат может совпасть с обычным ответом или отличаться — предсказать заранее нельзя.
⚠️ Не смешивай модальности: если вопрос с картинкой, перефразируй либо текст, либо картинку — не оба сразу. Одновременное изменение обоих частей вносит слишком много шума и портит голосование.
Как исследовали
Команда из Amazon Web Services взяла шесть разных тестов — от общих знаний (MMLU) и математики (Math500) до анализа изображений (MMMU) и тональности отзывов (IMDB) — и прогнала через них Claude Haiku, Sonnet и Opus. Сравнивали при равном бюджете вычислений: если self-consistency делает k запросов, у TTA тоже k запросов, просто с разными формулировками входа.
Главный вывод — при одинаковых затратах перефразирование входа даёт больше точности на доллар, чем повторная генерация ответа: примерно в 1,8 раза эффективнее self-consistency, и выигрывает на пяти из шести тестов.
Любопытная деталь: эффект сильнее на слабых моделях (Haiku) и почти исчезает на топовых (Opus) — потому что у топовой модели и так мало «шума формулировки», который можно было бы гасить. Ещё интереснее: для картинок перефразирование самого изображения (лёгкие повороты, яркость) работает хуже, чем перефразирование сопровождающего текста — модели куда чувствительнее к словам, чем к мелким визуальным искажениям.
Ресурсы
Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute. Nikita Kozodoi, Zainab Afolabi, Jack Butler (Amazon Web Services). Опубликовано на COLM 2026 Workshop on Efficient Reasoning. Код и промпты на GitHub.
