3,583 papers
arXiv:2608.09351 76 10 авг. 2026 г. FREE

Test-Time Augmentation (TTA): перефразируй вопрос несколько раз вместо повторной генерации ответа

КЛЮЧЕВАЯ СУТЬ
Модель цепляется за конкретные слова вопроса, а не за его суть — спроси «столица Франции» и «главный город Франции» и на сложных вопросах иногда получишь разные ответы. Test-Time Augmentation (TTA) позволяет повысить точность ответа без дообучения — просто меняя формулировку вопроса перед тем как спрашивать. Метод создаёт k разных перефразировок одного вопроса вместо того чтобы повторять тот же текст — и берёт ответ, победивший по большинству голосов.
Адаптировать под запрос

TL;DR

TTA — техника, которая вместо того чтобы просто повторно спрашивать модель один и тот же вопрос, сначала создаёт несколько перефразированных версий этого вопроса, получает ответ на каждую версию отдельно, а затем выбирает ответ, который встретился чаще всего (голосование большинством).

Модели чувствительны к формулировке: спроси «Какая столица Франции?» и «Назови главный город Франции» — иногда получишь разные ответы на сложных вопросах, потому что модель цепляется за конкретные слова в вопросе, а не за суть. Стандартный приём — self-consistency — просто повторяет тот же самый вопрос несколько раз при высокой температуре, надеясь, что модель хотя бы иногда рассуждает по-другому. Но это лечит только "случайность рассуждения", а не "случайность формулировки".

TTA решает обе проблемы сразу: генерирует k разных формулировок одного вопроса, получает ответ на каждую, а финальный ответ — тот, что победил по голосам. Это как спросить пятерых разными словами одно и то же и взять большинство.


🔬

Схема метода

ШАГ 1 (один промпт): Попросить модель сгенерировать k перефразировок вопроса, 
                      сохраняя смысл, формат ответа и все детали → k формулировок

ШАГ 2 (k отдельных запросов): Отправить каждую формулировку отдельно, 
                               получить ответ на каждую → k ответов

ШАГ 3: Посчитать, какой ответ встретился чаще всего → финальный ответ

🚀

Пример применения

Задача: Ты руководишь поддержкой на маркетплейсе. Пришёл спорный кейс — жалоба клиента, где неочевидно, кто виноват: продавец или сам покупатель. От решения зависит, возвращать ли деньги.

Промпт:

Вот жалоба клиента: 
"Заказал наушники, пришли без коробки, продавец говорит, что упаковку 
повредила служба доставки, но на фото коробки нет вообще следов повреждения 
— просто голые наушники в пакете."

ШАГ 1: Перефразируй эту жалобу 4 разными способами. Сохрани все детали 
и факты, просто меняй формулировку и структуру предложения.

ШАГ 2: Для каждой из 4 версий отдельно реши: виноват продавец или 
служба доставки, и почему. Отвечай на каждую версию так, как если бы 
видел её первый раз, без оглядки на предыдущие ответы.

ШАГ 3: Посчитай, какой вердикт (продавец/доставка) встретился чаще, 
и дай финальный ответ с объяснением.

Результат: Модель покажет 4 перефразированные версии жалобы, под каждой — отдельный вердикт с рассуждением, а в конце — итог: сколько раз выбрано «продавец», сколько «доставка», и финальное решение с аргументацией.


🧠

Почему это работает

Модель отвечает не на «смысл» вопроса, а на конкретный текст — набор слов и их порядок. Если задать один и тот же вопрос по-разному, ответ иногда меняется, потому что модель цепляется за случайные детали формулировки, как за подсказку.

Зато модель отлично умеет перефразировать текст, сохраняя смысл — это одна из базовых сильных сторон языковых моделей.

TTA использует эту сильную сторону, чтобы обойти слабость: вместо того чтобы полагаться на одну формулировку, метод создаёт несколько версий и усредняет через голосование. Шум от конкретной фразы гасится, потому что редко все версии собьются в одну сторону одновременно.

Рычаги управления: - Число перефразировок (k) — исследование показало, что 4 версии обычно достаточно, больше — почти не даёт прибавки, только тратит ресурсы - Тип перефразирования — смысловое (сохраняет суть, меняет слова) работает лучше, чем просто «испортить» текст опечатками - Модальность — если в вопросе есть картинка, лучше перефразировать текст, а не саму картинку: перефразирование текста даёт больше выигрыша, а смешивание текстовых и визуальных изменений может всё испортить


📋

Шаблон промпта

Вот вопрос/задача: {вопрос}

ШАГ 1: Перефразируй этот вопрос {число_версий} разными способами. 
Сохрани точный смысл, все важные детали, формат ожидаемого ответа. 
Меняй только слова и структуру предложения.

ШАГ 2: Ответь на каждую из {число_версий} версий отдельно, как если бы 
видел её первый раз — не подглядывай в предыдущие ответы.

ШАГ 3: Посчитай, какой ответ повторился чаще всего среди всех версий. 
Дай финальный ответ с кратким объяснением, почему именно он победил.

Что подставлять: {вопрос} — твоя реальная задача или спорный кейс. {число_версий} — обычно достаточно 4, для простых вопросов хватит 2, для сложных можно взять 6.

🚀 Быстрый старт — вставь в чат:

Вот шаблон Test-Time Augmentation. Адаптируй под мою задачу: {твоя задача}. 
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, сколько версий генерировать и насколько сильно можно менять формулировку без потери смысла — потому что от этого зависит, будет ли реальная разница между версиями, или они окажутся клонами друг друга.


⚠️

Ограничения

⚠️ Слабый эффект на топовых моделях: для сильных моделей, которые уже отвечают почти идеально, TTA почти ничего не добавляет — там просто нет пространства для улучшения.

⚠️ Прирост скромный: обычно 1-2 процентных пункта точности. Если задача простая или ответ модели и так стабилен, увеличение стоимости и времени в 2-6 раз может не окупиться.

⚠️ Метод статистический, а не гарантированный: выигрыш заметен на большом количестве вопросов. На одном конкретном вопросе результат может совпасть с обычным ответом или отличаться — предсказать заранее нельзя.

⚠️ Не смешивай модальности: если вопрос с картинкой, перефразируй либо текст, либо картинку — не оба сразу. Одновременное изменение обоих частей вносит слишком много шума и портит голосование.


🔍

Как исследовали

Команда из Amazon Web Services взяла шесть разных тестов — от общих знаний (MMLU) и математики (Math500) до анализа изображений (MMMU) и тональности отзывов (IMDB) — и прогнала через них Claude Haiku, Sonnet и Opus. Сравнивали при равном бюджете вычислений: если self-consistency делает k запросов, у TTA тоже k запросов, просто с разными формулировками входа.

Главный вывод — при одинаковых затратах перефразирование входа даёт больше точности на доллар, чем повторная генерация ответа: примерно в 1,8 раза эффективнее self-consistency, и выигрывает на пяти из шести тестов.

Любопытная деталь: эффект сильнее на слабых моделях (Haiku) и почти исчезает на топовых (Opus) — потому что у топовой модели и так мало «шума формулировки», который можно было бы гасить. Ещё интереснее: для картинок перефразирование самого изображения (лёгкие повороты, яркость) работает хуже, чем перефразирование сопровождающего текста — модели куда чувствительнее к словам, чем к мелким визуальным искажениям.


🔗

Ресурсы

Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute. Nikita Kozodoi, Zainab Afolabi, Jack Butler (Amazon Web Services). Опубликовано на COLM 2026 Workshop on Efficient Reasoning. Код и промпты на GitHub.


📋 Дайджест исследования

Ключевая суть

Модель цепляется за конкретные слова вопроса, а не за его суть — спроси «столица Франции» и «главный город Франции» и на сложных вопросах иногда получишь разные ответы. Test-Time Augmentation (TTA) позволяет повысить точность ответа без дообучения — просто меняя формулировку вопроса перед тем как спрашивать. Метод создаёт k разных перефразировок одного вопроса вместо того чтобы повторять тот же текст — и берёт ответ, победивший по большинству голосов.

Принцип работы

Стандартный self-consistency — это как пять раз задать один и тот же вопрос одному человеку, надеясь что он хоть раз ответит иначе. TTA — это как спросить пятерых разными словами одно и то же и взять большинство. Меняется не температура генерации ответа, а сам вопрос — вот в чём разница.

Почему работает

Модель отвечает не на смысл вопроса, а на конкретный набор слов и их порядок — формулировка работает как случайная подсказка, за которую модель цепляется. Зато перефразирование текста с сохранением смысла — одна из базовых сильных сторон языковых моделей. TTA бьёт слабость модели её же силой: шум от одной конкретной фразы гасится голосованием, потому что редко все версии собьются в одну сторону одновременно. Исследование показало: 4 перефразировки — оптимум, больше почти не добавляет точности, только жжёт токены.

Когда применять

Спорные и неоднозначные кейсы → задачи где ответ модели может зависеть от случайной формулировки, особенно в разборе жалоб, юридических и оценочных вопросах. НЕ подходит для топовых моделей на простых задачах — там модель уже отвечает почти идеально, и TTA не даёт выигрыша, только тратит в 2-6 раз больше запросов.

Мини-рецепт

1. Сгенерируй перефразировки: одним промптом попроси модель создать 4 версии вопроса, сохраняя смысл, детали и формат ответа.
2. Разошли отдельно: каждую версию отправь как новый запрос — без оглядки на предыдущие ответы, модель должна видеть её «первый раз».
3. Посчитай голоса: собери 4 ответа, найди тот что повторился чаще — это и есть финальный ответ.
4. Не смешивай картинку и текст: если вопрос с изображением, меняй либо текст, либо картинку — не оба сразу, иначе голосование развалится от шума.

Примеры

[ПЛОХО] : Кто виноват в этой жалобе — продавец или доставка? (одна формулировка — один шанс словить случайный ответ)
[ХОРОШО] : Перефразируй эту жалобу 4 разными способами, сохрани все факты. Для каждой версии отдельно реши: продавец или доставка виноват. Посчитай какой вердикт встретился чаще и дай финальный ответ.
Источник: Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute
ArXiv ID: 2608.09351 | Сгенерировано: 2026-08-11 05:32

Проблемы LLM

ПроблемаСутьКак обойти
Ответ модели меняется от формулировки вопросаСпрашиваешь одно и то же разными словами — получаешь разные ответы. Модель цепляется за конкретные слова в вопросе, а не за его суть. Особенно заметно на сложных вопросах. Из-за этого один ответ модели нельзя считать надёжным — он может быть случайным следствием формулировки, а не реальным знаниемСгенерируй несколько перефразировок вопроса с сохранением смысла. Получи ответ на каждую отдельно. Возьми ответ, который повторился чаще всего

Методы

МетодСуть
Голосование по перефразированным версиям вопроса (Test-Time Augmentation)Попроси модель создать k перефразировок вопроса, сохраняя смысл, детали и формат ответа. Отправь каждую версию отдельным запросом, без оглядки на предыдущие ответы. Посчитай, какой ответ повторился чаще всего — это и есть финальный ответ. Почему работает: перефразирование текста без потери смысла — сильная сторона языковых моделей, а чувствительность к конкретной формулировке — их слабость. Голосование по нескольким версиям гасит случайный шум от одной конкретной фразы, потому что редко все версии ошибутся в одну и ту же сторону. Когда да: сложные или спорные вопросы, важна надёжность ответа, есть ресурс на несколько запросов. Когда нет: топовая модель уже отвечает почти идеально — улучшать нечего; простой вопрос с и так стабильным ответом — рост стоимости в 2-6 раз не окупается

Тезисы

ТезисКомментарий
Увеличение числа вариаций входа быстро выходит на платоКогда генерируешь несколько версий вопроса для голосования, точность растёт только до определённого числа версий (около 4). После этого дополнительные версии почти не добавляют качества, только тратят время и ресурсы. Работает потому что после нескольких перефразировок основной "шум формулировки" уже усреднён — новые версии просто повторяют уже собранную информацию. Применяй: не генерируй больше 4-6 вариаций для голосования — этого почти всегда достаточно
📖 Простыми словами

Test-Time Augmentation forLLMs: When Input Diversity Beats Output Diversity at MatchedCompute

arXiv: 2608.09351

Суть в том, что современные нейронки — это не сверхразум, а капризные лингвистические калькуляторы. Они дико чувствительны к тому, как именно ты составил запрос. Если ты спросишь одно и то же дважды, используя разные слова, модель может выдать диаметрально противоположные ответы. Исследование доказывает: входное разнообразие (Input Diversity) работает лучше, чем простое ожидание, что модель «передумает» сама по себе. Вместо того чтобы долбить в одну точку, метод TTA заставляет систему посмотреть на задачу под разными углами, прежде чем вынести вердикт.

Это как если бы ты пришел к врачу с жалобой на боль в боку, а он, вместо того чтобы просто переспросить «точно болит?», позвал бы коллег и каждый задал бы вопрос по-своему: один про диету, другой про спорт, третий про сон. Если пятеро из шести врачей после разных вопросов придут к одному диагнозу, шанс на ошибку стремится к нулю. В этом и прикол: голосование большинством на базе разных формулировок отсекает случайные глюки нейронки, которые возникают из-за неудачного порядка слов.

Метод работает просто: берем твой исходный промпт и делаем перефразирование. Создаем пять-десять вариаций одного и того же вопроса, скармливаем их модели и смотрим на результат. Если на запрос «кто виноват в споре на маркетплейсе» модель в разных вариациях текста стабильно тычет пальцем в продавца, значит, это и есть истина. Исследователи выяснили, что такая аугментация на этапе теста эффективнее, чем просто генерировать много ответов на один и тот же текст, потому что она выбивает модель из колеи «зацикливания» на конкретных словах.

Этот принцип — универсальный паттерн для любой сложной задачи, где цена ошибки высока. Тестировали на логике и математике, но это маст-хэв для юристов, аналитиков и техподдержки. Везде, где ответ «да» или «нет» зависит от того, не встала ли нейронка с утра не с той ноги, нужно использовать TTA. Это превращает гадание на кофейной гуще в нормальный, воспроизводимый процесс, где статистика бьёт рандом.

Короче, хватит надеяться на один «идеальный» промпт — его не существует. Если хочешь выжать из LLM максимум точности, заставляй её отвечать на десять версий одного вопроса. Это требует больше вычислительных мощностей, но результат того стоит: точность растет без дообучения модели. Либо ты тратишь ресурсы на перепроверку, либо продолжаешь получать ответы, которые зависят от того, поставил ты в конце вопроса точку или восклицательный знак.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с