3,583 papers
arXiv:2608.18931 80 19 авг. 2026 г. FREE

Синтез вместо выбора: почему нельзя просто попросить LLM «выбрать лучший вариант»

КЛЮЧЕВАЯ СУТЬ
Просишь модель выбрать лучший из 5 вариантов юридического заключения — и получаешь результат почти как при подбрасывании монетки. Метод синтеза выбивает это дно: вместо выбора модель сшивает сильные куски всех черновиков в один финальный текст. Замена одного слова в промпте — «объединить» вместо «выбрать» — и качество заметно растёт. Модель не ранжирует тексты, она их компилирует — а это ей удаётся на порядок лучше.
Адаптировать под запрос

TL;DR

Когда просишь модель сгенерировать несколько вариантов ответа и выбрать лучший — для творческих, экспертных и открытых задач (юридическое заключение, медицинская консультация, текст для клиента) это почти не работает. Модель-судья, которая должна оценить и выбрать лучший из вариантов, угадывает результат почти случайно. Зато если попросить модель объединить лучшие куски из всех вариантов в один финальный текст — качество ощутимо растёт.

Проблема в том, что качественных вариантов среди сгенерированных много — это исследователи проверили отдельно и подтвердили. Но когда нужно выбрать один из них как "лучший", LLM-судья или reward-модель (модель, которая ставит оценку тексту) справляется почти на уровне подбрасывания монетки. Причина простая: reward-модели обучены различать "правильно/неправильно" на математике и коде, где есть единственный верный ответ. На открытых задачах, где качество — это нюанс, а не факт, эти модели не понимают, что оценивать.

Решение — не выбирать, а сплавлять. Вместо промпта "вот 5 вариантов, выбери лучший" нужен промпт "вот 5 вариантов, синтезируй из них один финальный ответ, взяв лучшее из каждого". Это единственная стратегия из проверенных, которая стабильно даёт улучшение на всех типах открытых задач — хотя и не выжимает весь потенциал, который есть в вариантах.


🔬

Схема метода

ШАГ 1: Сгенерировать N разных вариантов ответа на задачу → N черновиков
ШАГ 2: Попросить модель СИНТЕЗИРОВАТЬ (не выбрать!) финальный ответ,
       объединив сильные стороны всех вариантов → 1 финальный текст

Оба шага можно сделать в одном чате: сначала попросить N вариантов, потом — отдельным сообщением — синтез.


🚀

Пример применения

Задача: Юрист готовит заключение по спорному кейсу для клиента — ситуация неоднозначная, единственно верного текста не существует, важны нюансы аргументации.

Промпт:

Ты — опытный юрист. Вот описание кейса: {описание ситуации}.

Напиши 4 разных варианта юридического заключения по этому кейсу. 
Пусть варианты отличаются подходом к аргументации и структурой изложения.
Пронумеруй их: Вариант 1, Вариант 2, Вариант 3, Вариант 4.

Затем — новое сообщение:

Теперь изучи все 4 варианта выше. Не выбирай один из них как "лучший".
Вместо этого напиши ПЯТЫЙ, финальный вариант заключения, который 
объединяет самые сильные формулировки, аргументы и структурные решения 
из всех четырёх черновиков.

Результат: В первом сообщении модель выдаст 4 разных заключения, различающихся акцентами и структурой аргументации. Во втором — синтезированный текст, который заметно точнее и полнее любого отдельного варианта, потому что модель забирает сильные места из каждого черновика, а не гадает, какой черновик "правильный" целиком.


🧠

Почему это работает

LLM плохо умеет сравнивать и ранжировать целые тексты по абстрактному критерию "качество", когда правильного ответа не существует. Внутренний "судья" модели (и специальные reward-модели, обученные для этого) путается — их обучали в основном на задачах с чёткой правотой, вроде математики.

Зато LLM отлично умеет компилировать и переписывать — брать несколько кусков текста и сшивать их в связный документ. Это близко к тому, что модель и так хорошо делает: суммаризация, переписывание, объединение источников.

Метод обходит слабость (плохое ранжирование) через сильную сторону (хороший синтез). Вместо вопроса "что лучше?" модели задают вопрос "как объединить?" — и это принципиально другая, более лёгкая для неё задача.

Рычаги управления: - Число вариантов (N) — больше вариантов, больше разнообразия для синтеза, но и больше токенов. Для простых задач хватит 3, для сложных экспертных — 5-6. - Просьба "объединить" vs "выбрать" — ключевая формулировка. Замена одного слова меняет результат кардинально. - Просьба указать источник фразы ("отметь, из какого варианта взял формулировку") — даёт прозрачность, но не обязательна.


📋

Шаблон промпта

Ты — {роль эксперта}. Вот задача: {описание задачи}.

Шаг 1. Напиши {N} разных вариантов решения этой задачи. 
Пусть варианты отличаются подходом, структурой или акцентами.
Пронумеруй их.

Шаг 2. Изучи все варианты. Не выбирай один из них как готовый ответ.
Напиши финальный, {N+1}-й вариант, который объединяет самые 
сильные элементы из каждого черновика — лучшие формулировки, 
аргументы и структурные решения.

🚀 Быстрый старт — вставь в чат:

Вот шаблон работы с несколькими вариантами ответа через синтез. 
Адаптируй под мою задачу: {твоя задача}. 
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, сколько вариантов нужно и какую роль/экспертизу задать — потому что от этого зависит разнообразие черновиков, из которых потом собирается финальный текст.


⚠️

Ограничения

⚠️ Не работает там, где не нужно: для задач с единственным правильным ответом (математика, код, точные факты) обычный выбор лучшего варианта работает нормально — этот эффект касается только открытых, оценочных задач без единственно верного ответа.

⚠️ Самокритика — рискованная стратегия: просить модель "покритикуй и улучши свой же ответ" несколько раз подряд помогает редко и непредсказуемо — на части задач качество даже падает. Особенно опасно в точных экспертных областях (медицина, право), где "улучшение" может исказить факты.

⚠️ Синтез — не идеальное решение: даже лучшая стратегия (объединение вариантов) забирает лишь около 40% того потенциала качества, который реально есть среди сгенерированных черновиков. Метод лучше остальных, но не решает проблему полностью.

⚠️ Генерация большого дерева вариантов (пошаговый поиск) вредит: если модель на каждом шаге "отсекает" неудачные ветки рассуждения по своей внутренней оценке, все финальные варианты становятся почти одинаковыми — разнообразие исчезает, и толку от нескольких попыток нет.


🔍

Как исследовали

Команда протестировала пять стратегий работы с несколькими вариантами ответа (выбор через оценщика, два вида пошагового поиска, самокритика и синтез) на пяти открытых задачах: медицинские консультации, юридический анализ, финансовые заключения, обычный чат и творческое письмо. Тестировали на нескольких моделях (включая Qwen3.5 и OLMo3), при этом честно уравняли всех по затраченным токенам, чтобы сравнение было справедливым — иначе метод, который просто генерирует больше текста, выглядел бы "умнее".

Чтобы понять, сколько качества теоретически доступно в наборе вариантов, исследователи считали "оракульную" оценку — качество лучшего из всех черновиков по мнению независимого судьи, с поправкой на шум оценки. Разница между этой потенциальной планкой и тем, что метод реально выдаёт на выходе, и показала главное: потенциал есть, а вот способа его забрать почти нет.

Самое любопытное — reward-модели (специальные модели-оценщики) показали корреляцию с реальным качеством всего около 0.12 из максимума 1.0 — это уровень, близкий к случайному угадыванию. Причём две разные reward-модели ошибались практически одинаково, что говорит не о случайном баге одной модели, а о структурной проблеме подхода "обучи модель ставить оценки" для задач без единственного правильного ответа.


🔗

Ресурсы

Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck — Davide Romano, Kanak Raj, Jerrod Parker, Daniele Giofrè (Thomson Reuters Foundational Research)


📋 Дайджест исследования

Ключевая суть

Просишь модель выбрать лучший из 5 вариантов юридического заключения — и получаешь результат почти как при подбрасывании монетки. Метод синтеза выбивает это дно: вместо выбора модель сшивает сильные куски всех черновиков в один финальный текст. Замена одного слова в промпте — «объединить» вместо «выбрать» — и качество заметно растёт. Модель не ранжирует тексты, она их компилирует — а это ей удаётся на порядок лучше.

Принцип работы

Правило простое: никогда не проси модель выбрать лучший вариант для открытой задачи — проси собрать финальный текст из кусков. Не судья, а редактор-компилятор — вот новая роль модели. Она берёт абзац аргументации из варианта 2, структуру из варианта 4, и сшивает всё в один документ.

Почему работает

Reward-модели и LLM-судьи учились на математике и коде — там один правильный ответ, легко проверить. На юридическом заключении правильного ответа нет. Внутренний судья модели угадывает почти наугад. Зато компилировать и переписывать текст модель умеет отлично — это её конёк, ближе к суммаризации. Смена вопроса с «что лучше?» на «как объединить?» — и провальная задача становится посильной. Правда, даже синтез забирает лишь около 40% реального потенциала качества среди черновиков — метод хороший, но не идеальный.

Когда применять

Открытые экспертные задачи → юридические заключения, медицинские консультации, тексты для клиентов — там, где нет единственно верного ответа. НЕ подходит для математики, кода и задач с точным фактическим ответом — там обычный выбор лучшего варианта работает нормально.

Мини-рецепт

1. Собери черновики: попроси модель написать 3-6 разных вариантов ответа, пусть отличаются подходом и структурой.
2. Не выбирай — объединяй: новым сообщением попроси собрать финальный текст, забрав сильные формулировки и аргументы из каждого черновика.
3. Добавь прозрачность (опционально): попроси отметить, из какого варианта взята каждая часть — так проще проверить логику модели.

Примеры

[ПЛОХО] : Вот 5 вариантов ответа на клиентский запрос. Выбери лучший.
[ХОРОШО] : Вот 5 вариантов юридического заключения. Не выбирай один как лучший — напиши шестой, финальный вариант, объединив сильные формулировки и аргументы из каждого.
Источник: Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck
ArXiv ID: 2608.18931 | Сгенерировано: 2026-08-20 05:23

Проблемы LLM

ПроблемаСутьКак обойти
Модель не умеет выбирать лучший вариант из нескольких — на открытых задачахПросишь модель или отдельную оценивающую модель выбрать лучший из нескольких черновиков. Для юридических, медицинских, творческих, экспертных задач — угадывание почти на уровне монетки. Причина: такие модели-оценщики обучены на математике и коде, где есть один верный ответ. На открытых задачах, где качество — нюанс, а не факт, оценщик не понимает критерийНе проси выбрать. Проси синтезировать: собрать один финальный текст из лучших кусков всех вариантов

Методы

МетодСуть
Синтез вариантов вместо выбора одногоСначала попроси модель сгенерировать несколько (3–6) разных черновиков ответа. Затем отдельным сообщением попроси не выбрать лучший, а написать новый финальный текст, объединив сильные формулировки, аргументы и структуру из всех черновиков. "Не выбирай один вариант. Напиши финальный, который объединяет лучшее из всех". Работает потому, что модель гораздо лучше компилирует и переписывает текст, чем абстрактно ранжирует его качество. Замена слова "выбери" на "объедини" меняет результат кардинально. Работает на открытых, оценочных задачах без единственно верного ответа. Не работает и не нужен там, где ответ проверяем и однозначен — математика, код, точные факты. Даже лучший синтез не выжимает весь потенциал качества, который есть в черновиках — это улучшение, а не идеальное решение

Тезисы

ТезисКомментарий
Повторная самокритика не гарантирует улучшение ответаПросить модель раз за разом покритиковать и переписать свой же ответ — рискованная стратегия. Результат непредсказуем: иногда качество растёт, иногда падает. Механика та же, что и с выбором лучшего варианта — модель плохо оценивает абстрактное "качество" собственного текста. Особенно опасно в точных экспертных областях (медицина, право), где "улучшение" может незаметно искажать факты. Применяй: не зацикливай самокритику несколько раз подряд, лучше используй синтез нескольких независимых черновиков
📖 Простыми словами

Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck

arXiv: 2608.18931

Когда мы заставляем нейронку нагенерировать пять вариантов ответа и просим её саму выбрать лучший — в сложных задачах это полный провал. Популярный метод Best-of-N круто работает в коде или математике, где ответ либо верный, либо нет. Но в открытых темах внутренний LLM-судья просто тычет пальцем в небо, потому что не способен измерить абстрактное «качество аргументации».

Это как нанять трёх дизайнеров сделать логотип, а потом попросить стажёра вслепую выбрать «самый лучший». Стажёр ткнёт в случайную фигню, потому что не понимает критериев. Но если взять все три концепта, забрать из каждого удачные детали и собрать в один финальный макет, результат внезапно окажется на голову выше любого отдельного черновика.

Рабочая схема — не селекция, а синтез через слияние. Ты генерируешь несколько вариантов, а затем отдаёшь их модели с жёсткой задачей: «собери сильные тезисы из каждого драфта и выкинь воду». Фокус смещается с поиска идеального ответа на утилизацию лучших кусков, превращая разрозненные мысли в монолитный экспертный текст.

Тестировали на юридических заключениях, но принцип универсален для любой задачи без однозначного ответа. Медицинские разборы, сложные коммерческие предложения, тексты для клиентов или аналитика — везде, где правильный ответ субъективен, выбор одного варианта сливает результат, а компиляция черновиков выдаёт максимум.

Короче: хватит надеяться на «выбери лучший вариант» в задачах сложнее таблицы умножения — нейросудьи лажают и выбирают рандом. Генерируй несколько драфтов и заставляй сетку склеивать из них гибридный ответ. Это простой трюк, который мгновенно поднимает качество текста без дообучения моделей.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с