TL;DR
Когда просишь модель сгенерировать несколько вариантов ответа и выбрать лучший — для творческих, экспертных и открытых задач (юридическое заключение, медицинская консультация, текст для клиента) это почти не работает. Модель-судья, которая должна оценить и выбрать лучший из вариантов, угадывает результат почти случайно. Зато если попросить модель объединить лучшие куски из всех вариантов в один финальный текст — качество ощутимо растёт.
Проблема в том, что качественных вариантов среди сгенерированных много — это исследователи проверили отдельно и подтвердили. Но когда нужно выбрать один из них как "лучший", LLM-судья или reward-модель (модель, которая ставит оценку тексту) справляется почти на уровне подбрасывания монетки. Причина простая: reward-модели обучены различать "правильно/неправильно" на математике и коде, где есть единственный верный ответ. На открытых задачах, где качество — это нюанс, а не факт, эти модели не понимают, что оценивать.
Решение — не выбирать, а сплавлять. Вместо промпта "вот 5 вариантов, выбери лучший" нужен промпт "вот 5 вариантов, синтезируй из них один финальный ответ, взяв лучшее из каждого". Это единственная стратегия из проверенных, которая стабильно даёт улучшение на всех типах открытых задач — хотя и не выжимает весь потенциал, который есть в вариантах.
Схема метода
ШАГ 1: Сгенерировать N разных вариантов ответа на задачу → N черновиков
ШАГ 2: Попросить модель СИНТЕЗИРОВАТЬ (не выбрать!) финальный ответ,
объединив сильные стороны всех вариантов → 1 финальный текст
Оба шага можно сделать в одном чате: сначала попросить N вариантов, потом — отдельным сообщением — синтез.
Пример применения
Задача: Юрист готовит заключение по спорному кейсу для клиента — ситуация неоднозначная, единственно верного текста не существует, важны нюансы аргументации.
Промпт:
Ты — опытный юрист. Вот описание кейса: {описание ситуации}.
Напиши 4 разных варианта юридического заключения по этому кейсу.
Пусть варианты отличаются подходом к аргументации и структурой изложения.
Пронумеруй их: Вариант 1, Вариант 2, Вариант 3, Вариант 4.
Затем — новое сообщение:
Теперь изучи все 4 варианта выше. Не выбирай один из них как "лучший".
Вместо этого напиши ПЯТЫЙ, финальный вариант заключения, который
объединяет самые сильные формулировки, аргументы и структурные решения
из всех четырёх черновиков.
Результат: В первом сообщении модель выдаст 4 разных заключения, различающихся акцентами и структурой аргументации. Во втором — синтезированный текст, который заметно точнее и полнее любого отдельного варианта, потому что модель забирает сильные места из каждого черновика, а не гадает, какой черновик "правильный" целиком.
Почему это работает
LLM плохо умеет сравнивать и ранжировать целые тексты по абстрактному критерию "качество", когда правильного ответа не существует. Внутренний "судья" модели (и специальные reward-модели, обученные для этого) путается — их обучали в основном на задачах с чёткой правотой, вроде математики.
Зато LLM отлично умеет компилировать и переписывать — брать несколько кусков текста и сшивать их в связный документ. Это близко к тому, что модель и так хорошо делает: суммаризация, переписывание, объединение источников.
Метод обходит слабость (плохое ранжирование) через сильную сторону (хороший синтез). Вместо вопроса "что лучше?" модели задают вопрос "как объединить?" — и это принципиально другая, более лёгкая для неё задача.
Рычаги управления: - Число вариантов (N) — больше вариантов, больше разнообразия для синтеза, но и больше токенов. Для простых задач хватит 3, для сложных экспертных — 5-6. - Просьба "объединить" vs "выбрать" — ключевая формулировка. Замена одного слова меняет результат кардинально. - Просьба указать источник фразы ("отметь, из какого варианта взял формулировку") — даёт прозрачность, но не обязательна.
Шаблон промпта
Ты — {роль эксперта}. Вот задача: {описание задачи}.
Шаг 1. Напиши {N} разных вариантов решения этой задачи.
Пусть варианты отличаются подходом, структурой или акцентами.
Пронумеруй их.
Шаг 2. Изучи все варианты. Не выбирай один из них как готовый ответ.
Напиши финальный, {N+1}-й вариант, который объединяет самые
сильные элементы из каждого черновика — лучшие формулировки,
аргументы и структурные решения.
🚀 Быстрый старт — вставь в чат:
Вот шаблон работы с несколькими вариантами ответа через синтез.
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, сколько вариантов нужно и какую роль/экспертизу задать — потому что от этого зависит разнообразие черновиков, из которых потом собирается финальный текст.
Ограничения
⚠️ Не работает там, где не нужно: для задач с единственным правильным ответом (математика, код, точные факты) обычный выбор лучшего варианта работает нормально — этот эффект касается только открытых, оценочных задач без единственно верного ответа.
⚠️ Самокритика — рискованная стратегия: просить модель "покритикуй и улучши свой же ответ" несколько раз подряд помогает редко и непредсказуемо — на части задач качество даже падает. Особенно опасно в точных экспертных областях (медицина, право), где "улучшение" может исказить факты.
⚠️ Синтез — не идеальное решение: даже лучшая стратегия (объединение вариантов) забирает лишь около 40% того потенциала качества, который реально есть среди сгенерированных черновиков. Метод лучше остальных, но не решает проблему полностью.
⚠️ Генерация большого дерева вариантов (пошаговый поиск) вредит: если модель на каждом шаге "отсекает" неудачные ветки рассуждения по своей внутренней оценке, все финальные варианты становятся почти одинаковыми — разнообразие исчезает, и толку от нескольких попыток нет.
Как исследовали
Команда протестировала пять стратегий работы с несколькими вариантами ответа (выбор через оценщика, два вида пошагового поиска, самокритика и синтез) на пяти открытых задачах: медицинские консультации, юридический анализ, финансовые заключения, обычный чат и творческое письмо. Тестировали на нескольких моделях (включая Qwen3.5 и OLMo3), при этом честно уравняли всех по затраченным токенам, чтобы сравнение было справедливым — иначе метод, который просто генерирует больше текста, выглядел бы "умнее".
Чтобы понять, сколько качества теоретически доступно в наборе вариантов, исследователи считали "оракульную" оценку — качество лучшего из всех черновиков по мнению независимого судьи, с поправкой на шум оценки. Разница между этой потенциальной планкой и тем, что метод реально выдаёт на выходе, и показала главное: потенциал есть, а вот способа его забрать почти нет.
Самое любопытное — reward-модели (специальные модели-оценщики) показали корреляцию с реальным качеством всего около 0.12 из максимума 1.0 — это уровень, близкий к случайному угадыванию. Причём две разные reward-модели ошибались практически одинаково, что говорит не о случайном баге одной модели, а о структурной проблеме подхода "обучи модель ставить оценки" для задач без единственного правильного ответа.
Ресурсы
Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck — Davide Romano, Kanak Raj, Jerrod Parker, Daniele Giofrè (Thomson Reuters Foundational Research)
