TL;DR
Когда ты просишь модель дать несколько вариантов ответа — идей, решений, диагнозов, вариантов кода — важно не качество каждого отдельного варианта, а сколько из них реально разных и полезных. Исследователи придумали способ считать это точно: не "насколько тексты непохожи друг на друга", а "сколько разных полезных исходов накопилось после k попыток".
Главная боль: модель, которая даёт лучший единственный ответ, может проигрывать при генерации набора из 5-10 вариантов — потому что она зацикливается на одной и той же идее, просто переформулированной. И наоборот: непохожие по тексту варианты (разные слова, разная структура) часто оказываются той же самой идеей по сути — просто с другой обёрткой. Метрика "тексты выглядят по-разному" не ловит это.
Суть метода: для каждой задачи явно определяют, что считается "одним и тем же результатом" по смыслу (а не по форме), и считают, сколько разных по смыслу валидных результатов накопилось за k попыток. Это позволило показать: ранжирование моделей "кто лучше с первого раза" и "кто даёт больше разных полезных вариантов" — это два разных рейтинга, и они часто не совпадают.
Схема метода
Метод — это не промпт-техника, а способ измерения, что даёт ценный практический вывод для использования LLM:
ШАГ 1: Определи, что значит "два ответа — это по сути один и тот же результат"
(не по форме текста, а по смысловому ядру)
ШАГ 2: Генерируй k вариантов от модели
ШАГ 3: Проверяй каждый вариант на валидность (соответствует ли задаче)
ШАГ 4: Считай уникальные "смысловые ядра" среди валидных вариантов
→ это и есть реальная польза от k попыток, а не k штук текста
Пример применения
Задача: Ты просишь ChatGPT придумать 5 названий для нового бренда кофе навынос в стиле "Правда".
Промпт (наивный подход, который обманывает):
Придумай 5 разных названий для кофейни навынос.
Сделай их максимально непохожими друг на друга.
Что произойдёт по факту (инсайт из исследования): модель выдаст 5 текстово разных строк — но 3-4 из них могут быть вариациями одной и той же идеи ("Бодрость", "Заряд", "Энергия" — разные слова, одна смысловая ось "энергия/бодрость"). По тексту — разнообразие есть. По смыслу — почти нет.
Промпт (с поправкой на находку исследования):
Придумай 5 названий для кофейни навынос.
Каждое название должно строиться на РАЗНОЙ смысловой идее
(например: скорость, локальность района, ирония, премиальность, утренний ритуал).
Перед каждым названием укажи, на какой идее оно основано.
Если два названия окажутся на одной идее — замени одно из них.
Результат: Модель выдаст 5 названий с явной привязкой к разным смысловым осям и явно проверит их на пересечение — это заставляет её не повторяться по сути, а не только по формулировке.
Почему это работает
Модели по умолчанию хорошо перефразируют, но плохо самостоятельно замечают, что несколько разных формулировок — это одна и та же идея. Заставить модель варьировать слова легко, заставить её варьировать суть — сложнее, потому что она не держит явный список "уже использованных идей" в голове.
Сильная сторона LLM — она хорошо работает, если ей явно назвать критерий различия. Когда ты говоришь "разные по смысловой оси" и просишь модель проверять пересечения, она начинает реально следить за этим, а не полагаться на то, что разные слова = разные идеи.
Рычаг управления: самый мощный элемент — явное определение "что считается повтором" в промпте. Замени абстрактное "сделай разными" на конкретный список осей/критериев, релевантных твоей задаче (для текста — смысловые темы, для бизнес-идей — разные ниши/аудитории, для решений задачи — разные подходы/инструменты).
Шаблон промпта
Мне нужно {количество} разных вариантов для: {задача}.
Каждый вариант должен отличаться от других по СУТИ, а не только по формулировке.
Критерий различия: {что должно отличаться — идея, подход, аудитория, механизм и т.д.}
Для каждого варианта:
1. Укажи, какую конкретную идею/подход/угол он реализует
2. Проверь, не повторяет ли он по смыслу предыдущие варианты
3. Если повторяет — предложи другой вариант вместо него
Выведи финальный список из {количество} вариантов с кратким указанием,
чем каждый принципиально отличается от остальных.
🚀 Быстрый старт — вставь в чат:
Вот шаблон для получения РАЗНЫХ по сути вариантов, а не просто разных по форме.
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какой критерий различия важен именно для твоей задачи (идея, аудитория, технический подход) — потому что без этого модель не поймёт, что считать "повтором", и вернётся к разнообразию по форме текста.
Ограничения
⚠️ Не про качество, а про набор: если тебе нужен один хороший ответ, а не несколько вариантов — этот принцип не даёт преимущества. Он важен только когда ты специально просишь несколько кандидатов на выбор.
⚠️ Нужно самому определить критерий различия: метод работает только если ты (или модель по твоей просьбе) явно формулируешь, что считается "той же идеей". Без этого критерия модель по умолчанию будет варьировать форму, а не суть.
⚠️ Не панацея от повторов: даже с явным критерием модель может ошибаться в самопроверке — она не идеально ведёт учёт "уже сказанного", особенно если вариантов много (>7-10).
Как исследовали
Команда взяла пять совершенно разных практических задач — дизайн молекул под заданные свойства, исправление уязвимостей в коде, генерацию тестов для поиска багов, постановку дифференциального диагноза по истории болезни и поиск релевантных фрагментов текста для сложных вопросов. В каждой задаче они формально определили, что значит "два результата — это одно и то же" (например, для молекул — одинаковый структурный каркас, для патчей — одни и те же изменённые функции).
Дальше прогнали четыре модели (Qwen, GLM, DeepSeek) с разными настройками температуры и режима рассуждений, каждой дав от 5 до 20 попыток на задачу, и посчитали, сколько уникальных полезных исходов накопилось. Сравнили это с обычным "качество первого ответа" и с "текстовым разнообразием" (насколько ответы непохожи по форме).
Что удивило: в четырёх из пяти задач модель-лидер по качеству первой попытки — не была лидером по накопленному покрытию после 10-20 попыток. А модель, дающая текстово самые разные ответы, тоже не гарантировала больше разных полезных результатов — расхождение доходило до 25% упущенной пользы при выборе "неправильной" модели по привычным метрикам. Вывод для практики: если тебе важен набор разных вариантов, нельзя судить по одному ответу или по внешнему разнообразию — нужно явно проверять смысловое разнообразие.
