TL;DR
Когда просишь LLM придумать что-то творческое — альтернативные способы использования предмета, продолжение истории, ассоциации — модель выдаёт ответы, которые правдоподобны, но кучкуются в одном и том же "центре". Она почти никогда не даёт те редкие, неочевидные варианты, которые реальные люди придумывают на периферии своего воображения.
Проблема не в том, что LLM ошибается или пишет плохо. Проблема в том, что среди тысяч возможных "легитимных" ответов на открытый вопрос модель раз за разом выбирает один и тот же узкий кластер — самый вероятный, самый "усреднённый". Исследователи сравнили ответы моделей с реальными ответами людей на одни и те же задачи (придумать применения кирпичу, написать фанфик по Гарри Поттеру) и увидели: модель почти всегда попадает "внутрь" диапазона человеческих ответов (это хорошо), но покрывает лишь маленький кусок этого диапазона — в основном самый предсказуемый центр.
Авторы не предлагают готовую технику-лечение, только измеряют разрыв. Но из их находок вытекает практический принцип: чтобы получить от LLM действительно разнообразные, нестандартные идеи — нужно явно просить её выйти за пределы очевидного, потому что "просто попросить много вариантов" не сработает — все они будут похожи друг на друга.
Схема находки
НАБЛЮДЕНИЕ 1: LLM почти всегда "в рамках" человеческого разнообразия → ответы звучат правдоподобно
НАБЛЮДЕНИЕ 2: Но LLM покрывает только маленькую (центральную) часть этого разнообразия → идеи однотипны
НАБЛЮДЕНИЕ 3: Повышение "случайности" генерации расширяет охват без потери правдоподобности
НАБЛЮДЕНИЕ 4: Спросить несколько разных моделей — не помогает, они похожи друг на друга
НАБЛЮДЕНИЕ 5: "Непокрытые" людьми-ответы отличаются системно — это не шум, а конкретные типы контента, которые модель обходит стороной
Пример применения (экстраполяция принципа — не то, что тестировали авторы)
Задача: Маркетолог просит ChatGPT придумать 10 идей для рекламной кампании нового энергетика перед запуском.
Промпт (обычный, наивный):
Придумай 10 креативных идей для рекламной кампании нового энергетического напитка.
Результат по находке исследования: все 10 идей будут вариациями одной и той же "усреднённой" концепции — что-то про спорт, драйв, ночную жизнь. Разнообразие внутри списка есть, но все идеи из одного узкого сегмента возможных подходов.
Промпт с учётом находки (принцип "проси периферию"):
Придумай 10 идей для рекламной кампании нового энергетического напитка.
Первые 3 идеи — самые очевидные и предсказуемые, которые придумал бы любой маркетолог.
Следующие 4 идеи — нестандартные, которые обычно не приходят в голову сразу.
Последние 3 идеи — максимально неожиданные, даже рискованные: такие, что 9 из 10 маркетологов их не предложат.
Результат: Модель структурно разведёт ответы по уровню предсказуемости, и последние 3 идеи будут заметно дальше от "центра" — потому что явное указание сдвигает генерацию к менее вероятным продолжениям, а не оставляет её в зоне комфорта.
Почему это работает
LLM обучена предсказывать наиболее вероятное продолжение текста. При открытых, творческих задачах "наиболее вероятное" — это и есть самый очевидный, шаблонный, "средний" ответ. Именно поэтому просто попросить "10 идей" или "будь креативным" не расширяет охват — модель остаётся внутри своей зоны комфорта.
Сильная сторона модели — она может генерировать заведомо менее вероятные варианты, если её явно направить туда через инструкцию (или через параметр случайности, если он доступен). Исследование показало: повышение температуры (степени случайности в генерации, доступной в API и некоторых интерфейсах) расширяет охват без потери правдоподобности ответов — модель не начинает нести бред, она просто заходит дальше от центра.
Отсюда рычаг для обычного чата: раз явный технический параметр temperature недоступен в интерфейсе ChatGPT/Claude, эффект можно эмулировать словами — прямой инструкцией "дай неочевидные, нестандартные, редкие варианты" вместо расплывчатого "будь креативнее".
Рычаг, который стоит запомнить: спрашивать несколько разных LLM подряд в надежде на больше разнообразия — не сработает. Исследование показало, что модели гомогенны между собой: вторая, третья модель почти не добавляет новых идей сверх того, что дала первая. Если нужно реальное разнообразие — лучше один раз явно попросить модель структурировать ответ по уровню нестандартности, чем опрашивать пять разных чат-ботов.
Ограничения
⚠️ Не готовая техника, а диагноз: авторы не тестировали промпт-инструкции как решение проблемы — это моя экстраполяция из их находок. Насколько именно она работает на практике, нужно проверять самому.
⚠️ Не для задач с правильным ответом: находка касается только открытых задач без единственно верного решения — брейнштормы, творческое письмо, генерация идей. Для фактических вопросов или задач с чётким критерием это неприменимо.
⚠️ Опрос нескольких моделей не спасает: если рассчитываешь на разнообразие через "спросить у трёх разных ИИ" — не сработает, они дают похожие ответы.
Как исследовали
Исследователи взяли три открытые задачи: придумывание альтернативных применений предметов (Alternative Uses Task), поиск максимально несвязанных по смыслу слов (Divergent Association Task) и написание фанфиков по Гарри Поттеру — от абстрактного мышления до культурно насыщенного жанра со своими фандомными правилами.
Они собрали реальные ответы людей на эти задачи и превратили их в "карту" смыслового пространства (через эмбеддинги — числовое представление текста, отражающее его смысл). Вокруг каждого человеческого ответа построили небольшую "зону" — если ответ модели попадает в эту зону хотя бы одного человека, значит модель "накрыла" эту часть человеческого разнообразия.
Проверили пять открытых LLM (Qwen, Llama, Mistral, разных размеров, от 7 до 32 миллиардов параметров) при двух настройках температуры. Результат: модели почти всегда попадали внутрь диапазона человеческих ответов (высокая правдоподобность), но покрывали в разы меньше пространства, чем контрольная группа — когда одну случайную выборку людей сравнивали с другой. Причём чем "периферийнее" человеческий ответ (реже встречающийся, необычный), тем реже модель туда попадает. В фанфиках по Гарри Поттеру это выражалось конкретно: модель охотно пишет про узнаваемых канонических персонажей и стандартные гетеро-пейринги, но обходит стороной тексты с неканоничными персонажами и менее типичными сюжетами.
Отдельно проверили, помогает ли объединение нескольких моделей — не помогло: после первой модели прирост покрытия резко замедляется, потому что модели дают похожие ответы друг на друга.
Ресурсы
Where Models Converge and Humans Diverge: A Coverage Framework for Distributional Pluralism in Open-Ended Generation — Zini Yang, Emily Wenger, Richard So, Duke University. Pluralistic Alignment Workshop @ ICML 2026.
