3,583 papers
arXiv:2608.05576 70 6 авг. 2026 г. FREE

Coverage Gap: LLM дают правдоподобные, но "усреднённые" идеи — и почти никогда не заходят на периферию человеческого разнообразия

КЛЮЧЕВАЯ СУТЬ
Парадокс: LLM почти никогда не ошибается за границами человеческого воображения — и именно поэтому её «креативность» такая пресная. Модель всегда попадает внутрь диапазона реальных ответов людей, но занимает там один маленький угол — самый очевидный и предсказуемый. Метод авторов (фреймворк для измерения покрытия) показывает: правдоподобность и разнообразие — разные вещи, и высокая первая не гарантирует вторую. Модель не выдумывает, она усредняет — и в итоге даёт 10 разных слов для одной и той же мысли.
Адаптировать под запрос

TL;DR

Когда просишь LLM придумать что-то творческое — альтернативные способы использования предмета, продолжение истории, ассоциации — модель выдаёт ответы, которые правдоподобны, но кучкуются в одном и том же "центре". Она почти никогда не даёт те редкие, неочевидные варианты, которые реальные люди придумывают на периферии своего воображения.

Проблема не в том, что LLM ошибается или пишет плохо. Проблема в том, что среди тысяч возможных "легитимных" ответов на открытый вопрос модель раз за разом выбирает один и тот же узкий кластер — самый вероятный, самый "усреднённый". Исследователи сравнили ответы моделей с реальными ответами людей на одни и те же задачи (придумать применения кирпичу, написать фанфик по Гарри Поттеру) и увидели: модель почти всегда попадает "внутрь" диапазона человеческих ответов (это хорошо), но покрывает лишь маленький кусок этого диапазона — в основном самый предсказуемый центр.

Авторы не предлагают готовую технику-лечение, только измеряют разрыв. Но из их находок вытекает практический принцип: чтобы получить от LLM действительно разнообразные, нестандартные идеи — нужно явно просить её выйти за пределы очевидного, потому что "просто попросить много вариантов" не сработает — все они будут похожи друг на друга.


📌

Схема находки

НАБЛЮДЕНИЕ 1: LLM почти всегда "в рамках" человеческого разнообразия → ответы звучат правдоподобно
НАБЛЮДЕНИЕ 2: Но LLM покрывает только маленькую (центральную) часть этого разнообразия → идеи однотипны
НАБЛЮДЕНИЕ 3: Повышение "случайности" генерации расширяет охват без потери правдоподобности
НАБЛЮДЕНИЕ 4: Спросить несколько разных моделей — не помогает, они похожи друг на друга
НАБЛЮДЕНИЕ 5: "Непокрытые" людьми-ответы отличаются системно — это не шум, а конкретные типы контента, которые модель обходит стороной

🚀

Пример применения (экстраполяция принципа — не то, что тестировали авторы)

Задача: Маркетолог просит ChatGPT придумать 10 идей для рекламной кампании нового энергетика перед запуском.

Промпт (обычный, наивный):

Придумай 10 креативных идей для рекламной кампании нового энергетического напитка.

Результат по находке исследования: все 10 идей будут вариациями одной и той же "усреднённой" концепции — что-то про спорт, драйв, ночную жизнь. Разнообразие внутри списка есть, но все идеи из одного узкого сегмента возможных подходов.

Промпт с учётом находки (принцип "проси периферию"):

Придумай 10 идей для рекламной кампании нового энергетического напитка.

Первые 3 идеи — самые очевидные и предсказуемые, которые придумал бы любой маркетолог.
Следующие 4 идеи — нестандартные, которые обычно не приходят в голову сразу.
Последние 3 идеи — максимально неожиданные, даже рискованные: такие, что 9 из 10 маркетологов их не предложат.

Результат: Модель структурно разведёт ответы по уровню предсказуемости, и последние 3 идеи будут заметно дальше от "центра" — потому что явное указание сдвигает генерацию к менее вероятным продолжениям, а не оставляет её в зоне комфорта.


🧠

Почему это работает

LLM обучена предсказывать наиболее вероятное продолжение текста. При открытых, творческих задачах "наиболее вероятное" — это и есть самый очевидный, шаблонный, "средний" ответ. Именно поэтому просто попросить "10 идей" или "будь креативным" не расширяет охват — модель остаётся внутри своей зоны комфорта.

Сильная сторона модели — она может генерировать заведомо менее вероятные варианты, если её явно направить туда через инструкцию (или через параметр случайности, если он доступен). Исследование показало: повышение температуры (степени случайности в генерации, доступной в API и некоторых интерфейсах) расширяет охват без потери правдоподобности ответов — модель не начинает нести бред, она просто заходит дальше от центра.

Отсюда рычаг для обычного чата: раз явный технический параметр temperature недоступен в интерфейсе ChatGPT/Claude, эффект можно эмулировать словами — прямой инструкцией "дай неочевидные, нестандартные, редкие варианты" вместо расплывчатого "будь креативнее".

Рычаг, который стоит запомнить: спрашивать несколько разных LLM подряд в надежде на больше разнообразия — не сработает. Исследование показало, что модели гомогенны между собой: вторая, третья модель почти не добавляет новых идей сверх того, что дала первая. Если нужно реальное разнообразие — лучше один раз явно попросить модель структурировать ответ по уровню нестандартности, чем опрашивать пять разных чат-ботов.


⚠️

Ограничения

⚠️ Не готовая техника, а диагноз: авторы не тестировали промпт-инструкции как решение проблемы — это моя экстраполяция из их находок. Насколько именно она работает на практике, нужно проверять самому.

⚠️ Не для задач с правильным ответом: находка касается только открытых задач без единственно верного решения — брейнштормы, творческое письмо, генерация идей. Для фактических вопросов или задач с чётким критерием это неприменимо.

⚠️ Опрос нескольких моделей не спасает: если рассчитываешь на разнообразие через "спросить у трёх разных ИИ" — не сработает, они дают похожие ответы.


🔍

Как исследовали

Исследователи взяли три открытые задачи: придумывание альтернативных применений предметов (Alternative Uses Task), поиск максимально несвязанных по смыслу слов (Divergent Association Task) и написание фанфиков по Гарри Поттеру — от абстрактного мышления до культурно насыщенного жанра со своими фандомными правилами.

Они собрали реальные ответы людей на эти задачи и превратили их в "карту" смыслового пространства (через эмбеддинги — числовое представление текста, отражающее его смысл). Вокруг каждого человеческого ответа построили небольшую "зону" — если ответ модели попадает в эту зону хотя бы одного человека, значит модель "накрыла" эту часть человеческого разнообразия.

Проверили пять открытых LLM (Qwen, Llama, Mistral, разных размеров, от 7 до 32 миллиардов параметров) при двух настройках температуры. Результат: модели почти всегда попадали внутрь диапазона человеческих ответов (высокая правдоподобность), но покрывали в разы меньше пространства, чем контрольная группа — когда одну случайную выборку людей сравнивали с другой. Причём чем "периферийнее" человеческий ответ (реже встречающийся, необычный), тем реже модель туда попадает. В фанфиках по Гарри Поттеру это выражалось конкретно: модель охотно пишет про узнаваемых канонических персонажей и стандартные гетеро-пейринги, но обходит стороной тексты с неканоничными персонажами и менее типичными сюжетами.

Отдельно проверили, помогает ли объединение нескольких моделей — не помогло: после первой модели прирост покрытия резко замедляется, потому что модели дают похожие ответы друг на друга.


🔗

Ресурсы

Where Models Converge and Humans Diverge: A Coverage Framework for Distributional Pluralism in Open-Ended Generation — Zini Yang, Emily Wenger, Richard So, Duke University. Pluralistic Alignment Workshop @ ICML 2026.


📋 Дайджест исследования

Ключевая суть

Парадокс: LLM почти никогда не ошибается за границами человеческого воображения — и именно поэтому её «креативность» такая пресная. Модель всегда попадает внутрь диапазона реальных ответов людей, но занимает там один маленький угол — самый очевидный и предсказуемый. Метод авторов (фреймворк для измерения покрытия) показывает: правдоподобность и разнообразие — разные вещи, и высокая первая не гарантирует вторую. Модель не выдумывает, она усредняет — и в итоге даёт 10 разных слов для одной и той же мысли.

Принцип работы

Не проси «больше вариантов» — проси периферию. Обычный запрос «накинь 10 идей» держит модель в зоне комфорта: все 10 будут вариациями одного центрального кластера. Явная команда «дай самые неочевидные, редкие, рискованные варианты» сдвигает генерацию дальше от центра — модель способна на это, просто сама туда не идёт без пинка.

Почему работает

LLM обучена предсказывать самое вероятное продолжение текста. Для открытой задачи «самое вероятное» — это и есть самый шаблонный ответ. Исследование проверило температуру (степень случайности в генерации) — рост случайности расширяет охват без потери смысла, модель не начинает нести бред. Модель не тупая, она просто ленивая — идёт туда, куда толкнёшь. Отдельная жесть: спросить три разных ИИ подряд не помогает — модели похожи друг на друга и почти не добавляют новых идей сверх первой.

Когда применять

Брейншторм, генерация идей, творческое письмо → конкретно там, где нет единственно верного ответа и важно разнообразие подходов, а не количество похожих вариаций. НЕ подходит для фактических вопросов и задач с чётким критерием правильности — там разнообразие ответов не нужно и даже вредно.

Мини-рецепт

1. Разбей запрос по уровням: попроси сначала очевидные варианты, потом нестандартные, потом рискованные — отдельными блоками.
2. Дай явную метку редкости: такие идеи, которые 9 из 10 человек не предложат.
3. Не жди спасения от других чат-ботов: если под рукой есть API — подкрути температуру, если нет — усиливай словами вместо опроса второй модели.
4. Проверяй последний блок первым: самые ценные идеи обычно там, где модель сопротивлялась дольше всего.

Примеры

[ПЛОХО] : Придумай 10 креативных идей для рекламной кампании энергетика
[ХОРОШО] : Придумай 10 идей для рекламы энергетика. Первые 3 — самые очевидные, которые предложил бы любой маркетолог. Следующие 4 — нестандартные, такие что не приходят в голову сразу. Последние 3 — максимально неожиданные, рискованные, такие что 9 из 10 маркетологов их не предложат
Источник: Where Models Converge and Humans Diverge: A Coverage Framework for Distributional Pluralism in Open-Ended Generation
ArXiv ID: 2608.05576 | Сгенерировано: 2026-08-07 04:25

Проблемы LLM

ПроблемаСутьКак обойти
Модель выдаёт "усреднённые" идеи в открытых задачахПросишь придумать что-то творческое — применения предмету, продолжение истории, ассоциации. Модель даёт правдоподобные варианты, но все они из одного узкого центра возможных ответов. Редкие, неочевидные идеи, которые придумывают реальные люди на периферии воображения, почти не появляются. Просто попросить "10 вариантов" не помогает — все 10 похожи друг на другаЯвно попроси модель двигаться к периферии: раздели ответ на уровни предсказуемости. Например: "первые 3 — самые очевидные, следующие 4 — нестандартные, последние 3 — максимально неожиданные, которые 9 из 10 экспертов не предложат"

Методы

МетодСуть
Стратификация по предсказуемости — метод для разнообразных идейПроси модель явно разделить ответы на уровни: очевидные / нестандартные / рискованные. Первые N идей — самые предсказуемые. Следующие M — нестандартные. Последние K — максимально неожиданные. Почему работает: модель по умолчанию выбирает самый вероятный ответ — это и есть "средний" вариант. Явная инструкция сдвигает генерацию к менее вероятным, но всё ещё осмысленным продолжениям. Когда применять: брейнштормы, творческое письмо, генерация идей без единственно верного ответа. Когда не работает: задачи с фактическим или единственно правильным ответом

Тезисы

ТезисКомментарий
Разные модели дают похожие идеи — опрос нескольких LLM не увеличивает разнообразиеМодели обучены на похожих данных и с похожей целью — предсказать самый вероятный ответ. Поэтому вторая и третья модель почти не добавляют новых вариантов сверх того, что уже дала первая. Применяй: не трать время на опрос нескольких чат-ботов для разнообразия идей. Вместо этого один раз явно попроси одну модель структурировать ответ по уровню нестандартности (см. метод выше)
📖 Простыми словами

WhereModelsConverge and Humans Diverge: A Coverage Framework for Distributional Pluralism in Open-Ended Generation

arXiv: 2608.05576

Суть в том, что современные нейронки — это статистические конформисты. Когда ты просишь AI придумать что-то творческое, он не «творит», а вычисляет самое безопасное и вероятное среднее арифметическое из всех текстов в интернете. В итоге модель выдает ответы, которые выглядят адекватно, но всегда кучкуются в одной и той же предсказуемой точке. Пока люди разбредаются в разные стороны и выдают странные, дикие или гениальные идеи, LLM упорно держится за центр распределения, игнорируя всё, что находится на периферии воображения.

Это как если бы ты пришел на вечеринку и спросил у толпы: «Что можно сделать с кирпичом?». Большинство ответит «построить дом» или «подпереть дверь». Но всегда найдется один чудак, который предложит «растолочь в пудру для макияжа в стиле постапокалипсис». Так вот, нейронка — это та самая серая масса, которая хором кричит про стройку. Она физически не может уйти в отрыв, потому что её учили быть «правильной» и предсказуемой, а не уникальной. Формально она справилась, но на деле выдала скучную банальщину.

Исследователи ввели понятие дистрибутивного плюрализма и создали фреймворк для оценки «покрытия» идей. Выяснилось, что даже если ты просишь модель выдать 100 вариантов, она просто пересказывает одну и ту же мысль разными словами, не выходя за рамки шаблона. Реально работают только методы, которые заставляют модель смещать фокус или использовать внешние зацепки. Простое «будь креативным» — это полная фигня, которая не меняет математическую вероятность выдачи стандартного ответа.

Хотя эксперименты проводили на творческих задачах вроде альтернативного использования предметов, этот эффект усреднения бьет по всему контенту. Будь то сценарий для ролика, стратегия маркетинга или код — AI всегда будет предлагать «безопасный путь». Это значит, что если ты используешь нейронку для генерации идей без жестких рамок и специфических промптов, ты получаешь контентный фастфуд, который ничем не отличается от миллионов других таких же генераций. SEO-тексты превращаются в одинаковую кашу именно по этой причине.

Главный вывод: не надейся на «фантазию» машины, у неё её нет, есть только статистическая норма. Чтобы получить от AI что-то действительно стоящее, нужно принудительно выталкивать её из центра на периферию, задавая максимально странные контексты или используя методы разнообразного сэмплирования. Если просто нажать кнопку «сгенерируй», ты получишь продукт, который вроде бы ок, но на самом деле — абсолютный ноль в плане уникальности. Кто научится управлять этим «разбросом», тот и победит в битве за внимание.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с