3,583 papers
arXiv:2610.07791 84 6 окт. 2026 г. FREE

Иллюзорное восприятие паттернов: LLM принимают «больше данных» за «лучше» и достраивают причинные истории из совпадений

КЛЮЧЕВАЯ СУТЬ
У двух подрядчиков одинаковые 67% позитивных отзывов, но у одного отзывов 240, у другого 120. Большая языковая модель (LLM) уверенно советует первого и хвалит его за «стабильность». Защитный приём позволяет получать честное сравнение вариантов с неравным объёмом данных, а иногда честное «выбрать нельзя». Фишка: сначала заставь модель посчитать доли, и только потом разреши ей сказать «данных недостаточно». Модель страдает иллюзорным восприятием паттернов: путает «много» с «хорошо». Приём даёт заметное, но частичное снижение этой ошибки.
Адаптировать под запрос
⚡

TL;DR

Исследование показывает, как LLM ошибаются при сравнении вариантов и поиске причин. Если об одном варианте в тексте больше упоминаний, модель склонна считать его лучше, даже когда доли хорошего и плохого одинаковы. Если события просто случились рядом, модель достраивает причинную связь. Против этого частично помогают пошаговое рассуждение (Chain-of-Thought) и напоминание в промпте, что данных может быть недостаточно. Полностью они ошибку не убирают.

Типичная боль такая. Вы даёте модели отзывы на двух подрядчиков: у одного 240, у другого 120, доля позитивных одинаковая. Модель уверенно рекомендует «того, у которого больше отзывов» и объясняет это «стабильностью» и «надёжностью». Причина простая: модель реагирует на объём («этого много, он заметный»), а не считает доли. Во втором тесте модели видели два неоднозначных события и ставили связи между ними на 5–6 баллов из 7, тогда как люди ставили около 4.

Практический вывод: не просите «кто лучше?» на неравных объёмах. Сначала заставьте модель посчитать доли по каждому варианту, затем явно разрешите ей ответить «данных недостаточно» и только потом просите вывод.

🔬

Схема метода

Это не метод из статьи, а защитный приём, собранный из её находок.

ШАГ 1: Выровнять данные → дать доли и абсолютные числа по каждому варианту
ШАГ 2: Напоминание → «связи может не быть, "недостаточно данных" — нормальный ответ»
ШАГ 3: Пошаговый расчёт → модель считает доли ДО вывода (CoT)
ШАГ 4: Вывод → с оценкой уверенности и альтернативными объяснениями
(всё — в одном промпте)
🚀

Пример применения

Задача: Селлер на Wildberries выбирает между двумя фулфилмент-подрядчиками. Собрал отзывы: у «Подрядчика А» 240 отзывов (160 позитивных, 80 негативных), у «Подрядчика Б» 120 (80 позитивных, 40 негативных). Доли одинаковые, 67%. Без защиты модель, скорее всего, скажет «берите А, он проверен временем».

Промпт:

Ты помогаешь выбрать фулфилмент-подрядчика для магазина на Wildberries.

Данные по отзывам:
- Подрядчик А: 240 отзывов, 160 позитивных, 80 негативных
- Подрядчик Б: 120 отзывов, 80 позитивных, 40 негативных

Важно: у одного из вариантов отзывов больше. Это не значит, что он лучше.
Разница в количестве отзывов — не доказательство качества. Возможно,
между вариантами вообще нет различий, и ответ «по этим данным
выбрать нельзя» — нормальный и правильный.

Сделай по шагам:
1. Посчитай долю позитивных и негативных отзывов у каждого подрядчика.
2. Скажи, различаются ли доли. Если нет — так и напиши.
3. Объясни, что именно в данных НЕ позволяет сделать вывод
   (например, малая выборка, нет сроков, нет типов жалоб).
4. Дай рекомендацию и уровень уверенности: низкий / средний / высокий.
5. Перечисли, какие дополнительные данные нужны, чтобы решить.

Результат: Модель сначала покажет расчёт: у обоих около 67% позитивных. Затем честно скажет, что различия нет и «больше отзывов» не аргумент. Уверенность в рекомендации будет низкой или средней, а в конце появится список недостающих данных: сроки доставки, типы жалоб, динамика по месяцам.

🧠

Почему это работает

Слабость модели. Она училась на тексте, где «частое» обычно связано с «важным» и «хорошим». Поэтому объём подсказывает ей, что этот вариант заметнее и значит лучше. В экспериментах так и вышло. Когда большая группа имела меньшую долю позитива, модели всё равно часто выбирали её. А когда объёмы выровняли, ошибка почти исчезла.

Сильная сторона. Если объём убрать из игры, модель умеет использовать пропорции. При равных объёмах и разных долях она в большинстве случаев выбирала вариант с лучшей долей. Считать она может, ей просто нужно в этом помочь.

Как метод это использует. Расчёт долей до вывода убирает объём как подсказку. Явное разрешение сказать «данных мало» снимает давление на уверенный ответ. Это те же два рычага, что в статье: CoT и напоминание об осторожности.

Рычаги управления: - Убери фразу про «нормальный ответ — выбрать нельзя» → модель снова будет склонна к уверенной рекомендации. - Добавь «перечисли альтернативные объяснения» → для причинных вопросов это снижает достраивание историй. - Подавай данные уже в долях, без абсолютных чисел → объём перестаёт влиять совсем.

📋

Шаблон промпта

Задача: {что_выбираем_или_объясняем}

Данные:
- {вариант_1}: {всего}, из них {хорошее} и {плохое}
- {вариант_2}: {всего}, из них {хорошее} и {плохое}

Важно: объём данных у вариантов разный. Больше данных не значит лучше.
Связи между {фактор_1} и {фактор_2} может не быть.
Ответ «по этим данным вывод сделать нельзя» — нормальный и правильный.

Сделай по шагам:
1. Посчитай доли хорошего и плохого по каждому варианту.
2. Скажи, различаются ли они. Если нет — напиши прямо.
3. Назови, чего в данных не хватает для вывода.
4. Предложи минимум 2 объяснения, не связанные с причинностью
   (случайность, третий фактор, размер выборки).
5. Дай вывод с уровнем уверенности: низкий / средний / высокий.

Что подставлять: {что_выбираем_или_объясняем} — суть вопроса. {вариант_N} — сравниваемые сущности (подрядчики, каналы, кандидаты). {фактор_1} и {фактор_2} нужны, когда вы ищете причину («рост продаж» и «смена обложки»). Для чистого сравнения вариантов пункт 4 можно оставить в упрощённой форме.

⚠️

Ограничения

⚠️ Эффект защиты частичный. Даже с пошаговым рассуждением модели остаются склонными к иллюзии сильнее людей. Отставание от человека сократилось, но не исчезло. Приём снижает риск, а не отменяет проверку человеком.

⚠️ Текст напоминания не проверен по цифрам. Авторы использовали напоминание об осторожности (приложение D.3), но в доступной части статьи его точный текст и размер эффекта не приведены. Формулировка выше собрана по описанию, а не скопирована.

⚠️ Задачи упрощённые. Тесты построены на классических психологических опытах: две группы, бинарный выбор, два сценария. Как это ведёт себя на реальных таблицах и длинных отчётах, статья не проверяла.

⚠️ Новые модели не всегда лучше. Самые свежие модели в одних тестах ведут себя чуть аккуратнее, в других ошибаются так же сильно. Не рассчитывайте, что «новая версия сама разберётся».

⚠️ Часть статьи про внутренности моделей не применима. Анализ через разреженные автоэнкодеры (SAE) и управление внутренними сигналами требуют доступа к весам открытых моделей. Читателю это недоступно.

🔍

Как исследовали

Исследователи взяли три классических психологических эксперимента и прогнали их на людях и на LLM. В первом нужно выбрать товарища по команде из двух «сообществ». Во втором — выбрать компанию для инвестиций. В третьем — оценить, связаны ли два неоднозначных события. Во всех задачах доля позитива у вариантов была одинаковой, менялся только объём. Фокус был на объёме: у большой группы 26 описаний, у малой 13.

Людей было по 100 на задачу. Моделей — девять, от GPT-3.5 до GPT-5.2 и несколько открытых. На каждую задачу делали по 100 прогонов. Результат оказался резким: в среднем модели выбирали меньшую группу в сообществе лишь в 15% случаев, люди — в 46%. В инвестициях — 31% против 40%. В конспирологических сценариях средний балл моделей был 5,4 из 7 против 4,3 у людей.

Дальше проверили, не объясняется ли всё предрассудками о названиях. При равных объёмах выбор почти выравнивался. Когда большая группа была хуже по доле, модели всё равно часто выбирали её. А когда объёмы были равны, но доли разные, модели чаще выбирали лучший вариант. Вывод: проблема именно в объёме, а не в неумении считать.

Неожиданностей две. Во-первых, пошаговое рассуждение помогло лишь частично: ошибка осталась заметно выше человеческой. Во-вторых, GPT-5.2 в инвестиционной задаче вела себя почти как человек, но в задаче про сообщества нет. То есть улучшение на одном типе данных не гарантирует улучшения на другом.

💡

Адаптации и экстраполяции

🔧 Техника: убрать объём из данных → убрать причину ошибки

В эксперименте при равных объёмах ошибка почти исчезала. Поэтому перед сравнением переведите данные в доли и дайте модели только их:

Вариант А: 67% позитивных (выборка: 240)
Вариант Б: 67% позитивных (выборка: 120)
Сравни, не используя размер выборки как аргумент «за».

🔧 Техника: причинные вопросы → требовать альтернативы

Для сценариев «продажи упали после смены обложки» добавьте в конец:

Назови три объяснения, НЕ связывающие эти события: случайность,
сезонность, третий фактор. Затем оцени, какое из них вероятнее.

Это моя экстраполяция по результатам конспирологического теста. В статье такая формулировка напрямую не проверялась.

🔗

Ресурсы

  • Статья: Illusory Pattern Perception Drives Spurious Inference in Large Language Models
  • Авторы: Peihua Mai, Zhuoyan Shao, Xinbao Qiao, Meng Zhang, Xinyue Zhou, Yan Pang
  • Организации: National University of Singapore (Chongqing) Research Institute, National University of Singapore, Zhejiang University, The Chinese University of Hong Kong, University of Macau
  • Конференция: NeurIPS 2026
  • Код: GitHub-репозиторий NusIoraPrivacy/illusory
  • Опорная психологическая работа: парадигмы про иллюзорную корреляцию, псевдоконтингентность и веру в заговоры, взятые из классической когнитивной психологии

📋 Дайджест исследования

Ключевая суть

У двух подрядчиков одинаковые 67% позитивных отзывов, но у одного отзывов 240, у другого 120. Большая языковая модель (LLM) уверенно советует первого и хвалит его за «стабильность». Защитный приём позволяет получать честное сравнение вариантов с неравным объёмом данных, а иногда честное «выбрать нельзя». Фишка: сначала заставь модель посчитать доли, и только потом разреши ей сказать «данных недостаточно». Модель страдает иллюзорным восприятием паттернов: путает «много» с «хорошо». Приём даёт заметное, но частичное снижение этой ошибки.

Принцип работы

Это не метод из статьи, а защита, собранная из её находок. Она работает как короткий конвейер. 1. Даёшь по каждому варианту и абсолютные числа, и доли. 2. Предупреждаешь: «больше данных не значит лучше, связи может не быть». 3. Просишь посчитать доли до любого вывода (пошаговые рассуждения, CoT). 4. Требуешь вывод с уровнем уверенности и списком недостающих данных. Объём перестаёт быть подсказкой, когда доли посчитаны раньше вывода. Это как судья, которому сначала выдали протокол с очками, а не показали, какая трибуна кричит громче. Всё делается в одном промпте.

Почему работает

Модель училась на текстах, где «частое» обычно значит «важное» и «хорошее». Поэтому объём для неё сигнал качества. Когда большая группа имела меньшую долю позитива, модели всё равно часто выбирали именно её. Жесть: в тесте на причины модели ставили связи между случайными событиями на 5–6 баллов из 7, а люди около 4. Но есть и хорошая новость. Когда объёмы выровняли, ошибка почти исчезла. При разных долях модель в большинстве случаев выбирала лучшую. Считать она умеет, ей мешает не арифметика, а громкий объём. Защита бьёт ровно в это место. Полностью ошибку она не убирает: модели остаются доверчивее людей, хотя отставание сокращается.

Когда применять

Сравнение вариантов (подрядчики, рекламные каналы, кандидаты) → особенно когда отзывы или результаты собраны в разном объёме, а доли похожи. Поиск причин («продажи выросли после смены обложки») → когда два события просто случились рядом. НЕ подходит для решений без человека: тесты в статье простые (две группы, выбор из двух), на длинных отчётах и больших таблицах приём не проверяли. Если объёмы и так равны, защита почти ничего не добавит.

Мини-рецепт

1. Дай оба числа: по каждому варианту пиши всего, сколько хорошего и сколько плохого. Модель не должна гадать.
2. Предупреди заранее: «Больше данных не значит лучше. Ответ „выбрать по этим данным нельзя“ — нормальный».
3. Заставь считать: доли по каждому варианту идут первым шагом, до любого мнения.
4. Спроси про различие: «Отличаются ли доли? Если нет, так и напиши».
5. Для причин добавь: минимум 2 объяснения без причинной связи (случайность, третий фактор, малая выборка).
6. Закрой вывод: уровень уверенности (низкий / средний / высокий) и список данных, которых не хватает.
7. Проверь сам: если выводу нельзя доверять без человека, не доверяй. Защита снижает риск, но не отменяет проверку.

Примеры

[ПЛОХО] : Подрядчик А: 240 отзывов, 160 позитивных. Подрядчик Б: 120 отзывов, 80 позитивных. Кого выбрать для фулфилмента на Wildberries? Модель ответит: «Берите А, он проверен временем». Доли одинаковые, а объём сыграл за А.
[ХОРОШО] : Помоги выбрать подрядчика для магазина на Wildberries. Подрядчик А: 240 отзывов, 160 позитивных, 80 негативных. Подрядчик Б: 120 отзывов, 80 позитивных, 40 негативных. Важно: у одного отзывов больше, но это не доказательство качества. Ответ «по этим данным выбрать нельзя» — нормальный. Шаги: 1) посчитай доли позитивных и негативных у каждого; 2) скажи, различаются ли они, и если нет, напиши прямо; 3) назови, чего не хватает для вывода (сроки, типы жалоб); 4) дай рекомендацию и уверенность: низкая, средняя или высокая; 5) перечисли, какие данные запросить дополнительно. Модель покажет, что у обоих около 67%, и признает, что «больше отзывов» не аргумент. Уверенность будет низкой или средней, а в конце появится список: сроки доставки, типы жалоб, динамика по месяцам.
Источник: Illusory Pattern Perception Drives Spurious Inference in Large Language Models
ArXiv ID: 2610.07791 | Сгенерировано: 2026-10-07 05:10

Проблемы LLM

ПроблемаСутьКак обойти
Модель путает «больше данных» с «лучше»Даёшь два варианта с разным объёмом: отзывы, кандидаты, каналы. Доля хорошего у них одинаковая. Модель выбирает тот, где данных больше. И объясняет это «надёжностью» и «проверенностью». Даже если у крупного варианта доля хорошего ниже, он часто выигрывает. Решение выглядит обоснованным, но опирается на заметность, а не на качествоНе спрашивай «кто лучше?» на неравных объёмах. Сначала попроси посчитать доли по каждому варианту. Можно сразу подавать данные в долях, без абсолютных чисел. Тогда объём не влияет на ответ
Модель достраивает причинную связь из совпаденийДаёшь два события, которые просто случились рядом. Например, «сменили обложку» и «выросли продажи». Модель уверенно говорит, что одно вызвало другое. Люди в тех же случаях осторожнее. Риск есть в любом анализе «почему это произошло»Попроси назвать минимум 2 объяснения без причинной связи: случайность, третий фактор, малая выборка. Разреши ответ «связь не доказана». Попроси оценить уверенность: низкая, средняя, высокая

Методы

МетодСуть
Сначала расчёт, потом вывод, и разрешение сказать «данных мало»Построй запрос в три слоя. 1. Дай по каждому варианту итог и разбивку: «всего 240, из них 160 хорошего и 80 плохого». 2. Напиши: «больше данных не значит лучше. Ответ "по этим данным вывод сделать нельзя" — нормальный». 3. Попроси по шагам: посчитать доли, сказать различаются ли они, назвать чего не хватает, и только потом дать вывод с уровнем уверенности. Почему работает: расчёт долей до вывода убирает объём как подсказку. Модель уже видит, что доли равны. Явное разрешение сказать «не знаю» снимает давление на уверенную рекомендацию. Когда да: сравнение вариантов с разным объёмом данных, поиск причин в совпадениях. Когда нет: вариантов нет или объём данных не важен. Защита частичная. Модель остаётся склонной к ошибке сильнее человека. Важные решения проверяй сам. Если убрать фразу про «нормальный ответ», модель снова будет склонна к уверенному выбору
📖 Простыми словами

Illusory Pattern Perception Drives Spurious Inference inLargeLanguageModels

arXiv: 2610.07791

У больших языковых моделей есть фатальный баг: они путают популярность с качеством. Нейросети учились на гигабайтах текстов, где по умолчанию зашито правило: частое равно хорошему. В итоге включается иллюзорное восприятие паттернов — модель смотрит на количество упоминаний, а не на реальную суть. Если у одного варианта тупо больше текста, для LLM объём шума побеждает логику, даже если доля брака одинакова.

Это как слушать на вечеринке наглого выскочку, который безостановочно травит байки. Он несёт полную дичь, но из-за напора кажется душой компании, пока скромный профи молчит в углу. Модель ведётся ровно на этот трюк: кто забил эфир, тот и прав. Она на ровном месте изобретает ложные причинные связи и выдаёт фиктивную корреляцию за факт просто потому, что события описаны рядом.

Таблетки от этого есть, хотя идеального лекарства пока не изобрели. Во-первых, помогает Chain-of-Thought — заставь модель считать цифры по шагам, а не генерировать ответ сразу. Во-вторых, работает выравнивание объёмов: урежь простыню текста до одинакового размера перед отправкой в промпт. В-третьих, внедряй явные ограничения: прямо пиши, что данных может быть недостаточно. Без этих костылей модель гарантированно сядет в лужу.

В эксперименте гоняли выбор подрядчиков с соотношением отзывов 240 против 120, где при равной доле успеха в 67% модель уверенно топила за толпу. Но принцип универсален. Тот же провал случится в оценке резюме, аудите поставщиков, поиске багов или анализе конкурентов. Везде, где объёмы данных не равны, LLM сделает ложный вывод и выберет громкого неудачника.

Короче: нейросеть мыслит штампами и ведётся на болтовню, как бабка у подъезда. Всегда нормализуй выборку, заставляй модель считать твердые доли и вычищай словесный мусор. Иначе ты примешь провальное решение просто потому, что о худшем кандидате в интернете накатали в два раза больше букв.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с