TL;DR
Исследование показывает, как LLM ошибаются при сравнении вариантов и поиске причин. Если об одном варианте в тексте больше упоминаний, модель склонна считать его лучше, даже когда доли хорошего и плохого одинаковы. Если события просто случились рядом, модель достраивает причинную связь. Против этого частично помогают пошаговое рассуждение (Chain-of-Thought) и напоминание в промпте, что данных может быть недостаточно. Полностью они ошибку не убирают.
Типичная боль такая. Вы даёте модели отзывы на двух подрядчиков: у одного 240, у другого 120, доля позитивных одинаковая. Модель уверенно рекомендует «того, у которого больше отзывов» и объясняет это «стабильностью» и «надёжностью». Причина простая: модель реагирует на объём («этого много, он заметный»), а не считает доли. Во втором тесте модели видели два неоднозначных события и ставили связи между ними на 5–6 баллов из 7, тогда как люди ставили около 4.
Практический вывод: не просите «кто лучше?» на неравных объёмах. Сначала заставьте модель посчитать доли по каждому варианту, затем явно разрешите ей ответить «данных недостаточно» и только потом просите вывод.
Схема метода
Это не метод из статьи, а защитный приём, собранный из её находок.
ШАГ 1: Выровнять данные → дать доли и абсолютные числа по каждому варианту
ШАГ 2: Напоминание → «связи может не быть, "недостаточно данных" — нормальный ответ»
ШАГ 3: Пошаговый расчёт → модель считает доли ДО вывода (CoT)
ШАГ 4: Вывод → с оценкой уверенности и альтернативными объяснениями
(всё — в одном промпте)
Пример применения
Задача: Селлер на Wildberries выбирает между двумя фулфилмент-подрядчиками. Собрал отзывы: у «Подрядчика А» 240 отзывов (160 позитивных, 80 негативных), у «Подрядчика Б» 120 (80 позитивных, 40 негативных). Доли одинаковые, 67%. Без защиты модель, скорее всего, скажет «берите А, он проверен временем».
Промпт:
Ты помогаешь выбрать фулфилмент-подрядчика для магазина на Wildberries.
Данные по отзывам:
- Подрядчик А: 240 отзывов, 160 позитивных, 80 негативных
- Подрядчик Б: 120 отзывов, 80 позитивных, 40 негативных
Важно: у одного из вариантов отзывов больше. Это не значит, что он лучше.
Разница в количестве отзывов — не доказательство качества. Возможно,
между вариантами вообще нет различий, и ответ «по этим данным
выбрать нельзя» — нормальный и правильный.
Сделай по шагам:
1. Посчитай долю позитивных и негативных отзывов у каждого подрядчика.
2. Скажи, различаются ли доли. Если нет — так и напиши.
3. Объясни, что именно в данных НЕ позволяет сделать вывод
(например, малая выборка, нет сроков, нет типов жалоб).
4. Дай рекомендацию и уровень уверенности: низкий / средний / высокий.
5. Перечисли, какие дополнительные данные нужны, чтобы решить.
Результат: Модель сначала покажет расчёт: у обоих около 67% позитивных. Затем честно скажет, что различия нет и «больше отзывов» не аргумент. Уверенность в рекомендации будет низкой или средней, а в конце появится список недостающих данных: сроки доставки, типы жалоб, динамика по месяцам.
Почему это работает
Слабость модели. Она училась на тексте, где «частое» обычно связано с «важным» и «хорошим». Поэтому объём подсказывает ей, что этот вариант заметнее и значит лучше. В экспериментах так и вышло. Когда большая группа имела меньшую долю позитива, модели всё равно часто выбирали её. А когда объёмы выровняли, ошибка почти исчезла.
Сильная сторона. Если объём убрать из игры, модель умеет использовать пропорции. При равных объёмах и разных долях она в большинстве случаев выбирала вариант с лучшей долей. Считать она может, ей просто нужно в этом помочь.
Как метод это использует. Расчёт долей до вывода убирает объём как подсказку. Явное разрешение сказать «данных мало» снимает давление на уверенный ответ. Это те же два рычага, что в статье: CoT и напоминание об осторожности.
Рычаги управления: - Убери фразу про «нормальный ответ — выбрать нельзя» → модель снова будет склонна к уверенной рекомендации. - Добавь «перечисли альтернативные объяснения» → для причинных вопросов это снижает достраивание историй. - Подавай данные уже в долях, без абсолютных чисел → объём перестаёт влиять совсем.
Шаблон промпта
Задача: {что_выбираем_или_объясняем}
Данные:
- {вариант_1}: {всего}, из них {хорошее} и {плохое}
- {вариант_2}: {всего}, из них {хорошее} и {плохое}
Важно: объём данных у вариантов разный. Больше данных не значит лучше.
Связи между {фактор_1} и {фактор_2} может не быть.
Ответ «по этим данным вывод сделать нельзя» — нормальный и правильный.
Сделай по шагам:
1. Посчитай доли хорошего и плохого по каждому варианту.
2. Скажи, различаются ли они. Если нет — напиши прямо.
3. Назови, чего в данных не хватает для вывода.
4. Предложи минимум 2 объяснения, не связанные с причинностью
(случайность, третий фактор, размер выборки).
5. Дай вывод с уровнем уверенности: низкий / средний / высокий.
Что подставлять: {что_выбираем_или_объясняем} — суть вопроса. {вариант_N} — сравниваемые сущности (подрядчики, каналы, кандидаты). {фактор_1} и {фактор_2} нужны, когда вы ищете причину («рост продаж» и «смена обложки»). Для чистого сравнения вариантов пункт 4 можно оставить в упрощённой форме.
Ограничения
⚠️ Эффект защиты частичный. Даже с пошаговым рассуждением модели остаются склонными к иллюзии сильнее людей. Отставание от человека сократилось, но не исчезло. Приём снижает риск, а не отменяет проверку человеком.
⚠️ Текст напоминания не проверен по цифрам. Авторы использовали напоминание об осторожности (приложение D.3), но в доступной части статьи его точный текст и размер эффекта не приведены. Формулировка выше собрана по описанию, а не скопирована.
⚠️ Задачи упрощённые. Тесты построены на классических психологических опытах: две группы, бинарный выбор, два сценария. Как это ведёт себя на реальных таблицах и длинных отчётах, статья не проверяла.
⚠️ Новые модели не всегда лучше. Самые свежие модели в одних тестах ведут себя чуть аккуратнее, в других ошибаются так же сильно. Не рассчитывайте, что «новая версия сама разберётся».
⚠️ Часть статьи про внутренности моделей не применима. Анализ через разреженные автоэнкодеры (SAE) и управление внутренними сигналами требуют доступа к весам открытых моделей. Читателю это недоступно.
Как исследовали
Исследователи взяли три классических психологических эксперимента и прогнали их на людях и на LLM. В первом нужно выбрать товарища по команде из двух «сообществ». Во втором — выбрать компанию для инвестиций. В третьем — оценить, связаны ли два неоднозначных события. Во всех задачах доля позитива у вариантов была одинаковой, менялся только объём. Фокус был на объёме: у большой группы 26 описаний, у малой 13.
Людей было по 100 на задачу. Моделей — девять, от GPT-3.5 до GPT-5.2 и несколько открытых. На каждую задачу делали по 100 прогонов. Результат оказался резким: в среднем модели выбирали меньшую группу в сообществе лишь в 15% случаев, люди — в 46%. В инвестициях — 31% против 40%. В конспирологических сценариях средний балл моделей был 5,4 из 7 против 4,3 у людей.
Дальше проверили, не объясняется ли всё предрассудками о названиях. При равных объёмах выбор почти выравнивался. Когда большая группа была хуже по доле, модели всё равно часто выбирали её. А когда объёмы были равны, но доли разные, модели чаще выбирали лучший вариант. Вывод: проблема именно в объёме, а не в неумении считать.
Неожиданностей две. Во-первых, пошаговое рассуждение помогло лишь частично: ошибка осталась заметно выше человеческой. Во-вторых, GPT-5.2 в инвестиционной задаче вела себя почти как человек, но в задаче про сообщества нет. То есть улучшение на одном типе данных не гарантирует улучшения на другом.
Адаптации и экстраполяции
🔧 Техника: убрать объём из данных → убрать причину ошибки
В эксперименте при равных объёмах ошибка почти исчезала. Поэтому перед сравнением переведите данные в доли и дайте модели только их:
Вариант А: 67% позитивных (выборка: 240)
Вариант Б: 67% позитивных (выборка: 120)
Сравни, не используя размер выборки как аргумент «за».
🔧 Техника: причинные вопросы → требовать альтернативы
Для сценариев «продажи упали после смены обложки» добавьте в конец:
Назови три объяснения, НЕ связывающие эти события: случайность,
сезонность, третий фактор. Затем оцени, какое из них вероятнее.
Это моя экстраполяция по результатам конспирологического теста. В статье такая формулировка напрямую не проверялась.
Ресурсы
- Статья: Illusory Pattern Perception Drives Spurious Inference in Large Language Models
- Авторы: Peihua Mai, Zhuoyan Shao, Xinbao Qiao, Meng Zhang, Xinyue Zhou, Yan Pang
- Организации: National University of Singapore (Chongqing) Research Institute, National University of Singapore, Zhejiang University, The Chinese University of Hong Kong, University of Macau
- Конференция: NeurIPS 2026
- Код: GitHub-репозиторий NusIoraPrivacy/illusory
- Опорная психологическая работа: парадигмы про иллюзорную корреляцию, псевдоконтингентность и веру в заговоры, взятые из классической когнитивной психологии
