3,583 papers
arXiv:2607.23440 76 26 июля 2026 г. FREE

Дельта-тест: как проверить, рассуждает ли LLM или просто вспоминает из обучения

КЛЮЧЕВАЯ СУТЬ
Модель думает на 40% дольше — и всё равно ошибается чаще. Это не глубина мысли, это разоблачение: она не рассуждала, а рылась в памяти. Метод даёт способ проверить, понимает ли ИИ суть паттерна или просто выдаёт запомненный ответ — на любой задаче, не только на загадках. Фишка: сравни ответ на известный пример и на придуманный тобой, которого точно нет в интернете — разница в качестве и есть детектор угадывания.
Адаптировать под запрос

TL;DR

Исследователи придумали способ проверить, действительно ли ИИ рассуждает или просто выдаёт запомненные ответы, притворяясь умным. Для этого взяли китайские загадки-каламбуры сехоуюй (двухчастные фразы с игрой слов, вроде "Конфуций переезжает — сплошные книги/сплошные проигрыши") и сравнили, как модель справляется с редкими существующими загадками против совсем новых, придуманных лингвистами специально для теста — их точно нет в интернете.

Оказалось, что китайские топовые модели (DeepSeek, Kimi, GLM) почти идеально решают редкие, но существующие загадки (91% точности), а на свежепридуманных точность падает на 20-30 пунктов. При этом модели тратят на новые загадки на 40% больше токенов на "размышления", но результат не улучшается — это классическое перемышление: модель усердно думает, но не туда. У людей разница между редкими и новыми загадками — всего 3 пункта: человек одинаково хорошо решает и то, и другое, потому что реально разгадывает логику игры слов, а не вспоминает готовый ответ.

Вывод простой: если хочешь понять, понимает ли ИИ суть паттерна или просто вспоминает похожие примеры из обучения, дай ему что-то совсем новое, чего он точно не видел, и сравни результат с известным примером той же сложности.


🔬

Схема метода

ШАГ 1: Возьми известный пример паттерна (шутка, загадка, бизнес-кейс) → эталон
ШАГ 2: Придумай новый пример по той же логике, которого точно нет в интернете → тест-кейс
ШАГ 3: Попроси модель решить/объяснить ОБА примера, без подсказок и контекста → два ответа
ШАГ 4: Сравни точность и качество объяснения → большая разница = модель угадывала по памяти, малая = реально рассуждала

Все шаги можно выполнить в одном диалоге, по очереди.


🚀

Пример применения

Задача: Ты ведёшь Telegram-канал с ребусами и словесными играми (шарады, каламбуры) и хочешь понять, можно ли доверить ИИ придумывать новые загадки для подписчиков, или он просто пересказывает известные.

Промпт:

Вот известная русская загадка-каламбур: 
"Какой рак не рак? — Рак-отшельник, потому что раком не отшельничает, а отшельник не рак"
(пример условный, замени на настоящую).

Объясни логику этой загадки: почему ответ именно такой, 
на какой игре слов она строится.

Теперь придумай СВОЮ новую загадку по такой же логике игры слов, 
но с другой парой созвучных слов, и сразу объясни, почему твой ответ верный.

Результат: Модель сначала разберёт известную загадку — скорее всего, точно и уверенно, потому что могла видеть её в обучении. Дальше, когда попросишь придумать новую по той же схеме, обрати внимание: получится ли у неё выстроить свою цепочку "созвучие → смысл", или объяснение будет натянутым, с нелогичной связкой. Если объяснение новой загадки заметно слабее и более путаное, чем для известной — модель скорее вспоминает шаблоны, чем реально жонглирует смыслами.


🧠

Почему это работает

Языковые модели обучены на огромных массивах текста, где культурно значимые загадки, шутки и пословицы встречаются много раз. Модель может "узнавать" редкую фразу просто потому, что видела её пару раз в обучении — и это выглядит как рассуждение, хотя на самом деле это воспоминание.

Сильная сторона LLM — она хорошо ищет паттерны и связи между словами, если объяснить логику явно. Но это работает надёжно только тогда, когда у неё нет готового ответа в памяти, за который можно "срезать путь".

Метод использует это: если убрать возможность вспомнить (дав совершенно новый пример), модель вынуждена реально применить логику пошагово. Разница в качестве ответа на старом и новом примере — честный индикатор, угадывает модель или думает.

Рычаги управления: - Просьба "порассуждай" (Chain-of-Thought) — не всегда помогает. На творческих и словесных задачах она может даже мешать: модель тратит больше токенов, но не становится точнее (эффект "перемышления" из исследования). - Контекст (пример использования фразы) — реально помогает модели правильно понять смысл, повышает точность до 10%. Если хочешь честной проверки понимания — не давай контекст. Если хочешь максимального качества ответа — давай. - Формулировка "придумай новое, а не вспомни" — заставляет модель включить рассуждение вместо поиска по памяти.


📋

Шаблон промпта

Вот известный пример: {известный пример паттерна — шутка/загадка/кейс}.
Объясни логику: почему это работает именно так.

Теперь придумай свой новый пример по такой же логике, 
но с другими словами/деталями, которого точно не существует.
Сразу объясни, почему твой пример логичен.

Сравни: где твоё объяснение было увереннее и точнее — 
на известном примере или на новом?

Подставь в {известный пример паттерна} любую вещь, где хочешь проверить, реально ли модель понимает механику — шутку, загадку, метафору, аргумент, правило игры.

🚀 Быстрый старт — вставь в чат:

Вот шаблон для проверки, рассуждает ИИ или вспоминает готовые ответы. 
Адаптируй под мою задачу: {моя задача — проверить понимание чего}. 
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какой именно паттерн ты хочешь проверить (шутку, бизнес-правило, метафору) — потому что без конкретного примера-эталона тест не построить. Она возьмёт логику из шаблона и подгонит под твою тему.


⚠️

Ограничения

⚠️ Не абсолютное доказательство: если модель одинаково хорошо справилась и со старым, и с новым примером, это не значит, что она НЕ запоминала — она могла и запомнить много всего, и научиться рассуждать. Тест показывает только минимальный уровень запоминания, не ноль.

⚠️ Нужно самому придумать новый пример — это не готовый шаблон "вставь и получи ответ", придётся потратить время на создание тест-кейса, которого точно нет в интернете.

⚠️ Просьба "подумай подольше" может испортить результат на творческих и словесных задачах — не включай режим глубокого рассуждения по умолчанию для генерации шуток, метафор, каламбуров.

⚠️ ИИ хуже человека придумывает новое — даже топовые модели в исследовании создавали заметно менее удачные и смешные загадки, чем люди-эксперты. Не жди от ИИ оригинального юмора или словесной изобретательности на уровне человека.


🔗

Ресурсы

X-Riddles (датасет из 1143 китайских загадок-каламбуров сехоуюй), Hai Hu, Siyuan Song, Chongtian Shao и соавторы — The Hong Kong Polytechnic University, The University of Texas at Austin, Shanghai Jiao Tong University.


📋 Дайджест исследования

Ключевая суть

Модель думает на 40% дольше — и всё равно ошибается чаще. Это не глубина мысли, это разоблачение: она не рассуждала, а рылась в памяти. Метод даёт способ проверить, понимает ли ИИ суть паттерна или просто выдаёт запомненный ответ — на любой задаче, не только на загадках. Фишка: сравни ответ на известный пример и на придуманный тобой, которого точно нет в интернете — разница в качестве и есть детектор угадывания.

Принцип работы

Схема простая: эталон → тест-кейс → сравнение. Берёшь известный пример логики (загадку, шутку, правило) — модель могла его видеть при обучении. Придумываешь свой новый пример по той же логике, которого точно нет в сети — это тест-кейс. Если объяснение слабее и путанее на новом примере — модель угадывала, а не понимала. У человека разница между известным и новым — всего 3 пункта. У топовых китайских моделей — 20-30 пунктов точности вниз.

Почему работает

Модель обучена на текстах, где культовые загадки и шутки встречаются десятки раз. Она узнаёт фразу, а не разгадывает её — и со стороны это неотличимо от рассуждения. На новой загадке угадывать нечего, приходится реально складывать логику игры слов с нуля. Отсюда парадокс: токенов +40%, а точность не растёт — модель усердно роется в памяти, но там пусто.

Когда применять

Проверка понимания ИИ → для любых задач на смысл: шутки, метафоры, бизнес-правила, каламбуры, аналогии → особенно когда подозреваешь, что модель выдаёт заученный шаблон, а не реальную логику. Не подходит, если нужен просто быстрый красивый ответ здесь и сейчас — тест требует придумать свой тест-кейс и потратить время на сравнение двух ответов.

Мини-рецепт

1. Найди эталон: возьми известный пример паттерна — шутку, загадку, бизнес-правило.
2. Придумай тест-кейс: свой новый пример по той же логике, которого точно нет в интернете.
3. Спроси оба: попроси модель объяснить и решить оба примера без подсказок и контекста.
4. Сравни провал: большая разница в качестве = модель угадывала по памяти, маленькая = реально рассуждала.

Примеры

[ПЛОХО] : Объясни эту загадку и почему она смешная (без сравнения с новым примером не поймёшь — модель вспомнила или подумала)
[ХОРОШО] : Вот известная загадка: [X]. Объясни логику игры слов. Теперь придумай СВОЮ новую загадку по той же схеме, которой точно нет в сети, и сразу объясни почему твой ответ верный. Сравни — где твоё объяснение было увереннее и точнее.
Источник: Reasoning or Memorization: Can LLMs Understand and Generate Chinese Xiehouyu Riddles?
ArXiv ID: 2607.23440 | Сгенерировано: 2026-07-28 04:30

Проблемы LLM

ПроблемаСутьКак обойти
Запоминание выдаёт себя за рассуждениеМодель отвечает уверенно и точно на известную загадку, шутку или кейс. Кажется, что она поняла логику. На самом деле она просто видела похожий пример при обучении и вспомнила готовый ответ. Со стороны не отличить память от реального пониманияПридумай свой собственный новый пример по той же логике — такой, которого точно нет в интернете. Попроси модель решить его и объяснить свою логику. Если объяснение стало заметно слабее и путанее чем на известном примере — модель угадывала, а не рассуждала

Методы

МетодСуть
Дельта-тест — проверка рассуждения через новизнуВозьми известный пример паттерна (загадку, шутку, бизнес-правило). Попроси модель объяснить его логику. Затем попроси придумать и решить свой новый пример по той же логике — гарантированно отсутствующий в интернете. Сравни качество объяснения на обоих. известный пример объяснение + новый пример объяснение сравнение. Почему работает: на известном примере модель может "срезать путь" через память. На новом примере срезать нечем — приходится честно применять логику шаг за шагом. Разница в качестве ответа выдаёт запоминание. Когда применять: проверка понимания метафор, шуток, каламбуров, бизнес-логики, любых паттернов, которые могли встречаться в обучении. Когда не применять: задачи без чёткого правильного ответа, где не с чем сравнивать качество
📖 Простыми словами

Reasoning or Memorization: CanLLMsUnderstand and Generate Chinese Xiehouyu Riddles?

arXiv: 2607.23440

Суть в том, что современные нейронки — это гениальные симулянты, которые мастерски выдают заученное за результат глубоких раздумий. Исследователи решили прижать их к стенке с помощью китайских загадок сехоуюй. Это такие двухчастные каламбуры, где первая часть — метафора, а вторая — неожиданная развязка на игре слов. Проблема в том, что если модель видела загадку в интернете миллион раз, она просто выплевывает ответ из памяти, не включая мозги. Чтобы понять, есть ли там реальное логическое мышление, ученые скормили ИИ редкие старые фразы и абсолютно новые загадки, придуманные лингвистами с нуля.

Это как если бы ты пришел на экзамен по математике, выучив наизусть все ответы из старого решебника. Пока тебе попадаются задачи из книжки, ты выглядишь как чертов гений. Но стоит профессору чуть-чуть изменить условие или придумать новую задачу на тот же принцип, и ты садишься в лужу, потому что не понимаешь логику, а просто помнишь цифры. Модели ведут себя точно так же: на знакомых каламбурах они блистают, но на свежих примерах их интеллект рассыпается, обнажая обычный статистический автозаполнитель.

Что конкретно выяснили: эффект запоминания доминирует над логикой. Исследователи использовали метод сравнения производительности на известных и синтетических данных. Если на классических загадках точность зашкаливает, а на новых — падает в разы, значит, модель просто косплеит мудреца. Оказалось, что даже топовые LLM буксуют, когда нужно проанализировать структуру каламбура с нуля, а не вытащить готовую связку из кэша. Они не понимают юмор или культурный контекст, они просто считают вероятность появления следующего слова.

Этот принцип универсален и применим к любому контенту, будь то программирование, юридические консультации или креатив для соцсетей. Если ты просишь ИИ написать код или придумать шутку, он, скорее всего, выдает усредненный плагиат из своей базы. Тест на китайских загадках доказал: как только задача выходит за рамки того, что уже есть в сети, «магия» исчезает. Это значит, что доверять нейронке создание по-настоящему уникальных вещей — затея сомнительная, она всегда будет тяготеть к шаблонам и повторам.

Короче, не обольщайся: твой любимый чат-бот не стал умнее, он просто прочитал больше книг, чем ты. Главный вывод исследования — разрыв в качестве между знакомыми и новыми задачами огромен. Если хочешь проверить, реально ли модель «соображает» или просто имитирует, дай ей задачу, которой гарантированно нет в Google. Скорее всего, результат будет полной фигней, потому что без шпаргалки в виде обучающей выборки эти системы пока что беспомощны.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с