TL;DR
Исследователи придумали способ проверить, действительно ли ИИ рассуждает или просто выдаёт запомненные ответы, притворяясь умным. Для этого взяли китайские загадки-каламбуры сехоуюй (двухчастные фразы с игрой слов, вроде "Конфуций переезжает — сплошные книги/сплошные проигрыши") и сравнили, как модель справляется с редкими существующими загадками против совсем новых, придуманных лингвистами специально для теста — их точно нет в интернете.
Оказалось, что китайские топовые модели (DeepSeek, Kimi, GLM) почти идеально решают редкие, но существующие загадки (91% точности), а на свежепридуманных точность падает на 20-30 пунктов. При этом модели тратят на новые загадки на 40% больше токенов на "размышления", но результат не улучшается — это классическое перемышление: модель усердно думает, но не туда. У людей разница между редкими и новыми загадками — всего 3 пункта: человек одинаково хорошо решает и то, и другое, потому что реально разгадывает логику игры слов, а не вспоминает готовый ответ.
Вывод простой: если хочешь понять, понимает ли ИИ суть паттерна или просто вспоминает похожие примеры из обучения, дай ему что-то совсем новое, чего он точно не видел, и сравни результат с известным примером той же сложности.
Схема метода
ШАГ 1: Возьми известный пример паттерна (шутка, загадка, бизнес-кейс) → эталон
ШАГ 2: Придумай новый пример по той же логике, которого точно нет в интернете → тест-кейс
ШАГ 3: Попроси модель решить/объяснить ОБА примера, без подсказок и контекста → два ответа
ШАГ 4: Сравни точность и качество объяснения → большая разница = модель угадывала по памяти, малая = реально рассуждала
Все шаги можно выполнить в одном диалоге, по очереди.
Пример применения
Задача: Ты ведёшь Telegram-канал с ребусами и словесными играми (шарады, каламбуры) и хочешь понять, можно ли доверить ИИ придумывать новые загадки для подписчиков, или он просто пересказывает известные.
Промпт:
Вот известная русская загадка-каламбур:
"Какой рак не рак? — Рак-отшельник, потому что раком не отшельничает, а отшельник не рак"
(пример условный, замени на настоящую).
Объясни логику этой загадки: почему ответ именно такой,
на какой игре слов она строится.
Теперь придумай СВОЮ новую загадку по такой же логике игры слов,
но с другой парой созвучных слов, и сразу объясни, почему твой ответ верный.
Результат: Модель сначала разберёт известную загадку — скорее всего, точно и уверенно, потому что могла видеть её в обучении. Дальше, когда попросишь придумать новую по той же схеме, обрати внимание: получится ли у неё выстроить свою цепочку "созвучие → смысл", или объяснение будет натянутым, с нелогичной связкой. Если объяснение новой загадки заметно слабее и более путаное, чем для известной — модель скорее вспоминает шаблоны, чем реально жонглирует смыслами.
Почему это работает
Языковые модели обучены на огромных массивах текста, где культурно значимые загадки, шутки и пословицы встречаются много раз. Модель может "узнавать" редкую фразу просто потому, что видела её пару раз в обучении — и это выглядит как рассуждение, хотя на самом деле это воспоминание.
Сильная сторона LLM — она хорошо ищет паттерны и связи между словами, если объяснить логику явно. Но это работает надёжно только тогда, когда у неё нет готового ответа в памяти, за который можно "срезать путь".
Метод использует это: если убрать возможность вспомнить (дав совершенно новый пример), модель вынуждена реально применить логику пошагово. Разница в качестве ответа на старом и новом примере — честный индикатор, угадывает модель или думает.
Рычаги управления: - Просьба "порассуждай" (Chain-of-Thought) — не всегда помогает. На творческих и словесных задачах она может даже мешать: модель тратит больше токенов, но не становится точнее (эффект "перемышления" из исследования). - Контекст (пример использования фразы) — реально помогает модели правильно понять смысл, повышает точность до 10%. Если хочешь честной проверки понимания — не давай контекст. Если хочешь максимального качества ответа — давай. - Формулировка "придумай новое, а не вспомни" — заставляет модель включить рассуждение вместо поиска по памяти.
Шаблон промпта
Вот известный пример: {известный пример паттерна — шутка/загадка/кейс}.
Объясни логику: почему это работает именно так.
Теперь придумай свой новый пример по такой же логике,
но с другими словами/деталями, которого точно не существует.
Сразу объясни, почему твой пример логичен.
Сравни: где твоё объяснение было увереннее и точнее —
на известном примере или на новом?
Подставь в {известный пример паттерна} любую вещь, где хочешь проверить, реально ли модель понимает механику — шутку, загадку, метафору, аргумент, правило игры.
🚀 Быстрый старт — вставь в чат:
Вот шаблон для проверки, рассуждает ИИ или вспоминает готовые ответы.
Адаптируй под мою задачу: {моя задача — проверить понимание чего}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какой именно паттерн ты хочешь проверить (шутку, бизнес-правило, метафору) — потому что без конкретного примера-эталона тест не построить. Она возьмёт логику из шаблона и подгонит под твою тему.
Ограничения
⚠️ Не абсолютное доказательство: если модель одинаково хорошо справилась и со старым, и с новым примером, это не значит, что она НЕ запоминала — она могла и запомнить много всего, и научиться рассуждать. Тест показывает только минимальный уровень запоминания, не ноль.
⚠️ Нужно самому придумать новый пример — это не готовый шаблон "вставь и получи ответ", придётся потратить время на создание тест-кейса, которого точно нет в интернете.
⚠️ Просьба "подумай подольше" может испортить результат на творческих и словесных задачах — не включай режим глубокого рассуждения по умолчанию для генерации шуток, метафор, каламбуров.
⚠️ ИИ хуже человека придумывает новое — даже топовые модели в исследовании создавали заметно менее удачные и смешные загадки, чем люди-эксперты. Не жди от ИИ оригинального юмора или словесной изобретательности на уровне человека.
Ресурсы
X-Riddles (датасет из 1143 китайских загадок-каламбуров сехоуюй), Hai Hu, Siyuan Song, Chongtian Shao и соавторы — The Hong Kong Polytechnic University, The University of Texas at Austin, Shanghai Jiao Tong University.
