3,583 papers
arXiv:2607.27747 71 30 июля 2026 г. FREE

IllusionReasoning: зрительные ИИ путаются в оптических иллюзиях и уходят от прямого ответа

КЛЮЧЕВАЯ СУТЬ
55-60% правильных ответов — вот весь потолок топовых vision-моделей на очевидных зрительных обманках, это чуть выше случайной монетки. Метод IllusionReasoning заставляет модель дать честный да/нет ответ вместо расплывчатой отмазки на спорной детали фото — вместо "на фото интересный архитектурный элемент" получаешь конкретный вердикт. Фишка: вопрос разбивается на три отдельных шага — детекция, чистое описание и объяснение причины обмана — а в конце модель обязана дать явный итог, спрятаться за общей фразой не получится.
Адаптировать под запрос

TL;DR

Исследователи собрали 650 настоящих фотографий оптических иллюзий из реального мира — не рисунков из учебников, а фото, которые люди сами снимали и путались, что на них изображено. Проверили на них десятки топовых vision-моделей (GPT, Gemini, Qwen и другие) и получили результат чуть выше случайного угадывания: даже лучшие модели правильно отвечают в 55-60% случаев.

Главная находка: модели либо слепо верят картинке, как и человек — принимают рисунок за реальный объект, либо — что хуже — дают расплывчатый нейтральный ответ, полностью игнорируя спорную деталь на фото, чтобы не ошибиться. Такое "уклонение от ответа" встречается в 30-60% случаев. Например, фургон с нарисованным на боку кабриолетом: топовые модели не могут уверенно сказать, что серая машина — это роспись, а не реальный автомобиль.

Метод решает это через трёхэтапную структуру вопроса: сначала прямой да/нет вопрос про объект, потом чистое описание того, что буквально видно (без выводов), потом — просьба объяснить причину несоответствия между тем, что кажется, и тем, что есть на самом деле. Плюс — явное требование итогового вывода, чтобы модель не спряталась за общими фразами.


🔬

Схема метода

ШАГ 1: ДЕТЕКЦИЯ → прямой вопрос "да/нет" — существует ли объект как физическая вещь
ШАГ 2: ОПИСАНИЕ → что буквально видно на фото, без интерпретаций
ШАГ 3: ПРИЧИНА → если объекта на самом деле нет — объяснить, за счёт чего возникает обман (свет, тень, перспектива, роспись)
ИТОГ: явный однозначный вывод в конце ответа

Все три шага можно уложить в один промпт с одной картинкой.


🚀

Пример применения

Задача: Друг присылает в чат фото уличного стрит-арта в Екатеринбурге (там много trompe l'oeil-росписей на домах — окна, балконы, лестницы, которых на самом деле нет). Нужно точно понять, что на фото реально, а что нарисовано, прежде чем репостить с подписью.

Промпт:

Вот фото. Проанализируй его в три этапа, не пропускай ни один:

1. ДЕТЕКЦИЯ: Ответь прямо "да" или "нет" — присутствует ли на фото открытое окно 
(или балкон) как реальный физический объект, а не как роспись, тень или отражение?

2. ОПИСАНИЕ: Опиши только то, что буквально видно на фото — форму, цвет, 
расположение элементов. Без выводов о том, что это "на самом деле".

3. ПРИЧИНА: Если в шаге 1 ты ответил "нет" — объясни, за счёт чего создаётся 
впечатление, что окно реально: перспектива, тень, стиль росписи, ракурс камеры.

Дай явный итоговый вывод: "Итог: окно на фото [реальное / нарисованное], потому что..."

Результат: Модель выдаст структурированный ответ из трёх пронумерованных частей и явный финальный вердикт, а не общее туманное "на фото интересный элемент архитектуры". Такая структура снижает шанс, что модель уйдёт от прямого ответа на спорную деталь.


🧠

Почему это работает

Vision-модели по умолчанию обманываются картинкой так же, как люди, либо, чтобы не рисковать ошибкой, дают расплывчатый ответ и просто игнорируют спорную деталь изображения — так происходит в 30-60% случаев на неоднозначном визуальном контенте.

При этом модели неплохо объясняют причину несоответствия, если им явно сообщить факт и пошагово попросить рассуждать — именно в задачах "почему возникает иллюзия" thinking-режим и явные инструкции дают заметный прирост.

Метод разбивает задачу на детекцию / описание / причину и требует финального вердикта — это не даёт модели спрятаться за общей фразой и заставляет отделить "что вижу" от "что это значит".

Рычаги управления: - Требование "дай явный вывод" → выбивает модель из нейтрального уклончивого ответа. - Включение пошагового рассуждения (thinking mode) → помогает именно на вопросах "почему", но может даже ухудшить простые вопросы обнаружения — не включай его "на всякий случай" для простых задач.


📋

Шаблон промпта

Вот изображение. Проанализируй его в три этапа, не пропускай ни один:

1. ДЕТЕКЦИЯ: Ответь прямо "да" или "нет" — присутствует ли на фото {объект} 
как отдельный физический предмет (а не рисунок, отражение или тень)?

2. ОПИСАНИЕ: Опиши только то, что буквально видно на фото — цвета, формы, 
расположение объектов. Без выводов о том, что это "на самом деле".

3. ПРИЧИНА: Если в шаге 1 ты ответил "нет" — объясни, за счёт чего создаётся 
впечатление, что объект есть: свет, тень, перспектива, роспись, отражение, ракурс камеры.

Дай явный итоговый вывод: "Итог: {объект} на фото [реален / не реален], потому что ..."

{объект} — конкретная спорная деталь на фото (окно, машина, дыра в стене, тень человека и т.д.)

🚀 Быстрый старт — вставь в чат:

Вот шаблон анализа обманчивых изображений. Адаптируй под мою задачу: [опиши фото 
и что тебя смущает]. Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какой именно объект вызывает сомнение — потому что без этого шаг 1 (детекция) не сработает: модели нужен конкретный предмет для прямого да/нет ответа, а не общий вопрос "что на фото".


⚠️

Ограничения

⚠️ Метод не панацея: даже топовые модели дают правильный ответ на явные визуальные иллюзии лишь в 55-60% случаев — это немного лучше случайного угадывания для вопросов да/нет.

⚠️ Расширенное рассуждение вредит на простых задачах: включение thinking-режима может ухудшить результат на вопросах обнаружения и описания — не включай его для простых визуальных проверок.

⚠️ Уклонение от ответа не убирается полностью: модели склонны выдавать нейтральные обтекаемые ответы на неоднозначный визуальный контент. Явные формулировки промпта снижают эту склонность, но не убирают её до конца.


🔍

Как исследовали

Команда собрала 650 реальных фотографий оптических иллюзий, специально искав их через поисковики по запросу "оптические иллюзии в реальном мире" — не рисованные учебные примеры (линия Мюллера-Лайера, треугольник Пенроуза), чтобы модель не могла просто вспомнить ответ из тренировочных данных. Разметчики создали больше 3000 вопросов трёх типов — обнаружение, описание, причина — и каждый вопрос проверяли минимум два раза разные аннотаторы. Ответы моделей оценивал GPT-4o как судья, показав 99% совпадения с человеческой оценкой.

Протестировали больше десятка моделей — от 1 миллиарда до сотен миллиардов параметров, включая GPT-5.5, Gemini, Qwen, InternVL. Неожиданный результат: размер модели почти не влияет на итог — маленькие модели иногда не хуже больших в разы. Это говорит, что дело не в масштабе модели, а в том, какими данными она обучена справляться с визуальным обманом.


📋 Дайджест исследования

Ключевая суть

55-60% правильных ответов — вот весь потолок топовых vision-моделей на очевидных зрительных обманках, это чуть выше случайной монетки. Метод IllusionReasoning заставляет модель дать честный да/нет ответ вместо расплывчатой отмазки на спорной детали фото — вместо "на фото интересный архитектурный элемент" получаешь конкретный вердикт. Фишка: вопрос разбивается на три отдельных шага — детекция, чистое описание и объяснение причины обмана — а в конце модель обязана дать явный итог, спрятаться за общей фразой не получится.

Принцип работы

Модель, как и человек, либо слепо верит картинке и принимает роспись за реальный объект, либо, чтобы не рисковать ошибкой, выдаёт нейтральный уклончивый ответ и просто игнорирует спорную деталь. Разделение вопроса на детекцию / описание / причину не даёт модели спрятаться — она не может одной размытой фразой закрыть сразу и "что вижу", и "что это значит".

Почему работает

Уклонение от прямого ответа — это не баг, а стратегия модели: если не уверена, безопаснее сказать нейтрально, чем ошибиться. Отсюда 30-60% случаев обтекаемых ответов на неоднозначных фото. Требование явного финального вывода буквально выбивает модель из этой нейтральной позиции — ей нужно выбрать сторону. Отдельная деталь: пошаговые рассуждения (thinking mode) реально помогают на вопросах "почему возникает обман", но могут ухудшить ответ на простом обнаружении объекта — включать его нужно избирательно, не "на всякий случай".

Когда применять

Проверка визуального контента → анализ фото со стрит-артом, trompe l'oeil-росписями, обманными перспективами и рекламными муралами, особенно когда нужно понять реальность объекта перед репостом или публикацией. Не подходит для thinking-режима на простых задачах обнаружения — там расширенные рассуждения могут сбить модель, лучше короткий прямой вопрос.

Мини-рецепт

1. Назови конкретный объект спора: не "что на фото", а точно — окно, машина, тень, дыра в стене. Без конкретики шаг детекции не сработает.
2. Задай прямой да/нет вопрос: существует ли объект как реальная физическая вещь, а не роспись или отражение.
3. Попроси чистое описание: только то, что буквально видно — форма, цвет, расположение, без выводов о реальности.
4. Спроси причину обмана: если объекта нет — за счёт чего создаётся иллюзия: свет, тень, перспектива, стиль росписи.
5. Требуй явный вердикт: формула вида "Итог: [объект] реален/нарисован, потому что..." — это отсекает уклончивые ответы.

Примеры

[ПЛОХО] : Что изображено на этой фотографии?
[ХОРОШО] : 1. ДЕТЕКЦИЯ: да/нет — присутствует ли на фото открытое окно как реальный физический объект, а не роспись или тень? 2. ОПИСАНИЕ: опиши только то, что буквально видно, без выводов. 3. ПРИЧИНА: если окна нет — объясни за счёт чего создаётся впечатление реальности (перспектива, тень, стиль росписи). Дай итог: "Окно на фото [реальное/нарисованное], потому что..."
Источник: IllusionReasoning: Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities
ArXiv ID: 2607.27747 | Сгенерировано: 2026-07-31 04:24

Проблемы LLM

ПроблемаСутьКак обойти
Модель уходит от ответа при неоднозначном визуальном сигналеКогда на картинке спорная деталь (тень, роспись, отражение), модель либо слепо принимает иллюзию за реальность — как человек, либо даёт расплывчатый нейтральный ответ и просто игнорирует противоречие, чтобы не ошибиться. Так происходит в 30-60% случаев на неоднозначном контенте. Итоговая точность даже у топовых моделей — 55-60%, чуть выше угадыванияРазбей вопрос на этапы: сначала прямой да/нет про физическое существование объекта, потом чистое описание без выводов, потом причина обмана. В конце явно потребуй итоговый вердикт — это не даёт спрятаться за общей фразой

Методы

МетодСуть
Трёхэтапная структура запроса: детекция описание причина + явный выводЗадай вопрос тремя шагами в одном промпте: 1) прямой "да/нет" — существует ли объект как физическая вещь; 2) описание того, что буквально видно, без интерпретаций; 3) если объекта нет — объяснение причины обмана (свет, тень, перспектива, роспись). Завершить явным вердиктом типа "Итог: X реален/нереален, потому что...". Почему работает: разделение "что вижу" и "что это значит" не даёт модели спрятаться за туманной общей фразой, вынуждает дать однозначный ответ. Когда применять: любой неоднозначный визуальный (или текстовый) контент, где нужно отделить наблюдение от интерпретации. Когда не работает: для однозначных простых вопросов лишние этапы и особенно включённый режим рассуждения могут даже ухудшить результат

Тезисы

ТезисКомментарий
Явное требование финального вывода снижает уклонение модели от ответаМодель по умолчанию склонна давать обтекаемый нейтральный ответ на неоднозначный вход — так она избегает риска ошибиться. Если явно попросить дать однозначный вердикт в конце ответа ("Итог: A или B, потому что..."), модель реже прячется за общими формулировками. Полностью уклонение это не убирает, но заметно снижает. Применяй: всегда завершай промпт требованием явного однозначного вывода, а не просто вопросом
📖 Простыми словами

Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities

arXiv: 2607.27747

Суть проблемы в том, что современные мультимодальные модели (LVLM), вроде GPT-4o или Gemini, смотрят на мир как близорукие туристы без очков. Они не анализируют физику света или геометрию пространства, а просто пытаются угадать, что «обычно» бывает на таких картинках. Когда им подсовывают оптическую иллюзию, их мозг из нейронов плавится, потому что они привыкли доверять первому впечатлению, а не логике. В итоге даже топовые нейронки лажают почти в половине случаев, выдавая результат чуть лучше, чем если бы ты просто подбросил монетку.

Это как если бы ты пришел в «Музей иллюзий», где нарисованная на полу дыра кажется бездной, и твой друг-робот начал бы истошно орать, пытаясь тебя спасти. Формально он видит дыру, но у него напрочь отсутствует понимание того, как работает перспектива и краска на плоской поверхности. Модели ведут себя как доверчивые дети: если картинка выглядит как лестница, ведущая в небо, они так и напишут, полностью игнорируя тот факт, что в реальности это просто удачный ракурс и кусок бетона.

Исследователи прогнали модели через датасет из 650 реальных фото-иллюзий, и результаты — полный облом. Выяснилось, что нейронки либо тупо верят глазам, либо включают режим «безопасного чиновника» и выдают расплывчатый ответ, игнорируя самую важную деталь. В 30–60% случаев модель просто делает вид, что не заметила подвоха. Хуже всего то, что даже если модель правильно описывает элементы картинки, она не может связать их логически — визуальное восприятие и рассуждение у них живут в разных комнатах и друг с другом не общаются.

Хотя тест проводили на странных фотках, принцип универсален для любой работы с визуалом. Это касается проверки фейков, анализа медицинских снимков или работы беспилотников. Если нейронка не может отличить стрит-арт от реального балкона в Екатеринбурге, она так же легко может принять тень на дороге за бетонный блок или пропустить критическую ошибку в чертеже, просто потому что «глаз замылился». Зрение AI пока не равно пониманию реальности.

Короче: не вздумай доверять нейронкам анализ сложных или спорных изображений, где важна глубина и контекст. Точность в 55-60% — это приговор для серьезных задач. Пока разработчики не научат модели сомневаться в увиденном и перепроверять картинку через законы физики, они будут оставаться жертвами дешевых фокусов. Если хочешь понять, что на самом деле на фото — верь своим глазам, а не чат-боту, который до сих пор ведется на нарисованные двери.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с