TL;DR
Исследователи собрали 650 настоящих фотографий оптических иллюзий из реального мира — не рисунков из учебников, а фото, которые люди сами снимали и путались, что на них изображено. Проверили на них десятки топовых vision-моделей (GPT, Gemini, Qwen и другие) и получили результат чуть выше случайного угадывания: даже лучшие модели правильно отвечают в 55-60% случаев.
Главная находка: модели либо слепо верят картинке, как и человек — принимают рисунок за реальный объект, либо — что хуже — дают расплывчатый нейтральный ответ, полностью игнорируя спорную деталь на фото, чтобы не ошибиться. Такое "уклонение от ответа" встречается в 30-60% случаев. Например, фургон с нарисованным на боку кабриолетом: топовые модели не могут уверенно сказать, что серая машина — это роспись, а не реальный автомобиль.
Метод решает это через трёхэтапную структуру вопроса: сначала прямой да/нет вопрос про объект, потом чистое описание того, что буквально видно (без выводов), потом — просьба объяснить причину несоответствия между тем, что кажется, и тем, что есть на самом деле. Плюс — явное требование итогового вывода, чтобы модель не спряталась за общими фразами.
Схема метода
ШАГ 1: ДЕТЕКЦИЯ → прямой вопрос "да/нет" — существует ли объект как физическая вещь
ШАГ 2: ОПИСАНИЕ → что буквально видно на фото, без интерпретаций
ШАГ 3: ПРИЧИНА → если объекта на самом деле нет — объяснить, за счёт чего возникает обман (свет, тень, перспектива, роспись)
ИТОГ: явный однозначный вывод в конце ответа
Все три шага можно уложить в один промпт с одной картинкой.
Пример применения
Задача: Друг присылает в чат фото уличного стрит-арта в Екатеринбурге (там много trompe l'oeil-росписей на домах — окна, балконы, лестницы, которых на самом деле нет). Нужно точно понять, что на фото реально, а что нарисовано, прежде чем репостить с подписью.
Промпт:
Вот фото. Проанализируй его в три этапа, не пропускай ни один:
1. ДЕТЕКЦИЯ: Ответь прямо "да" или "нет" — присутствует ли на фото открытое окно
(или балкон) как реальный физический объект, а не как роспись, тень или отражение?
2. ОПИСАНИЕ: Опиши только то, что буквально видно на фото — форму, цвет,
расположение элементов. Без выводов о том, что это "на самом деле".
3. ПРИЧИНА: Если в шаге 1 ты ответил "нет" — объясни, за счёт чего создаётся
впечатление, что окно реально: перспектива, тень, стиль росписи, ракурс камеры.
Дай явный итоговый вывод: "Итог: окно на фото [реальное / нарисованное], потому что..."
Результат: Модель выдаст структурированный ответ из трёх пронумерованных частей и явный финальный вердикт, а не общее туманное "на фото интересный элемент архитектуры". Такая структура снижает шанс, что модель уйдёт от прямого ответа на спорную деталь.
Почему это работает
Vision-модели по умолчанию обманываются картинкой так же, как люди, либо, чтобы не рисковать ошибкой, дают расплывчатый ответ и просто игнорируют спорную деталь изображения — так происходит в 30-60% случаев на неоднозначном визуальном контенте.
При этом модели неплохо объясняют причину несоответствия, если им явно сообщить факт и пошагово попросить рассуждать — именно в задачах "почему возникает иллюзия" thinking-режим и явные инструкции дают заметный прирост.
Метод разбивает задачу на детекцию / описание / причину и требует финального вердикта — это не даёт модели спрятаться за общей фразой и заставляет отделить "что вижу" от "что это значит".
Рычаги управления: - Требование "дай явный вывод" → выбивает модель из нейтрального уклончивого ответа. - Включение пошагового рассуждения (thinking mode) → помогает именно на вопросах "почему", но может даже ухудшить простые вопросы обнаружения — не включай его "на всякий случай" для простых задач.
Шаблон промпта
Вот изображение. Проанализируй его в три этапа, не пропускай ни один:
1. ДЕТЕКЦИЯ: Ответь прямо "да" или "нет" — присутствует ли на фото {объект}
как отдельный физический предмет (а не рисунок, отражение или тень)?
2. ОПИСАНИЕ: Опиши только то, что буквально видно на фото — цвета, формы,
расположение объектов. Без выводов о том, что это "на самом деле".
3. ПРИЧИНА: Если в шаге 1 ты ответил "нет" — объясни, за счёт чего создаётся
впечатление, что объект есть: свет, тень, перспектива, роспись, отражение, ракурс камеры.
Дай явный итоговый вывод: "Итог: {объект} на фото [реален / не реален], потому что ..."
{объект} — конкретная спорная деталь на фото (окно, машина, дыра в стене, тень человека и т.д.)
🚀 Быстрый старт — вставь в чат:
Вот шаблон анализа обманчивых изображений. Адаптируй под мою задачу: [опиши фото
и что тебя смущает]. Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какой именно объект вызывает сомнение — потому что без этого шаг 1 (детекция) не сработает: модели нужен конкретный предмет для прямого да/нет ответа, а не общий вопрос "что на фото".
Ограничения
⚠️ Метод не панацея: даже топовые модели дают правильный ответ на явные визуальные иллюзии лишь в 55-60% случаев — это немного лучше случайного угадывания для вопросов да/нет.
⚠️ Расширенное рассуждение вредит на простых задачах: включение thinking-режима может ухудшить результат на вопросах обнаружения и описания — не включай его для простых визуальных проверок.
⚠️ Уклонение от ответа не убирается полностью: модели склонны выдавать нейтральные обтекаемые ответы на неоднозначный визуальный контент. Явные формулировки промпта снижают эту склонность, но не убирают её до конца.
Как исследовали
Команда собрала 650 реальных фотографий оптических иллюзий, специально искав их через поисковики по запросу "оптические иллюзии в реальном мире" — не рисованные учебные примеры (линия Мюллера-Лайера, треугольник Пенроуза), чтобы модель не могла просто вспомнить ответ из тренировочных данных. Разметчики создали больше 3000 вопросов трёх типов — обнаружение, описание, причина — и каждый вопрос проверяли минимум два раза разные аннотаторы. Ответы моделей оценивал GPT-4o как судья, показав 99% совпадения с человеческой оценкой.
Протестировали больше десятка моделей — от 1 миллиарда до сотен миллиардов параметров, включая GPT-5.5, Gemini, Qwen, InternVL. Неожиданный результат: размер модели почти не влияет на итог — маленькие модели иногда не хуже больших в разы. Это говорит, что дело не в масштабе модели, а в том, какими данными она обучена справляться с визуальным обманом.
