3,583 papers
arXiv:2608.22232 79 23 авг. 2026 г. FREE

Guided Visual Reasoning: три шага против обмана зрения у ИИ

КЛЮЧЕВАЯ СУТЬ
Кружка с молоком до краёв похожа на перевёрнутую — GPT и Claude уверенно советуют её опрокинуть, хотя молоко просто налито до края. Guided Visual Reasoning позволяет модели отличать то, что видно на фото, от того, что есть на самом деле, а не домысливать по шаблону. Фишка метода — запретить модели прыгать сразу к выводу: сначала наблюдение, потом привязка к конкретной картинке, и только затем вывод о реальности. Один промпт, три обязательные части — и число ошибок падает заметно.
Адаптировать под запрос

TL;DR

Guided Visual Reasoning — простая техника промптинга, которая заставляет модель сначала описать что видно на фото, потом связать объекты между собой, и только затем сделать вывод о реальном положении дел. Метод работает на изображениях, где то, что видно, обманывает — и заставляет модель не перескакивать сразу к ответу.

Проблема в том, что современные модели (включая топовые GPT и Claude) массово ошибаются, когда картинка выглядит не так, как есть на самом деле. Пример из исследования: кружка с молоком, налитым до краёв, выглядит как перевёрнутая — потому что поверхность молока похожа на дно кружки. Модель видит "перевёрнутую кружку" и советует её перевернуть, что залило бы всё молоко. Причина сбоя — модель либо неправильно считывает детали (не заметила важное, перепутала одно с другим), либо опирается на стереотипы вместо конкретной картинки ("бегемотов в зоопарках обычно водят на ремне" — и модель "видит" ремень там, где на самом деле просто тень), либо не понимает общую геометрию сцены (не поняла, что фото повёрнуто на 90 градусов, и спутала стену с полом).

Метод решает это через три явные инструкции внутри одного промпта: сначала тщательно осмотреть визуальные улики, затем связать объекты и их отношения именно на этом изображении (не по общим знаниям), и только потом сделать вывод о реальном физическом состоянии сцены, прежде чем отвечать на вопрос.

🔬

Схема метода

ШАГ 1 (Observation): Опиши все релевантные визуальные детали на фото → список наблюдений
ШАГ 2 (Grounding): Свяжи объекты и их взаимное расположение именно на этом фото, 
                    не опираясь на общие предположения → карта связей
ШАГ 3 (Reasoning): Сделай вывод о реальном физическом состоянии сцены → финальный ответ

Все три шага выполняются в одном промпте, одним запросом.


🚀

Пример применения

Задача: Вы получили фото квартиры от риелтора на Авито или Циан и хотите понять, не искажает ли ракурс реальные пропорции комнаты — классическая история "ожидание vs реальность" при просмотре жилья.

Промпт:

Проанализируй это фото комнаты по трём шагам:

1. НАБЛЮДЕНИЕ: Опиши все видимые детали — расположение мебели, углы съёмки, 
   освещение, что попало в кадр по краям. Не делай выводов, просто перечисли, что видишь.

2. СВЯЗЫВАНИЕ: Свяжи объекты между собой на основе именно этого фото — 
   как соотносятся размеры мебели с размером комнаты, какой ракурс использован 
   (широкоугольный объектив искажает пропорции), где может быть оптический обман.
   Не опирайся на "обычные" размеры квартир — смотри только на то, что видно на фото.

3. ВЫВОД: На основе шагов 1 и 2 сделай заключение — реальны ли пропорции комнаты 
   на фото, или ракурс/объектив создают ложное впечатление о размере пространства?

Результат: Модель выдаст три пронумерованных блока. В первом — сухой список деталей (угол камеры, что в кадре, тип освещения). Во втором — анализ связей: например, "диван занимает половину кадра, что нетипично для широкоугольной съёмки — вероятно, комната меньше, чем кажется". В третьем — итоговый вывод с прямым ответом на вопрос о реальных пропорциях.


🧠

Почему это работает

Модели умеют хорошо описывать то, что видят на картинке отдельными фразами — это их сильная сторона. Но когда их просят сразу дать финальный ответ, они склеивают наблюдение и вывод в один шаг и по пути подмешивают стереотипы: "раз это бегемот в зоопарке — значит, вот эта тень наверняка ремень".

Разделение на три шага не даёт модели "срезать путь". Она вынуждена сначала выписать то, что реально видно, — а не то, что "обычно бывает". Это тот же принцип, что у Chain-of-Thought (пошаговое рассуждение), но с конкретной структурой под визуальные задачи: сначала факты, потом связи, потом интерпретация.

Рычаги управления: - Если задача проще (нет явного подвоха в фото) — можно убрать шаг "grounding" и оставить observation → reasoning, это ускорит ответ. - Если хотите видеть детальный ход мысли модели — попросите не сворачивать шаги в один абзац, а явно нумеровать их в ответе. - Для задач с действиями ("что мне делать с этим предметом") — усильте формулировку шага 3: "перед тем как предлагать действия, явно проверь, не противоречат ли они выводу из шага 2".


📋

Шаблон промпта

Проанализируй это изображение по трём шагам, не переходя к следующему, 
пока не завершил предыдущий:

1. НАБЛЮДЕНИЕ: Опиши все детали на фото, относящиеся к вопросу «{вопрос}». 
   Перечисли только то, что видно буквально, без интерпретаций.

2. СВЯЗЫВАНИЕ: Определи, как эти детали физически связаны друг с другом 
   именно на этом изображении — расположение, форма, освещение, ракурс. 
   Не используй общие предположения о том, «как обычно бывает» — 
   опирайся только на то, что видно на фото.

3. ВЫВОД: На основе шагов 1 и 2 дай ответ на вопрос: «{вопрос}». 
   Если наблюдение и первое впечатление противоречат друг другу — 
   явно укажи это противоречие и объясни, какая версия соответствует реальности.

{вопрос} — ваш конкретный запрос к фото: "что не так с этим товаром", "реальны ли пропорции комнаты", "как расположены объекты на самом деле" и т.д.

🚀 Быстрый старт — вставь в чат:

Вот шаблон трёхшагового анализа изображений. Адаптируй под мою задачу: {твоя задача с фото}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какой именно вопрос задать к фото и что именно проверять на противоречия — потому что без конкретного вопроса шаг "grounding" не сможет отличить релевантные детали от лишних.


⚠️

Ограничения

⚠️ Не спасает полностью: даже после применения метода лучшие модели дают около 70-80% точности — метод снижает число ошибок, но не убирает их полностью.

⚠️ Слабее на задачах планирования действий: если нужно не просто понять сцену, а спланировать последовательность физических действий на её основе, точность остаётся заметно ниже, чем на простом распознавании.

⚠️ На маленьких открытых моделях эффект слабее или нестабилен: метод сильнее помогает топовым моделям (Gemini, GPT, Claude), на компактных моделях улучшение может быть минимальным или отсутствовать вовсе.

⚠️ "Думай дольше" не панацея: увеличение времени на рассуждение у модели само по себе не гарантирует лучший результат — иногда модель начинает домысливать несуществующие детали и результат становится хуже. Явная структура (три шага) работает надёжнее, чем просто просьба "подумай подольше".


🔍

Как исследовали

Исследователи собрали 904 реальных фото, где вид расходится с реальностью — из Reddit, Zhihu, специализированных подборок оптических иллюзий и других источников — и построили из них 3723 задачи трёх типов: правда/ложь, открытые вопросы и планирование действий. Проверили 27 конфигураций моделей — от компактных открытых до топовых закрытых — и обнаружили, что даже лучшие модели ошибаются почти в 40% случаев на "хитрых" фото, а на задачах планирования действий точность падает ниже 45%.

Разбор ошибок показал закономерность: сначала модель неправильно считывает детали (45% ошибок), потом неправильно связывает их между собой из-за стереотипов (34%), и только в последнюю очередь ошибается в общей логике сцены (20%). Эта последовательность и подсказала решение — явно разбить процесс на три соответствующих шага. После внедрения такого промпта точность выросла на 5-20 процентных пунктов у большинства моделей, что подтвердило: структура рассуждения важнее, чем просто "подумай получше".


🔗

Ресурсы

MSIBench (Yang, Xiong, Zhou, Wei, Cui, Shi — Beijing University of Posts and Telecommunications), код и датасет на GitHub и Hugging Face (yangzm1105/MSIBench).


📋 Дайджест исследования

Ключевая суть

Кружка с молоком до краёв похожа на перевёрнутую — GPT и Claude уверенно советуют её опрокинуть, хотя молоко просто налито до края. Guided Visual Reasoning позволяет модели отличать то, что видно на фото, от того, что есть на самом деле, а не домысливать по шаблону. Фишка метода — запретить модели прыгать сразу к выводу: сначала наблюдение, потом привязка к конкретной картинке, и только затем вывод о реальности. Один промпт, три обязательные части — и число ошибок падает заметно.

Принцип работы

Формат: наблюдение → связывание → вывод, где каждый шаг блокирует переход к следующему пока не завершён предыдущий. Модель не может срезать путь и сразу выдать ответ по стереотипу — она обязана сначала выписать голые факты с фото, потом связать именно эти детали друг с другом, а не с тем «как обычно бывает». Это тот же принцип что у цепочки рассуждений (Chain-of-Thought), но заточенный конкретно под визуальный обман.

Почему работает

Модель отлично описывает картинку по кускам — это её сильная сторона. Но при прямом ответе она склеивает наблюдение и вывод в одно движение, и в этот момент проскакивает стереотип: «бегемота в зоопарке обычно водят на ремне» — и тень превращается в ремень. Разделение на шаги не даёт домыслить лишнее — модель вынуждена сверяться с конкретным кадром, а не с общими знаниями о мире. Даже с методом лучшие модели держат точность на уровне 70-80% — не идеал, но заметный отрыв от прямого ответа без структуры.

Когда применять

Анализ фото с визуальным обманом → товары на маркетплейсах, квартиры с искажённым ракурсом на Авито и Циан, бытовые оптические illusii, особенно когда первое впечатление от кадра прямо противоречит физике сцены. Не подходит как основной инструмент для планирования сложных последовательностей действий по фото — здесь точность метода заметно ниже, чем на простом распознавании сцены.

Мини-рецепт

1. Задай точный вопрос: не «что тут?», а конкретно — «реальны ли пропорции комнаты?», «что не так с этим товаром?».
2. Раздели промпт на три блока: наблюдение → связывание → вывод, каждый со своей чёткой инструкцией.
3. Запрети домыслы: явно пропиши «не опирайся на общие предположения о том как обычно бывает — только то что видно на фото».
4. Вытащи противоречие: попроси модель сравнить первое впечатление с итоговым выводом и назвать, где они расходятся.

Примеры

[ПЛОХО] : Что не так с этой кружкой на фото?
[ХОРОШО] : Проанализируй фото по трём шагам: 1) НАБЛЮДЕНИЕ — опиши форму кружки, уровень жидкости, освещение, без выводов. 2) СВЯЗЫВАНИЕ — свяжи форму жидкости с формой кружки именно на этом фото, не опираясь на то, как обычно выглядят кружки. 3) ВЫВОД — кружка перевёрнута или это молоко налито до краёв?
Источник: Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models
ArXiv ID: 2608.22232 | Сгенерировано: 2026-08-25 05:27

Проблемы LLM

ПроблемаСутьКак обойти
Модель путает "что видно" с "что обычно бывает"Если просишь сразу дать ответ по фото, модель не разделяет наблюдение и стереотип. Тень принимает за ремень, потому что "у животных в зоопарке обычно ремень". Дно кружки путает с поверхностью молока. Стену со стеной, повёрнутой на 90°, путает с полом. Ломается на любых сценах с визуальным подвохом — необычный ракурс, оптический обман, нестандартное положение предметаРаздели запрос на три явных шага: сначала перечислить видимые детали без выводов, потом связать их именно на этой картинке (не по общим знаниям), потом сделать вывод

Методы

МетодСуть
Трёхшаговый визуальный разбор — наблюдение связывание выводВ одном запросе проси модель пройти три шага по порядку: 1. Опиши детали без выводов 2. Свяжи их именно на этом фото, не опираясь на "как обычно бывает" 3. Сделай вывод о реальном положении дел. Работает, потому что не даёт модели "срезать путь" к привычному ответу — она вынуждена сначала зафиксировать факты, прежде чем подключать интерпретацию. Хорошо: сцены с визуальным обманом, нестандартные ракурсы, задачи "что здесь не так". Слабо: простые фото без подвоха (шаг связывания можно убрать), задачи планирования действий (точность ниже), маленькие модели (эффект нестабилен)

Тезисы

ТезисКомментарий
Явная структура рассуждения надёжнее просьбы "думай дольше"Просто попросить модель размышлять подольше не гарантирует лучший ответ — она может начать домысливать детали, которых нет на картинке. Чёткая последовательность шагов даёт более стабильный результат, потому что ограничивает куда именно направлено рассуждение на каждом этапе. Применяй: вместо "проанализируй внимательно" дай конкретные пронумерованные шаги и попроси не сворачивать их в один абзац
Запрет на выводы на первом шаге мешает подмене фактов стереотипомКогда описание и интерпретация происходят одновременно, модель подтягивает привычный шаблон вместо реальной картинки. Если явно запретить делать выводы на этапе перечисления деталей, факты фиксируются раньше, чем включаются стереотипы. Применяй: в промпте пиши прямо "не делай выводов, просто перечисли, что видишь"
📖 Простыми словами

Beyond What Meets the Eye: Unveiling Situational Illusions for MultimodalLargeLanguageModels

arXiv: 2608.22232

Мультимодальные сетки лажают на сложных ракурсах ровно по одной причине: они склеивают наблюдение и вывод в один шаг. Вместо того чтобы честно разобрать картинку на пиксели, модель сразу пытается угадать, что тут вообще происходит. На этом этапе вылезают стереотипы и галлюцинации — нейросеть радостно подменяет реальные детали кадра своими шаблонными ожиданиями.

Это как уставший охранник, который мельком глянул на мутный экран камеры: увидел тёмную палку в руках прохожего и с перепугу решил, что это вооружённое нападение. Вместо того чтобы последовательно зафиксировать факты — форму предмета, позу, окружение — мозг мгновенно подсовывает готовый ярлык. В итоге получается полная ерунда на ровном месте.

Лечится это техникой Guided Visual Reasoning. Ты ломаешь модели привычку спешить и ведешь её по строгому алгоритму: сначала инвентаризация объектов (тупо перечислить всё, что видно), затем пространственная привязка (как эти вещи расположены относительно друг друга), и только в конце — финальный вывод. Когда сетку заставляют рассуждать вслух по шагам, иллюзии перестают её обманывать.

Тестировали механику на тестах с иллюзиями, но принцип универсален. Самый наглядный пример — фотографии квартир на Циан или Авито, где риелторы выкручивают широкоугольные линзы, пытаясь выдать конуру за пентхаус. Тот же подход вскрывает искажённые пропорции товаров на маркетплейсах, фейковые скриншоты и любые другие попытки развести зрителя визуальными манипуляциями.

Короче: никогда не проси модель выдать вердикт по картинке с первого захода. Хочешь получить правду — принудительно разделяй зрение и логику. Заставь сетку сначала описать геометрию сцены, а потом делать выводы, иначе вместо анализа получишь уверенную фантазию.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с