TL;DR
Guided Visual Reasoning — простая техника промптинга, которая заставляет модель сначала описать что видно на фото, потом связать объекты между собой, и только затем сделать вывод о реальном положении дел. Метод работает на изображениях, где то, что видно, обманывает — и заставляет модель не перескакивать сразу к ответу.
Проблема в том, что современные модели (включая топовые GPT и Claude) массово ошибаются, когда картинка выглядит не так, как есть на самом деле. Пример из исследования: кружка с молоком, налитым до краёв, выглядит как перевёрнутая — потому что поверхность молока похожа на дно кружки. Модель видит "перевёрнутую кружку" и советует её перевернуть, что залило бы всё молоко. Причина сбоя — модель либо неправильно считывает детали (не заметила важное, перепутала одно с другим), либо опирается на стереотипы вместо конкретной картинки ("бегемотов в зоопарках обычно водят на ремне" — и модель "видит" ремень там, где на самом деле просто тень), либо не понимает общую геометрию сцены (не поняла, что фото повёрнуто на 90 градусов, и спутала стену с полом).
Метод решает это через три явные инструкции внутри одного промпта: сначала тщательно осмотреть визуальные улики, затем связать объекты и их отношения именно на этом изображении (не по общим знаниям), и только потом сделать вывод о реальном физическом состоянии сцены, прежде чем отвечать на вопрос.
Схема метода
ШАГ 1 (Observation): Опиши все релевантные визуальные детали на фото → список наблюдений
ШАГ 2 (Grounding): Свяжи объекты и их взаимное расположение именно на этом фото,
не опираясь на общие предположения → карта связей
ШАГ 3 (Reasoning): Сделай вывод о реальном физическом состоянии сцены → финальный ответ
Все три шага выполняются в одном промпте, одним запросом.
Пример применения
Задача: Вы получили фото квартиры от риелтора на Авито или Циан и хотите понять, не искажает ли ракурс реальные пропорции комнаты — классическая история "ожидание vs реальность" при просмотре жилья.
Промпт:
Проанализируй это фото комнаты по трём шагам:
1. НАБЛЮДЕНИЕ: Опиши все видимые детали — расположение мебели, углы съёмки,
освещение, что попало в кадр по краям. Не делай выводов, просто перечисли, что видишь.
2. СВЯЗЫВАНИЕ: Свяжи объекты между собой на основе именно этого фото —
как соотносятся размеры мебели с размером комнаты, какой ракурс использован
(широкоугольный объектив искажает пропорции), где может быть оптический обман.
Не опирайся на "обычные" размеры квартир — смотри только на то, что видно на фото.
3. ВЫВОД: На основе шагов 1 и 2 сделай заключение — реальны ли пропорции комнаты
на фото, или ракурс/объектив создают ложное впечатление о размере пространства?
Результат: Модель выдаст три пронумерованных блока. В первом — сухой список деталей (угол камеры, что в кадре, тип освещения). Во втором — анализ связей: например, "диван занимает половину кадра, что нетипично для широкоугольной съёмки — вероятно, комната меньше, чем кажется". В третьем — итоговый вывод с прямым ответом на вопрос о реальных пропорциях.
Почему это работает
Модели умеют хорошо описывать то, что видят на картинке отдельными фразами — это их сильная сторона. Но когда их просят сразу дать финальный ответ, они склеивают наблюдение и вывод в один шаг и по пути подмешивают стереотипы: "раз это бегемот в зоопарке — значит, вот эта тень наверняка ремень".
Разделение на три шага не даёт модели "срезать путь". Она вынуждена сначала выписать то, что реально видно, — а не то, что "обычно бывает". Это тот же принцип, что у Chain-of-Thought (пошаговое рассуждение), но с конкретной структурой под визуальные задачи: сначала факты, потом связи, потом интерпретация.
Рычаги управления: - Если задача проще (нет явного подвоха в фото) — можно убрать шаг "grounding" и оставить observation → reasoning, это ускорит ответ. - Если хотите видеть детальный ход мысли модели — попросите не сворачивать шаги в один абзац, а явно нумеровать их в ответе. - Для задач с действиями ("что мне делать с этим предметом") — усильте формулировку шага 3: "перед тем как предлагать действия, явно проверь, не противоречат ли они выводу из шага 2".
Шаблон промпта
Проанализируй это изображение по трём шагам, не переходя к следующему,
пока не завершил предыдущий:
1. НАБЛЮДЕНИЕ: Опиши все детали на фото, относящиеся к вопросу «{вопрос}».
Перечисли только то, что видно буквально, без интерпретаций.
2. СВЯЗЫВАНИЕ: Определи, как эти детали физически связаны друг с другом
именно на этом изображении — расположение, форма, освещение, ракурс.
Не используй общие предположения о том, «как обычно бывает» —
опирайся только на то, что видно на фото.
3. ВЫВОД: На основе шагов 1 и 2 дай ответ на вопрос: «{вопрос}».
Если наблюдение и первое впечатление противоречат друг другу —
явно укажи это противоречие и объясни, какая версия соответствует реальности.
{вопрос} — ваш конкретный запрос к фото: "что не так с этим товаром", "реальны ли пропорции комнаты", "как расположены объекты на самом деле" и т.д.
🚀 Быстрый старт — вставь в чат:
Вот шаблон трёхшагового анализа изображений. Адаптируй под мою задачу: {твоя задача с фото}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какой именно вопрос задать к фото и что именно проверять на противоречия — потому что без конкретного вопроса шаг "grounding" не сможет отличить релевантные детали от лишних.
Ограничения
⚠️ Не спасает полностью: даже после применения метода лучшие модели дают около 70-80% точности — метод снижает число ошибок, но не убирает их полностью.
⚠️ Слабее на задачах планирования действий: если нужно не просто понять сцену, а спланировать последовательность физических действий на её основе, точность остаётся заметно ниже, чем на простом распознавании.
⚠️ На маленьких открытых моделях эффект слабее или нестабилен: метод сильнее помогает топовым моделям (Gemini, GPT, Claude), на компактных моделях улучшение может быть минимальным или отсутствовать вовсе.
⚠️ "Думай дольше" не панацея: увеличение времени на рассуждение у модели само по себе не гарантирует лучший результат — иногда модель начинает домысливать несуществующие детали и результат становится хуже. Явная структура (три шага) работает надёжнее, чем просто просьба "подумай подольше".
Как исследовали
Исследователи собрали 904 реальных фото, где вид расходится с реальностью — из Reddit, Zhihu, специализированных подборок оптических иллюзий и других источников — и построили из них 3723 задачи трёх типов: правда/ложь, открытые вопросы и планирование действий. Проверили 27 конфигураций моделей — от компактных открытых до топовых закрытых — и обнаружили, что даже лучшие модели ошибаются почти в 40% случаев на "хитрых" фото, а на задачах планирования действий точность падает ниже 45%.
Разбор ошибок показал закономерность: сначала модель неправильно считывает детали (45% ошибок), потом неправильно связывает их между собой из-за стереотипов (34%), и только в последнюю очередь ошибается в общей логике сцены (20%). Эта последовательность и подсказала решение — явно разбить процесс на три соответствующих шага. После внедрения такого промпта точность выросла на 5-20 процентных пунктов у большинства моделей, что подтвердило: структура рассуждения важнее, чем просто "подумай получше".
Ресурсы
MSIBench (Yang, Xiong, Zhou, Wei, Cui, Shi — Beijing University of Posts and Telecommunications), код и датасет на GitHub и Hugging Face (yangzm1105/MSIBench).
