Когда ИИ с картинками (VLM — vision-language model) не может решить задачу по изображению — часто дело не в том, что он "не умеет думать", а в том, что он неправильно распознаёт саму картинку. Если явно подписать элементы изображения текстом — координаты, названия объектов, метки "начало/конец" — точность решения задачи растёт на десятки процентных пунктов, хотя сама задача и модель не меняются.
Модель может выдать неправильный ответ по картинке не потому, что запуталась в правилах, а потому, что банально спутала два похожих значка. В исследовании модель, глядя на пустую клетку сетки, правильно называла её "пустой" только в 21% случаев — в 65% случаев она путала её с "путём", хотя это визуально разные вещи. То есть ИИ иногда не решает задачу неправильно — он видит не то, что нарисовано.
Исследователи взяли одну и ту же головоломку (сетка с правилами, нужно построить путь из точки А в точку Б) и постепенно "дорисовывали" на картинке подсказки: сначала пометили старт/финиш, потом добавили координатную сетку по краям (как в Excel), потом вписали координаты в каждую клетку, и наконец заменили все значки словами. Каждый слой убирал один тип путаницы — и точность решения выросла с 14% до 48% на одной и той же задаче, только за счёт того, как выглядела картинка.
Схема метода
ШАГ 1: Пометить ключевые точки на картинке (начало/конец) → маркеры S/E
ШАГ 2: Добавить координатную сетку по краям картинки → подписи осей (как в таблице)
ШАГ 3: Вписать координаты в каждую ячейку картинки → числа прямо на изображении
ШАГ 4: Заменить иконки/значки текстовыми словами → "звезда" вместо картинки звезды
Шаги накопительные — можно комбинировать. В оригинальном исследовании разметку делали программно, но принцип переносится на ручную работу с картинкой или на текстовый запрос к модели.
Пример применения
Задача: Вы загружаете в Claude или ChatGPT скан плана квартиры (нарисованные стены, окна, розетки условными значками) и просите посчитать, сколько метров кабель-канала нужно провести от щитка до розетки на кухне, минуя дверные проёмы.
Промпт:
Вот план квартиры (изображение прикреплено).
Прежде чем отвечать на вопрос, сначала опиши текстом всё, что видишь на плане:
- Перечисли комнаты и их расположение (используй стороны: слева, справа, сверху, снизу)
- Укажи, где именно находится щиток, розетка на кухне и дверные проёмы между ними
- Назови словами каждый значок, который видишь (не полагайся на "узнавание на глаз")
Только после этого описания посчитай маршрут кабеля от щитка до розетки на кухне, минуя дверные проёмы, и оцени длину в метрах.
Результат: Модель сначала выдаст текстовое "описание-разметку" плана — по сути, проговорит вслух, где что находится и что означает каждый значок. Только после этого она перейдёт к расчёту маршрута. Такой промежуточный шаг снижает риск, что модель спутает розетку с выключателем или неправильно определит, где дверной проём — то есть уберёт ошибки "не увидел", а не ошибки "не посчитал".
Почему это работает
VLM не "смотрит" на картинку так, как человек — она превращает пиксели в приблизительное текстовое представление, и на этом этапе часто теряет детали: путает похожие значки, неправильно определяет координаты, забывает мелкие элементы. Это слабость восприятия, а не мышления.
Зато с текстом модель работает отлично — она обучена на огромном объёме текста и умеет точно оперировать явно названными объектами и числами. Когда символ на картинке превращается в слово "звезда" или в число-координату, модель перестаёт "угадывать", что изображено, и начинает работать с однозначным фактом.
Метод переносит нагрузку с ненадёжного визуального распознавания на надёжное текстовое понимание. Рычаги управления: для простых задач достаточно пометить только ключевые точки (старт/финиш); для сложных, где важна каждая деталь — переводить в текст все элементы картинки. Чем важнее точность — тем сильнее нужна разметка.
Шаблон промпта
Вот изображение: {описание того, что на картинке — план/схема/диаграмма/таблица}.
Прежде чем отвечать на вопрос, сначала опиши текстом всё, что видишь:
- Перечисли все объекты/элементы и их точное расположение (используй систему координат или стороны: слева, справа, сверху, снизу)
- Если есть значки, иконки или символы — назови их словами, не полагайся на "узнавание на глаз"
- Если важны точные позиции — пронумеруй элементы по строкам и столбцам, как в таблице
Только после этого описания ответь на вопрос: {вопрос}
Подставь: {описание того, что на картинке} — тип изображения; {вопрос} — что именно нужно узнать или посчитать.
🚀 Быстрый старт — вставь в чат:
Вот шаблон промпта для работы со сложными изображениями (планы, схемы, таблицы). Адаптируй под мою задачу: {твоя задача с картинкой}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какой тип изображения ты загружаешь и что именно нужно узнать — потому что от этого зависит, какую разметку просить (координаты, названия объектов или и то, и другое).
Ограничения
⚠️ Не решает задачи логики: разметка убирает ошибки восприятия — где что находится, — но не делает модель умнее в самих правилах. На сложных многошаговых задачах модель всё равно ошибается, даже видя картинку идеально чётко.
⚠️ Диагностическая находка, не универсальный метод: авторы прямо пишут, что их разметка — это узкий инструмент под конкретную головоломку, а не готовая техника промптинга. Перенос на фото, графики или произвольные диаграммы не проверялся напрямую в статье — предложенный выше "самостоятельный текстовый шаг" — это адаптация принципа, а не то, что тестировали исследователи.
⚠️ Ручная разметка картинки эффективнее, чем просьба к модели описать её саму: самый сильный эффект в исследовании давала физическая разметка изображения (подписи, координаты прямо на картинке), а не просьба модели самой всё описать текстом. Если задача критична — лучше подписать картинку заранее в любом простом редакторе, а не надеяться только на промпт.
Как исследовали
Команда протестировала семь открытых VLM (от Mistral и Gemma до Qwen 397B) на бенчмарке SPaRC — 500 головоломок на сетке, где нужно построить путь по правилам, не задевая "запретные" клетки. Для каждой головоломки сделали шесть версий одной и той же картинки: от оригинала до полностью текстовой разметки символов. Отдельно замеряли не только итоговую точность решения, но и то, насколько точно модель распознаёт сами элементы доски — старт, финиш, пустые клетки, значки правил.
Оказалось, что точность распознавания элементов картинки почти линейно связана с точностью решения задачи (корреляция 0.96) — чем лучше модель "видит" доску, тем лучше она её "решает". Самое неожиданное: даже базовые элементы вроде пустой клетки распознавались правильно только в 21% случаев на оригинальной картинке — модель путала их с "путём" в 65% случаев. После полной текстовой разметки эта путаница практически исчезла (100% точность на базовых элементах). При этом даже с идеальной разметкой сложные головоломки (уровень 4-5) всё равно решались плохо — то есть разметка чинит "зрение", но не чинит "мышление".
Ресурсы
Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds — Lars Benedikt Kaesberg, Tianyu Yang, Florian Valentin Wunderlich, Terry Ruas, Jan Philip Wahle, Daniel Kurzawe, Bela Gipp, University of Göttingen. Бенчмарк SPaRC (Kaesberg et al., 2025). Код и данные — на GitHub (ссылка в оригинальной статье).
