3,583 papers
arXiv:2608.21170 79 21 авг. 2026 г. FREE

Визуальный скаффолдинг: почему VLM путают картинку, а не логику

КЛЮЧЕВАЯ СУТЬ
Пустая клетка на сетке — модель называет её пустой только в 21% случаев. В 65% случаев путает её с целым путём, хотя это визуально разные вещи. Разметка изображения текстом позволяет ИИ точно решать задачи по планам, схемам и головоломкам — без единого изменения в самой модели. Секрет в том, что нагрузка переносится с ненадёжного распознавания картинки на надёжную работу с текстом — подписи, координаты и словесные названия значков поднимают точность одной и той же головоломки с 14% до 48%.
Адаптировать под запрос

Когда ИИ с картинками (VLM — vision-language model) не может решить задачу по изображению — часто дело не в том, что он "не умеет думать", а в том, что он неправильно распознаёт саму картинку. Если явно подписать элементы изображения текстом — координаты, названия объектов, метки "начало/конец" — точность решения задачи растёт на десятки процентных пунктов, хотя сама задача и модель не меняются.

Модель может выдать неправильный ответ по картинке не потому, что запуталась в правилах, а потому, что банально спутала два похожих значка. В исследовании модель, глядя на пустую клетку сетки, правильно называла её "пустой" только в 21% случаев — в 65% случаев она путала её с "путём", хотя это визуально разные вещи. То есть ИИ иногда не решает задачу неправильно — он видит не то, что нарисовано.

Исследователи взяли одну и ту же головоломку (сетка с правилами, нужно построить путь из точки А в точку Б) и постепенно "дорисовывали" на картинке подсказки: сначала пометили старт/финиш, потом добавили координатную сетку по краям (как в Excel), потом вписали координаты в каждую клетку, и наконец заменили все значки словами. Каждый слой убирал один тип путаницы — и точность решения выросла с 14% до 48% на одной и той же задаче, только за счёт того, как выглядела картинка.

🔬

Схема метода

ШАГ 1: Пометить ключевые точки на картинке (начало/конец) → маркеры S/E
ШАГ 2: Добавить координатную сетку по краям картинки → подписи осей (как в таблице)
ШАГ 3: Вписать координаты в каждую ячейку картинки → числа прямо на изображении
ШАГ 4: Заменить иконки/значки текстовыми словами → "звезда" вместо картинки звезды

Шаги накопительные — можно комбинировать. В оригинальном исследовании разметку делали программно, но принцип переносится на ручную работу с картинкой или на текстовый запрос к модели.


🚀

Пример применения

Задача: Вы загружаете в Claude или ChatGPT скан плана квартиры (нарисованные стены, окна, розетки условными значками) и просите посчитать, сколько метров кабель-канала нужно провести от щитка до розетки на кухне, минуя дверные проёмы.

Промпт:

Вот план квартиры (изображение прикреплено).

Прежде чем отвечать на вопрос, сначала опиши текстом всё, что видишь на плане:
- Перечисли комнаты и их расположение (используй стороны: слева, справа, сверху, снизу)
- Укажи, где именно находится щиток, розетка на кухне и дверные проёмы между ними
- Назови словами каждый значок, который видишь (не полагайся на "узнавание на глаз")

Только после этого описания посчитай маршрут кабеля от щитка до розетки на кухне, минуя дверные проёмы, и оцени длину в метрах.

Результат: Модель сначала выдаст текстовое "описание-разметку" плана — по сути, проговорит вслух, где что находится и что означает каждый значок. Только после этого она перейдёт к расчёту маршрута. Такой промежуточный шаг снижает риск, что модель спутает розетку с выключателем или неправильно определит, где дверной проём — то есть уберёт ошибки "не увидел", а не ошибки "не посчитал".


🧠

Почему это работает

VLM не "смотрит" на картинку так, как человек — она превращает пиксели в приблизительное текстовое представление, и на этом этапе часто теряет детали: путает похожие значки, неправильно определяет координаты, забывает мелкие элементы. Это слабость восприятия, а не мышления.

Зато с текстом модель работает отлично — она обучена на огромном объёме текста и умеет точно оперировать явно названными объектами и числами. Когда символ на картинке превращается в слово "звезда" или в число-координату, модель перестаёт "угадывать", что изображено, и начинает работать с однозначным фактом.

Метод переносит нагрузку с ненадёжного визуального распознавания на надёжное текстовое понимание. Рычаги управления: для простых задач достаточно пометить только ключевые точки (старт/финиш); для сложных, где важна каждая деталь — переводить в текст все элементы картинки. Чем важнее точность — тем сильнее нужна разметка.


📋

Шаблон промпта

Вот изображение: {описание того, что на картинке — план/схема/диаграмма/таблица}.

Прежде чем отвечать на вопрос, сначала опиши текстом всё, что видишь:
- Перечисли все объекты/элементы и их точное расположение (используй систему координат или стороны: слева, справа, сверху, снизу)
- Если есть значки, иконки или символы — назови их словами, не полагайся на "узнавание на глаз"
- Если важны точные позиции — пронумеруй элементы по строкам и столбцам, как в таблице

Только после этого описания ответь на вопрос: {вопрос}

Подставь: {описание того, что на картинке} — тип изображения; {вопрос} — что именно нужно узнать или посчитать.

🚀 Быстрый старт — вставь в чат:

Вот шаблон промпта для работы со сложными изображениями (планы, схемы, таблицы). Адаптируй под мою задачу: {твоя задача с картинкой}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какой тип изображения ты загружаешь и что именно нужно узнать — потому что от этого зависит, какую разметку просить (координаты, названия объектов или и то, и другое).


⚠️

Ограничения

⚠️ Не решает задачи логики: разметка убирает ошибки восприятия — где что находится, — но не делает модель умнее в самих правилах. На сложных многошаговых задачах модель всё равно ошибается, даже видя картинку идеально чётко.

⚠️ Диагностическая находка, не универсальный метод: авторы прямо пишут, что их разметка — это узкий инструмент под конкретную головоломку, а не готовая техника промптинга. Перенос на фото, графики или произвольные диаграммы не проверялся напрямую в статье — предложенный выше "самостоятельный текстовый шаг" — это адаптация принципа, а не то, что тестировали исследователи.

⚠️ Ручная разметка картинки эффективнее, чем просьба к модели описать её саму: самый сильный эффект в исследовании давала физическая разметка изображения (подписи, координаты прямо на картинке), а не просьба модели самой всё описать текстом. Если задача критична — лучше подписать картинку заранее в любом простом редакторе, а не надеяться только на промпт.


🔍

Как исследовали

Команда протестировала семь открытых VLM (от Mistral и Gemma до Qwen 397B) на бенчмарке SPaRC — 500 головоломок на сетке, где нужно построить путь по правилам, не задевая "запретные" клетки. Для каждой головоломки сделали шесть версий одной и той же картинки: от оригинала до полностью текстовой разметки символов. Отдельно замеряли не только итоговую точность решения, но и то, насколько точно модель распознаёт сами элементы доски — старт, финиш, пустые клетки, значки правил.

Оказалось, что точность распознавания элементов картинки почти линейно связана с точностью решения задачи (корреляция 0.96) — чем лучше модель "видит" доску, тем лучше она её "решает". Самое неожиданное: даже базовые элементы вроде пустой клетки распознавались правильно только в 21% случаев на оригинальной картинке — модель путала их с "путём" в 65% случаев. После полной текстовой разметки эта путаница практически исчезла (100% точность на базовых элементах). При этом даже с идеальной разметкой сложные головоломки (уровень 4-5) всё равно решались плохо — то есть разметка чинит "зрение", но не чинит "мышление".


🔗

Ресурсы

Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds — Lars Benedikt Kaesberg, Tianyu Yang, Florian Valentin Wunderlich, Terry Ruas, Jan Philip Wahle, Daniel Kurzawe, Bela Gipp, University of Göttingen. Бенчмарк SPaRC (Kaesberg et al., 2025). Код и данные — на GitHub (ссылка в оригинальной статье).


📋 Дайджест исследования

Ключевая суть

Пустая клетка на сетке — модель называет её пустой только в 21% случаев. В 65% случаев путает её с целым путём, хотя это визуально разные вещи. Разметка изображения текстом позволяет ИИ точно решать задачи по планам, схемам и головоломкам — без единого изменения в самой модели. Секрет в том, что нагрузка переносится с ненадёжного распознавания картинки на надёжную работу с текстом — подписи, координаты и словесные названия значков поднимают точность одной и той же головоломки с 14% до 48%.

Принцип работы

Метод работает как слоёный пирог из подсказок. Сначала помечаешь старт и финиш прямо на картинке. Потом добавляешь координатную сетку по краям — как оси в таблице Excel. Потом вписываешь числа-координаты в каждую клетку. И наконец заменяешь все значки словами — «звезда» вместо картинки звезды. Каждый слой убирает свой тип путаницы, слои можно комбинировать по мере нужности.

Почему работает

Модель не смотрит на картинку как человек. Она превращает пиксели в примерное текстовое описание — и на этом шаге теряет детали: путает похожие значки, ошибается в координатах. Зато с текстом работает отлично — на нём её и учили. Когда значок становится словом «звезда», модель перестаёт гадать и работает с однозначным фактом. Отсюда и скачок точности с 14% до 48% на одной и той же задаче.

Когда применять

Работа с изображениями → планы квартир, схемы, диаграммы, таблицы с условными обозначениями, особенно когда важна точная позиция каждого элемента. Не подходит для голых логических задач — разметка убирает ошибки восприятия, но не делает модель умнее в самих правилах.

Мини-рецепт

1. Пометь ключевые точки: подпиши старт и финиш прямо на картинке буквами S и E
2. Добавь координатную сетку: подписи по краям изображения, как оси в таблице
3. Впиши координаты в клетки: числа прямо на изображении, а не рядом с ним
4. Замени значки словами: «звезда» вместо иконки звезды — там, где точность критична

Примеры

[ПЛОХО] : Вот план квартиры, посчитай сколько метров кабеля от щитка до розетки на кухне
[ХОРОШО] : Вот план квартиры. Сначала опиши текстом: где щиток, где розетка на кухне, где дверные проёмы, назови словами каждый значок, который видишь. Только после этого посчитай маршрут кабеля в метрах
Источник: Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds
ArXiv ID: 2608.21170 | Сгенерировано: 2026-08-24 05:23

Проблемы LLM

ПроблемаСутьКак обойти
VLM путает похожие визуальные элементы на картинкеМодель не «смотрит» на изображение как человек. Она превращает пиксели в приблизительное текстовое представление. На этом шаге теряются детали: похожие значки путаются друг с другом, пустые области принимаются за заполненные. Модель может провалить задачу не из-за логики, а потому что неправильно распознала саму картинкуПодпиши ключевые элементы изображения текстом: названия объектов, координаты, метки. Замени неоднозначные значки словами. Модель работает с текстом надёжнее, чем с распознаванием картинки

Методы

МетодСуть
Прогрессивная текстовая разметка изображенияДобавляй подсказки послойно: сначала пометь ключевые точки (старт/финиш), затем добавь координатную сетку по краям, затем впиши координаты в каждый элемент, в конце замени все значки словами. Можно комбинировать любые слои. Почему работает: каждый слой убирает один тип визуальной путаницы, перенося нагрузку с ненадёжного распознавания картинки на надёжную работу с текстом. Когда применять: для простых задач достаточно пометить только ключевые точки; для задач где важна каждая деталь — размечать всё. Когда не работает: если модель ошибается в самой логике задачи (правилах, вычислениях) — разметка картинки это не исправит

Тезисы

ТезисКомментарий
Точность решения растёт постепенно с каждым слоем визуальной разметки, а не скачкомЭффект накопительный: разметка старта/финиша даёт небольшой прирост, добавление координатной сетки — больше, полная замена значков словами — максимум. Это значит, что нет единственной «правильной» степени разметки — есть шкала. Применяй: оценивай сложность своей задачи и подбирай минимально нужный уровень разметки, не разбирая картинку полностью, если хватает пометки ключевых точек
📖 Простыми словами

Is VisualPromptingAll You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds

arXiv: 2608.21170

Мультимодальные модели (VLM) не умеют «смотреть» глазами. Когда ты скармливаешь нейросети картинку, она тупо переводит пиксели в приблизительное текстовое представление, теряя координаты, мелкие значки и расстояния. Модель не тупая в логике — у неё кривое восприятие на старте, поэтому на сложных пространственных задачах вроде планов и схем она гарантированно лажает.

Это как попросить человека с сильной близорукостью и без очков найти розетку на сложном чертеже. Он знает геометрию на отлично, но тупо не видит детали и тычет пальцем в стену. Но стоит обвести нужные точки ярким маркером прямо по бумаге — и задача решается мгновенно.

Спасает ситуацию метод visual scaffolding (пошаговые визуальные подсказки). Вместо голого изображения ты накладываешь на картинку координатную сетку, подсвечиваешь ключевые объекты цветными метками и размечаешь опорные точки. Когда нейросеть опирается на готовые визуальные направляющие, точность в расчёте сложных маршрутов подскакивает в разы.

Тестировали механику на планах квартир и прокладке кабелей, но принцип универсален. Тот же подход вытягивает чтение инженерных чертежей, анализ сложных графиков, аудит интерфейсов и медицинские сканы. Везде, где критически важна геометрия, текстовый промпт проигрывает визуальной разметке.

Хватит надеяться, что нейросеть сама распутает хаос из тонких линий — получишь галлюцинацию вместо точного расчёта. Перестань писать длинные простыни текста и внедряй визуальный промптинг: размечай опорные точки и границы прямо на картинке. Кто научится помогать модели «видеть», тот получит рабочий инструмент, остальные продолжат тыкать пальцем в небо.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с