3,583 papers
arXiv:2607.24707 71 27 июля 2026 г. FREE

Spatial Proximity Bias: VLM путают связи на диаграмме по близости, а не по смыслу

КЛЮЧЕВАЯ СУТЬ
Обнаружено: модели для работы с изображениями (VLM) смотрят не на линии между блоками схемы, а на расстояние между ними — и додумывают связи по смыслу слов, а не по факту соединения. Находка позволяет понять, почему модель выдумывает лишние связи в органиграммах, ER-диаграммах, mind-map — и как заставить её проверять реальные линии, а не логику названий. Модель путает 'нарисовано рядом' с 'соединено линией' — сами объекты она узнаёт почти идеально (точность 90%+), а связи путает в 15-25% случаев. Замени названия на случайные буквы — точность обрушится ещё сильнее, кроме reasoning-моделей (тех, что 'думают' перед ответом) — они проседают в 2-3 раза меньше.
Адаптировать под запрос

TL;DR

Когда вы просите ChatGPT или Claude разобрать схему, диаграмму или чертёж по картинке, модель часто придумывает связи между элементами, которые просто нарисованы рядом, и пропускает реальные связи между элементами, которые находятся далеко друг от друга — даже если на картинке чётко видна соединяющая линия. Модель смотрит не на линии, а на расстояние.

Исследователи прогнали через модели 2960 диаграмм баз данных (ER-диаграммы — это схемы "какие объекты в базе связаны с какими") и увидели: сущности модели узнают почти идеально (точность 90%+), а вот связи между ними — с ошибками в 15-25% случаев. Пример из статьи: на схеме нарисовано "Зона — Станция" (линия есть), а рядом стоит "Поезд" и "Наличие мест". Модель вместо реальной связи выдумывает "Поезд — Наличие мест", потому что это звучит логично и элементы расположены близко. То есть модель достраивает связь по смыслу слов, а не проверяет линию на картинке.

Хуже того — если названия элементов сделать бессмысленными (случайные буквы) или перепутать местами, точность рушится ещё сильнее у обычных моделей. Reasoning-модели (те, что "думают" перед ответом) держатся заметно устойчивее — у них падение точности в 2-3 раза меньше, чем у обычных.


📌

Схема исследования

ТЕСТ 1: Обычные диаграммы → замер точности по сущностям и связям
ТЕСТ 2 (Context-Free): Заменили все подписи на случайные буквы → замер падения точности
ТЕСТ 3 (Label Permutation): Перемешали подписи между элементами → замер падения точности
ТЕСТ 4: Диаграммы с 20+ элементами → замер обрушения точности на сложности

🚀

Пример применения

⚠️ Ограничение метода: это не готовая техника с промптом-решением, а находка о слабости VLM при чтении визуальных схем. Работает для любых картинок со связями: организационные структуры, схемы процессов, mind-map, диаграммы связей проекта — не только базы данных.

Задача: Вы скинули Claude скриншот органиграммы компании (кто кому подчиняется) и просите: "Опиши структуру подчинения".

Промпт:

Посмотри на схему организационной структуры на картинке.

Не описывай структуру в целом. Вместо этого:

1. Перечисли каждую линию/связь отдельно в формате "Кто → Кому подчиняется"
2. Для каждой связи явно укажи: ты видишь линию, соединяющую эти два блока, 
   или делаешь вывод по расположению/названию?
3. Отдельно проверь: есть ли блоки, расположенные ДАЛЕКО друг от друга на схеме, 
   но соединённые линией? Не пропусти их.
4. Отдельно проверь: есть ли блоки, расположенные РЯДОМ, но между ними НЕТ линии? 
   Не добавляй их в список как связанные.

Результат: Модель пройдёт по схеме систематически, а не общим впечатлением. Пункт 2 заставляет её признаться, откуда взялась каждая связь — это резко снижает число выдуманных связей "по смыслу". Пункты 3-4 напрямую компенсируют найденный в исследовании bias.


🧠

Почему это работает

VLM обучены угадывать смысл изображения через комбинацию визуальных паттернов и языковых ассоциаций. Когда модель видит слова "Поезд" и "Наличие мест" рядом на картинке, у неё в "голове" уже есть сильная языковая ассоциация "поезд имеет места" — и эта ассоциация перебивает слабый визуальный сигнал от тонкой линии на схеме.

Модель хорошо умеет читать текст и узнавать объекты — отсюда высокая точность распознавания самих сущностей. Но прослеживание линии от точки А до точки Б через всю картинку — это не то, в чём VLM сильна: она не "трассирует" пиксели как графический алгоритм, она угадывает по общей картине.

Явная просьба "укажи, видишь ли ты линию или делаешь вывод" заставляет модель разделить эти два источника информации вместо того, чтобы смешивать их в один быстрый ответ.

Рычаги управления: - Просьба перечислить связи по одной, а не общим текстом → меньше галлюцинаций - Просьба указать источник вывода (линия vs логика) → модель сама себя проверяет - Reasoning-режим (расширенное мышление в Claude/ChatGPT) → в 2-3 раза устойчивее к ошибкам на сложных схемах - Разбиение сложной схемы на части по 5-7 элементов → компенсирует обрушение точности при 20+ элементах на одной картинке


⚠️

Ограничения

⚠️ Сложность диаграммы: на схемах с 20+ элементами точность распознавания связей у большинства моделей падает почти до нуля. Если ваша диаграмма большая — дробите её на части перед анализом.

⚠️ Незнакомые названия: если элементы на схеме названы кодами, аббревиатурами или на незнакомом языке — точность распознавания связей резко падает, потому что модель теряет "смысловую подсказку", на которую обычно опирается.

⚠️ Иерархии наследования: для схем типа "родитель-потомок" (например, категория → подкатегория) без явных текстовых подсказок точность падает драматически (у некоторых моделей с 96% до 12%).


🔍

Как исследовали

Команда собрала почти 3000 диаграмм баз данных — из учебников, реальных систем (Spider, Sakila, Chinook и другие) и сгенерированных синтетически, — и для каждой создала эталонный машиночитаемый JSON-файл со всеми элементами и связями. Модели просили превратить картинку в такой же JSON, а потом сверяли результат по элементам: сущности, связи, атрибуты, ключи.

Самое интересное — эксперимент с "порчей" подписей. Исследователи заменили все названия на случайные буквы (чтобы убрать смысловые подсказки) и отдельно перемешали подписи местами (чтобы сломать соответствие роли и названия). В обоих случаях точность рухнула у всех моделей, но у reasoning-моделей — заметно меньше. Это подтвердило гипотезу: обычные модели угадывают структуру диаграммы по знакомым словам, а не по реальным линиям и расположению.

Отдельно проверили карту внимания модели (куда она "смотрит" при ответе на вопрос про конкретную связь) — и увидели, что модель физически не обращает внимание на нужную линию и сущность, подтверждая, что проблема не в семантике, а в визуальном прослеживании связей.


📋 Дайджест исследования

Ключевая суть

Обнаружено: модели для работы с изображениями (VLM) смотрят не на линии между блоками схемы, а на расстояние между ними — и додумывают связи по смыслу слов, а не по факту соединения. Находка позволяет понять, почему модель выдумывает лишние связи в органиграммах, ER-диаграммах, mind-map — и как заставить её проверять реальные линии, а не логику названий. Модель путает 'нарисовано рядом' с 'соединено линией' — сами объекты она узнаёт почти идеально (точность 90%+), а связи путает в 15-25% случаев. Замени названия на случайные буквы — точность обрушится ещё сильнее, кроме reasoning-моделей (тех, что 'думают' перед ответом) — они проседают в 2-3 раза меньше.

Принцип работы

Простое правило: не проси модель описать схему целиком одним текстом — проси перечислить каждую связь по одной и указать источник вывода. Модель должна признаться: она видит линию или додумывает по смыслу слов. Это разделяет визуальный сигнал (реальная линия на картинке) от языковой ассоциации (смысл названий блоков), которые иначе сливаются в один быстрый и не всегда честный ответ.

Почему работает

Языковая связка 'поезд имеет места' в голове модели сильнее тонкой линии на картинке. VLM отлично читает текст и узнаёт объекты — отсюда точность 90%+ на самих сущностях. Но прослеживание линии от точки А до точки Б через всю картинку — это не то, в чём модель сильна, она не трассирует пиксели как графический алгоритм, она угадывает по общей картине. Убери смысловую подсказку — замени названия на случайные буквы — и точность на иерархиях падает с 96% до 12%. Reasoning-режим спасает: модели, которые думают перед ответом, ошибаются в 2-3 раза реже на сложных схемах.

Когда применять

Разбор любых картинок со связями → органиграммы, схемы процессов, mind-map, диаграммы баз данных, особенно когда элементов больше 15-20 или названия неочевидные (коды, аббревиатуры, чужой язык). Не подходит как замена ручной проверки критичных схем — метод снижает число ошибок, но не даёт стопроцентной гарантии на сложных диаграммах.

Мини-рецепт

1. Разбей схему: если элементов больше 15-20 — дели на части по 5-7 блоков перед тем как отправить модели
2. Проси по одной связи: не общее описание, а список вида 'Кто → Кому подчиняется'
3. Заставь модель признаться: для каждой связи спроси — она видит линию или делает вывод по расположению и смыслу названий
4. Проверь оба направления: отдельно попроси найти дальние связи (соединены линией, но далеко друг от друга) и близкие не-связи (рядом, но без линии)
5. Включи расширенное мышление (reasoning-режим в Claude/ChatGPT) — на сложных схемах модель ошибается в 2-3 раза реже

Примеры

[ПЛОХО] : Опиши структуру подчинения на этой картинке
[ХОРОШО] : Перечисли каждую связь отдельно: Кто → Кому подчиняется. Для каждой укажи - ты видишь линию, соединяющую блоки, или делаешь вывод по расположению и названию. Отдельно проверь дальние связи, соединённые линией, и близкие блоки без линии между ними
Источник: ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams
ArXiv ID: 2607.24707 | Сгенерировано: 2026-07-28 06:28

Проблемы LLM

ПроблемаСутьКак обойти
Модель путает связи на схеме по близости, а не по линииСмотришь на органиграмму, диаграмму или mind-map с картинки. Модель почти всегда правильно узнаёт сами блоки/объекты. Но связи между ними придумывает — если два блока стоят рядом и звучат логично связанными, модель рисует связь, даже когда реальной линии нет. А настоящую связь между далёкими друг от друга блоками — пропускает. Работает на любых схемах со связями: организационные структуры, блок-схемы процессов, диаграммы баз данных, mind-mapПопроси модель перечислить каждую связь отдельно и указать: "ты видишь линию, соединяющую эти два блока, или делаешь вывод по расположению/смыслу?". Отдельно попроси проверить далёкие блоки на скрытые связи и близкие блоки на отсутствие связи
Точность распознавания связей рушится на сложных схемахЕсли на картинке 20+ элементов, модель почти теряет способность правильно определить связи между ними — точность падает почти до нуля. Это происходит даже если запрос сформулирован идеальноРазбивай сложную схему на части по 5-7 элементов перед тем, как просить модель её анализировать
Бессмысленные или незнакомые названия элементов рушат точность связейМодель обычно опирается на смысл слов в названиях блоков, чтобы угадать связи. Если названия заменить на случайные буквы, коды или незнакомый язык — точность резко падает, потому что модели больше не на что опереться, кроме самой линии, а линию она читает плохоЕсли названия элементов непонятны, явно попроси модель игнорировать смысл названий и искать только визуальные линии-соединители, перечисляя их одну за одной

Методы

МетодСуть
Разделение источника связи (линия vs логика)Проси модель для каждой найденной связи явно ответить: "вижу линию" или "делаю вывод по смыслу/расположению". Перечисли каждую связь отдельно в формате X Y, укажи источник. Работает потому что модель обычно смешивает два разных сигнала — реальную визуальную линию и языковую ассоциацию слов ("поезд" рядом с "местами") — в один быстрый ответ. Явный вопрос про источник заставляет её разделить эти сигналы и перепроверить слабый визуальный сигнал вместо того, чтобы полагаться на более сильную языковую догадку. Работает: любые схемы, диаграммы, чертежи со связями между блоками. Не работает: изображения без явных линий-соединителей (например, просто список рядом расположенных объектов без структуры)
📖 Простыми словами

ERUnderstand: Evaluating Vision-LanguageModelson Structured ER Diagrams

arXiv: 2607.24707

Современные нейронки, которые умеют «видеть» картинки, на самом деле работают не как глаза, а как статистический гадальщик. Когда ты скармливаешь модели сложную схему или чертеж, она не прослеживает линии взглядом, а пытается угадать смысл по контексту. Проблема в том, что визуальная близость для нее важнее логики: если два блока нарисованы рядом, модель железно решит, что они связаны, даже если между ними нет никакой линии. И наоборот — если связь тянется через весь лист, AI ее просто проигнорирует, потому что «далеко, значит, не про это».

Это как если бы ты пришел в ресторан, увидел в меню рядом слова «мороженое» и «стейк» и решил, что это одно блюдо, просто потому что они напечатаны на одной строчке. Формально ты прочитал оба слова, но полностью провалил понимание структуры меню. Модель ведет себя так же: она цепляется за знакомые сочетания слов и их положение в пространстве, напрочь игнорируя структурные связи, которые для человека очевидны.

В основе этого облома лежит конфликт между зрением и «мозгами» модели. Vision-Language Models обучены на гигантских массивах текстов, где слова «заказ» и «клиент» всегда ходят парой. Когда такая модель видит эти слова на схеме, у нее срабатывает языковой рефлекс, который тупо сильнее, чем визуальный сигнал от нарисованной линии. Она не «смотрит» на стрелочку, она просто знает, что эти понятия обычно связаны, и достраивает реальность под свои ожидания. В итоге мы получаем уверенный ответ, который является чистой галлюцинацией на основе близости.

Этот косяк — не специфическая проблема баз данных, а фундаментальная дыра во всех мультимодальных моделях. Принцип работает везде: от оргсхем крупных компаний до твоих личных mind-map или планов эвакуации. Тестировали это на сложных ER-диаграммах, но диагноз универсален для любого визуала, где смысл передается через линии и иерархию. Пока элементы разнесены по углам или навалены кучей, AI будет лажать, выдавая желаемое за действительное.

Главный вывод прост: нельзя доверять нейронкам анализ сложных визуальных структур без двойной проверки. Модель может быть чертовски убедительна, но она смотрит на координаты, а не на логику. Если хочешь, чтобы AI адекватно разобрал твою схему, придется либо дробить ее на мелкие понятные куски, либо смириться с тем, что половина связей будет высосана из пальца. Пока что GEO и визуальный анализ — это минное поле, где близость объектов важнее их реального смысла.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с