3,583 papers
arXiv:2608.16805 74 17 авг. 2026 г. FREE

InstaBind-Lite: диагностика подмены атрибутов между похожими объектами на картинке

КЛЮЧЕВАЯ СУТЬ
В 80% случаев путаницы модель тащит цвет у соседа, стоящего вплотную — не у случайного объекта на фото. Обычная проверка точности не видит разницу между этим и полной выдумкой: 'синяя машина вместо красной' засчитывается как провал наравне с бредом. Метод instance-first prompting позволяет отделить эту конкретную ошибку и снизить её — модель сначала перечисляет все объекты слева направо с атрибутами, потом отвечает на вопрос. Список работает как шпаргалка — модель сверяется с ним, а не гадает по памяти о картинке.
Адаптировать под запрос

TL;DR

InstaBind-Lite — это тест, который показывает: когда на фото несколько одинаковых объектов (машины, люди, чашки), нейросеть путает, какой из них какого цвета. Модель правильно видит, что на картинке есть красная машина и синяя машина — но когда её спрашивают про конкретную машину, она может назвать цвет соседней.

Главная находка: обычные проверки на точность ответа не видят эту ошибку отдельно от других. Модель говорит "синяя" вместо "красная" — и это просто засчитывается как неправильный ответ, наравне с полной выдумкой. Но на самом деле происходит конкретная вещь: атрибут украден у соседнего объекта. Исследователи выяснили, что в 80% случаев путаницы модель берёт цвет именно у ближайшего соседа — не у случайного объекта на фото, а у того, что стоит рядом в ряду.

Метод решения — не позволять модели отвечать "напрямую", а заставить её сначала явно перечислить все объекты слева направо с их атрибутами, и только потом отвечать на вопрос. Это снижает путаницу у части моделей, хотя не у всех.


🔬

Схема метода

БЕЗ метода (напрямую):
Вопрос: "Какого цвета третья машина слева?" → Ответ (может быть цвет соседней машины)

С методом (instance-first prompting):
ШАГ 1: "Перечисли все объекты слева направо с их атрибутами" → список: 1-красная, 2-синяя, 3-зелёная...
ШАГ 2: "Теперь ответь на вопрос" → Ответ (опираясь на явный список выше)

Оба шага можно сделать в одном промпте — просят модель сначала составить список, потом ответить.


🚀

Пример применения

Задача: Вы загрузили в Claude/ChatGPT фото витрины интернет-магазина с пятью похожими товарами (например, кроссовки разных цветов на полке) и спрашиваете: "Какого цвета третий кроссовок слева?" Модель может ответить неправильно — и не потому что не видит кроссовки, а потому что перепутает их между собой.

Промпт:

Посмотри на фото. Сначала перечисли все [кроссовки/машины/товары] на изображении 
слева направо, указав для каждого его отличительный цвет или признак. 
Пронумеруй их.

После этого ответь на вопрос: [какого цвета третий кроссовок слева?]

Отвечай строго по своему списку выше, не меняй атрибуты между пунктами списка и ответом.

Результат: Модель сначала выдаст пронумерованный список объектов с атрибутами (1. красный, 2. белый, 3. чёрный...), а затем ответит на конкретный вопрос, опираясь на этот список. Это снижает вероятность того, что она "перепрыгнет" на соседний объект при ответе — потому что список уже зафиксировал, что где находится.


🧠

Почему это работает

Слабость LLM здесь в том, что при виде нескольких похожих объектов подряд модель держит в голове не точную привязку "объект-атрибут", а что-то более расплывчатое — общее ощущение "тут были красный, синий, зелёный", без жёсткой привязки к позиции. Когда нужно ответить про конкретный объект, модель как бы "тянет" атрибут не от того элемента.

Сильная сторона LLM — она хорошо генерирует текст по явному, разложенному по шагам паттерну. Если попросить сначала явно зафиксировать список "кто где и какой", модель создаёт себе текстовую опору, к которой потом обращается при ответе — вместо того, чтобы заново "вспоминать" картинку и путать соседей.

Рычаг управления: можно менять порядок — попросить перечислять не слева направо, а по другому признаку (сверху вниз, по размеру). Также можно попросить модель после списка сверить финальный ответ со списком явной фразой "проверь, совпадает ли твой ответ с пунктом списка №X" — это добавляет второй уровень самопроверки.


📋

Шаблон промпта

Посмотри на изображение. На нём несколько похожих {объектов} 
(одного класса, но разных по {признаку: цвету/размеру/деталям}).

Шаг 1. Перечисли все {объекты} по порядку {слева направо / сверху вниз}, 
пронумеруй их и укажи отличительный признак каждого.

Шаг 2. Ответь на вопрос: {вопрос про конкретный объект}.

Важно: в ответе используй только тот признак, который ты указал 
в списке для этого номера. Не путай его с соседними пунктами списка.

🚀 Быстрый старт — вставь в чат:

Вот шаблон для точного распознавания атрибутов похожих объектов на фото. 
Адаптируй под мою задачу: [опиши свою картинку и вопрос].
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какие объекты на фото, по какому признаку их различать и в каком порядке считать — потому что без этой разбивки модель снова рискует "перепрыгнуть" атрибут с одного объекта на другой.


⚠️

Ограничения

⚠️ Не универсальное решение: метод помог трём из пяти открытых моделей, но у некоторых (например, LLaVA-1.5 в отдельных сценариях) точность просела сильно, а путаница выросла. Перед тем как доверять этой технике — проверьте на своей задаче, не наоборот ли эффект.

⚠️ Коммерческие модели (условно GPT/Gemini/Claude) реагируют иначе: у API-моделей в исследовании обрезка изображения на нужный объект иногда УВЕЛИЧИВАЛА путаницу вместо уменьшения. Значит, "явный список + вопрос" — не гарантированное лекарство, это стоит проверять эмпирически на конкретной модели.

⚠️ Работает лучше на явно разных цветах: если объекты отличаются тонкими деталями (не цвет, а форма/текстура), эффективность метода не проверена — исследование сфокусировано на цветах и цвете одежды.


🔍

Как исследовали

Исследователи собрали 524 фотографии, где на каждой — 3-6 одинаковых объектов (машины, люди, чашки и т.д.) в чёткой пространственной последовательности с разными цветами. На основе этого сделали 9580 вопросов четырёх типов: "какого цвета третий слева", "где находится синий", "какого цвета сосед красного" и "верно ли, что средний — зелёный".

Проверили семь моделей — пять открытых и две коммерческие (условно как GPT/Gemini). Ключевая метка эксперимента — не просто "правильно/неправильно", а специальная разметка: откуда именно взялся неправильный атрибут — придуман с нуля или скопирован у соседнего объекта.

Оказалось, что у открытых моделей до 34% всех ответов — это скопированный атрибут у соседа, а у коммерческих моделей — заметно меньше, около 6-9%, но в 80% случаев путаницы источник ошибки — именно соседний объект, а не случайный. Это статистически подтверждено бутстрэп-тестом на 1000 пересборках, так что закономерность не случайна.

Также проверили: если "обрезать" фото до нужного объекта (убрать соседей из виду) — некоторым моделям это сильно помогает (точность выросла на 20 пунктов у одной из моделей), а некоторым — вредит. И приём "сначала перечисли всех, потом отвечай" сработал только для части моделей.


📋 Дайджест исследования

Ключевая суть

В 80% случаев путаницы модель тащит цвет у соседа, стоящего вплотную — не у случайного объекта на фото. Обычная проверка точности не видит разницу между этим и полной выдумкой: 'синяя машина вместо красной' засчитывается как провал наравне с бредом. Метод instance-first prompting позволяет отделить эту конкретную ошибку и снизить её — модель сначала перечисляет все объекты слева направо с атрибутами, потом отвечает на вопрос. Список работает как шпаргалка — модель сверяется с ним, а не гадает по памяти о картинке.

Принцип работы

Без метода модель отвечает напрямую — держит в голове расплывчатое 'где-то был красный, где-то синий', без жёсткой привязки к позиции. Фишка: заставь модель сначала зафиксировать список — а потом сверяться с ним, а не гадать по памяти. Это как попросить свидетеля сначала описать всех людей по порядку, а не сразу спрашивать 'какого цвета был третий?' по размытому воспоминанию.

Почему работает

Слабость модели — она не хранит жёсткую привязку объект-позиция-цвет для похожих объектов подряд. Зато сильная сторона LLM — она отлично пишет текст по явному, разложенному шаблону. Явный список даёт модели опору, к которой она обращается вместо повторного угадывания по картинке. Метод сработал у 3 из 5 открытых моделей — у остальных путаница осталась или даже выросла.

Когда применять

Мультимодальные задачи с распознаванием фото → конкретно когда на изображении несколько похожих объектов одного класса (товары на полке, машины в ряду, люди в одинаковой форме), особенно если нужен точный ответ про объект по его позиции. Не подходит: если объекты различаются не цветом, а формой или текстурой — на таких случаях метод не проверялся.

Мини-рецепт

1. Опиши сцену: сколько объектов на фото и по какому признаку их различать — цвет, размер, деталь.
2. Попроси список: пусть модель пронумерует все объекты слева направо с признаком каждого.
3. Задай вопрос: спрашивай про конкретный объект только после того, как список готов.
4. Добавь проверку: попроси модель сверить финальный ответ с номером в своём же списке.

Примеры

[ПЛОХО] : Какого цвета третья машина слева?
[ХОРОШО] : Перечисли все машины на фото слева направо с их цветом, пронумеруй. Потом ответь: какого цвета третья машина? Используй только цвет из своего списка для этого номера.
Источник: Diagnosing Dense Same-Class Attribute Misbinding in Large Vision-Language Models
ArXiv ID: 2608.16805 | Сгенерировано: 2026-08-18 05:26

Проблемы LLM

ПроблемаСутьКак обойти
Путаница атрибутов между похожими объектамиКогда на фото несколько объектов одного класса (машины, кроссовки, люди), модель видит их атрибуты правильно в общем — но при вопросе про конкретный объект называет атрибут другого. Модель знает "тут есть красный и синий", но не привязывает жёстко цвет к позиции. Ошибка выглядит как обычный неправильный ответ, но по сути атрибут "украден" у соседаЗаставь модель сначала явно перечислить все объекты по порядку (слева направо) с их атрибутами, пронумеровав их. Только потом задавай вопрос про конкретный объект и проси отвечать строго по этому списку

Методы

МетодСуть
Instance-first prompting — список перед ответомРаздели задачу на два шага в одном промпте: 1) "перечисли все объекты по порядку с отличительным признаком каждого", 2) "теперь ответь на вопрос, используя только признак из своего списка". Шаг 1: список Шаг 2: вопрос. Работает потому что модель создаёт себе текстовую опору — явную привязку "номер-атрибут", вместо того чтобы заново расплывчато вспоминать картинку и путать соседние объекты. Когда да: объекты явно различаются по цвету, много похожих объектов подряд, открытые/локальные модели. Когда нет: не гарантированно работает на коммерческих моделях (может даже увеличить путаницу), не проверено для тонких различий (форма, текстура вместо цвета), иногда ухудшает результат — нужно проверять на своей задаче перед использованием
📖 Простыми словами

Diagnosing Dense Same-Class Attribute Misbinding inLargeVision-LanguageModels

arXiv: 2608.16805

Современные нейросети, которые умеют «видеть», на самом деле страдают жестким когнитивным искажением, которое исследователи назвали атрибутивным смешиванием. Суть в том, что когда в кадре появляется несколько одинаковых объектов — скажем, три чашки или пять машин — у модели «замыливается» глаз. Она прекрасно понимает, что перед ней чашки, и видит все цвета, но напрочь теряет связь между конкретным предметом и его характеристикой. Это фундаментальный баг Vision-Language Models, которые считывают картинку не как цельную сцену, а как набор разрозненных признаков, которые потом пытаются склеить в кучу.

Это похоже на то, как если бы ты зашел в детский сад, где все дети одеты в одинаковые комбинезоны, но разных цветов. Ты видишь, что в комнате есть красный, синий и желтый ребенок, но стоит им начать бегать, как в голове всё превращается в кашу. Если тебя спросят: «В чем пришел именно Петя?», ты с уверенностью назовешь цвет соседа, просто потому что мозг зафиксировал наличие цвета, но не приклеил его к личности. Нейросеть ведет себя точно так же: она знает, что на фото есть «красный» и «синий», но когда дело доходит до конкретики, она просто тыкает пальцем в небо.

Проблема вскрылась благодаря тесту InstaBind-Lite, который буквально ловит модели на вранье. Работает это так: мы берем изображение с кучей однотипных предметов и просим модель сопоставить их. Выяснилось, что точность падает в разы, как только плотность объектов растет. Модель видит атрибуты (цвета, формы) отдельно от самих объектов. Это не просто ошибка зрения, это системный сбой логики, когда нейронка смешивает данные из разных частей картинки в один невнятный винегрет.

Хотя тестировали это на цветах и машинах, принцип универсален для любой задачи, где нужно различать похожие сущности. Это касается анализа медицинских снимков с несколькими очагами воспаления, разбора чеков с кучей позиций или даже модерации контента, где нужно понять, кто именно на видео нарушает правила. Если объекты выглядят похоже, для AI они превращаются в одну большую массу, где свойства одного предмета магическим образом перетекают на другой.

Короче, не стоит доверять нейросетям задачи, где важна прецизионная привязка деталей к конкретным объектам в толпе. Пока что они работают как близорукий свидетель: вроде всё видел, но кто в какой куртке был — не разберет. Если твой бизнес-процесс завязан на распознавании мелких различий в группе одинаковых товаров, готовься к тому, что модель будет галлюцинировать на ровном месте, просто перемешивая реальные факты между собой.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с