3,583 papers
arXiv:2607.16311 73 14 июля 2026 г. FREE

Визуальные прайоры VLM: модели отвечают по памяти, а не по изображению — и как заставить их смотреть

КЛЮЧЕВАЯ СУТЬ
Обнаружено: модели с поддержкой изображений часто отвечают не по картинке, а по памяти. GPT-5 теряет точность с 78% до 47% на «неправильных» изображениях — и при этом уверенно врёт, не говоря «не знаю». PriVE-метод позволяет снизить этот эффект через принудительное буквальное описание перед ответом: сначала «опиши только пиксели», потом «ответь на вопрос». Модель вынуждена зафиксировать конкретный кадр текстом — и этот текст становится опорой для ответа, а не абстрактная память о том, как «должно быть».
Адаптировать под запрос

TL;DR

Мультимодальные модели (VLM, те самые GPT-4o и Claude с поддержкой картинок) часто дают ответы на вопросы по изображению не глядя в картинку — а вспоминая, «как обычно бывает». Покажи модели баскетбольный мяч фиолетового цвета и спроси — она с высокой вероятностью скажет «оранжевый». Покажи птицу с тремя крыльями и спроси сколько крыльев — ответит «два».

Исследование PriVE-Bench систематически измерило этот эффект: точность падала у GPT-5 с 78% до 47%, у Claude Sonnet 4 с 71% до 47%, когда изображения противоречили привычным ожиданиям. Причём модели не говорят «не уверен» — они уверенно дают неправильный ответ, соответствующий тому, что «должно быть» по их опыту.

Главная находка доступна для противодействия: явная инструкция смотреть на пиксели и принудительное описание перед ответом — работающие техники. Для GPT/Claude также помогают кроп и зум нужного фрагмента. Подготовили шаблон промпта для работы с изображениями, где важна точность восприятия.


🔬

Схема метода

ШАГ 1: Антипрайор-инструкция → запрет отвечать по ожиданиям
ШАГ 2: Принудительное буквальное описание → только пиксели, без интерпретации
ШАГ 3: Ответ на вопрос → теперь основан на описании, а не на прайоре
(опционально) ШАГ 0: Кроп/зум нужного фрагмента → передать картинку отдельно

Всё в одном промпте. Для шага 0 нужна подготовка изображения заранее.

🚀

Пример применения

Задача: Ты продаёшь кастомный мерч на Wildberries. Перед публикацией хочешь проверить фото — правильно ли нанесён логотип на худи. Логотип нестандартный: зеркально отражённый и с непривычным сочетанием цветов. Обычный вопрос «логотип правильный?» получит «да» — потому что модель знает как выглядит оригинальный логотип и «узнаёт» его.

Промпт:

Смотри на изображение очень внимательно.

Сначала — буквально опиши логотип: его форму, направление (зеркальный или нет), 
цвета каждого элемента, расположение текста. Только то, что видишь на пикселях. 
Не используй знания о том, как этот логотип «должен» выглядеть.

После описания ответь: соответствует ли логотип на фото этому эталону:
[вставь описание эталона — например: "буква N смотрит вправо, красный фон, белые буквы"]

Если видишь расхождение — назови конкретно что не так.

Результат: Модель сначала выдаст подробное описание того, что буквально видит — направление, цвета, порядок элементов. Это «заземляет» её на конкретное изображение. Потом сравнит с эталоном и назовёт конкретные расхождения. Без принудительного описания она бы просто «узнала» логотип и сказала «всё ок».


🧠

Почему это работает

LLM — это статистическая машина памяти. Когда модель видит изображение, она не «смотрит» на пиксели как человек. Она одновременно обрабатывает визуальные токены и языковые паттерны — и языковые паттерны часто перевешивают. Модель «знает», что мячи для баскетбола оранжевые, птицы имеют два крыла, логотипы брендов выглядят определённым образом. Это знание активируется автоматически.

Буквальное описание — это обходной путь. Когда ты просишь модель сначала описать, а потом ответить, она вынуждена сформировать промежуточный текст на основе изображения. Этот текст становится частью контекста ответа. Теперь модель отвечает уже не только по прайору, но и по тому что сама написала про конкретный кадр. Это не идеально, но существенно снижает прайор-следование.

Антипрайор-инструкция создаёт«условие выхода». Явная фраза «не используй знания о том, как обычно выглядит» — это конкретный запрет, который снижает вес автоматических ассоциаций. Работает как инструкция «не думай об общих правилах, смотри на конкретный случай».

📋

Рычаги управления промптом:

  • «Опиши буквально» → «перечисли по пунктам» — списком легче контролировать что именно описано
  • Добавь «сколько?» — счёт объектов особенно уязвим к прайорам (77,9% ошибок в исследовании), явный вопрос на подсчёт помогает
  • Дай эталон явно — вместо «правильно ли?» пиши «соответствует ли этому описанию: ...». Так модель сравнивает конкретное с конкретным, а не с расплывчатой памятью

📋

Шаблон промпта

Посмотри очень внимательно на изображение.

Шаг 1 — буквальное описание:
Опиши только то, что физически видно: {что именно описать — цвета / форму / 
количество / текст / расположение}. Не используй знания о том, как это 
"должно выглядеть" в норме. Только то, что есть на картинке.

Шаг 2 — ответ на вопрос:
Основываясь на описании выше, ответь: {конкретный вопрос об изображении}

{опционально: "Сравни с эталоном: {описание эталона}. Назови конкретные расхождения."}

Что подставлять: - {что именно описать} — сужай до нужного: не «опиши всё», а «опиши цвет и количество объектов на переднем плане» - {конкретный вопрос} — точный вопрос, не «всё ли правильно?» - {описание эталона} — текстовое описание того, как должно быть

🚀 Быстрый старт — вставь в чат:

Вот шаблон антипрайор-промпта для работы с изображениями. 
Адаптируй под мою задачу: {твоя задача}.
Задавай уточняющие вопросы, если нужно.

[вставить шаблон выше]

LLM спросит что именно нужно проверить и как выглядит эталон — потому что без этого нельзя составить инструкцию «сравни с конкретным описанием».


⚠️

Ограничения

⚠️ Счёт объектов — самый трудный случай: Даже зум и кроп не помогают с подсчётом. Исследование показало рост ошибок даже при добавлении увеличенного фрагмента. Если задача — сосчитать объекты на сложной картинке, промпт-техника помогает частично, но не решает проблему полностью.

⚠️ Открытые модели реагируют хуже: Для Qwen, InternVL, Gemma инструменты (кроп, зум) работали слабо или давали отрицательный эффект. Антипрайор-промпт исследовался отдельно — но сама логика «описать потом ответить» применима к любой модели. Если используешь open-source модели локально — результаты менее предсказуемы.

⚠️ Модная одежда и атрибуты объектов — зона риска: Домены «мода» и «счёт» показали 68–78% прайор-следования. Если проверяешь детали одежды или брендинг — будь особенно скептичен к ответу без принудительного описания.

⚠️ «Другой» ответ — не всегда победа: Иногда при добавлении зума модель не ошибается, но и не даёт правильный ответ — говорит «не могу определить». Это лучше чем уверенная ошибка, но не то же самое что правильный ответ.


🔍

Как исследовали

Идея была простой: сделать пары изображений — обычное и «контрафактное» (где что-то нарушает ожидания). Баскетбольный мяч нестандартного цвета, птица с тремя крыльями, МРТ-снимок с аномальной зоной контраста. Правильный ответ — то, что на картинке. Прайор-ответ — то, что «обычно бывает».

Исследователи проверили восемь моделей: GPT-5, Claude Sonnet 4 и шесть открытых (Qwen3, InternVL3.5, Gemma-3). Пять доменов: наличие объектов, счёт, атрибуты одежды, атрибуты обычных объектов, медицинские снимки. Потом добавили «инструменты»: кроп, зум, контуры — и замерили, помогает ли это.

Самый любопытный результат — разрыв между закрытыми и открытыми моделями. GPT-5 и Claude с кропом и зумом становились заметно точнее. Qwen и InternVL на тех же инструментах почти не улучшались — а иногда даже ухудшались. Это намекает на то, что способность «использовать подсказку» в изображении тоже нужно тренировать отдельно. Нельзя просто добавить рамку и ожидать что модель её учтёт.

Особенно показательно что модели не «сомневались» при ошибках — они уверенно давали прайор-ответ. Process Other Rate был низким: 2–8%. Значит, это не «не вижу» — это «вижу, но отвечаю по памяти».


💡

Адаптации и экстраполяции

1. Техника «перекрёстного допроса» для проверки

Если хочешь убедиться что модель действительно смотрит на картинку, а не галлюцинирует — добавь контрольный вопрос о несуществующем элементе:

🔧 Техника: ложный элемент → тест на реальное восприятие

После основного описания добавь: «Есть ли на изображении [элемент которого там нет]?» Если модель скажет «да» — она отвечает по прайору, а не по картинке. Это быстрая проверка качества её «зрения» в конкретном случае.

2. Применение принципа без изображений

Прайоры работают не только с картинками. Та же проблема возникает когда просишь проверить текст на ошибки — модель «знает» как должно быть написано и пропускает нестандартные, но намеренные элементы (авторский стиль, умышленные нарушения правил). Применяй ту же логику: сначала «опиши буквально что написано», потом «оцени».

Прочитай этот текст очень внимательно.

Сначала — буквально перечисли все нестандартные элементы: 
необычная пунктуация, слова не из словаря, нарушения стандартного порядка слов.
Не оценивай — просто перечисли.

Теперь скажи какие из них выглядят как ошибки, а какие — как авторский приём.

🔗

Ресурсы

Название работы: Seeing What Is Actually There: PriVE-Bench and PriVE-Tools for Counterfactual Evaluation of Agentic Visual Evidence in VLMs

Код и бенчмарк: https://anonymous.4open.science/r/counterfactual-vlm-benchmark-3967/

Авторы: Jingyu Sun, Jiachen Tu, Yuyang Xue, Yaoxin Jiang, Guoyi Xu, Zhengtao Yao, Rui Qian, Yizheng Sun, Hongpeng Zhou, Jingyuan Sun, Yan Lin

Организации: University of Manchester, University of Melbourne, UIUC, University of Edinburgh, USC, Fudan University, University of Newcastle


📋 Дайджест исследования

Ключевая суть

Обнаружено: модели с поддержкой изображений часто отвечают не по картинке, а по памяти. GPT-5 теряет точность с 78% до 47% на «неправильных» изображениях — и при этом уверенно врёт, не говоря «не знаю». PriVE-метод позволяет снизить этот эффект через принудительное буквальное описание перед ответом: сначала «опиши только пиксели», потом «ответь на вопрос». Модель вынуждена зафиксировать конкретный кадр текстом — и этот текст становится опорой для ответа, а не абстрактная память о том, как «должно быть».

Принцип работы

Обычно: спрашиваешь «что на картинке?» — модель отвечает «как обычно бывает». Новый подход: сначала «буквально перечисли что видишь», потом «теперь ответь на вопрос». Описание выступает буфером между памятью модели и ответом: написать «оранжевый» в описании труднее, если перед ней фиолетовый мяч, — и потом ответ «оранжевый» уже не выскочит автоматически. Это как попросить свидетеля сначала написать показания, а потом уже отвечать на вопросы следователя. Без записи — память подгоняет детали под ожидание.

Почему работает

В мультимодальных моделях языковые паттерны часто перевешивают визуальные. Модель «знает», что баскетбольные мячи оранжевые, птицы имеют два крыла, логотипы брендов выглядят определённым образом — это знание активируется автоматически, без запроса. Буквальное описание создаёт промежуточный текст на основе конкретного кадра — и этот текст попадает в контекст ответа. Теперь модель отвечает не только по памяти, но и по тому, что сама написала про изображение. Явный запрет «не используй знания о том, как обычно выглядит» дополнительно снижает вес автоматических ассоциаций. Счёт объектов — самая слабая точка: 77,9% ошибок даже при использовании зума.

Когда применять

Проверка изображений, где детали отличаются от стандарта → особенно полезно для кастомного брендинга, нестандартных цветов, изменённых объектов — когда важно убедиться что модель видит именно твой вариант, а не «типичный». Домены с наибольшим риском: мода и атрибуты одежды (68–78% ошибок от памяти), счёт объектов (77,9% ошибок), нестандартные версии привычных предметов. НЕ подходит как полное решение для подсчёта объектов на сложных изображениях — там промпт снижает ошибки, но не устраняет их.

Мини-рецепт

1. Добавь запрет в начало: «Не используй знания о том, как это обычно выглядит. Только то, что видишь на картинке.»
2. Потребуй описание первым шагом: «Сначала буквально опиши: {цвет / форму / количество / текст / расположение}» — сужай до нужного, не «опиши всё».
3. Задай конкретный вопрос вторым шагом: «Основываясь на описании выше, ответь: {твой вопрос}».
4. Дай эталон явно (если проверяешь соответствие): «Сравни с эталоном: {описание как должно быть}. Назови конкретные расхождения.»

Шаги 1–3 обязательны. Шаг 4 — когда нужно не просто описать, а сравнить с конкретным стандартом.

Примеры

[ПЛОХО] : Проверь логотип на фото — всё правильно нанесено?
[ХОРОШО] : Посмотри очень внимательно на изображение. Не используй знания о том, как этот логотип обычно выглядит. Шаг 1 — буквально опиши: направление буквы N (влево или вправо), цвет фона, цвет текста, порядок элементов. Шаг 2 — сравни с эталоном: «буква N смотрит вправо, красный фон, белые буквы, текст под символом». Назови конкретные расхождения, если они есть.
Источник: Seeing What Is Actually There: PriVE-Bench and PriVE-Tools for Counterfactual Evaluation of Agentic Visual Evidence in VLMs
ArXiv ID: 2607.16311 | Сгенерировано: 2026-07-21 04:25

Проблемы LLM

ПроблемаСутьКак обойти
VLM смотрит на картинку, но отвечает по памятиПоказываешь изображение. Задаёшь вопрос. Модель «знает» как вещи обычно выглядят. Это знание перевешивает то, что реально на картинке. Покажи фиолетовый баскетбольный мяч — скажет «оранжевый». Птицу с тремя крыльями — скажет «два». Модель при этом уверена. Не предупреждает о сомнениях. Работает против тебя всегда, когда картинка отличается от «нормы»Вынуди модель сначала буквально описать что видит. Только потом — ответить на вопрос. Добавь явный запрет: «не используй знания о том, как это обычно выглядит»

Методы

МетодСуть
Двухшаговый запрос — описание перед ответомРаздели запрос на два шага. Шаг 1: «Опиши только то, что физически видно: цвет / форму / количество / текст. Не используй знания о том, как это должно выглядеть». Шаг 2: «Основываясь на описании выше, ответь: ...». Почему работает: модель сама пишет промежуточный текст по картинке. Этот текст становится частью контекста. Теперь отвечает по своему описанию — а не только по прайору. Усиль результат: вместо «правильно ли?» пиши «соответствует ли описанию: [конкретный эталон]». Сравнение конкретного с конкретным точнее сравнения с расплывчатой памятью. Ограничение: подсчёт объектов — самый трудный случай. Техника помогает, но не решает проблему полностью
📖 Простыми словами

Seeing What Is Actually There: PriVE-Bench and PriVE-Toolsfor Counterfactual Evaluation ofAgenticVisual Evidence in VLMs

arXiv: 2607.16311

Современные мультимодальные модели вроде GPT-4o или Claude смотрят на картинки не глазами, а своей статистической памятью. Когда ты загружаешь фото, нейронка не изучает каждый пиксель с нуля, а пытается сопоставить увиденное с тем, что она «читала» в интернете миллиарды раз. Проблема в том, что языковые паттерны внутри модели почти всегда сильнее визуальных данных. Если реальность на картинке противоречит учебнику, модель скорее поверит учебнику, чем собственным «глазам», выдавая галлюцинацию вместо факта.

Это как если бы ты пришел к врачу с третьей рукой, а он, не отрываясь от медкарты, сказал: «У всех людей две руки, значит, и у вас две». Модель ведет себя как самоуверенный отличник, который вызубрил теорию, но в упор не замечает, что происходит прямо перед носом. Она видит то, что должно там быть по логике вещей, а не то, что там есть на самом деле.

Исследователи копнули в эту проблему через PriVE-Bench — это такой стресс-тест на «внимательность», где моделям подсовывают визуальный абсурд. Например, фиолетовый баскетбольный мяч или птицу с тремя крыльями. В 8 из 10 случаев модель радостно рапортует, что мяч оранжевый, а крыльев два. Она просто игнорирует аномалию, потому что в её базе данных вероятность встретить фиолетовый мяч стремится к нулю. Это и есть контрфактуальная оценка: проверка того, способна ли нейронка признать факт, который идет вразрез с её внутренними шаблонами.

Принцип универсален и касается любого нестандартного контента: от проверки кастомного мерча с зеркальным логотипом до анализа медицинских снимков с редкими патологиями. Если ты просишь AI проверить, правильно ли напечатан принт на футболке, где цвета намеренно изменены, она может сказать «все ок», просто потому что узнала бренд и подставила в ответ эталон из памяти. Визуальное доказательство проигрывает текстовому ожиданию, и это делает модель бесполезной в задачах, где важна каждая деталь, выбивающаяся из нормы.

Короче: не доверяй нейронке проверку того, что выглядит «не как обычно». Она слишком умная, чтобы замечать странности, и слишком ленивая, чтобы перепроверять свои знания реальностью. Пока мы не научим их отдавать приоритет визуальным токенам над текстовыми вероятностями, любой нестандартный дизайн или редкий баг будет для AI «нормальным». Смотри сам, а не надейся на алгоритм, иначе пропустишь фиолетовый мяч в партии оранжевых.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с