TL;DR
Мультимодальные модели (VLM, те самые GPT-4o и Claude с поддержкой картинок) часто дают ответы на вопросы по изображению не глядя в картинку — а вспоминая, «как обычно бывает». Покажи модели баскетбольный мяч фиолетового цвета и спроси — она с высокой вероятностью скажет «оранжевый». Покажи птицу с тремя крыльями и спроси сколько крыльев — ответит «два».
Исследование PriVE-Bench систематически измерило этот эффект: точность падала у GPT-5 с 78% до 47%, у Claude Sonnet 4 с 71% до 47%, когда изображения противоречили привычным ожиданиям. Причём модели не говорят «не уверен» — они уверенно дают неправильный ответ, соответствующий тому, что «должно быть» по их опыту.
Главная находка доступна для противодействия: явная инструкция смотреть на пиксели и принудительное описание перед ответом — работающие техники. Для GPT/Claude также помогают кроп и зум нужного фрагмента. Подготовили шаблон промпта для работы с изображениями, где важна точность восприятия.
Схема метода
ШАГ 1: Антипрайор-инструкция → запрет отвечать по ожиданиям
ШАГ 2: Принудительное буквальное описание → только пиксели, без интерпретации
ШАГ 3: Ответ на вопрос → теперь основан на описании, а не на прайоре
(опционально) ШАГ 0: Кроп/зум нужного фрагмента → передать картинку отдельно
Всё в одном промпте. Для шага 0 нужна подготовка изображения заранее.
Пример применения
Задача: Ты продаёшь кастомный мерч на Wildberries. Перед публикацией хочешь проверить фото — правильно ли нанесён логотип на худи. Логотип нестандартный: зеркально отражённый и с непривычным сочетанием цветов. Обычный вопрос «логотип правильный?» получит «да» — потому что модель знает как выглядит оригинальный логотип и «узнаёт» его.
Промпт:
Смотри на изображение очень внимательно.
Сначала — буквально опиши логотип: его форму, направление (зеркальный или нет),
цвета каждого элемента, расположение текста. Только то, что видишь на пикселях.
Не используй знания о том, как этот логотип «должен» выглядеть.
После описания ответь: соответствует ли логотип на фото этому эталону:
[вставь описание эталона — например: "буква N смотрит вправо, красный фон, белые буквы"]
Если видишь расхождение — назови конкретно что не так.
Результат: Модель сначала выдаст подробное описание того, что буквально видит — направление, цвета, порядок элементов. Это «заземляет» её на конкретное изображение. Потом сравнит с эталоном и назовёт конкретные расхождения. Без принудительного описания она бы просто «узнала» логотип и сказала «всё ок».
Почему это работает
LLM — это статистическая машина памяти. Когда модель видит изображение, она не «смотрит» на пиксели как человек. Она одновременно обрабатывает визуальные токены и языковые паттерны — и языковые паттерны часто перевешивают. Модель «знает», что мячи для баскетбола оранжевые, птицы имеют два крыла, логотипы брендов выглядят определённым образом. Это знание активируется автоматически.
Буквальное описание — это обходной путь. Когда ты просишь модель сначала описать, а потом ответить, она вынуждена сформировать промежуточный текст на основе изображения. Этот текст становится частью контекста ответа. Теперь модель отвечает уже не только по прайору, но и по тому что сама написала про конкретный кадр. Это не идеально, но существенно снижает прайор-следование.
Антипрайор-инструкция создаёт«условие выхода». Явная фраза «не используй знания о том, как обычно выглядит» — это конкретный запрет, который снижает вес автоматических ассоциаций. Работает как инструкция «не думай об общих правилах, смотри на конкретный случай».
Рычаги управления промптом:
- «Опиши буквально» → «перечисли по пунктам» — списком легче контролировать что именно описано
- Добавь «сколько?» — счёт объектов особенно уязвим к прайорам (77,9% ошибок в исследовании), явный вопрос на подсчёт помогает
- Дай эталон явно — вместо «правильно ли?» пиши «соответствует ли этому описанию: ...». Так модель сравнивает конкретное с конкретным, а не с расплывчатой памятью
Шаблон промпта
Посмотри очень внимательно на изображение.
Шаг 1 — буквальное описание:
Опиши только то, что физически видно: {что именно описать — цвета / форму /
количество / текст / расположение}. Не используй знания о том, как это
"должно выглядеть" в норме. Только то, что есть на картинке.
Шаг 2 — ответ на вопрос:
Основываясь на описании выше, ответь: {конкретный вопрос об изображении}
{опционально: "Сравни с эталоном: {описание эталона}. Назови конкретные расхождения."}
Что подставлять:
- {что именно описать} — сужай до нужного: не «опиши всё», а «опиши цвет и количество объектов на переднем плане»
- {конкретный вопрос} — точный вопрос, не «всё ли правильно?»
- {описание эталона} — текстовое описание того, как должно быть
🚀 Быстрый старт — вставь в чат:
Вот шаблон антипрайор-промпта для работы с изображениями.
Адаптируй под мою задачу: {твоя задача}.
Задавай уточняющие вопросы, если нужно.
[вставить шаблон выше]
LLM спросит что именно нужно проверить и как выглядит эталон — потому что без этого нельзя составить инструкцию «сравни с конкретным описанием».
Ограничения
⚠️ Счёт объектов — самый трудный случай: Даже зум и кроп не помогают с подсчётом. Исследование показало рост ошибок даже при добавлении увеличенного фрагмента. Если задача — сосчитать объекты на сложной картинке, промпт-техника помогает частично, но не решает проблему полностью.
⚠️ Открытые модели реагируют хуже: Для Qwen, InternVL, Gemma инструменты (кроп, зум) работали слабо или давали отрицательный эффект. Антипрайор-промпт исследовался отдельно — но сама логика «описать потом ответить» применима к любой модели. Если используешь open-source модели локально — результаты менее предсказуемы.
⚠️ Модная одежда и атрибуты объектов — зона риска: Домены «мода» и «счёт» показали 68–78% прайор-следования. Если проверяешь детали одежды или брендинг — будь особенно скептичен к ответу без принудительного описания.
⚠️ «Другой» ответ — не всегда победа: Иногда при добавлении зума модель не ошибается, но и не даёт правильный ответ — говорит «не могу определить». Это лучше чем уверенная ошибка, но не то же самое что правильный ответ.
Как исследовали
Идея была простой: сделать пары изображений — обычное и «контрафактное» (где что-то нарушает ожидания). Баскетбольный мяч нестандартного цвета, птица с тремя крыльями, МРТ-снимок с аномальной зоной контраста. Правильный ответ — то, что на картинке. Прайор-ответ — то, что «обычно бывает».
Исследователи проверили восемь моделей: GPT-5, Claude Sonnet 4 и шесть открытых (Qwen3, InternVL3.5, Gemma-3). Пять доменов: наличие объектов, счёт, атрибуты одежды, атрибуты обычных объектов, медицинские снимки. Потом добавили «инструменты»: кроп, зум, контуры — и замерили, помогает ли это.
Самый любопытный результат — разрыв между закрытыми и открытыми моделями. GPT-5 и Claude с кропом и зумом становились заметно точнее. Qwen и InternVL на тех же инструментах почти не улучшались — а иногда даже ухудшались. Это намекает на то, что способность «использовать подсказку» в изображении тоже нужно тренировать отдельно. Нельзя просто добавить рамку и ожидать что модель её учтёт.
Особенно показательно что модели не «сомневались» при ошибках — они уверенно давали прайор-ответ. Process Other Rate был низким: 2–8%. Значит, это не «не вижу» — это «вижу, но отвечаю по памяти».
Адаптации и экстраполяции
1. Техника «перекрёстного допроса» для проверки
Если хочешь убедиться что модель действительно смотрит на картинку, а не галлюцинирует — добавь контрольный вопрос о несуществующем элементе:
🔧 Техника: ложный элемент → тест на реальное восприятие
После основного описания добавь: «Есть ли на изображении [элемент которого там нет]?» Если модель скажет «да» — она отвечает по прайору, а не по картинке. Это быстрая проверка качества её «зрения» в конкретном случае.
2. Применение принципа без изображений
Прайоры работают не только с картинками. Та же проблема возникает когда просишь проверить текст на ошибки — модель «знает» как должно быть написано и пропускает нестандартные, но намеренные элементы (авторский стиль, умышленные нарушения правил). Применяй ту же логику: сначала «опиши буквально что написано», потом «оцени».
Прочитай этот текст очень внимательно.
Сначала — буквально перечисли все нестандартные элементы:
необычная пунктуация, слова не из словаря, нарушения стандартного порядка слов.
Не оценивай — просто перечисли.
Теперь скажи какие из них выглядят как ошибки, а какие — как авторский приём.
Ресурсы
Название работы: Seeing What Is Actually There: PriVE-Bench and PriVE-Tools for Counterfactual Evaluation of Agentic Visual Evidence in VLMs
Код и бенчмарк: https://anonymous.4open.science/r/counterfactual-vlm-benchmark-3967/
Авторы: Jingyu Sun, Jiachen Tu, Yuyang Xue, Yaoxin Jiang, Guoyi Xu, Zhengtao Yao, Rui Qian, Yizheng Sun, Hongpeng Zhou, Jingyuan Sun, Yan Lin
Организации: University of Manchester, University of Melbourne, UIUC, University of Edinburgh, USC, Fudan University, University of Newcastle
