TL;DR
Если LLM со зрением (VLM, модель, которая читает текст и картинки) оценивает или размечает текст, а рядом лежит картинка, метки начинают «плавать». Это происходит даже когда в промпте прямо написано «решай только по тексту». Картинка не «подталкивает» к своему смыслу: ответ меняется почти случайно. Само присутствие картинки встряхивает ответ.
Боль выглядит так. Вы прогоняете 100 отзывов с фото через модель и получаете красивую точность. Но у каждой пятой метки ответ без фото был бы другим. Ошибки в одну и в другую сторону гасят друг друга, поэтому общий процент совпадения с людьми не меняется. Нестабильность в среднем не видна. Причина проста: модель читает всё, что в неё положили, а инструкция «игнорируй» — просто ещё одна строка текста. Она не отключает внимание к картинке.
Практический вывод: не прикладывайте к оценке то, что не нужно для решения. Если приложить пришлось, прогоните элементы дважды (с картинкой и без) и сравните метки по каждому элементу, а не по общему проценту. Исследование проверяло это на разметке идиом, но правило применимо к любому судье с лишним контекстом.
Схема метода (проверка устойчивости судьи)
ШАГ 1: Прогнать выборку БЕЗ лишнего контекста → метки A
ШАГ 2: Прогнать ту же выборку С лишним контекстом (картинка, предыдущее сообщение) → метки B
ШАГ 3: Сравнить A и B по каждому элементу (не по среднему) → доля изменившихся меток
ШАГ 4 (по желанию): Дать другой лишний контекст → метки C. Если A→B и A→C меняются одинаково, нестабильность идёт от самого присутствия контекста
ШАГ 5: Если доля заметна — убрать контекст из запроса или зафиксировать конфигурацию в отчёте
Каждый шаг — отдельный запрос или прогон. Ручной процесс, который собирается в чате или в автоматизации без кода.
Пример применения
Задача: Вы ведёте модерацию отзывов на Wildberries. Модель размечает отзывы: «хвалят», «ругают», «буквальная жалоба на брак». Решение должно зависеть только от текста. Но в отзывах есть фото, и часть из них вводит в заблуждение. Например, пишут «Фен — огонь!» (это похвала), а на фото дымящийся оплавленный фен.
Промпт (прогон 1, только текст):
Ты размечаешь отзывы с маркетплейса. Решай ТОЛЬКО по тексту отзыва.
Определи, как использовано выделенное выражение:
- ПЕРЕНОСНОЕ — оборот в переносном смысле (похвала, эмоция)
- БУКВАЛЬНОЕ — описывается реальное событие (горит, ломается)
Отзыв: «Фен — огонь, за 2000 ₽ сушит как в салоне, волосы шелковые».
Выражение: «огонь»
Ответь одним словом: ПЕРЕНОСНОЕ или БУКВАЛЬНОЕ.
Промпт (прогон 2, тот же отзыв + фото оплавленного фена):
[тот же текст, что выше]
Фото отзыва приложено. Игнорируй фото, решай только по тексту.
Затем: повторить для 30–50 отзывов и вручную сравнить метки по каждому отзыву.
Результат: Часть меток, скорее всего, изменится, хотя текст тот же. Исследование этого не гарантирует, но на другой тематике закономерность может повторяться. Если доля изменений заметная (в статье около 15–20%), метки с фото нельзя считать надёжными. Тогда фото лучше вообще не передавать в этот запрос. Если нужно учитывать и фото (например, для жалоб на брак), делайте это отдельным запросом со своей задачей.
Почему это работает (и почему не работает «игнорируй»)
Слабость. Модель не умеет «не смотреть». Всё, что попало в запрос, влияет на генерацию. Фраза «игнорируй картинку» — лишь одна из нескольких влияний. Она снижает эффект, но не убирает его: в контроле с удалённой инструкцией сдвинулось около 11–12% меток, а присутствие картинки двигало около 20%.
Что удивило. Ожидалось, что картинка с буквальным смыслом потянет метку к «буквально», а с переносным потянет к «переносно». Этого не произошло. Согласующая и обманывающая картинки сдвигают примерно одинаково (20,5% и 19,4%), и лишь около трети сдвинутых меток идёт в сторону картинки. Сдвиг больше похож на шум. Поэтому общая точность не падает, а ошибки «спрятаны» внутри.
Как использовать. Надёжная защита здесь — убрать лишнее из контекста, а не просить его не замечать. Второй рычаг: сравнивать метки по каждому элементу, а не по среднему. Именно поэтому дважды прогнанные элементы выявляют проблему, которую общий процент скрывает.
Рычаги проверки: - Размер выборки (30–50 элементов) → больше элементов, точнее оценка нестабильности. - Тип лишнего контекста → меняйте: картинка, предыдущее сообщение, история чата. - Порог → решите заранее, сколько изменений допустимо (например, не больше 5%).
Шаблон промпта
Ты размечаешь {что_размечаем}. Решай ТОЛЬКО по {источник_решения}.
Всё остальное, что приложено к элементу, не относится к решению.
Категории:
- {категория_1} — {определение_1}
- {категория_2} — {определение_2}
Элемент: «{текст_элемента}»
Ответь одним словом: {список_категорий}.
Запустите шаблон дважды на одной выборке: один раз без {лишний_контекст}, другой раз с ним. Потом сравните метки по каждому элементу.
Что подставлять:
- {что_размечаем} — тип объектов (отзывы, письма, тикеты).
- {источник_решения} — на чём основано решение (на тексте, на теме письма).
- {лишний_контекст} — то, что проверяете (фото, подпись, предыдущее сообщение).
Ограничения
⚠️ Нет сравнения с совсем посторонней картинкой: обе картинки в исследовании относились к проверяемой фразе. Неизвестно, двигает ли картинка «ни о чём» ещё сильнее.
⚠️ Одна задача, один язык: выводы получены на разметке идиом на английском. Перенос на тональность, модерацию, поддержку — гипотеза, а не результат статьи.
⚠️ Рассуждение выключено: у моделей с режимом размышлений авторы его отключили. Как ведут себя «думающие» режимы, неизвестно.
⚠️ Нет человеческого эталона нестабильности: никто не размечал один элемент дважды, поэтому неизвестно, насколько сами люди «плавают».
⚠️ Общая точность не ухудшилась: сильный довод вроде «картинка снижает качество» нельзя сделать. Проблема в том, что метки нестабильны на уровне отдельных элементов, а общая цифра этого не показывает.
Как исследовали
Исследователи сделали тест MIST: 200 английских предложений с оборотами вроде «kicked the bucket», где слова могут читаться переносно или буквально. К каждому предложению были три входа: без картинки, с картинкой, показывающей правильное прочтение, и с картинкой, показывающей обратное. Правильный ответ определяется только текстом, поэтому любое изменение метки из-за картинки считается ошибкой. Тринадцать VLM-судей (GPT-5.2, Gemini, Gemma, Qwen, Mistral и другие) прогнали через четыре типа промптов (без примеров, с примерами, с рассуждением и комбинацию), с инструкцией «игнорируй картинку» и без неё. Получилось 52 000 меток. Шесть человек разметили те же предложения двумя независимыми тройками.
Ожидали, что картинка будет «тянуть» метку к своему смыслу. Вместо этого обе картинки двигали примерно одинаково много меток, а только около трети изменений шло в сторону картинки. Для практики из этого следует: влияние идёт через сам факт присутствия, а не через содержание. Согласие с людьми при этом не менялось (около 54% при любом варианте), поэтому по общему проценту нестабильность не заметить. Эффект был слабее у моделей, которые лучше проходят тест на замену человека (alt-test), но присутствовал у всех.
Адаптации и экстраполяции
🔧 Техника: проверка «с лишним и без лишнего» для любого судьи
Те же два прогона на одной выборке подойдут для любого лишнего контекста: добавьте автора отзыва, рейтинг, предыдущее сообщение клиента. Если метки по элементам меняются заметно, запрос нужно сузить.
🔧 Техника: разведение задач по запросам
Если нужен и текст, и картинка, делайте два запроса. Первый: «оцени текст» (картинки нет). Второй: «что на фото» (текста нет). Затем сопоставляйте результаты вручную или отдельным запросом. Это моя экстраполяция, а не результат статьи: исследование показало только проблему.
Ресурсы
- «It's Not What the Image Shows: Irrelevant Context Destabilises VLM Judges Without Informing Them», NeurIPS 2026 Workshop TAE (Trust-AI-Eval).
- Датасет MIST: huggingface.co/datasets/naghamo/mist-vlm-judges
- Авторы: Nagham Omar, Mahmoud Jabarin, Kinan Ibraheem, Lotem Peled-Cohen, Технион (Израиль).
- Связанные работы: alt-test (Calderon и др.), AdMIRe (SemEval-2025), CheckList (Ribeiro и др.).
