3,583 papers
arXiv:2609.37863 77 29 сент. 2026 г. FREE

Нерелевантный контекст в VLM-судьях: картинка раскачивает метки, даже если сказать «игнорируй»

КЛЮЧЕВАЯ СУТЬ
Обнаружено: если рядом с текстом лежит картинка, модель со зрением (VLM) меняет около 20% меток, хотя в промпте написано «решай только по тексту». Общий процент совпадения с людьми при этом не меняется, и проблему легко не заметить. Метод проверки позволяет поймать эту скрытую нестабильность, когда вы размечаете или оцениваете тексты, к которым приложены фото. Фишка: картинка не тянет ответ к своему смыслу, она просто встряхивает его. Ошибки в обе стороны гасят друг друга, поэтому средняя точность выглядит нормально, а у каждой пятой метки ответ без фото был бы другим.
Адаптировать под запрос
⚡

TL;DR

Если LLM со зрением (VLM, модель, которая читает текст и картинки) оценивает или размечает текст, а рядом лежит картинка, метки начинают «плавать». Это происходит даже когда в промпте прямо написано «решай только по тексту». Картинка не «подталкивает» к своему смыслу: ответ меняется почти случайно. Само присутствие картинки встряхивает ответ.

Боль выглядит так. Вы прогоняете 100 отзывов с фото через модель и получаете красивую точность. Но у каждой пятой метки ответ без фото был бы другим. Ошибки в одну и в другую сторону гасят друг друга, поэтому общий процент совпадения с людьми не меняется. Нестабильность в среднем не видна. Причина проста: модель читает всё, что в неё положили, а инструкция «игнорируй» — просто ещё одна строка текста. Она не отключает внимание к картинке.

Практический вывод: не прикладывайте к оценке то, что не нужно для решения. Если приложить пришлось, прогоните элементы дважды (с картинкой и без) и сравните метки по каждому элементу, а не по общему проценту. Исследование проверяло это на разметке идиом, но правило применимо к любому судье с лишним контекстом.

🔬

Схема метода (проверка устойчивости судьи)

ШАГ 1: Прогнать выборку БЕЗ лишнего контекста → метки A
ШАГ 2: Прогнать ту же выборку С лишним контекстом (картинка, предыдущее сообщение) → метки B
ШАГ 3: Сравнить A и B по каждому элементу (не по среднему) → доля изменившихся меток
ШАГ 4 (по желанию): Дать другой лишний контекст → метки C. Если A→B и A→C меняются одинаково, нестабильность идёт от самого присутствия контекста
ШАГ 5: Если доля заметна — убрать контекст из запроса или зафиксировать конфигурацию в отчёте

Каждый шаг — отдельный запрос или прогон. Ручной процесс, который собирается в чате или в автоматизации без кода.

🚀

Пример применения

Задача: Вы ведёте модерацию отзывов на Wildberries. Модель размечает отзывы: «хвалят», «ругают», «буквальная жалоба на брак». Решение должно зависеть только от текста. Но в отзывах есть фото, и часть из них вводит в заблуждение. Например, пишут «Фен — огонь!» (это похвала), а на фото дымящийся оплавленный фен.

Промпт (прогон 1, только текст):

Ты размечаешь отзывы с маркетплейса. Решай ТОЛЬКО по тексту отзыва.
Определи, как использовано выделенное выражение:
- ПЕРЕНОСНОЕ — оборот в переносном смысле (похвала, эмоция)
- БУКВАЛЬНОЕ — описывается реальное событие (горит, ломается)

Отзыв: «Фен — огонь, за 2000 ₽ сушит как в салоне, волосы шелковые».
Выражение: «огонь»
Ответь одним словом: ПЕРЕНОСНОЕ или БУКВАЛЬНОЕ.

Промпт (прогон 2, тот же отзыв + фото оплавленного фена):

[тот же текст, что выше]
Фото отзыва приложено. Игнорируй фото, решай только по тексту.

Затем: повторить для 30–50 отзывов и вручную сравнить метки по каждому отзыву.

Результат: Часть меток, скорее всего, изменится, хотя текст тот же. Исследование этого не гарантирует, но на другой тематике закономерность может повторяться. Если доля изменений заметная (в статье около 15–20%), метки с фото нельзя считать надёжными. Тогда фото лучше вообще не передавать в этот запрос. Если нужно учитывать и фото (например, для жалоб на брак), делайте это отдельным запросом со своей задачей.

🧠

Почему это работает (и почему не работает «игнорируй»)

Слабость. Модель не умеет «не смотреть». Всё, что попало в запрос, влияет на генерацию. Фраза «игнорируй картинку» — лишь одна из нескольких влияний. Она снижает эффект, но не убирает его: в контроле с удалённой инструкцией сдвинулось около 11–12% меток, а присутствие картинки двигало около 20%.

Что удивило. Ожидалось, что картинка с буквальным смыслом потянет метку к «буквально», а с переносным потянет к «переносно». Этого не произошло. Согласующая и обманывающая картинки сдвигают примерно одинаково (20,5% и 19,4%), и лишь около трети сдвинутых меток идёт в сторону картинки. Сдвиг больше похож на шум. Поэтому общая точность не падает, а ошибки «спрятаны» внутри.

Как использовать. Надёжная защита здесь — убрать лишнее из контекста, а не просить его не замечать. Второй рычаг: сравнивать метки по каждому элементу, а не по среднему. Именно поэтому дважды прогнанные элементы выявляют проблему, которую общий процент скрывает.

Рычаги проверки: - Размер выборки (30–50 элементов) → больше элементов, точнее оценка нестабильности. - Тип лишнего контекста → меняйте: картинка, предыдущее сообщение, история чата. - Порог → решите заранее, сколько изменений допустимо (например, не больше 5%).

📋

Шаблон промпта

Ты размечаешь {что_размечаем}. Решай ТОЛЬКО по {источник_решения}.
Всё остальное, что приложено к элементу, не относится к решению.

Категории:
- {категория_1} — {определение_1}
- {категория_2} — {определение_2}

Элемент: «{текст_элемента}»
Ответь одним словом: {список_категорий}.

Запустите шаблон дважды на одной выборке: один раз без {лишний_контекст}, другой раз с ним. Потом сравните метки по каждому элементу.

Что подставлять: - {что_размечаем} — тип объектов (отзывы, письма, тикеты). - {источник_решения} — на чём основано решение (на тексте, на теме письма). - {лишний_контекст} — то, что проверяете (фото, подпись, предыдущее сообщение).

⚠️

Ограничения

⚠️ Нет сравнения с совсем посторонней картинкой: обе картинки в исследовании относились к проверяемой фразе. Неизвестно, двигает ли картинка «ни о чём» ещё сильнее.

⚠️ Одна задача, один язык: выводы получены на разметке идиом на английском. Перенос на тональность, модерацию, поддержку — гипотеза, а не результат статьи.

⚠️ Рассуждение выключено: у моделей с режимом размышлений авторы его отключили. Как ведут себя «думающие» режимы, неизвестно.

⚠️ Нет человеческого эталона нестабильности: никто не размечал один элемент дважды, поэтому неизвестно, насколько сами люди «плавают».

⚠️ Общая точность не ухудшилась: сильный довод вроде «картинка снижает качество» нельзя сделать. Проблема в том, что метки нестабильны на уровне отдельных элементов, а общая цифра этого не показывает.

🔍

Как исследовали

Исследователи сделали тест MIST: 200 английских предложений с оборотами вроде «kicked the bucket», где слова могут читаться переносно или буквально. К каждому предложению были три входа: без картинки, с картинкой, показывающей правильное прочтение, и с картинкой, показывающей обратное. Правильный ответ определяется только текстом, поэтому любое изменение метки из-за картинки считается ошибкой. Тринадцать VLM-судей (GPT-5.2, Gemini, Gemma, Qwen, Mistral и другие) прогнали через четыре типа промптов (без примеров, с примерами, с рассуждением и комбинацию), с инструкцией «игнорируй картинку» и без неё. Получилось 52 000 меток. Шесть человек разметили те же предложения двумя независимыми тройками.

Ожидали, что картинка будет «тянуть» метку к своему смыслу. Вместо этого обе картинки двигали примерно одинаково много меток, а только около трети изменений шло в сторону картинки. Для практики из этого следует: влияние идёт через сам факт присутствия, а не через содержание. Согласие с людьми при этом не менялось (около 54% при любом варианте), поэтому по общему проценту нестабильность не заметить. Эффект был слабее у моделей, которые лучше проходят тест на замену человека (alt-test), но присутствовал у всех.

💡

Адаптации и экстраполяции

🔧 Техника: проверка «с лишним и без лишнего» для любого судьи

Те же два прогона на одной выборке подойдут для любого лишнего контекста: добавьте автора отзыва, рейтинг, предыдущее сообщение клиента. Если метки по элементам меняются заметно, запрос нужно сузить.

🔧 Техника: разведение задач по запросам

Если нужен и текст, и картинка, делайте два запроса. Первый: «оцени текст» (картинки нет). Второй: «что на фото» (текста нет). Затем сопоставляйте результаты вручную или отдельным запросом. Это моя экстраполяция, а не результат статьи: исследование показало только проблему.

🔗

Ресурсы

  • «It's Not What the Image Shows: Irrelevant Context Destabilises VLM Judges Without Informing Them», NeurIPS 2026 Workshop TAE (Trust-AI-Eval).
  • Датасет MIST: huggingface.co/datasets/naghamo/mist-vlm-judges
  • Авторы: Nagham Omar, Mahmoud Jabarin, Kinan Ibraheem, Lotem Peled-Cohen, Технион (Израиль).
  • Связанные работы: alt-test (Calderon и др.), AdMIRe (SemEval-2025), CheckList (Ribeiro и др.).

📋 Дайджест исследования

Ключевая суть

Обнаружено: если рядом с текстом лежит картинка, модель со зрением (VLM) меняет около 20% меток, хотя в промпте написано «решай только по тексту». Общий процент совпадения с людьми при этом не меняется, и проблему легко не заметить. Метод проверки позволяет поймать эту скрытую нестабильность, когда вы размечаете или оцениваете тексты, к которым приложены фото. Фишка: картинка не тянет ответ к своему смыслу, она просто встряхивает его. Ошибки в обе стороны гасят друг друга, поэтому средняя точность выглядит нормально, а у каждой пятой метки ответ без фото был бы другим.

Принцип работы

Принцип простой: сравнивай не среднее, а каждый элемент. 1. Прогони выборку без лишнего контекста. Получишь метки A. 2. Прогони ту же выборку с картинкой. Получишь метки B. 3. Сравни A и B по каждому элементу. Считай долю изменившихся меток. 4. Для проверки дай другую лишнюю вещь (картинку-обманку, прошлое сообщение). Получишь метки C. Если A→B и A→C меняются одинаково, виновато само присутствие контекста. Общий процент совпадения не видит нестабильности, её видит только сравнение метка к метке. Это как взвесить два мешка и сказать «вес одинаковый». А в одном из них половина картошки заменена камнями.

Почему работает

Модель не умеет «не смотреть». Всё, что попало в запрос, влияет на ответ. Фраза «игнорируй картинку» — всего лишь ещё одна строка текста. Она не выключает внимание к картинке. Цифры из исследования: - с картинкой сдвигается около 20% меток; - без инструкции «игнорируй» сдвиг около 11–12%; - картинка, согласная с текстом, двигает 20,5% меток, картинка-обманка — 19,4%; - в сторону картинки уходит лишь около трети сдвинутых меток. Инструкция чуть снижает эффект, но не убирает его. Ожидалось, что буквальная картинка потянет метку к «буквально». Этого не случилось. Согласная и обманная картинки двигают почти одинаково, значит сдвиг идёт от самого присутствия картинки, а не от её смысла. Поэтому общая точность не падает: сдвиги идут в обе стороны. Надёжная защита одна: убрать лишнее из запроса, а не просить модель этого не замечать.

Когда применять

Разметка и оценка текстов с приложенным контекстом → особенно отзывы с фото, письма с вложениями, ответы с историей чата, когда решение должно зависеть только от текста. Если вы уже гоните сотни элементов через модель-судью и верите красивому проценту, проверьте это в первую очередь. НЕ подходит, если фото нужно для самого решения (например, жалоба на брак). Тогда делайте отдельный запрос со своей задачей, а не мешайте всё в один. Учтите и границы исследования: проверяли только разметку идиом на английском, режим рассуждений был выключен. Перенос на модерацию или тональность пока гипотеза.

Мини-рецепт

1. Собери выборку: 30–50 элементов, которые у вас реально приходят с лишним контекстом.
2. Прогон «чистый»: только текст, промпт «решай ТОЛЬКО по тексту». Сохрани метки.
3. Прогон «грязный»: тот же текст плюс картинка или прошлое сообщение. Метки сохрани отдельно.
4. Сравни по строкам: таблица на два столбца, считай, сколько меток поменялось. Среднюю точность не смотри.
5. Контроль (по желанию): подсунь другой лишний контекст. Если меняется столько же, значит, дело в самом присутствии.
6. Поставь порог заранее: например, не больше 5% изменений. Выше порога — убирай контекст из запроса.
7. Нужна картинка для решения? Вынеси её в отдельный запрос со своей задачей.

Примеры

[ПЛОХО] : Оцени отзыв. Игнорируй фото, оно не важно. и вера в то, что инструкция сработала.
[ХОРОШО] : Два прогона на 40 отзывах с маркетплейса. Первый: Ты размечаешь отзывы. Решай ТОЛЬКО по тексту. Как использовано выражение «огонь»: ПЕРЕНОСНОЕ (похвала, эмоция) или БУКВАЛЬНОЕ (что-то реально горит)? Отзыв: «Фен — огонь, за 2000 ₽ сушит как в салоне». Ответь одним словом. Второй: тот же текст плюс фото оплавленного фена. Потом сравниваешь метки по каждому отзыву. Если у 8 из 40 ответ другой, фото из этого запроса надо убрать, даже если общая точность осталась прежней. Шаблон для своей задачи: Ты размечаешь {что_размечаем}. Решай ТОЛЬКО по {источник_решения}. Категории: {категория_1} — {определение_1}; {категория_2} — {определение_2}. Элемент: «{текст_элемента}». Ответь одним словом.
Источник: It's Not What the Image Shows: Irrelevant Context Destabilises VLM Judges Without Informing Them
ArXiv ID: 2609.37863 | Сгенерировано: 2026-10-08 10:40

Проблемы LLM

ПроблемаСутьКак обойти
Лишний контекст раскачивает ответы, даже если написано «игнорируй»Модель оценивает или размечает текст. Рядом лежит то, что не нужно для решения: картинка, прошлое сообщение, подпись. В запросе стоит «решай только по тексту». Часть меток всё равно меняется, примерно каждая пятая. Фраза «игнорируй» — просто ещё одна строка текста. Она не отключает внимание к лишнему. Только ослабляет эффект. Общая точность при этом может не падать, потому что ошибки в обе стороны гасят друг друга. Нестабильность скрыта внутри среднегоНе клади в запрос то, что не нужно для решения. Если контекст нужен для другой цели, обработай его отдельным запросом со своей задачей. Не полагайся на «игнорируй» как на защиту

Методы

МетодСуть
Двойной прогон с поэлементным сравнением — видно скрытую нестабильностьПрогони 30–50 элементов без лишнего контекста. Метки A. Прогони те же элементы с контекстом. Метки B. Сравни A и B по каждому элементу, а не по общему проценту. Посчитай долю изменившихся меток. Задай порог заранее, например не больше 5%. Для проверки можно взять второй вид лишнего контекста и получить метки C. Если A→B и A→C меняются похоже, источник шума — само присутствие контекста. Почему работает: средняя точность не замечает, когда одни метки переворачиваются в одну сторону, а другие в обратную. Поэлементное сравнение это ловит. Когда применять: оценка или разметка с дополнительным контекстом (фото, история чата, метаданные). Также при смене модели или версии запроса. Когда не работает: нужен эталон правильных ответов, а не стабильность. Двойной прогон показывает только шум, а не правильность. Для одного-двух элементов выборка мала

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с