3,583 papers
arXiv:2607.24354 78 27 июля 2026 г. FREE

CMVF: как «показать» модели её же ошибки перед тем, как переписывать промпт

КЛЮЧЕВАЯ СУТЬ
Обнаружено: когда ИИ разбирает свою ошибку на задаче с картинкой, он смотрит только на текст — вопрос, свой ответ, правильный ответ. Саму картинку он второй раз не видит, хотя ошибся именно из-за неё. Метод CMVF позволяет находить настоящую визуальную причину провала — не разглядел бирку, спутал срез на снимке — и вшивать защиту от неё прямо в текстовый промпт. Фишка в том, что диагностика идёт без ответа: модель описывает что видит на фото, не зная правильный ли был вывод. Так описание не подгоняется под готовый результат — честная картина вместо оправдания задним числом.
Адаптировать под запрос

TL;DR

CMVF (Cross-Modal Visual Feedback) — техника оптимизации промптов для задач с картинками, где сначала «сильная» модель смотрит на изображения, где случились ошибки, описывает что на них видно, а потом эти описания превращаются в чек-лист, который вшивается в финальный текстовый промпт.

Когда мы просим ИИ разобрать свои ошибки на задачах с изображениями (распознать график, снимок МРТ, фото улицы), он смотрит только на текст: вопрос, свой неправильный ответ, правильный ответ. Картинку, из-за которой он ошибся, он не видит повторно — как учитель, который проверяет тест по ответам, не глядя в условие с рисунком. Поэтому ИИ может понять что он ответил неправильно, но не почему: не разглядел мелкую подпись на оси графика, спутал похожие срезы на снимке, понадеялся на общую логику вместо деталей на фото.

CMVF решает это в два шага: сначала отдельная «модель-диагност» смотрит именно на картинки с ошибками (без ответов, чтобы не подгонять объяснение под известный результат) и описывает что на них важного. Потом эти описания сжимаются в короткий список типичных слабых мест ("проверь мелкий текст", "не путай уровень срезов") — и этот список вшивается в обычный текстовый промпт. Картинка нужна только на этапе доработки промпта — при реальном использовании модель работает с готовым текстовым промптом, без лишних затрат.


🔬

Схема метода

ШАГ 1 (отдельный запрос): Прогнать модель на обучающих примерах → собрать вопросы, где она ответила неправильно

ШАГ 2 (отдельный запрос, для каждой ошибки): Показать "модели-диагносту" картинку + вопрос (БЕЗ ответа модели и БЕЗ правильного ответа) 
→ получить описание "что важного видно на этой картинке"

ШАГ 3 (один запрос): Собрать все описания из шага 2 + список ошибок (что ответила модель / что правильно) 
→ попросить найти повторяющиеся визуальные проблемы → получить компактный список закономерностей

ШАГ 4 (один запрос): Отдать модели старый промпт + список закономерностей из шага 3 
→ получить переписанный текстовый промпт с явными проверками ("сначала проверь ось Y", "уточни уровень срезов")

ШАГ 5: Повторить шаги 1-4 несколько раз (в исследовании — 20 итераций), каждый раз улучшая промпт

🚀

Пример применения

Задача: Вы настраиваете чат-бота для интернет-магазина одежды, который отвечает на вопросы клиентов по фото товара («какой это размер по факту», «это точно хлопок или синтетика», «есть ли дефект на этой фотке»). Бот регулярно путается — то не замечает бирку на фото, то не видит потёртость на джинсах.

Промпт (для этапа диагностики — шаг 2 из схемы):

Вот фотография товара и вопрос клиента: "{вопрос}".

Не сообщай мне никакой оценки или ответа — просто опиши, 
что важного для ответа на этот вопрос видно на изображении: 
детали, надписи, дефекты, ракурс, освещение. Опиши то, что 
реально можно разглядеть на фото, без домыслов.

Промпт (для этапа сборки закономерностей — шаг 3 из схемы):

Вот список случаев, где бот ответил неправильно на вопросы 
по фото товара. Для каждого случая: вопрос клиента, ответ бота, 
правильный ответ, и описание того, что видно на фото ({описания из шага 2}).

Найди повторяющиеся визуальные проблемы, из-за которых бот 
ошибается (например: "не замечает мелкие надписи на бирках", 
"путает цвет при плохом освещении на фото"). 
Сформулируй их как короткий список правил-проверок.

Результат: После нескольких циклов получится финальный текстовый промпт для бота — без картинок внутри, просто с явными инструкциями вроде «перед ответом проверь бирку в углу кадра», «уточни, не искажён ли цвет из-за освещения». Этот промпт дальше работает как обычный, без доп. затрат на анализ фото при каждом запросе.


🧠

Почему это работает

Модель, которая только читает текст ошибки («ответила неправильно на вопрос про размер»), не может понять визуальную причину провала — картинка для неё как чёрный ящик, который она уже «забыла» после первого ответа. Попросить её просто «подумать получше» не помогает: она рассуждает на пустом месте, без новых данных.

Но модель отлично умеет описывать что видит на картинке, если её попросить напрямую — это её сильная сторона. И отлично умеет находить общие паттерны в большом списке текстовых описаний.

CMVF просто соединяет эти две сильные стороны последовательно: сначала «смотрим», потом «обобщаем», и только потом «переписываем инструкцию». Ключевой трюк — на этапе «смотрим» модель не знает правильный ответ, поэтому не подгоняет описание под готовый вывод, а честно фиксирует что видит.

Рычаги управления: - Число ошибок для анализа (в исследовании — до 30 за раз) → для простой задачи хватит 5-10, экономия времени - Сокрытие правильного ответа на этапе описания картинки → если убрать это условие, описания станут менее честными, "подогнанными" - Число итераций (в оригинале 20) → для простой задачи 3-5 циклов может быть достаточно - Кто "диагностирует" → можно взять более сильную модель для диагностики, а слабую — для финального использования (в исследовании так и делали)


📋

Шаблон промпта

Этап 1 — диагностика (для каждого случая ошибки, отдельно):

Вот изображение и вопрос: "{вопрос}".

Не давай оценку и не сообщай правильный ли был ответ. 
Просто опиши, что важного для ответа на этот вопрос видно 
на изображении — конкретные детали, а не общие впечатления.

Этап 2 — сборка закономерностей (один раз, после накопления описаний):

Вот список ошибок модели на задаче "{задача}". Для каждой ошибки: 
вопрос, неправильный ответ модели, правильный ответ, 
и описание того, что видно на изображении:

{список: вопрос — ответ модели — правильный ответ — описание картинки}

Найди повторяющиеся визуальные причины, из-за которых модель 
ошибается. Сформулируй их как короткий список конкретных 
проверок, которые нужно делать перед ответом.

Этап 3 — переписывание промпта:

Вот текущий промпт для модели: "{текущий_промпт}"

Вот список визуальных проблем, которые нужно устранить: 
{список закономерностей из этапа 2}

Перепиши промпт так, чтобы модель явно проверяла эти моменты 
перед тем как отвечать. Промпт должен остаться текстовым — 
без картинок внутри.

🚀 Быстрый старт — вставь в чат:

Вот шаблон CMVF для улучшения промпта на задачах с изображениями. 
Адаптируй под мою задачу: {твоя задача}. 
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит какие именно ошибки у тебя случаются и есть ли примеры неудачных ответов с картинками — потому что без конкретных случаев ошибок метод не сможет найти закономерности. Она возьмёт трёхэтапную структуру (диагностика → сборка → переписывание) и адаптирует под твою задачу.


⚠️

Ограничения

⚠️ Нужны примеры реальных ошибок: метод работает только если у вас накопился набор случаев, где ИИ ответил неправильно на вопрос по картинке. Без базы ошибок — нечего анализировать.

⚠️ Не помогает, если ошибки не визуальные: если модель путается в логике или терминологии, а не в том, что видит на фото — метод почти не даст прироста. Работает лучше всего там, где ошибка — это буквально "не разглядел деталь".

⚠️ Нужна более сильная модель для диагностики: в исследовании для анализа картинок использовали более мощную модель, чем та, для которой оптимизировали промпт. С одной и той же слабой моделью для обоих шагов эффект может быть слабее.

⚠️ Требует несколько циклов: одного прохода "посмотри-обобщи-перепиши" может не хватить — в исследовании использовали 20 итераций для устойчивого результата.


🔗

Ресурсы

Are Prompt Optimizers Blind? Cross-Modal Visual Feedback for Automatic Prompt Optimization — Haoyue Liu, Xiaoyu Ma, Ye Chen, Yuexian Zou, Xiaoying Tang (The Chinese University of Hong Kong Shenzhen, Xi'an Jiaotong University, Peking University). Метод сравнивался с ProTeGi, OPRO, DSPy, TextGrad, REVOLVE на 12 наборах данных VQA и 4 моделях (Qwen, LLaVA, Phi-3.5-vision).


📋 Дайджест исследования

Ключевая суть

Обнаружено: когда ИИ разбирает свою ошибку на задаче с картинкой, он смотрит только на текст — вопрос, свой ответ, правильный ответ. Саму картинку он второй раз не видит, хотя ошибся именно из-за неё. Метод CMVF позволяет находить настоящую визуальную причину провала — не разглядел бирку, спутал срез на снимке — и вшивать защиту от неё прямо в текстовый промпт. Фишка в том, что диагностика идёт без ответа: модель описывает что видит на фото, не зная правильный ли был вывод. Так описание не подгоняется под готовый результат — честная картина вместо оправдания задним числом.

Принцип работы

Три отдельных шага, никакой каши в одном запросе. Шаг первый — смотрим: модель-диагност описывает картинку без ответа. Шаг второй — обобщаем: ищем повторяющиеся визуальные проблемы в списке ошибок. Шаг третий — переписываем: вшиваем найденные проверки в обычный текстовый промпт. Картинка нужна только на этапе доработки — готовый промпт работает без неё, никаких лишних затрат при реальном использовании.

Почему работает

Модель, которая видит только текст ошибки, не может понять визуальную причину провала — картинка для неё чёрный ящик, забытый после первого ответа. Попросить её 'подумать получше' бесполезно: она рассуждает на пустом месте, без новых данных. Но описывать что видно на фото и находить закономерности в текстах — это её сильная сторона. Ключевой момент — модель не знает правильный ответ на этапе описания, поэтому фиксирует то что реально видит, а не подгоняет объяснение под известный вывод. Метод проверили на 12 наборах данных, 4 моделях, с 20 циклами улучшения промпта.

Когда применять

Задачи с картинками → анализ фото товаров, медицинских снимков, графиков, скриншотов, особенно когда ИИ регулярно спотыкается на одном и том же — не замечает деталь, путает похожие элементы. НЕ подходит, если ошибки логические или терминологические: метод чинит только то, что 'не разглядел', а не то, что 'не понял'.

Мини-рецепт

1. Собери провалы: найди 10-30 случаев, где ИИ ответил неправильно по картинке.
2. Спроси 'что видно': покажи картинку и вопрос отдельной модели, БЕЗ ответов — пусть просто опишет детали, надписи, дефекты.
3. Найди повтор: отдай список описаний плюс ошибки модели — пусть найдёт общие визуальные проблемы.
4. Перепиши промпт: вставь найденные проверки в текст промпта явными пунктами.
5. Повтори 3-5 раз: для простой задачи цикл короче, чем 20 итераций из исследования — но один проход почти никогда не хватает.

Примеры

[ПЛОХО] : Почему ты ответил неправильно на вопрос про размер одежды на фото? Подумай ещё раз и объясни свою ошибку.
[ХОРОШО] : Вот фото товара и вопрос клиента: "Это точно хлопок?". Не говори правильный ли был ответ — просто опиши, что видно на бирке, ткани, швах. Собери так 10-15 описаний по разным провалам, отдай их отдельным запросом с вопросом "какая общая визуальная проблема повторяется?" — и только потом переписывай сам промпт.
Источник: Are Prompt Optimizers Blind? Cross-Modal Visual Feedback for Automatic Prompt Optimization
ArXiv ID: 2607.24354 | Сгенерировано: 2026-07-28 06:32

Проблемы LLM

ПроблемаСутьКак обойти
Модель не видит картинку повторно при разборе своей ошибкиПросишь ИИ объяснить, почему он ошибся на задаче с картинкой. Он получает только текст: вопрос, свой ответ, правильный ответ. Саму картинку ему не показывают снова. Он рассуждает "на пустом месте" — не может понять визуальную причину провала. Может сказать "ответил неверно", но не может сказать "не разглядел подпись на оси"Покажи модели картинку отдельным запросом. Без её старого ответа, без правильного ответа — только вопрос и картинка. Попроси описать что видно. Потом отдельным шагом ищи закономерности в этих описаниях

Методы

МетодСуть
Раздельная визуальная диагностика перед переписыванием промптаТри отдельных шага, каждый — свой запрос. Шаг 1: покажи модели картинку с ошибкой + вопрос, попроси описать что видно — без ответов, без оценки. Шаг 2: собери несколько таких описаний вместе с парами "ответ модели / правильный ответ", попроси найти повторяющиеся визуальные причины ошибок. Шаг 3: отдай старый промпт + найденные закономерности, попроси переписать промпт с явными проверками. Почему работает: разделение "что вижу" и "что из этого следует" не даёт модели подгонять объяснение под готовый вывод. Когда да: есть накопленная база ошибок (5+ случаев), ошибки визуальные — модель реально не разглядела деталь. Когда нет: ошибка одна и та же логическая/терминологическая, без картинки; примеров ошибок нет
📖 Простыми словами

ArePromptOptimizers Blind? Cross-Modal Visual Feedback for AutomaticPromptOptimization

arXiv: 2607.24354

Оптимизаторы промптов сейчас работают как слепые котята: они пытаются исправить ошибки в задачах с картинками, вообще не видя самих картинок. Когда нейронка лажает и не может отличить хлопок от синтетики по фото, алгоритм оптимизации получает на вход только сухой текст ошибки. Это фундаментальный баг: модель пытается починить то, чего не видит, опираясь на галлюцинации о том, что там могло пойти не так. В итоге вместо реального улучшения промпта мы получаем бессмысленные советы «стараться лучше», которые никак не касаются визуальных деталей.

Это как если бы ты пытался научить друга чинить машину по телефону, при этом сам никогда не открывал капот и не видел, что там вообще дымится. Ты можешь зачитать ему всю инструкцию по эксплуатации, но толку будет ноль, если ты не знаешь, что там перебит конкретный синий провод. CMVF (Cross-Modal Visual Feedback) — это когда ты наконец-то открываешь глаза, делаешь скриншот поломки и превращаешь его в четкую инструкцию. Формально ты всё еще пишешь текст, но этот текст пропитан знанием о реальной картинке.

Суть метода в том, что «сильная» модель-зритель внимательно изучает изображения, на которых бот облажался, и выписывает конкретные приметы: где висит бирка, как выглядит текстура ткани или под каким углом снят дефект. Эти наблюдения превращаются в структурированный чек-лист, который вшивается в финальный текстовый промпт. Теперь бот не просто гадает, а идет по списку: «проверь правый нижний угол на наличие этикетки» или «ищи блики, которые похожи на потертости». Это превращает абстрактное «анализируй фото» в алгоритм визуального поиска.

Хотя метод тестировали на классификации картинок, принцип визуальной обратной связи универсален для любого бизнеса, где AI работает с глазами. Это актуально для модерации контента, контроля качества на производстве по камерам или даже для медицинских ассистентов. Если модель стабильно пропускает брак на деталях, бесполезно менять формулировки «будь внимателен» — нужно внедрять CMVF, чтобы промпт содержал описание конкретных визуальных ловушек. Текст без контекста картинки — это гадание на кофейной гуще.

Главный вывод: автоматическая оптимизация промптов без визуального фидбека — это тупик. Чтобы AI перестал тупить на сложных изображениях, нужно перестать кормить его только логами ошибок и дать ему глаза в виде чек-листов. Либо ты учишь модель видеть конкретные детали через текстовые подсказки, либо она продолжит выдавать уверенную чушь. 6 из 10 ошибок исправляются простым указанием на то, куда именно смотреть на картинке.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с