TL;DR
EVADE — метод, который заставляет модель проверять свой ответ по фотографии не через "перечитай себя ещё раз", а через сравнение двух разных снимков одной сцены: общего вида и увеличенного кропа важной детали. Модель сначала отвечает на вопрос по всей картинке и оценивает свою уверенность. Если уверенность низкая — модель сама указывает область, которая важна для ответа, эту область вырезают и увеличивают отдельной картинкой, и модель отвечает заново уже по ней. Если оба ответа совпали — модель доверяет результату. Если не совпали — либо смотрит на оба вида сразу и пытается разрешить противоречие, либо честно говорит "не уверен".
Главная находка: когда модель разбирает изображение (особенно мелкие детали — цифры в таблице, надписи на фото, элементы диаграммы), она систематически переоценивает свою уверенность. Просьба "перепроверь свой ответ" не спасает — модель просто смотрит на ту же самую картинку и тот же текст, и соглашается сама с собой. Авторы называют это "иллюзией верификации": проверка выглядит как проверка, а по факту это повторение первого вывода.
EVADE обходит это не текстом, а новыми визуальными данными. Второй ответ модель даёт не по той же картинке, а по увеличенному фрагменту — то есть она физически видит больше деталей, которых не было в первом кадре. Если два независимых наблюдения совпали — это настоящее доказательство, а не самообман.
Схема метода
ШАГ 1: Модель отвечает на вопрос по полному изображению + оценивает уверенность → ответ + число (0–100%)
ШАГ 2 (если уверенность низкая): Модель называет область изображения, важную для ответа → координаты / описание области
ШАГ 3: Область вырезают и увеличивают отдельным изображением, модель отвечает заново, глядя только на неё → второй ответ
ШАГ 4: Сравнение двух ответов →
совпали → принимаем ответ
не совпали → модель смотрит на оба вида сразу и решает, либо честно отвечает "не уверен"
Все шаги можно выполнить в одном диалоге, отправляя изображения последовательно.
Пример применения
Задача: Разбор скриншота таблицы с продажами в Excel/Google Sheets, где нужно точно назвать цифру из мелкой строки — например, выручку за март в отчёте для инвестора.
Промпт (шаг 1):
Вот скриншот таблицы с продажами за квартал [прикрепить изображение].
Ответь на вопрос: какая выручка в строке «Итого» за март?
Сначала дай ответ, потом укажи свою уверенность от 0 до 100%.
Если уверенность ниже 70% — скажи, какую именно область таблицы нужно
увеличить, чтобы ответить точно (например: "строка 12, столбец C").
Промпт (шаг 2, после того как вы вручную вырезали и увеличили эту область в Paint/Preview/на телефоне):
Вот увеличенный фрагмент этой же таблицы [прикрепить кроп].
Ответь на тот же вопрос ещё раз, глядя только на этот фрагмент.
Промпт (шаг 3):
Сравни свой первый и второй ответ.
Если они совпадают — дай финальный ответ с уверенностью.
Если не совпадают — посмотри на оба изображения одновременно
и разреши противоречие, либо честно скажи, что не можешь точно
определить цифру.
Результат: вы получите либо согласованный ответ с обоснованной уверенностью, либо честное признание модели, что цифра неразборчива — и тогда вы понимаете, что нужно свериться с оригиналом файла, а не доверять "красивому" ответу с первого раза.
Почему это работает
Модели переоценивают свою уверенность при разборе мелких деталей на изображениях, и просьба "проверь себя" не помогает — модель смотрит на ту же картинку и тот же вывод, поэтому почти всегда соглашается сама с собой.
При этом модели неплохо умеют указывать, куда смотреть — какая область картинки важна для ответа — даже без специального обучения. И отвечают точнее, когда важная деталь занимает больше места в кадре (крупнее = чётче видно).
EVADE соединяет эти два свойства: модель сама называет зону риска, вы физически даёте ей увеличенный фрагмент этой зоны (а не тот же текст), и ответ принимается только если два независимых наблюдения совпали.
Рычаги управления: - Порог уверенности для запуска проверки — для простых задач можно снизить требования и не тратить второй шаг. - Правило совпадения ответов — для открытых вопросов (не просто "да/нет") можно смягчить: считать совпадением смысловое сходство, а не точное слово в слово. - Отказ от ответа можно заменить на "дай диапазон значений" или "назови два варианта", если полный отказ неудобен для вашей задачи.
Шаблон промпта
Вот изображение: {описание изображения}.
Вопрос: {вопрос}.
Шаг 1. Ответь на вопрос по этому изображению.
Оцени уверенность от 0 до 100%.
Если уверенность ниже {порог}% — укажи, какую область изображения
нужно рассмотреть крупнее, чтобы ответить точно.
[После этого вырежьте и увеличьте указанную область и отправьте её
отдельным сообщением с промптом:]
Вот увеличенный фрагмент того же изображения.
Ответь на тот же вопрос {вопрос}, глядя только на этот фрагмент.
[Затем отправьте финальный промпт:]
Сравни свой первый и второй ответ.
Если они совпадают — дай финальный ответ и уверенность.
Если не совпадают — посмотри на оба изображения сразу и разреши
противоречие, либо честно скажи, что не можешь точно ответить.
🚀 Быстрый старт — вставь в чат:
Вот шаблон EVADE (проверка ответа по картинке через два разных взгляда).
Адаптируй под мою задачу: {твоя задача с изображением}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какое у вас изображение, какой вопрос по нему нужно проверить и что считать "совпадением ответов" — потому что от этого зависит, когда метод должен доверять ответу, а когда просить уточнение.
Ограничения
⚠️ Ложная локализация: если модель сама неверно определит важную область, зум не поможет — метод исправляет только "не видел деталь", но не "перепутал, куда смотреть".
⚠️ Зум работает как новые данные, не как "подумай внимательнее": исследование показало, что просьба "мысленно приблизиться" без реального увеличения картинки даёт слабый эффект — нужен физически более крупный и чёткий фрагмент, а не просто фокус внимания.
⚠️ Модель плохо использует зум для пересмотра сложных выводов: даже когда модель правильно нашла нужную область, 7-миллиардная модель не всегда умеет качественно изменить свой ответ на основе увеличенной детали — выигрыш метода в основном идёт от честного отказа при несовпадении, а не от того, что зум "исправляет" ошибки.
⚠️ Пороги подбирались на тестовых данных: в исследовании точки принятия решения (когда доверять, когда отказаться) калибровались заранее на отдельной выборке. В обычном чате точной калибровки нет — придётся выбирать порог интуитивно.
Ресурсы
EVADE: Evidence-Verified Agentic Diagnosis with Escape (2026). Mohaimenul Azam Khan Raiaan (Monash University), Nur Mohammad Fahad (Murdoch University). Тестировалось на Qwen2.5-VL-7B-Instruct, датасеты VQA-RAD, SLAKE, PathVQA.
