3,583 papers
arXiv:2608.09145 76 10 авг. 2026 г. FREE

Thermal-Grounded Feedback: как проверить не ответ модели, а её обоснование

КЛЮЧЕВАЯ СУТЬ
Обнаружено: убери у модели инфракрасное изображение, подставь обычную картинку — точность ответов почти не падает, а обоснование рушится полностью. Модель начинает ссылаться на форму и отражения света вместо теплового сигнала — и чем умнее модель, тем чаще она это делает. TGF (Thermal-Grounded Feedback) позволяет проверить и исправить именно обоснование ответа, без изменения самого вывода. Судья ставит диагноз по 5 осям, а 4 узких агента чинят каждый свой тип ошибки — тепловую обоснованность, привязку к объекту, подмену источника, завышенную уверенность.
Адаптировать под запрос

TL;DR

Модель может дать правильный ответ, но обосновать его неправильными причинами — и обычная проверка "верно/неверно" это не заметит. Исследователи разделили оценку на два слоя: правильность ответа и обоснованность объяснения — и показали, что это разные вещи, которые не совпадают даже у сильных моделей.

Главная находка: когда модели дали инфракрасное изображение, треть правильных ответов держалась на слабых доказательствах — модель ссылалась на форму объекта или отражения света, а не на тепловой сигнал, хотя вопрос был именно про тепло. Хуже: если убрать оригинальное инфракрасное изображение и подсунуть модели "перевод" в обычную картинку, точность ответов почти не падает, а вот обоснованность рушится — модель начинает объяснять ответ visible-light-подсказками вместо тепловых. Причём чем умнее модель, тем сильнее она "переключается" на подмену источника — и это происходит только тогда, когда оригинал недоступен.

Решение — Thermal-Grounded Feedback (TGF): цикл из нескольких ролей-агентов, которые проверяют и переписывают только объяснение, не трогая уже данный ответ. Судья диагностирует дефект по нескольким осям, четыре специализированных агента дают точечный фидбек, ревизор переписывает текст, селектор выбирает лучшую версию.


🔬

Схема метода

ШАГ 1 (Judge-агент, один запрос): оценить существующий ответ+объяснение 
  → диагноз по 5 осям: тепловая обоснованность, привязка доказательств к региону/объекту, 
    использование "чужих" визуальных подсказок, калибровка уверенности, итоговая оценка

ШАГ 2 (4 Feedback-агента, параллельно в том же запросе): каждый агент даёт узкую правку
  → Агент-1 (тепло): "добавь тепловое доказательство"
  → Агент-2 (привязка): "укажи конкретный объект, регион, тепловой признак"
  → Агент-3 (карантин): "убери визуальные подсказки, не относящиеся к теплу"
  → Агент-4 (уверенность): "снизь уверенность, если тепловых доказательств мало"

ШАГ 3 (Reviser, тот же или следующий запрос): переписать объяснение с учётом всех 4 правок
  → ответ остаётся ТЕМ ЖЕ, меняется только текст объяснения

ШАГ 4 (Selector): сравнить новую версию со старой по иерархии критериев, 
  выбрать лучшую, повторить цикл если критерии не пройдены

Все шаги можно выполнить в одном длинном промпте — модель симулирует роли последовательно внутри одного ответа.


🚀

Пример применения

Задача: Вы просите Claude или ChatGPT оценить питч-дек стартапа для инвестора — стоит вкладываться или нет. Модель отвечает "не инвестировать", но вам важно понять: обоснование реальное (плохая unit-экономика, нет повторных покупок) или общие фразы ("рынок конкурентный", "команда неопытная" — которые можно приклеить к любому стартапу).

Промпт:

Вот мой предыдущий ответ на вопрос "Стоит ли инвестировать в этот стартап?":

Ответ: Не инвестировать
Обоснование: [вставь текст обоснования, которое дала модель ранее]

Теперь разбери это обоснование как многоагентная проверка:

1. СУДЬЯ: оцени обоснование по 4 параметрам (0-3 балла каждый):
   - Опирается ли вывод на конкретные цифры из питч-дека (LTV, CAC, retention), 
     а не на общие фразы?
   - Указан ли конкретный раздел презентации, на который ссылается вывод?
   - Есть ли в обосновании "общие штампы", которые не привязаны к данным этого стартапа?
   - Калибрована ли уверенность — не завышена ли она при слабых данных?

2. ЧЕТЫРЕ АГЕНТА ПРАВЯТ обоснование, каждый со своей задачей:
   - Агент "Цифры": добавь конкретные метрики из презентации в поддержку вывода
   - Агент "Привязка": укажи точный слайд/раздел, откуда взят каждый аргумент
   - Агент "Карантин штампов": убери общие фразы, не подтверждённые данными
   - Агент "Уверенность": скорректируй уверенность вывода под реальную силу доказательств

3. РЕВИЗОР: перепиши обоснование с учётом правок всех агентов. Вывод (инвестировать/нет) НЕ МЕНЯЙ — только обоснование.

4. Покажи финальную версию обоснования.

Результат: Модель выдаст пошаговый разбор — сначала оценку старого обоснования по 4 параметрам, потом реплики каждого из 4 "агентов", затем переписанный текст обоснования, где общие фразы заменены на конкретные цифры и ссылки на разделы презентации. Вывод (инвестировать/не инвестировать) останется прежним — изменится только то, ЧЕМ он подтверждён.


🧠

Почему это работает

Модели любят давать красиво звучащее объяснение, даже если оно не связано с реальными фактами задачи. Это происходит потому что модель хорошо предсказывает "как звучит уверенный ответ", но не всегда проверяет, действительно ли она опиралась на нужный источник — особенно если есть более простой, привычный источник-заменитель (визуальная картинка вместо теплового сигнала, общие бизнес-штампы вместо цифр из документа).

Сильная сторона LLM — она умеет критиковать текст по конкретному чек-листу, если этот чек-лист явно прописан. Одна общая инструкция "объясни лучше" смешивает разные типы ошибок и модель чинит что-то одно, забывая остальное.

Метод разбивает критику на узкие роли — каждая ловит свой тип дефекта (нехватка доказательств, неправильная привязка, подмена источника, лишняя уверенность). Это заставляет модель проверять каждый аспект отдельно, а не одной размытой попыткой.

Рычаги управления: - Число feedback-агентов — можно урезать до 2 (например, "точность данных" + "калибровка уверенности"), если задача проще - Критерий отбора у Selector — замени иерархию критериев ("сначала точность, потом привязка...") на свой порядок приоритетов - "Ответ не меняй" — можно убрать это условие, если хочешь, чтобы модель пересмотрела и сам вывод, а не только обоснование


📋

Шаблон промпта

Вот мой предыдущий ответ на задачу: {задача}

Ответ: {итоговый_вывод}
Обоснование: {текст_обоснования}

Разбери это как многоагентную проверку обоснования (сам вывод не трогай):

1. СУДЬЯ: оцени обоснование по параметрам (0-3 балла):
   - {критерий_1, например: опирается на конкретные факты, не на общие фразы}
   - {критерий_2, например: указан точный источник/раздел}
   - {критерий_3, например: нет ли подмены источника доказательств}
   - {критерий_4, например: адекватна ли уверенность вывода}

2. АГЕНТЫ правят обоснование, каждый со своей задачей:
   - Агент "{название_1}": {что исправляет}
   - Агент "{название_2}": {что исправляет}
   - Агент "{название_3}": {что исправляет}
   - Агент "{название_4}": {что исправляет}

3. РЕВИЗОР: перепиши обоснование с учётом правок. Вывод "{итоговый_вывод}" НЕ МЕНЯЙ.

4. Покажи финальную версию.

Что подставлять: {задача} — исходный вопрос, {итоговый_вывод} и {текст_обоснования} — то, что модель ответила раньше, {критерий_N} и агенты — под конкретный тип ошибок, которые вас волнуют (фактчекинг, привязка к источнику, штампы, уверенность).

🚀 Быстрый старт — вставь в чат:

Вот шаблон многоагентной проверки обоснования ответа. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какие именно критерии обоснованности важны для вашей задачи и какие типы ошибок (общие фразы, подмена источника, завышенная уверенность) вы хотите ловить — потому что без этого агенты будут проверять что-то абстрактное, а не вашу конкретную боль.


⚠️

Ограничения

⚠️ Метод не меняет сам вывод: если ответ модели неправильный по существу, TGF это не исправит — он чинит только обоснование при уже зафиксированном ответе.

⚠️ Нужен эталон "правильного" источника доказательств: метод работает, когда есть чёткое понятие "какой источник валиден" (тепловой сигнал, а не картинка). Если у вашей задачи нет такого чёткого разделения источников — критерии судьи будет сложно сформулировать.

⚠️ Требует несколько раундов диалога: в оригинале это цикл с повторными проверками, что означает несколько обменов с моделью, а не один ответ с первого раза.


🔍

Как исследовали

Исследователи взяли 680 вопросов по инфракрасным изображениям и прогнали через 11 мультимодальных моделей (от Gemini и GPT до маленьких открытых моделей), под 5 разными вариантами входных данных — от "только инфракрасное изображение" до "только перевод в обычную картинку без оригинала". Оценивали не только правильность ответа, но и отдельно — обоснованность объяснения, для чего создали "судью" из двух LLM (GPT и Gemini), чью работу дополнительно проверили на 48 примерах, размеченных людьми — совпадение оказалось высоким.

Главный неожиданный результат: чем умнее модель, тем сильнее она "предаёт" тепловые данные, если оригинал недоступен — сильные модели охотнее подменяют доказательства на visible-light-подсказки. Но если оригинал остаётся доступен рядом с переводом — эффект исчезает полностью. Это значит, что дело не в самой RGB-подсказке, а именно в подмене источника данных.

Для проверки метода TGF взяли локальную выборку из 200 примеров на 4 моделях — метод поднял долю "правильный ответ + обоснованное объяснение" (F@C) заметно, при этом точность ответов не изменилась, а количество ошибок парсинга упало почти втрое.


📋 Дайджест исследования

Ключевая суть

Обнаружено: убери у модели инфракрасное изображение, подставь обычную картинку — точность ответов почти не падает, а обоснование рушится полностью. Модель начинает ссылаться на форму и отражения света вместо теплового сигнала — и чем умнее модель, тем чаще она это делает. TGF (Thermal-Grounded Feedback) позволяет проверить и исправить именно обоснование ответа, без изменения самого вывода. Судья ставит диагноз по 5 осям, а 4 узких агента чинят каждый свой тип ошибки — тепловую обоснованность, привязку к объекту, подмену источника, завышенную уверенность.

Принцип работы

Правило простое: не трогай ответ, чини только объяснение. Судья работает как ОТК на заводе — не чинит деталь, только ставит бирку "брак по параметру Х". Дальше 4 узких мастера-агента: один добавляет тепловое доказательство, второй привязывает его к конкретному объекту, третий вычищает визуальные подсказки не про тепло, четвёртый сбивает завышенную уверенность. Каждый агент видит только один срез проблемы — и поэтому не путает задачи. Ревизор собирает все правки в один текст, Селектор сверяет новую версию со старой.

Почему работает

Модель хорошо умеет звучать уверенно, но не всегда проверяет — от какого именно источника взят её вывод. Если рядом есть простая замена (обычная картинка вместо тепловой карты, общие фразы вместо цифр) — модель хватается за неё, потому что так проще. Треть правильных ответов в тесте держалась именно на таких слабых доказательствах — форма объекта вместо теплового сигнала, хотя вопрос был про тепло. Разбивка критики на узкие роли заставляет модель проверять каждый тип ошибки отдельно — одна общая инструкция "объясни лучше" смешивает всё, и модель чинит что-то одно, забывая остальное.

Когда применять

Мультимодальные модели с изображениями (тепловые снимки, медицинские сканы, спутниковые данные) → для задач, где важно ЧЕМ модель обосновала вывод, а не только правильный ли он, особенно когда есть риск подмены источника доказательств. Не подходит, если у задачи нет чёткого разделения "валидный источник против заменителя" — тогда судье нечем мерить.

Мини-рецепт

1. Зафиксируй ответ: возьми уже данный моделью вывод — его трогать не будем.
2. Опиши критерии судье: 4-5 параметров для проверки обоснования (опора на факты, привязка к источнику, отсутствие подмены, адекватность уверенности).
3. Назначь узких агентов: каждому свой тип правки — не смешивай задачи в одну инструкцию.
4. Ревизор переписывает: только текст обоснования, вывод остаётся прежним.
5. Сравни версии: выбери ту, что лучше проходит критерии судьи, повтори цикл если нужно.

Примеры

[ПЛОХО] : Проверь, правильно ли ты объяснил свой предыдущий ответ про инвестиции
[ХОРОШО] : Вот мой ответ "не инвестировать" и обоснование [текст]. Разбери как судья по 4 параметрам (опора на цифры, привязка к слайду, отсутствие штампов, адекватность уверенности), затем 4 агента правят каждый свой пункт, ревизор переписывает обоснование — вывод не менять.
Источник: Right Answer, Wrong Heat: Explanation-Aware Evaluation and Thermal-Grounded Feedback for MLLMs on Infrared Images
ArXiv ID: 2608.09145 | Сгенерировано: 2026-08-11 05:44

Проблемы LLM

ПроблемаСутьКак обойти
Правильный ответ держится на неправильных доказательствахМодель отвечает верно, но объясняет ответ не тем, чем нужно. Например, вопрос про тепло — а объяснение про форму объекта. Обычная проверка "верно/неверно" эту подмену не видит. Ответ засчитан как правильный, хотя логика ошибочнаПроси модель отдельно оценить обоснование: "укажи, на какой именно тип доказательства ты опираешься — {нужный источник}. Если используешь другой признак — отметь это явно"
Точность ответа скрывает провал обоснования при потере исходных данныхУбираешь модели доступ к нужному источнику (оригинальный файл, точные цифры, первичный документ) и даёшь замену (пересказ, скриншот, выжимку). Ответ остаётся почти таким же верным. Но объяснение начинает опираться на признаки из замены, а не из настоящего источника. Внешне всё выглядит нормально — точность не упалаПроверяй обоснование отдельно от ответа: "объясни, ссылаясь только на {конкретный тип данных}. Если такого доказательства нет — скажи прямо, что не хватает данных, а не подменяй его другим признаком"

Методы

МетодСуть
Многоагентная проверка обоснования по узким ролямНе проси модель "объясни лучше" — это смешивает разные типы ошибок и правится что-то одно. Разбей критику на роли: 1) Судья — оценивает старое обоснование по 3-5 конкретным осям (0-3 балла каждая: опора на нужный факт, привязка к конкретному месту/объекту, отсутствие "чужих" подсказок, калибровка уверенности). 2) Отдельные агенты — каждый чинит только свою ось (один добавляет нужное доказательство, другой убирает лишние подсказки, третий калибрует уверенность). 3) Ревизор — переписывает текст обоснования с учётом всех правок, сам вывод не трогает. 4) Селектор — сравнивает старую и новую версию, выбирает лучшую. Судья: оцени по осям X,Y,Z Агенты: каждый чинит свою ось Ревизор: перепиши, вывод не менять Селектор: выбери лучшее. Работает, потому что узкая роль ловит один конкретный дефект, а не пытается исправить всё сразу размытой инструкцией. Применяй когда: нужно проверить не только ЧТО ответила модель, но и ЧЕМ она это обосновала (фактчекинг, оценка инвестиций, диагностика, юридический анализ). Не работает: если у задачи нет чёткого понятия "правильный источник доказательства" — тогда оси для судьи сформулировать нечем

Тезисы

ТезисКомментарий
Более сильная модель охотнее заменяет недоступный источник доказательств похожим, но невернымМодель обучена звучать убедительно, а не проверять источник факта. Когда нужного доказательства нет, она ищет замену среди того, что доступно — и чем мощнее модель, тем убедительнее получается подставное объяснение. Это происходит только когда настоящий источник недоступен — при его наличии подмены не возникает. Применяй: если убираешь модели доступ к первичным данным, явно проверяй потом — "какой конкретно факт подтверждает твой вывод? Есть он в предоставленных данных?"
📖 Простыми словами

Right Answer, Wrong Heat: Explanation-Aware Evaluation and Thermal-Grounded Feedback for MLLMs on Infrared Images

arXiv: 2608.09145

Современные мультимодальные нейронки — это виртуозные лжецы, которые научились угадывать правильные ответы, не понимая сути происходящего. Проблема в том, что мы привыкли оценивать их по бинарной логике: ответила модель «да» или «нет». Но исследователи копнули глубже и выяснили, что правильный ответ часто базируется на галлюциногенных аргументах. Модель может верно опознать объект на тепловизоре, но при этом смотреть вообще не на тепловой след, а на случайные пиксели фона. Это фундаментальный баг: нейронка просто имитирует уверенный тон, подтягивая под ответ любые правдоподобные слова, которые есть в её базе.

Это как если бы ты пришёл к врачу с переломом, а он, едва взглянув на тебя, сказал: «У вас сломана нога». Ты радуешься точности диагноза, но потом выясняется, что врач сделал такой вывод, потому что у тебя шнурки развязаны. Формально он прав — нога действительно сломана, но метод диагностики — полная херня. В следующий раз, когда шнурки будут завязаны, он пропустит даже открытый перелом. В этом и заключается облом: мы доверяем экспертности там, где сработала обычная статистическая удача.

Чтобы вскрыть этот обман, ввели метод двухслойной оценки. Теперь проверяют не только финальный результат, но и то, насколько объяснение коррелирует с реальностью — в данном случае с тепловыми данными. Выяснилось, что даже топовые модели часто выдают правильный ответ при ложном обосновании. Они используют «костыли» — общие фразы и визуальные шаблоны, которые звучат убедительно, но по факту являются пустышкой. Если модель говорит, что на картинке человек, потому что видит «характерное тепловое излучение», а на деле смотрит на дерево — это дисквалификация, какой бы точный ответ она ни дала.

Хотя исследование гоняли на инфракрасных изображениях, этот принцип универсален для любого AI-анализа. Будь то разбор юридического договора, медицинский диагноз или оценка бизнес-плана — модель всегда будет пытаться срезать углы. Она подсунет тебе стандартные штампы про «риски» и «перспективы», потому что так звучит любой экспертный текст, а не потому, что она реально нашла дыру в твоих расчётах. SEO-логика ответов проникает в глубокую аналитику, и это огромная проблема для безопасности.

Короче: если нейронка выдала верный результат, это ещё не значит, что она не тупая. Нужно внедрять Explanation-Aware Evaluation — проверку обоснованности, иначе мы рискуем построить критически важные системы на фундаменте из случайных совпадений. Хватит радоваться правильным буквам на экране, пора смотреть, на что именно «смотрит» модель, когда принимает решение. Без этого любая проверка — это просто игра в угадайку, где цена ошибки может быть фатальной.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с