3,583 papers
arXiv:2610.04777 71 3 окт. 2026 г. FREE

ARISE: пятишаговый воркфлоу, который заставляет модель описывать картинку через проверяемые гипотезы вместо ответа «на глаз»

КЛЮЧЕВАЯ СУТЬ
Обнаружено: на тонких различиях модель не смотрит на детали, а отвечает «по общему впечатлению». Отсюда вечное «похоже на косметический ремонт, но возможно евро». Метод ARISE позволяет классифицировать изображения с близкими классами и получать обоснованный ответ: класс, гипотеза и признаки, которые модель реально увидела. Фишка: знание о задаче лежит не в голове модели, а в списке проверяемых гипотез «признак → класс». Его собирают из подсказок эксперта и размеченных примеров, потом чистят от противоречий. Модель перестаёт гадать и начинает опираться на конкретные наблюдения. Точность растёт на всех протестированных моделях, сильнее всего на самой сложной задаче и у самых слабых моделей.
Адаптировать под запрос
⚡

TL;DR

ARISE — это цепочка из пяти запросов к модели, где каждый шаг оставляет проверяемый «след». Сначала модель формулирует гипотезы вида «признак → класс». Потом по одному разбирает размеченные примеры и записывает только то, что реально видно. Затем переписывает гипотезы с учётом увиденного. После этого гипотезы переводятся в логические правила, и решатель (программа Z3) ищет противоречия. Только потом модель классифицирует новое изображение, называя гипотезу, на которую опирается.

Главная находка: на тонких различиях модель «плывёт». Если спросить в лоб, она колеблется между трактовками и выдаёт уклончивое описание, поэтому на многоклассовой задаче часто почти угадывает. Причина простая: ей не дали рамки, на какие признаки смотреть и как они связаны с классами, и она отвечает «по общему впечатлению». В ARISE та же модель опирается на конкретные наблюдения, и точность растёт на всех протестированных моделях. Сильнее всего она растёт на самой сложной задаче и у самых слабых моделей.

Суть метода. Знание о задаче хранится не в весах модели, а в списке проверяемых гипотез. Его строят из подсказок экспертов и из размеченных примеров, потом чистят от противоречий. Каждый шаг оценивается отдельно, поэтому видно, где рассуждение ломается: хорошие промежуточные шаги ещё не гарантируют верный итог.

🔬

Схема метода

ШАГ 1 (S1): подсказки экспертов + классы → 5–10 кратких проверяемых гипотез «признак → класс»
ШАГ 2 (S2): по ОДНОМУ размеченному примеру за раз → список наблюдаемых признаков
            (только из заранее заданного словаря) → копится «память наблюдений»
ШАГ 3 (S3): гипотезы + память наблюдений → уточнённые гипотезы
ШАГ 4 (S4): гипотезы → логические правила → решатель Z3 ищет противоречия
            → если нашёл, модель чинит конфликтующие гипотезы
ШАГ 5 (S5): проверенные гипотезы + несколько примеров → класс нового изображения
            + какая гипотеза использована

Это отдельные запросы, шаги 2–4 идут по цепочке, состояние передаётся между ними. Шаг 4 в оригинале требует кода (Z3).

🚀

Пример применения

Задача: Вы руководите модерацией в сервисе недвижимости вроде Циан или Авито. Нужно по фото квартиры определять состояние ремонта: «без ремонта», «косметический», «евроремонт», «дизайнерский». Если спросить ChatGPT в лоб, он хеджирует: «похоже на косметический, но возможно евро». У вас есть 20–30 размеченных риелтором фото и его подсказки, на что смотреть.

Промпт (шаг 1, гипотезы):

<Задача>
Классифицировать состояние ремонта квартиры по фотографии комнаты.
Классы: без ремонта / косметический / евроремонт / дизайнерский.
Вывод: один класс и гипотеза, на которой он основан.


<Подсказки_экспертов>
Риелтор подсказывает: смотреть на стыки обоев и швы плитки, ровность потолка и
наличие натяжного или многоуровневого потолка, тип пола (линолеум, ламинат,
паркет, инженерная доска), скрытые плинтусы и встроенный свет, состояние розеток
и дверей, наличие авторских решений (нестандартные материалы, акцентные стены).


Сформулируй 8 кратких проверяемых гипотез вида «наблюдаемый признак → класс».
Не делай утверждений, которые нельзя проверить по фото.

Дальше по цепочке: шаг 2 запускаете по каждому размеченному фото отдельно (картинка + метка + гипотезы + список разрешённых признаков). Шаг 3 получает все накопленные наблюдения и переписывает гипотезы. Шаг 5 получает итоговые гипотезы и классифицирует новое фото.

Результат: После шага 1 будет список гипотез. После шага 2 для каждого примера придёт короткий список признаков из словаря («ламинат», «линолеум», «натяжной потолок», «следы протечек»). После шага 3 будет переработанный набор гипотез, где лишнее убрано, а недостающее добавлено. На шаге 5 модель назовёт класс, гипотезу и признаки, которые увидела. Вместо «возможно, косметический» вы получаете обоснованный выбор, который можно проверить глазами.

🧠

Почему это работает

Слабость. Когда просишь классифицировать изображение «с ходу», модель смешивает наблюдение и вывод. Тонкие признаки в общих данных представлены слабо, поэтому она подстраховывается обтекаемыми формулировками. Рассуждение оказывается внутренне противоречивым, а ошибку не найти: видно только итоговую метку.

Сильная сторона. Модель хорошо справляется со структурными задачами по правилам: сгенерировать гипотезы по описанию, перевести их в формальный вид, исправить по подсказке о конфликте. Авторы подтверждают: эти шаги стабильно сильны у всех моделей. Модель также хорошо копирует формат, особенно если словарь признаков задан заранее.

Как метод это использует. Он разделяет «что я вижу» и «что из этого следует». Наблюдения ограничены словарём, поэтому сравнивать их с экспертной разметкой легко. Гипотезы сначала строятся из знаний экспертов, а потом правятся по реальным примерам. Самое слабое звено, по авторам, — уточнение гипотез по картинкам (S3). Там модели должны вернуться к изображению и пересмотреть собственные выводы.

Рычаги управления: - Температура и top-p на шаге 1 → выше, чтобы получить более разнообразные гипотезы. - Словарь признаков (шаг 2) → чем точнее, тем легче сверять наблюдения с эталоном. - Размер набора примеров → в статье небольшой, но нужен хотя бы один пример на класс. - Подсказки экспертов → самое ценное сырьё: чем конкретнее, тем лучше гипотезы. - Вес этапов в оценке → в статье самый высокий у приземления в изображение (S2), следом идут уточнение и проверка. - Требование назвать гипотезу на шаге 5 → оставьте, это даёт возможность проверить ответ.

🔍

Как исследовали (кратко)

Метод проверяли на двух типах изображений: капсульная эндоскопия при болезни Крона (три задачи, от «норма/патология» до шести классов поражений) и УЗИ кишечника при язвенном колите. Сравнивали четыре модели (GPT-5.4, GPT-4o-mini, Gemini-2.5, Qwen2-VL) в обычном режиме и внутри ARISE.

  • На шестиклассовой задаче точность GPT-5.4 выросла с 0.32 до 0.79, а у GPT-4o-mini с 0.29 до 0.74.
  • На УЗИ у Gemini-2.5 точность выросла с 0.26 до 0.71.
  • Лучшие результаты в самих этапах показали генерация гипотез и логическая проверка, а худшие — уточнение по картинкам.
📋

Шаблон промпта

Это оригинальная структура метода. Каждый шаг — отдельный запрос, состояние (гипотезы, наблюдения) передаётся вручную.

ШАГ 1 — гипотезы:

<Задача>
Классифицировать {объект} по изображению. Тип изображений: {тип_изображений}.
Классы: {список_классов}. Вывод: {формат_ответа}.


<Подсказки_экспертов>
{какие признаки эксперты считают значимыми для каждого класса}


Сформулируй {число_гипотез} кратких проверяемых гипотез вида «наблюдаемый признак → класс».
Не делай утверждений, которые нельзя проверить по изображению.

ШАГ 2 — наблюдения (повторить для каждого размеченного примера, по одному):

<Пример>
Изображение: {изображение}
Метка: {класс}


<Гипотезы>{текущие_гипотезы}

<Словарь_признаков>{список_допустимых_признаков}

Перечисли ТОЛЬКО то, что реально видно на этом изображении и поддерживает метку.
Используй только признаки из словаря. Ничего не домысливай сверх увиденного.
Формат: список признаков через запятую.

ШАГ 3 — уточнение:

<Гипотезы>{начальные_гипотезы}
<Накопленные_наблюдения>{список_наблюдений_по_всем_примерам}

Перепиши гипотезы с учётом наблюдений: уточни формулировки, удали неподтверждённые,
добавь недостающие. Каждая гипотеза: «признак → класс».

ШАГ 4 — перевод в логику (оригинал: дальше код с Z3):

Переведи каждую гипотезу в логическое правило вида
(Признак1(x) ∧ Признак2(x)) → Класс.
Пример: «мазок с белым дном = афтозная язва» → (РазрывСлизистой(x) ∧ БелоеДно(x)) → АфтозныеЯзвы.
Выдай список правил без пояснений.

Дальше правила проверяет решатель Z3 (нужен небольшой скрипт). Если он возвращает конфликтующий набор, вернитесь в модель:

Эти гипотезы противоречат друг другу: {конфликтующий_набор}.
Исправь их, чтобы противоречие исчезло, сохранив смысл.

ШАГ 5 — финальная классификация:

<Проверенные_гипотезы>{итоговые_гипотезы}
<Примеры>{несколько_размеченных_изображений}

Классифицируй это изображение: {изображение}.
Выведи: класс, гипотезу, на основе которой принято решение, и признаки, которые ты видишь.

Что подставлять: {объект} и {список_классов} — вашу задачу, {подсказки_экспертов} — знания человека, который умеет различать классы, {словарь_признаков} — конечный список признаков, которые можно отмечать.

🚀 Быстрый старт — вставь в чат:

Вот шаблон ARISE (пятишаговый воркфлоу классификации изображений через гипотезы).
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит про классы, про то, какие признаки отличают один класс от другого, и про то, сколько у вас размеченных примеров. Это нужно, чтобы собрать словарь признаков и подсказки экспертов, на которых держится весь метод. Она возьмёт структуру шагов из шаблона и адаптирует под вашу область.

📌

Адаптации (моё, авторы не проверяли)

Шаг 4 без кода. Если Z3 вам недоступен, можно попросить модель проверить набор правил: нет ли двух классов с одинаковыми признаками и нет ли правила, которое никогда не сработает. Это не равноценно решателю: модель может пропустить конфликт. Эффект такой замены в статье не измерялся.

Эксперт проверяет шаги. Авторы сами называют метод «врач в контуре». Раз каждый шаг оставляет артефакт (гипотезы, наблюдения, правила), человек может проверить шаги 1–3 глазами и поправить.

⚠️

Ограничения

⚠️ Нет разбора по частям: авторы сравнили только весь пайплайн с обычным запросом. Какой шаг даёт основной прирост, из статьи не ясно. Вполне возможно, что многое даёт просто «гипотезы + размеченные примеры».

⚠️ Нужен код для шага 4: проверка логики идёт через решатель Z3, а контроллер пайплайна — это детерминированная программа. Без скрипта остаётся упрощённая версия, которую статья не проверяла.

⚠️ Узкая область и мало данных: две медицинские задачи, УЗИ только от 13 пациентов. Кадры одного пациента в обучающем и тестовом наборе могли пересекаться, это в тексте не уточнено. Перенос на другие задачи не доказан.

⚠️ Слабое звено — уточнение по картинкам: модели хуже всего возвращаются к изображению и правят свои гипотезы. Слабая модель может идеально пройти шаги по правилам и всё равно ошибиться в итоге.

⚠️ Нужен эксперт и размеченные примеры: без подсказок человека, который отличает классы, и без нескольких размеченных примеров метод не запустить.

⚠️ Не клиническая система: метод ещё не прошёл клиническую проверку, авторы описывают её как будущий этап. Использовать его для реальной постановки диагноза нельзя.

🔗

Ресурсы

  • ARISE: Adaptive Agentic Reasoning with Image-grounded Self-Evaluation for Interpretable IBD Assessment
  • Авторы: Pronoma Banerjee, Anuva Shah, Jason Wu, Md. Masudur Rahman, Sanjay Mohanty, Satya Kurada, Juan P. Wachs
  • Purdue University (West Lafayette), Indiana University School of Medicine (Indianapolis)
  • Данные: CrohnIPI (капсульная эндоскопия, Vallée et al. 2020), C-TRUS (УЗИ, Leenings et al. 2025)
  • Z3 SMT solver (De Moura, Bjørner 2008)

📋 Дайджест исследования

Ключевая суть

Обнаружено: на тонких различиях модель не смотрит на детали, а отвечает «по общему впечатлению». Отсюда вечное «похоже на косметический ремонт, но возможно евро». Метод ARISE позволяет классифицировать изображения с близкими классами и получать обоснованный ответ: класс, гипотеза и признаки, которые модель реально увидела. Фишка: знание о задаче лежит не в голове модели, а в списке проверяемых гипотез «признак → класс». Его собирают из подсказок эксперта и размеченных примеров, потом чистят от противоречий. Модель перестаёт гадать и начинает опираться на конкретные наблюдения. Точность растёт на всех протестированных моделях, сильнее всего на самой сложной задаче и у самых слабых моделей.

Принцип работы

Пять отдельных запросов. Каждый оставляет проверяемый след. 1. Гипотезы. Эксперт даёт подсказки. Модель пишет 5–10 коротких гипотез «признак → класс». 2. Наблюдения. Модель смотрит на ОДИН размеченный пример за раз. Записывает только признаки из заранее заданного словаря. 3. Правка. Гипотезы переписываются с учётом накопленных наблюдений. 4. Проверка логики. Гипотезы превращаются в правила. Программа-решатель (Z3) ищет противоречия. Нашла конфликт — модель чинит гипотезы. 5. Ответ. Модель классифицирует новое фото и называет гипотезу, на которую опёрлась. Главное правило: отдельно «что я вижу», отдельно «что из этого следует». Это как врач, который сначала диктует протокол осмотра, а диагноз ставит потом. Если диагноз странный, видно, на каком месте протокола всё поехало.

Почему работает

Когда просишь ответ «с ходу», модель смешивает наблюдение и вывод. Тонкие признаки редко встречались в её обучающих данных, поэтому она подстраховывается обтекаемыми формулировками. Ошибку не найти, потому что виден только итоговый ярлык. Но у модели есть сильная сторона. Структурные задачи по правилам ей даются стабильно на всех моделях: придумать гипотезы по описанию, перевести их в формальный вид, исправить по подсказке о конфликте. Копировать формат она тоже умеет, особенно если словарь признаков задан заранее. Метод даёт модели рамку: на какие признаки смотреть и как они связаны с классами. Наблюдения из словаря легко сверить с разметкой эксперта. Каждый шаг оценивается отдельно. Видно, где рассуждение ломается. Честная оговорка: хорошие промежуточные шаги не гарантируют верный итог. Самое слабое звено, по авторам, шаг 3. Там модель должна вернуться к картинкам и пересмотреть собственные выводы. В моём пересказе нет конкретных цифр точности. Прирост подан только словами.

Когда применять

Классификация изображений с близкими классами → когда у вас есть 20–30 размеченных примеров и подсказки эксперта, на что смотреть. Например: состояние ремонта по фото квартиры, степень дефекта на производстве, стадия по медицинскому снимку (в исходной статье это оценка заболеваний кишечника). Особенно полезно, когда нужно объяснить решение, а не просто выдать ярлык. Не подходит, если нет ни размеченных примеров, ни экспертных подсказок. Не подходит и для разового вопроса «что на этом фото?». Пять запросов ради одной картинки не окупятся. Шаг 4 в оригинале требует кода (Z3). Без программиста его можно заменить запросом «найди противоречия между гипотезами», но это упрощение, в статье такого нет.

Мини-рецепт

1. Собери сырьё: 20–30 размеченных примеров, минимум по одному на каждый класс. Плюс подсказки эксперта: на что смотреть.
2. Составь словарь признаков: закрытый список слов вроде «ламинат», «натяжной потолок», «следы протечек». Чем точнее словарь, тем легче сверять наблюдения.
3. Запроси гипотезы: <задача>классы и формат ответа + <подсказки_экспертов>текст эксперта. Попроси 8 коротких гипотез «признак → класс». Запрети утверждения, которые нельзя проверить по фото. Хочешь больше разнообразия, подними температуру на этом шаге.
4. Разбери примеры по одному: фото + метка + гипотезы + словарь. Просишь вернуть только признаки из списка. Каждый ответ складывай в общую «память наблюдений».
5. Перепиши гипотезы: отдай модели гипотезы и всю память. Пусть уберёт лишнее и добавит недостающее.
6. Найди противоречия: переведи гипотезы в правила и прогони через Z3. Нет программиста? Попроси модель найти конфликты между гипотезами. Если нашлись, пусть исправит.
7. Классифицируй новое фото: итоговые гипотезы + несколько примеров + картинка. Обязательно требуй назвать гипотезу и увиденные признаки. Без этого ответ не проверить.

Примеры

[ПЛОХО]: `Какое состояние ремонта на этом фото: без ремонта, косметический, евроремонт или дизайнерский?` Ответ: «Похоже на косметический, но возможно евро». Что именно увидела модель, непонятно. [ХОРОШО], шаг 1: `<задача>Определить состояние ремонта по фото комнаты. Классы: без ремонта / косметический / евроремонт / дизайнерский. <подсказки_экспертов>Смотреть на стыки обоев и швы плитки, ровность потолка, тип пола, скрытые плинтусы и встроенный свет, состояние розеток и дверей, авторские решения. Сформулируй 8 кратких проверяемых гипотез вида «признак → класс». Не делай утверждений, которые нельзя проверить по фото.` [ХОРОШО], шаг 2 (для каждого размеченного фото отдельно): `Вот фото, его метка: евроремонт. Вот гипотезы. Перечисли только те признаки, которые реально видны, и только из этого списка: ламинат, линолеум, паркет, натяжной потолок, скрытый плинтус, следы протечек.` [ХОРОШО], шаг 5: `Вот проверенные гипотезы и три примера. Определи класс нового фото. В ответе: класс, номер гипотезы, на которую ты опираешься, и признаки, которые видишь.` Вместо «возможно, косметический» получаете: «Евроремонт. Гипотеза 3: скрытый плинтус плюс встроенный свет. Признаки: натяжной потолок, ламинат». Модератор проверяет это глазами за пять секунд.
Источник: ARISE: Adaptive Agentic Reasoning with Image-grounded Self-Evaluation for Interpretable IBD Assessment
ArXiv ID: 2610.04777 | Сгенерировано: 2026-10-06 06:30

Проблемы LLM

ПроблемаСутьКак обойти
На тонких различиях модель отвечает «по общему впечатлению» и уклоняется от выбораПросишь отнести объект (фото, текст) к одному из похожих классов. Модель смешивает то, что видит, и то, что из этого следует. Выдаёт обтекаемое «похоже на А, но возможно Б». Тонкие признаки в общих данных представлены слабо, поэтому она подстраховывается. Видна только итоговая метка. Где рассуждение сломалось, не понятьДай рамку до ответа. Сначала пусть модель выпишет признаки из заданного списка. Потом пусть выберет класс по готовым гипотезам «признак → класс» и назовёт ту, на которую опёрлась. Подробности в методах ниже

Методы

МетодСуть
Сначала наблюдения из закрытого словаря, потом выводРаздели ответ на два запроса. Запрос 1: «Перечисли только признаки из этого списка, которые видишь: [словарь]. Выводов не делай». Запрос 2: «Вот признаки и гипотезы. Выбери класс. Назови гипотезу, на которой он основан». Почему работает: модель не может спрятать догадку в описании. Словарь ограничивает формулировки, поэтому наблюдения легко сверить с эталоном или проверить глазами. Если ответ неверный, видно, где ошибка: в наблюдении или в выводе. Когда да: тонкие различия, нужна проверяемость, есть эксперт или размеченные примеры. Когда нет: классы различаются грубо, одного запроса хватает
Список проверяемых гипотез вместо знаний «в голове» моделиПострой знание о задаче как короткий список гипотез «наблюдаемый признак → класс». Шаг 1: дай модели подсказки эксперта и список классов. Попроси 5–10 гипотез. Добавь: «Не пиши того, что нельзя проверить по входным данным». Шаг 2: разбери размеченные примеры по одному. Пусть модель выпишет признаки в память наблюдений. Шаг 3: дай гипотезы и накопленные наблюдения. Попроси переписать гипотезы: убрать лишнее, добавить недостающее. Шаг 4: проверь гипотезы на противоречия. Надёжнее всего перевести их в логические правила и отдать решателю (например, Z3). Если нашлись конфликты, попроси модель починить именно их. Почему работает: эксперт даёт основу, примеры её исправляют, проверка убирает несовместимое. Модель опирается на явные правила, а не на впечатление. Условия: нужен хотя бы один размеченный пример на класс. Чем конкретнее подсказки эксперта, тем лучше гипотезы. Без кода противоречия можно искать запросом к модели. Это слабее проверки решателем

Тезисы

ТезисКомментарий
Хорошие промежуточные шаги не гарантируют верный итогЕсли рассуждение идёт цепочкой, каждый шаг может выглядеть разумно, а ответ всё равно будет неверным. Ошибка прячется в связке между шагами. Применяй: оценивай каждый шаг отдельно: наблюдения, гипотезы, итог. Не суди только по финальному ответу. Так видно, где цепочка рвётся
Модель сильна в структурных шагах, слабее в пересмотре своих выводов по исходным даннымМодель стабильно хорошо делает три вещи: строит гипотезы по описанию, переводит их в формальный вид, правит по подсказке «вот конфликт». Хуже получается вернуться к картинке и пересмотреть собственные выводы. Без внешней опоры она держится за первый вариант. Применяй: не пиши «перепроверь себя». Давай конкретную опору для пересмотра: новый размеченный пример, список конфликтов, найденное противоречие. Подавай примеры по одному
📖 Простыми словами

ARISE: AdaptiveAgenticReasoning with Image-grounded Self-Evaluation for Interpretable IBD Assessment

arXiv: 2610.04777

Нейронки паршиво оценивают сложные картинки, если спрашивать их в лоб. Когда просишь модель выдать категорию с ходу, она мешает факты с домыслами и трусливо выдает обтекаемую кашу: «ну, вроде косметический, но возможно и евро». Суть метода ARISE в том, чтобы разбить этот слепой порыв на жесткую цепочку из пяти шагов, где каждый шаг оставляет железный след, а модель лишают возможности гадать на кофейной гуще.

Это как разница между ленивым копом и дотошным криминалистом. Первый мельком глянул на комнату и ляпнул: «похоже на грабеж, дело закрыто». А второй методично протоколирует каждую пылинку, сопоставляет улики и проверяет алиби по таймлайну. Когда модель заставляют фиксировать только видимое глазами, у нее просто пропадает шанс нести складную чушь и подгонять факты под ответ.

Система работает как строгий конвейер: сначала выкатывает гипотезы вида «признак ведет к классу», затем разбирает размеченные примеры и протоколирует только чистые визуальные факты. Дальше гипотезы переписываются начисто, а сторонний логический решатель Z3 прогоняет их через код и вычищает любые нестыковки. Финал — модель размечает новый снимок, ссылаясь на конкретно доказанное правило, а не на свои фантазии.

Исследовали это на тяжелой медицине — оценке воспалений кишечника, но принцип абсолютно универсален. Загони этот пайплайн в модерацию объявлений на Циан или Авито, чтобы безошибочно отличать «бабушкин ремонт» от «евро», или прикрути к контролю брака на заводе. Везде, где обычный ChatGPT начинает юлить и хеджировать, структурированный аудит рассуждений выбивает из него всю дурь.

Хватит ждать от нейросетей экспертной интуиции — у них ее нет, зато есть талант убедительно пудрить мозги. Заставляй модель раскладывать логику на проверяемые атомы и скармливай их жестким алгоритмам верификации. Проверяемый след вместо гаданий дает точность, за которую не стыдно перед бизнесом. Либо ты контролируешь каждый шаг модели, либо получаешь рулетку за свои же деньги.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с