TL;DR
ARISE — это цепочка из пяти запросов к модели, где каждый шаг оставляет проверяемый «след». Сначала модель формулирует гипотезы вида «признак → класс». Потом по одному разбирает размеченные примеры и записывает только то, что реально видно. Затем переписывает гипотезы с учётом увиденного. После этого гипотезы переводятся в логические правила, и решатель (программа Z3) ищет противоречия. Только потом модель классифицирует новое изображение, называя гипотезу, на которую опирается.
Главная находка: на тонких различиях модель «плывёт». Если спросить в лоб, она колеблется между трактовками и выдаёт уклончивое описание, поэтому на многоклассовой задаче часто почти угадывает. Причина простая: ей не дали рамки, на какие признаки смотреть и как они связаны с классами, и она отвечает «по общему впечатлению». В ARISE та же модель опирается на конкретные наблюдения, и точность растёт на всех протестированных моделях. Сильнее всего она растёт на самой сложной задаче и у самых слабых моделей.
Суть метода. Знание о задаче хранится не в весах модели, а в списке проверяемых гипотез. Его строят из подсказок экспертов и из размеченных примеров, потом чистят от противоречий. Каждый шаг оценивается отдельно, поэтому видно, где рассуждение ломается: хорошие промежуточные шаги ещё не гарантируют верный итог.
Схема метода
ШАГ 1 (S1): подсказки экспертов + классы → 5–10 кратких проверяемых гипотез «признак → класс»
ШАГ 2 (S2): по ОДНОМУ размеченному примеру за раз → список наблюдаемых признаков
(только из заранее заданного словаря) → копится «память наблюдений»
ШАГ 3 (S3): гипотезы + память наблюдений → уточнённые гипотезы
ШАГ 4 (S4): гипотезы → логические правила → решатель Z3 ищет противоречия
→ если нашёл, модель чинит конфликтующие гипотезы
ШАГ 5 (S5): проверенные гипотезы + несколько примеров → класс нового изображения
+ какая гипотеза использована
Это отдельные запросы, шаги 2–4 идут по цепочке, состояние передаётся между ними. Шаг 4 в оригинале требует кода (Z3).
Пример применения
Задача: Вы руководите модерацией в сервисе недвижимости вроде Циан или Авито. Нужно по фото квартиры определять состояние ремонта: «без ремонта», «косметический», «евроремонт», «дизайнерский». Если спросить ChatGPT в лоб, он хеджирует: «похоже на косметический, но возможно евро». У вас есть 20–30 размеченных риелтором фото и его подсказки, на что смотреть.
Промпт (шаг 1, гипотезы):
<Задача>
Классифицировать состояние ремонта квартиры по фотографии комнаты.
Классы: без ремонта / косметический / евроремонт / дизайнерский.
Вывод: один класс и гипотеза, на которой он основан.
Задача>
<Подсказки_экспертов>
Риелтор подсказывает: смотреть на стыки обоев и швы плитки, ровность потолка и
наличие натяжного или многоуровневого потолка, тип пола (линолеум, ламинат,
паркет, инженерная доска), скрытые плинтусы и встроенный свет, состояние розеток
и дверей, наличие авторских решений (нестандартные материалы, акцентные стены).
Подсказки_экспертов>
Сформулируй 8 кратких проверяемых гипотез вида «наблюдаемый признак → класс».
Не делай утверждений, которые нельзя проверить по фото.
Дальше по цепочке: шаг 2 запускаете по каждому размеченному фото отдельно (картинка + метка + гипотезы + список разрешённых признаков). Шаг 3 получает все накопленные наблюдения и переписывает гипотезы. Шаг 5 получает итоговые гипотезы и классифицирует новое фото.
Результат: После шага 1 будет список гипотез. После шага 2 для каждого примера придёт короткий список признаков из словаря («ламинат», «линолеум», «натяжной потолок», «следы протечек»). После шага 3 будет переработанный набор гипотез, где лишнее убрано, а недостающее добавлено. На шаге 5 модель назовёт класс, гипотезу и признаки, которые увидела. Вместо «возможно, косметический» вы получаете обоснованный выбор, который можно проверить глазами.
Почему это работает
Слабость. Когда просишь классифицировать изображение «с ходу», модель смешивает наблюдение и вывод. Тонкие признаки в общих данных представлены слабо, поэтому она подстраховывается обтекаемыми формулировками. Рассуждение оказывается внутренне противоречивым, а ошибку не найти: видно только итоговую метку.
Сильная сторона. Модель хорошо справляется со структурными задачами по правилам: сгенерировать гипотезы по описанию, перевести их в формальный вид, исправить по подсказке о конфликте. Авторы подтверждают: эти шаги стабильно сильны у всех моделей. Модель также хорошо копирует формат, особенно если словарь признаков задан заранее.
Как метод это использует. Он разделяет «что я вижу» и «что из этого следует». Наблюдения ограничены словарём, поэтому сравнивать их с экспертной разметкой легко. Гипотезы сначала строятся из знаний экспертов, а потом правятся по реальным примерам. Самое слабое звено, по авторам, — уточнение гипотез по картинкам (S3). Там модели должны вернуться к изображению и пересмотреть собственные выводы.
Рычаги управления: - Температура и top-p на шаге 1 → выше, чтобы получить более разнообразные гипотезы. - Словарь признаков (шаг 2) → чем точнее, тем легче сверять наблюдения с эталоном. - Размер набора примеров → в статье небольшой, но нужен хотя бы один пример на класс. - Подсказки экспертов → самое ценное сырьё: чем конкретнее, тем лучше гипотезы. - Вес этапов в оценке → в статье самый высокий у приземления в изображение (S2), следом идут уточнение и проверка. - Требование назвать гипотезу на шаге 5 → оставьте, это даёт возможность проверить ответ.
Как исследовали (кратко)
Метод проверяли на двух типах изображений: капсульная эндоскопия при болезни Крона (три задачи, от «норма/патология» до шести классов поражений) и УЗИ кишечника при язвенном колите. Сравнивали четыре модели (GPT-5.4, GPT-4o-mini, Gemini-2.5, Qwen2-VL) в обычном режиме и внутри ARISE.
- На шестиклассовой задаче точность GPT-5.4 выросла с 0.32 до 0.79, а у GPT-4o-mini с 0.29 до 0.74.
- На УЗИ у Gemini-2.5 точность выросла с 0.26 до 0.71.
- Лучшие результаты в самих этапах показали генерация гипотез и логическая проверка, а худшие — уточнение по картинкам.
Шаблон промпта
Это оригинальная структура метода. Каждый шаг — отдельный запрос, состояние (гипотезы, наблюдения) передаётся вручную.
ШАГ 1 — гипотезы:
<Задача>
Классифицировать {объект} по изображению. Тип изображений: {тип_изображений}.
Классы: {список_классов}. Вывод: {формат_ответа}.
Задача>
<Подсказки_экспертов>
{какие признаки эксперты считают значимыми для каждого класса}
Подсказки_экспертов>
Сформулируй {число_гипотез} кратких проверяемых гипотез вида «наблюдаемый признак → класс».
Не делай утверждений, которые нельзя проверить по изображению.
ШАГ 2 — наблюдения (повторить для каждого размеченного примера, по одному):
<Пример>
Изображение: {изображение}
Метка: {класс}
Пример>
<Гипотезы>{текущие_гипотезы}Гипотезы>
<Словарь_признаков>{список_допустимых_признаков}Словарь_признаков>
Перечисли ТОЛЬКО то, что реально видно на этом изображении и поддерживает метку.
Используй только признаки из словаря. Ничего не домысливай сверх увиденного.
Формат: список признаков через запятую.
ШАГ 3 — уточнение:
<Гипотезы>{начальные_гипотезы}Гипотезы>
<Накопленные_наблюдения>{список_наблюдений_по_всем_примерам}Накопленные_наблюдения>
Перепиши гипотезы с учётом наблюдений: уточни формулировки, удали неподтверждённые,
добавь недостающие. Каждая гипотеза: «признак → класс».
ШАГ 4 — перевод в логику (оригинал: дальше код с Z3):
Переведи каждую гипотезу в логическое правило вида
(Признак1(x) ∧ Признак2(x)) → Класс.
Пример: «мазок с белым дном = афтозная язва» → (РазрывСлизистой(x) ∧ БелоеДно(x)) → АфтозныеЯзвы.
Выдай список правил без пояснений.
Дальше правила проверяет решатель Z3 (нужен небольшой скрипт). Если он возвращает конфликтующий набор, вернитесь в модель:
Эти гипотезы противоречат друг другу: {конфликтующий_набор}.
Исправь их, чтобы противоречие исчезло, сохранив смысл.
ШАГ 5 — финальная классификация:
<Проверенные_гипотезы>{итоговые_гипотезы}Проверенные_гипотезы>
<Примеры>{несколько_размеченных_изображений}Примеры>
Классифицируй это изображение: {изображение}.
Выведи: класс, гипотезу, на основе которой принято решение, и признаки, которые ты видишь.
Что подставлять: {объект} и {список_классов} — вашу задачу, {подсказки_экспертов} — знания человека, который умеет различать классы, {словарь_признаков} — конечный список признаков, которые можно отмечать.
🚀 Быстрый старт — вставь в чат:
Вот шаблон ARISE (пятишаговый воркфлоу классификации изображений через гипотезы).
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит про классы, про то, какие признаки отличают один класс от другого, и про то, сколько у вас размеченных примеров. Это нужно, чтобы собрать словарь признаков и подсказки экспертов, на которых держится весь метод. Она возьмёт структуру шагов из шаблона и адаптирует под вашу область.
Адаптации (моё, авторы не проверяли)
Шаг 4 без кода. Если Z3 вам недоступен, можно попросить модель проверить набор правил: нет ли двух классов с одинаковыми признаками и нет ли правила, которое никогда не сработает. Это не равноценно решателю: модель может пропустить конфликт. Эффект такой замены в статье не измерялся.
Эксперт проверяет шаги. Авторы сами называют метод «врач в контуре». Раз каждый шаг оставляет артефакт (гипотезы, наблюдения, правила), человек может проверить шаги 1–3 глазами и поправить.
Ограничения
⚠️ Нет разбора по частям: авторы сравнили только весь пайплайн с обычным запросом. Какой шаг даёт основной прирост, из статьи не ясно. Вполне возможно, что многое даёт просто «гипотезы + размеченные примеры».
⚠️ Нужен код для шага 4: проверка логики идёт через решатель Z3, а контроллер пайплайна — это детерминированная программа. Без скрипта остаётся упрощённая версия, которую статья не проверяла.
⚠️ Узкая область и мало данных: две медицинские задачи, УЗИ только от 13 пациентов. Кадры одного пациента в обучающем и тестовом наборе могли пересекаться, это в тексте не уточнено. Перенос на другие задачи не доказан.
⚠️ Слабое звено — уточнение по картинкам: модели хуже всего возвращаются к изображению и правят свои гипотезы. Слабая модель может идеально пройти шаги по правилам и всё равно ошибиться в итоге.
⚠️ Нужен эксперт и размеченные примеры: без подсказок человека, который отличает классы, и без нескольких размеченных примеров метод не запустить.
⚠️ Не клиническая система: метод ещё не прошёл клиническую проверку, авторы описывают её как будущий этап. Использовать его для реальной постановки диагноза нельзя.
Ресурсы
- ARISE: Adaptive Agentic Reasoning with Image-grounded Self-Evaluation for Interpretable IBD Assessment
- Авторы: Pronoma Banerjee, Anuva Shah, Jason Wu, Md. Masudur Rahman, Sanjay Mohanty, Satya Kurada, Juan P. Wachs
- Purdue University (West Lafayette), Indiana University School of Medicine (Indianapolis)
- Данные: CrohnIPI (капсульная эндоскопия, Vallée et al. 2020), C-TRUS (УЗИ, Leenings et al. 2025)
- Z3 SMT solver (De Moura, Bjørner 2008)
