TL;DR
RISE-Agent — схема из трёх ролей: планировщик, исполнитель и проверяющий. Планировщик сначала выводит целевое состояние («как должна выглядеть картинка после правки») и только потом передаёт задачу исполнителю. Исполнитель рисует. Проверяющий смотрит результат и решает: принять, доработать или вернуться к плану. Схема работает без дообучения и в статье обходит большинство закрытых моделей.
Главная находка исследования: современные модели уже хорошо сохраняют внешний вид картинки и делают её правдоподобной, а вот понять, что именно нужно нарисовать, они не умеют. Вы просите «покажи эту шахматную позицию после мата в два хода» или «пройди лабиринт по кратчайшему пути». Картинка получается чистой и красивой, но решение на ней неверное. Причина простая: в таких задачах нужно сначала решить, потом рисовать. Модель же рисует сразу, без этого шага. Хуже всего дело обстоит с логикой и с цепочками правок подряд, когда каждая следующая зависит от предыдущей.
Метод ставит между просьбой и рисованием отдельный этап рассуждения. Сначала целевое состояние описывается словами. Потом идёт генерация. Затем результат проверяется на соответствие описанию, и при расхождении правка повторяется.
Схема метода
ШАГ 1 — Планировщик: разбирает инструкцию, рассуждает, при необходимости
зовёт внешние инструменты → описание целевого состояния
ШАГ 2 — Исполнитель: генеративная модель + программные инструменты правки
→ кандидат-картинка
ШАГ 3 — Проверяющий: сверяет кандидата с целью → решение:
ПРИНЯТЬ / ДОРАБОТАТЬ / ПЕРЕПЛАНИРОВАТЬ
(при «доработать» и «перепланировать» — цикл назад)
В статье это отдельные программные роли с инструментами. В обычном чате их можно сымитировать несколькими сообщениями (см. ниже).
Пример применения
Задача: Маркетолог готовит карточку мороженого на Ozon. Нужен баннер «Что будет с эскимо через 20 минут на пляже в Анапе при +35». Это сильная зона метода: причинно-временная правка, где нужно знание о физике, а не логическая головоломка.
Промпт (сообщение 1, роль планировщика, без рисования):
Ты работаешь как Планировщик. Картинку пока НЕ генерируй.
Исходник: фото эскимо в шоколадной глазури на деревянной палочке, на белом фоне.
Инструкция: показать, как оно выглядит через 20 минут на пляже в Анапе при +35 °C на прямом солнце.
Выведи целевое состояние:
1. Что физически произойдёт с мороженым, с глазурью, с палочкой — по пунктам.
2. Что должно остаться неизменным (форма упаковки, ракурс, фон, цвет палочки).
3. Чек-лист из 5 проверяемых признаков готовой картинки.
Промпт (сообщение 2, роль исполнителя):
Исполнитель: сгенерируй изображение строго по целевому состоянию и чек-листу выше.
Всё из пункта «остаётся неизменным» сохрани без изменений.
Промпт (сообщение 3, роль проверяющего; прикрепи результат):
Проверяющий: сравни картинку с чек-листом. По каждому пункту — выполнено / нет.
Затем одно решение: ПРИНЯТЬ, ДОРАБОТАТЬ (что именно поправить) или ПЕРЕПЛАНИРОВАТЬ
(если сам план физически неверен).
Результат: Планировщик выдаст текстовый разбор: что тает, как стекает глазурь, что остаётся прежним, плюс чек-лист из пяти пунктов. Исполнитель нарисует картинку по этому разбору. Проверяющий пройдёт по чек-листу и вынесет одно из трёх решений. Если выбрано «доработать», вы отправляете его замечания обратно исполнителю.
Почему это работает
Слабость. Модель, которая рисует по короткой просьбе, одновременно должна понять смысл, вывести следствия и нарисовать. Рассуждение при этом сжимается или пропускается. Результат: внешне аккуратная картинка, но с неверной физикой или логикой.
Сильная сторона. В статье современные модели уверенно держат внешний вид и правдоподобие. Пропустить текст через рассуждение и проверить результат по чек-листу они тоже умеют. Текстовое описание «что должно получиться» модель выдаёт заметно надёжнее, чем сразу верную картинку.
Как метод это использует. Он выносит рассуждение в отдельный шаг, а проверку делает отдельной ролью. Планировщик отвечает за «что», исполнитель за «как нарисовать», проверяющий ловит расхождения. Ошибка рассуждения больше не прячется внутри красивой картинки.
Рычаги управления: - Чек-лист в плане (число пунктов) → больше пунктов дают строже проверку, но дольше цикл. - Блок «что не менять» → защищает внешний вид, главная слабость простых правок. - Три исхода проверяющего → «перепланировать» нужен, когда ошибка в самом плане, а не в рисовании. - Число кругов → ограничьте двумя-тремя, иначе уйдёте в бесконечную доводку.
Шаблон промпта
В доступном тексте статьи дословных промптов агента нет, есть только описание ролей. Шаблон ниже — реконструкция по этим ролям: структура взята из статьи, формулировки мои.
Ты ведёшь правку изображения по схеме из трёх ролей. Работай по порядку,
не смешивай роли и не пропускай шаги.
Исходное изображение: {описание или вложение}
Инструкция по правке: {что нужно изменить}
Что обязательно сохранить: {элементы, ракурс, стиль, фон}
Картинку НЕ генерируй. Рассуди:
1. Какое знание нужно для этой правки (время, причина-следствие, пространство, правила)?
2. Каким должно быть целевое состояние — по пунктам, конкретно.
3. Что должно остаться неизменным.
4. Чек-лист из {число_пунктов} проверяемых признаков.
Если задача логическая (головоломка, маршрут, правила) — сначала реши её текстом,
выпиши ответ, и только потом описывай картинку.
Сгенерируй изображение строго по целевому состоянию и чек-листу.
Сравни результат с чек-листом по каждому пункту: выполнено / нет.
Оцени отдельно:
- Выполнение инструкции (то, что просили, реально сделано и верно по смыслу)
- Сохранность внешнего вида (неизменяемое не тронуто)
- Правдоподобие (нет артефактов, анатомических и физических нелепостей)
Решение — одно из: ПРИНЯТЬ / ДОРАБОТАТЬ: {что поправить} / ПЕРЕПЛАНИРОВАТЬ: {что не так с планом}.
Повторяй Executor → Verifier, пока решение не «ПРИНЯТЬ», максимум {число_кругов} кругов.
При «ПЕРЕПЛАНИРОВАТЬ» вернись в Planner.
Что подставлять: {описание} — что на исходнике; {что нужно изменить} — сама просьба; {что обязательно сохранить} — всё, что нельзя трогать; {число_пунктов} — обычно 5; {число_кругов} — обычно 2–3.
🚀 Быстрый старт — вставь в чат:
Вот шаблон RISE-Agent (планировщик → исполнитель → проверяющий). Адаптируй под мою задачу: [твоя задача по правке картинки].
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, что на исходной картинке, что именно менять и что нельзя трогать. Это нужно, чтобы планировщик мог описать целевое состояние, а проверяющий знал, что сверять. Она возьмёт структуру из шаблона и соберёт готовый промпт под вашу правку.
Ограничения
⚠️ Логика и цепочки правок: Именно здесь модели ошибаются чаще всего: головоломки, поиск пути, правила игр, несколько правок подряд. Планировщик в чате помогает, но не гарантирует верный ответ. Результат всё равно проверяйте сами.
⚠️ Агент авторов нельзя «включить» в чате: RISE-Agent использует программные инструменты правки и внешние вызовы. Чат-версия выше — упрощённая имитация. Прирост, измеренный в статье, относится к полной системе, а не к трём сообщениям.
⚠️ Проверяющий — тоже модель: Он может пропустить ошибку или придраться зря. В статье оценку тоже делают модели-судьи, но их согласие с людьми проверяли отдельно. Для важных картинок финальный взгляд за человеком.
⚠️ Статья — в основном бенчмарк: Основной вклад — тест на 1000 задач и рейтинг 58 подходов. Сам агент описан как один из вкладов. Дословных промптов в доступной части текста нет.
Как исследовали
Команда из Шанхайского университета Цзяотун собрала 1000 задач на правку изображений с готовыми ответами. Их сделали вручную, на русском их нет: каждая есть на английском и китайском. Задачи разложили на шесть видов рассуждения: временное, причинное, пространственное, логическое, «а что если», гибридное (несколько правок подряд). Внутри это 12 подкатегорий и 65 типов задач. Потом прогнали 58 подходов: открытые модели, закрытые (серии GPT-Image и Nano Banana) и агентные системы.
Оценивали по трём осям: верно ли выполнена инструкция, сохранился ли внешний вид, выглядит ли результат правдоподобно. Оценки ставили люди и модель-судья (Gemini). Судью проверяли на согласие с экспертами.
Результат оказался неожиданным. Внешний вид и правдоподобие у свежих моделей почти не проблема, узкое место — само рассуждение, особенно логика и гибридные задачи. Среди одиночных моделей лучшей стала GPT-Image-2.5 Sunburst. Но RISE-Agent на открытом исполнителе обошёл большинство закрытых моделей и агентных методов. Практический вывод: добавить этап рассуждения и проверки часто выгоднее, чем искать модель посильнее.
Адаптации и экстраполяции
🔧 Техника: готовый результат → отдельная проверка по трём осям
Даже без планировщика можно вставить в Claude или Gemini результат и попросить оценку по осям статьи:
Оцени картинку по трём осям, каждую от 1 до 5, с коротким обоснованием:
1) Выполнена ли инструкция «{инструкция}» — верно по смыслу, а не только внешне.
2) Сохранён ли внешний вид исходника.
3) Нет ли визуальных нелепостей и артефактов.
Затем: принять или что поправить.
Экстраполяция: для логических задач убери «сразу рисуй». Сначала попроси решить задачу текстом: «Реши и выпиши ответ по шагам. Картинку не рисуй. Когда я подтвержу ответ, нарисуй». Это мой вывод, в статье он не проверялся. Он основан на том, что логика — слабейшая зона, а текстовое рассуждение модели надёжнее.
Ресурсы
- Reasoning-Informed Visual Editing (RISEBench++, RISE-Agent). Авторы: Xue Yang, Peiyuan Zhang, Yilun Zhu, Qihao Yang и др.; Shanghai Jiao Tong University, Southeast University, South China University of Technology, Microsoft Research Asia, Fudan University, East China Normal University.
- Предыдущая версия: RISEBench, NeurIPS 2025, Datasets and Benchmarks Track (Oral).
- Связанные работы: KRIS-Bench, WiseEdit, UniREditBench, Mind-Brush, ImAgent, IntentEdit.
