3,583 papers
arXiv:2610.12343 70 8 окт. 2026 г. FREE

RISE-Agent: правка изображений через цикл «спланируй → сделай → проверь»

КЛЮЧЕВАЯ СУТЬ
Обнаружено: современные модели отлично сохраняют внешний вид и рисуют правдоподобно, но не понимают, что именно рисовать. Просишь шахматную позицию после мата или кратчайший путь по лабиринту. Картинка чистая, красивая, а решение на ней неверное. Метод RISE-Agent позволяет править изображения так, чтобы логика, физика и причинно-следственные связи на картинке были верными, а не только красивыми. Фишка: между просьбой и рисованием ставится отдельный шаг, где цель описывается словами. Планировщик выводит целевое состояние, исполнитель рисует, проверяющий сверяет результат с планом. Работает без дообучения.
Адаптировать под запрос
⚡

TL;DR

RISE-Agent — схема из трёх ролей: планировщик, исполнитель и проверяющий. Планировщик сначала выводит целевое состояние («как должна выглядеть картинка после правки») и только потом передаёт задачу исполнителю. Исполнитель рисует. Проверяющий смотрит результат и решает: принять, доработать или вернуться к плану. Схема работает без дообучения и в статье обходит большинство закрытых моделей.

Главная находка исследования: современные модели уже хорошо сохраняют внешний вид картинки и делают её правдоподобной, а вот понять, что именно нужно нарисовать, они не умеют. Вы просите «покажи эту шахматную позицию после мата в два хода» или «пройди лабиринт по кратчайшему пути». Картинка получается чистой и красивой, но решение на ней неверное. Причина простая: в таких задачах нужно сначала решить, потом рисовать. Модель же рисует сразу, без этого шага. Хуже всего дело обстоит с логикой и с цепочками правок подряд, когда каждая следующая зависит от предыдущей.

Метод ставит между просьбой и рисованием отдельный этап рассуждения. Сначала целевое состояние описывается словами. Потом идёт генерация. Затем результат проверяется на соответствие описанию, и при расхождении правка повторяется.

🔬

Схема метода

ШАГ 1 — Планировщик: разбирает инструкцию, рассуждает, при необходимости
        зовёт внешние инструменты → описание целевого состояния
ШАГ 2 — Исполнитель: генеративная модель + программные инструменты правки
        → кандидат-картинка
ШАГ 3 — Проверяющий: сверяет кандидата с целью → решение:
        ПРИНЯТЬ / ДОРАБОТАТЬ / ПЕРЕПЛАНИРОВАТЬ
        (при «доработать» и «перепланировать» — цикл назад)

В статье это отдельные программные роли с инструментами. В обычном чате их можно сымитировать несколькими сообщениями (см. ниже).

🚀

Пример применения

Задача: Маркетолог готовит карточку мороженого на Ozon. Нужен баннер «Что будет с эскимо через 20 минут на пляже в Анапе при +35». Это сильная зона метода: причинно-временная правка, где нужно знание о физике, а не логическая головоломка.

Промпт (сообщение 1, роль планировщика, без рисования):

Ты работаешь как Планировщик. Картинку пока НЕ генерируй.

Исходник: фото эскимо в шоколадной глазури на деревянной палочке, на белом фоне.
Инструкция: показать, как оно выглядит через 20 минут на пляже в Анапе при +35 °C на прямом солнце.

Выведи целевое состояние:
1. Что физически произойдёт с мороженым, с глазурью, с палочкой — по пунктам.
2. Что должно остаться неизменным (форма упаковки, ракурс, фон, цвет палочки).
3. Чек-лист из 5 проверяемых признаков готовой картинки.

Промпт (сообщение 2, роль исполнителя):

Исполнитель: сгенерируй изображение строго по целевому состоянию и чек-листу выше.
Всё из пункта «остаётся неизменным» сохрани без изменений.

Промпт (сообщение 3, роль проверяющего; прикрепи результат):

Проверяющий: сравни картинку с чек-листом. По каждому пункту — выполнено / нет.
Затем одно решение: ПРИНЯТЬ, ДОРАБОТАТЬ (что именно поправить) или ПЕРЕПЛАНИРОВАТЬ
(если сам план физически неверен).

Результат: Планировщик выдаст текстовый разбор: что тает, как стекает глазурь, что остаётся прежним, плюс чек-лист из пяти пунктов. Исполнитель нарисует картинку по этому разбору. Проверяющий пройдёт по чек-листу и вынесет одно из трёх решений. Если выбрано «доработать», вы отправляете его замечания обратно исполнителю.

🧠

Почему это работает

Слабость. Модель, которая рисует по короткой просьбе, одновременно должна понять смысл, вывести следствия и нарисовать. Рассуждение при этом сжимается или пропускается. Результат: внешне аккуратная картинка, но с неверной физикой или логикой.

Сильная сторона. В статье современные модели уверенно держат внешний вид и правдоподобие. Пропустить текст через рассуждение и проверить результат по чек-листу они тоже умеют. Текстовое описание «что должно получиться» модель выдаёт заметно надёжнее, чем сразу верную картинку.

Как метод это использует. Он выносит рассуждение в отдельный шаг, а проверку делает отдельной ролью. Планировщик отвечает за «что», исполнитель за «как нарисовать», проверяющий ловит расхождения. Ошибка рассуждения больше не прячется внутри красивой картинки.

Рычаги управления: - Чек-лист в плане (число пунктов) → больше пунктов дают строже проверку, но дольше цикл. - Блок «что не менять» → защищает внешний вид, главная слабость простых правок. - Три исхода проверяющего → «перепланировать» нужен, когда ошибка в самом плане, а не в рисовании. - Число кругов → ограничьте двумя-тремя, иначе уйдёте в бесконечную доводку.

📋

Шаблон промпта

В доступном тексте статьи дословных промптов агента нет, есть только описание ролей. Шаблон ниже — реконструкция по этим ролям: структура взята из статьи, формулировки мои.


Ты ведёшь правку изображения по схеме из трёх ролей. Работай по порядку,
не смешивай роли и не пропускай шаги.



Исходное изображение: {описание или вложение}
Инструкция по правке: {что нужно изменить}
Что обязательно сохранить: {элементы, ракурс, стиль, фон}



Картинку НЕ генерируй. Рассуди:
1. Какое знание нужно для этой правки (время, причина-следствие, пространство, правила)?
2. Каким должно быть целевое состояние — по пунктам, конкретно.
3. Что должно остаться неизменным.
4. Чек-лист из {число_пунктов} проверяемых признаков.
Если задача логическая (головоломка, маршрут, правила) — сначала реши её текстом,
выпиши ответ, и только потом описывай картинку.



Сгенерируй изображение строго по целевому состоянию и чек-листу.



Сравни результат с чек-листом по каждому пункту: выполнено / нет.
Оцени отдельно:
- Выполнение инструкции (то, что просили, реально сделано и верно по смыслу)
- Сохранность внешнего вида (неизменяемое не тронуто)
- Правдоподобие (нет артефактов, анатомических и физических нелепостей)
Решение — одно из: ПРИНЯТЬ / ДОРАБОТАТЬ: {что поправить} / ПЕРЕПЛАНИРОВАТЬ: {что не так с планом}.



Повторяй Executor → Verifier, пока решение не «ПРИНЯТЬ», максимум {число_кругов} кругов.
При «ПЕРЕПЛАНИРОВАТЬ» вернись в Planner.

Что подставлять: {описание} — что на исходнике; {что нужно изменить} — сама просьба; {что обязательно сохранить} — всё, что нельзя трогать; {число_пунктов} — обычно 5; {число_кругов} — обычно 2–3.

🚀 Быстрый старт — вставь в чат:

Вот шаблон RISE-Agent (планировщик → исполнитель → проверяющий). Адаптируй под мою задачу: [твоя задача по правке картинки].
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, что на исходной картинке, что именно менять и что нельзя трогать. Это нужно, чтобы планировщик мог описать целевое состояние, а проверяющий знал, что сверять. Она возьмёт структуру из шаблона и соберёт готовый промпт под вашу правку.

⚠️

Ограничения

⚠️ Логика и цепочки правок: Именно здесь модели ошибаются чаще всего: головоломки, поиск пути, правила игр, несколько правок подряд. Планировщик в чате помогает, но не гарантирует верный ответ. Результат всё равно проверяйте сами.

⚠️ Агент авторов нельзя «включить» в чате: RISE-Agent использует программные инструменты правки и внешние вызовы. Чат-версия выше — упрощённая имитация. Прирост, измеренный в статье, относится к полной системе, а не к трём сообщениям.

⚠️ Проверяющий — тоже модель: Он может пропустить ошибку или придраться зря. В статье оценку тоже делают модели-судьи, но их согласие с людьми проверяли отдельно. Для важных картинок финальный взгляд за человеком.

⚠️ Статья — в основном бенчмарк: Основной вклад — тест на 1000 задач и рейтинг 58 подходов. Сам агент описан как один из вкладов. Дословных промптов в доступной части текста нет.

🔍

Как исследовали

Команда из Шанхайского университета Цзяотун собрала 1000 задач на правку изображений с готовыми ответами. Их сделали вручную, на русском их нет: каждая есть на английском и китайском. Задачи разложили на шесть видов рассуждения: временное, причинное, пространственное, логическое, «а что если», гибридное (несколько правок подряд). Внутри это 12 подкатегорий и 65 типов задач. Потом прогнали 58 подходов: открытые модели, закрытые (серии GPT-Image и Nano Banana) и агентные системы.

Оценивали по трём осям: верно ли выполнена инструкция, сохранился ли внешний вид, выглядит ли результат правдоподобно. Оценки ставили люди и модель-судья (Gemini). Судью проверяли на согласие с экспертами.

Результат оказался неожиданным. Внешний вид и правдоподобие у свежих моделей почти не проблема, узкое место — само рассуждение, особенно логика и гибридные задачи. Среди одиночных моделей лучшей стала GPT-Image-2.5 Sunburst. Но RISE-Agent на открытом исполнителе обошёл большинство закрытых моделей и агентных методов. Практический вывод: добавить этап рассуждения и проверки часто выгоднее, чем искать модель посильнее.

💡

Адаптации и экстраполяции

🔧 Техника: готовый результат → отдельная проверка по трём осям

Даже без планировщика можно вставить в Claude или Gemini результат и попросить оценку по осям статьи:

Оцени картинку по трём осям, каждую от 1 до 5, с коротким обоснованием:
1) Выполнена ли инструкция «{инструкция}» — верно по смыслу, а не только внешне.
2) Сохранён ли внешний вид исходника.
3) Нет ли визуальных нелепостей и артефактов.
Затем: принять или что поправить.

Экстраполяция: для логических задач убери «сразу рисуй». Сначала попроси решить задачу текстом: «Реши и выпиши ответ по шагам. Картинку не рисуй. Когда я подтвержу ответ, нарисуй». Это мой вывод, в статье он не проверялся. Он основан на том, что логика — слабейшая зона, а текстовое рассуждение модели надёжнее.

🔗

Ресурсы

  • Reasoning-Informed Visual Editing (RISEBench++, RISE-Agent). Авторы: Xue Yang, Peiyuan Zhang, Yilun Zhu, Qihao Yang и др.; Shanghai Jiao Tong University, Southeast University, South China University of Technology, Microsoft Research Asia, Fudan University, East China Normal University.
  • Предыдущая версия: RISEBench, NeurIPS 2025, Datasets and Benchmarks Track (Oral).
  • Связанные работы: KRIS-Bench, WiseEdit, UniREditBench, Mind-Brush, ImAgent, IntentEdit.

📋 Дайджест исследования

Ключевая суть

Обнаружено: современные модели отлично сохраняют внешний вид и рисуют правдоподобно, но не понимают, что именно рисовать. Просишь шахматную позицию после мата или кратчайший путь по лабиринту. Картинка чистая, красивая, а решение на ней неверное. Метод RISE-Agent позволяет править изображения так, чтобы логика, физика и причинно-следственные связи на картинке были верными, а не только красивыми. Фишка: между просьбой и рисованием ставится отдельный шаг, где цель описывается словами. Планировщик выводит целевое состояние, исполнитель рисует, проверяющий сверяет результат с планом. Работает без дообучения.

Принцип работы

Процесс: Планировщик → Исполнитель → Проверяющий, и цикл назад, если что-то не так. 1. Планировщик не рисует. Он рассуждает, выписывает целевое состояние, список «что не трогать» и чек-лист из 5 признаков. 2. Исполнитель рисует строго по этому плану. 3. Проверяющий идёт по чек-листу. Решение одно из трёх: принять, доработать или перепланировать. Три исхода нужны, чтобы различать ошибку в рисовании и ошибку в самом плане. Это как стройка. Архитектор чертит, прораб строит, технадзор принимает работу. Если дом кривой из-за чертежа, перекладывать кирпичи бесполезно. Нужен новый чертёж.

Почему работает

Модель, которая рисует по короткой просьбе, делает три дела разом: понимает смысл, выводит следствия и рисует. Рассуждение при этом сжимается или пропускается. Выходит аккуратная картинка с неверной физикой. При этом текстовое описание «что должно получиться» модель выдаёт заметно надёжнее, чем сразу верную картинку. Сверку результата по чек-листу она тоже умеет. Метод выносит рассуждение в отдельный шаг, и ошибка логики больше не прячется внутри красивой картинки. Блок «что не менять» защищает внешний вид, главную слабость простых правок. Для масштаба: авторы собрали тест на 1000 задач и сравнили 58 подходов. Агент обходит большинство закрытых моделей. Но точных цифр прироста в доступном тексте нет, так что не ждите чудес.

Когда применять

Правка изображений → задачи, где нужно знание о мире: «что будет с эскимо через 20 минут на жаре», «как выглядит комната после затопления», «покажи следующий ход». Особенно когда модель рисует красиво, но по смыслу мимо. Не подходит для простых правок вроде «поменяй цвет фона» или «убери надпись». Три роли там лишний круг. На головоломках, поиске пути и цепочках правок подряд метод помогает, но верный ответ не гарантирует. Результат проверяйте сами.

Мини-рецепт

1. Опиши исходник и просьбу: что на картинке и что нужно изменить.
2. Составь список «не трогать»: ракурс, фон, форма, цвет мелких деталей.
3. Запусти планировщика: попроси не рисовать, а выписать, что изменится, что останется и чек-лист из 5 пунктов.
4. Для головоломок реши задачу текстом: выпиши ответ, и только потом описывай картинку.
5. Отдай план исполнителю: рисовать строго по плану и чек-листу.
6. Прикрепи результат и позови проверяющего: по каждому пункту «выполнено / нет», затем одно решение: принять, доработать или перепланировать.
7. Поставь потолок: 2-3 круга. Дальше начнётся бесконечная доводка.
8. Посмотри глазами сам: проверяющий тоже модель и может пропустить ошибку или придраться зря.

Примеры

[ПЛОХО] : Нарисуй, как эскимо выглядит через 20 минут на пляже в Анапе
[ХОРОШО] : Ты Планировщик. Картинку НЕ генерируй. Исходник: эскимо в шоколадной глазури на деревянной палочке, белый фон. Инструкция: показать, как оно выглядит через 20 минут на пляже при +35 °C на прямом солнце. Выведи: 1) что физически произойдёт с мороженым, глазурью и палочкой, по пунктам; 2) что остаётся неизменным (ракурс, фон, цвет палочки); 3) чек-лист из 5 проверяемых признаков. Дальше: Исполнитель: сгенерируй изображение строго по целевому состоянию и чек-листу выше. Всё из пункта «остаётся неизменным» сохрани. И в конце: Проверяющий: сравни картинку с чек-листом, по каждому пункту выполнено или нет. Затем одно решение: ПРИНЯТЬ, ДОРАБОТАТЬ (что поправить) или ПЕРЕПЛАНИРОВАТЬ (если сам план физически неверен). В плохом запросе модель сама решает, что значит «растаяло», и чаще всего рисует просто размазанную лужу. В хорошем сначала фиксируются физика и список неизменного. Потом картинку можно честно проверить по пунктам. Честная оговорка: в статье агент работает с программными инструментами правки. Три сообщения в чате лишь упрощённая имитация. Прирост из статьи относится к полной системе.
Источник: Reasoning-Informed Visual Editing
ArXiv ID: 2610.12343 | Сгенерировано: 2026-10-10 09:30

Проблемы LLM

ПроблемаСутьКак обойти
Модель рисует красиво, но неверно, если перед рисованием нужно подуматьПросишь показать итог процесса. Например: «как растает мороженое на жаре», «позиция после мата», «кратчайший путь». Картинка выходит чистой и правдоподобной. Но содержание неверное. Модель сразу и понимает задачу, и выводит следствия, и рисует. Рассуждение сжимается или пропускается. Ошибка прячется внутри аккуратного изображения. Проблема общая для любых правок, где нужны знания о времени, причинах, пространстве или правилахРаздели задачу на два шага. Сначала попроси описать итог словами. Картинку пока не рисуй. Если задача логическая, пусть сначала решит её текстом и выпишет ответ. Рисовать — только по этому описанию

Методы

МетодСуть
Три шага: описать цель, нарисовать, проверить — меньше скрытых ошибокЧто делать. Работай тремя отдельными сообщениями или ролями. Шаг 1. «Картинку не генерируй. Опиши итог по пунктам. Что изменится. Что должно остаться как есть. Дай список из 5 проверяемых признаков». Шаг 2. «Нарисуй строго по описанию и списку. Неизменяемое не трогай». Шаг 3. Прикрепи результат: «Сравни с каждым пунктом списка: выполнено или нет. Затем дай одно решение». Почему работает: модель надёжнее описывает словами, что должно получиться, чем сразу рисует верный результат. Рассуждение выносится в отдельный шаг. Ошибка видна в тексте, а не спрятана в картинке. Проверка по списку тоже получается лучше, чем общий взгляд «вроде нормально». Когда да: правки, где нужны знания о мире, причина и следствие, правила, пространство. Когда нет: простая правка стиля или цвета, где думать не нужно. Ограничения: для головоломок и цепочек правок подряд метод помогает, но не гарантирует верный ответ. Проверяющий — тоже модель. Он может пропустить ошибку или придраться зря. Для важных картинок смотри сам. Ограничь число кругов доводки двумя-тремя
📖 Простыми словами

Reasoning-Informed Visual Editing

arXiv: 2610.12343

Обычные нейросети для картинок адски тупят, пытаясь одновременно думать и рисовать. Когда ты просишь показать «что будет с мороженым через 20 минут на жаре», модель сразу генерирует пиксели, напрочь игнорируя базовую физику реального мира. Рассуждение тупо пропускается, и на выходе получается аккуратная, но абсолютно бессмысленная фигня. Метод RISE-Agent убирает этот провал: он заставляет систему сначала досконально осмыслить последствия, а уже потом браться за кисть.

Это как нанять одного рабочего, который пытается быть архитектором, каменщиком и прорабом в одну каску. Формально дом построен, но стена завалилась, потому что чертежа не было, а результат никто не проверил. Чтобы сложная графика не разваливалась логически, нужна нормальная бригада с разделением труда, где каждый делает свой кусок работы и получает по рукам за откровенную халтуру.

Вся суть метода укладывается в три роли. Сначала планировщик формулирует целевое состояние текстом — буквально расписывает физику процесса и то, как потечёт глазурь на пляже при +35. Затем обычный исполнитель берёт это строгое ТЗ и генерирует визуал. В финале подключается проверяющий: он сличает результат с логикой и решает — принять картинку, докрутить детали или отправить всех переделывать концепт с нуля. И фокус в том, что схема работает вообще без дообучения нейросетей.

Эксперимент ставили на мороженом, но принцип абсолютно универсален. Любая причинно-следственная задача — состарить лицо, показать последствия аварии, разбить стекло или визуализировать износ обуви для маркетплейса — требует понимания механики мира. Архитектура из трёх ролей всухую обходит закрытые топ-модели, которые привыкли рисовать всё наобум в один проход, просто за счёт того, что не пытается срезать углы.

Хватит ждать, что одна монолитная сетка окажется гениальным физиком и художником одновременно. Разделяй планирование, генерацию и проверку, если нужен вменяемый результат, а не случайная мазня. Либо ты выстраиваешь систему взаимного контроля агентов, либо продолжаешь вручную отбирать удачные генерации и гадать, почему нейросеть снова нарисовала чушь.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с