TL;DR
VIPE — это способ улучшить качество ответа видео-модели, не трогая текстовый промпт, а меняя картинку, которую ей подсовываешь. Берёшь исходное изображение задачи, просишь другую нейросеть-редактор картинок перерисовать его в другом стиле (например, из схематичного рисунка сделать фотореалистичную сцену), и отдаёшь этот новый вариант видео-модели вместо оригинала.
Оказывается, видео-модели плохо «рассуждают» по абстрактным схематичным картинкам — линии, кружочки, чёрно-белые схемы. Модель на таких простых рисунках выдаёт результат близкий к случайному угадыванию. Но если ту же самую задачу нарисовать реалистично — шарик стал бильярдным шаром, линии стали деревянными полками — модель вдруг начинает решать задачу заметно лучше, хотя суть задачи не изменилась ни на йоту.
VIPE решает это в три шага: (1) нейросеть-«генератор идей» предлагает, как можно перерисовать картинку без изменения логики задачи, (2) редактор изображений (например, Nano Banana) рисует несколько вариантов, (3) фильтр (другая модель-судья) выбирает лучший вариант по качеству и верности оригиналу. Готовую картинку отдают видео-модели для решения задачи.
Схема метода
ШАГ 1 (ИДЕАТОР): Модель придумывает текстовое описание правки → "заменить схему на фотореалистичную сцену, не меняя структуру"
ШАГ 2 (РЕДАКТОР): Модель-редактор картинок генерирует 3-5 вариантов новой картинки по этому описанию → набор изображений-кандидатов
ШАГ 3 (ФИЛЬТР, опционально): Модель-судья выбирает лучший вариант — по качеству и точности сохранения задачи → одна финальная картинка
ШАГ 4 (ОСНОВНАЯ ЗАДАЧА): Финальную картинку + обычный текстовый промпт отдают видео-модели → видео-ответ на задачу
Все шаги можно выполнять как отдельные запросы к разным моделям (в оригинале — так и делали), но принцип применим и в один диалог с картинкой.
Пример применения
Задача: Вы объясняете видео-нейросети (например, генератору коротких роликов) физическую задачу и хотите получить осмысленную симуляцию, а не бессмысленное видео.
Промпт (шаг 1, генерация улучшенной картинки):
Вот схематичный чертёж: шарик скатывается по наклонным линиям и падает в одну из трёх корзин.
Перерисуй эту сцену так, чтобы она выглядела как фотореалистичная фотография:
- ракурс камеры не менять, смотрим прямо на стену
- белый кружок замени на маленький красный бильярдный шар
- каждую чёрную линию замени на деревянную полку той же длины, ориентации и расположения
- больше ничего не добавляй и не меняй
Промпт (шаг 2, основная задача — отдаётся видео-модели вместе с новой картинкой):
На этом изображении шарик скатывается по деревянным полкам под действием гравитации.
Сгенерируй видео, показывающее, в какую из трёх корзин упадёт шарик.
Результат: Модель-редактор вернёт фотореалистичную версию исходной схемы с сохранённой геометрией. Дальше видео-модель, получив эту более «понятную» ей картинку, сгенерирует видео с траекторией шарика — и вероятность, что итоговое видео физически правдоподобно и правильно предсказывает исход, вырастет заметно по сравнению с тем, если бы вы подали ей исходную схему.
Почему это работает
Видео-модели обучены на реальных фото и видео из мира, а не на схемах и чертежах. Когда вы даёте им абстрактный рисунок — линии, кружочки, минималистичную сцену — модель попадает в непривычную для себя визуальную зону и «путается», как человек, которому вместо чертежа дали каракули.
Зато с реалистичными сценами модель работает в своей стихии: она видела миллионы видео с шарами, полками, тенями, физикой падения предметов. Дать ей знакомый визуальный контекст — это как дать переводчику текст на языке, который он выучил, а не на языке, который он видел только в учебнике.
VIPE использует эту сильную сторону: не пытается научить модель понимать схемы, а убирает необходимость это делать, заранее переводя задачу на «родной» для модели визуальный язык.
Рычаги управления: - Инструкция редактору (что можно менять, что нельзя) → сузь её жёстко, если задача чувствительна к геометрии — иначе редактор может случайно упростить задачу - Число вариантов-кандидатов → больше вариантов = выше шанс найти удачный, но дороже; для простых задач хватит 2-3 - Наличие фильтра-судьи → без него один случайный вариант может испортить задачу (например, "решить" её за модель); с фильтром выше надёжность - Замена реализма на другой стиль (мультяшный, нуарный, макро) → сам принцип "перерисовать в понятный модели стиль" работает не только с фотореализмом
Шаблон промпта
Шаг 1 — генерация улучшенной картинки (промпт для модели-редактора изображений):
"Вот изображение задачи: {описание сцены и объектов}.
Перерисуй это в фотореалистичном стиле, сохранив:
- ракурс и композицию без изменений
- расположение, размер и пропорции всех объектов точно как в оригинале
Замени {абстрактный элемент 1} на {реалистичный аналог 1}.
Замени {абстрактный элемент 2} на {реалистичный аналог 2}.
Не добавляй новых объектов и не меняй логику задачи."
Шаг 2 — основная задача (промпт для видео-модели, вместе с новой картинкой):
"На этом изображении {описание ситуации}.
{Вопрос или задание к видео-модели: что должно произойти, что нужно предсказать}."
🚀 Быстрый старт — вставь в чат:
Вот шаблон визуального прайм-инжиниринга для видео-задач. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какая у вас исходная картинка, какие элементы в ней абстрактны или схематичны, и в какой реалистичный стиль их лучше перевести — потому что именно точность замены "абстрактное → конкретное" при сохранении геометрии определяет, сработает ли метод.
Ограничения
⚠️ Нужна отдельная модель-редактор изображений: метод требует доступа к инструменту генерации/редактирования картинок (Nano Banana, Midjourney с img2img и подобные), просто текстовый чат с LLM без картинок это не воспроизведёт.
⚠️ Риск случайно облегчить задачу: редактор может при перерисовке незаметно исказить геометрию или логику — исследователи вручную проверяли, что задача не стала легче. Без проверки результата есть шанс получить недостоверные результаты.
⚠️ Работает не с любой "абстрактностью": отдельный тест показал, что дело не в переходе от 2D к 3D-виду, а именно в реализме текстур и материалов. Просто "накинуть объём" без реалистичной фактуры почти не помогает.
⚠️ Проверено на видео-моделях, не факт что переносится на обычные LLM без изображений: эффект показан именно там, где модель получает картинку как часть задачи (видео-генерация, визуальное рассуждение) — не применим к чисто текстовым задачам.
Как исследовали
Команда взяла датасет физических задач VPCT — шарик катится по рампам и падает в одну из трёх корзин, задача изначально нарисована схематично (чёрные линии, белый кружок). Они перерисовали весь датасет в фотореалистичный стиль через модель-редактор (Nano Banana Pro) с чётким текстовым описанием, что можно менять, а что нельзя, и проверили итог вручную, чтобы задача не стала проще.
Дальше сравнили, как разные видео-модели (Wan2.2, Veo 3.1, Omni Flash) решают задачу на схематичной версии против фотореалистичной — на 1000 примеров, усреднённых по 10 прогонам. Разница оказалась огромной: некоторые модели на схемах работали на уровне случайного угадывания, а на реалистичных картинках — заметно выше шанса.
Что удивило: отдельная проверка показала, что дело не в "объёме" картинки (переход от плоской схемы к 3D-виду), а именно в реализме материалов и текстур — версия с 3D-видом, но нереалистичными текстурами, почти не улучшила результат.
Дальше проверили, можно ли автоматизировать поиск удачного визуального стиля — сравнили два подхода (свободная генерация идей моделью и пошаговое редактирование по одному элементу за раз) на 6 разных задачах и 18160 сгенерированных видео. Оба подхода систематически улучшали результат, причём VIPE оказался эффективнее классического приёма test-time scaling (голосование по нескольким попытками) и при этом дешевле — один вариант картинки стоит примерно 1/8 стоимости генерации видео.
Адаптации и экстраполяции
🔧 Техника: замена "фотореализм" → "стиль, релевантный домену модели"
Если у вас задача не про физику, а, например, про схему бизнес-процесса или диаграмму — можно попросить редактор перерисовать её не в фотореализм, а в стиль, который модель "видела" много раз: инфографика с реальных сайтов, скринкаст интерфейса, фото доски с маркером. Принцип тот же — дать модели знакомую визуальную обёртку вместо абстрактной схемы.
Пример: "Перерисуй эту блок-схему как фотографию настоящей белой доски с маркерными надписями и стикерами, сохранив расположение всех блоков и стрелок."
🔧 Техника: комбинация с несколькими попытками (self-consistency)
Исследование показало, что VIPE и классическое "спроси модель несколько раз и возьми большинство" работают независимо и складываются. В чате это можно воспроизвести так: сделать 2-3 разных визуальных варианта задачи, для каждого запросить решение, и сравнить, совпадают ли ответы — совпадающий ответ вероятнее правильный.
Ресурсы
Visual prompt engineering for video models — Robert Geirhos, Yuxuan Li, Thaddäus Wiedemer, Neha Kalibhat, Zi Wang, Mani Malek, Oyvind Tafjord, Kevin Swersky, Been Kim, Priyank Jaini (Google DeepMind). Примеры видео на проектной странице.
