3,583 papers
arXiv:2607.25537 74 28 июля 2026 г. FREE

VIPE (Visual Prompt Engineering): улучшение видео-моделей через переделку картинки, а не текста

КЛЮЧЕВАЯ СУТЬ
Видео-модель тупит на простой схеме с шариком и линиями — выдаёт результат почти случайный. Перерисуй ту же схему в фотореалистичное фото — и точность решения задачи заметно растёт, хотя суть задачи не изменилась ни на йоту. Метод VIPE позволяет улучшить видео-генерацию на физических и логических задачах без единой правки текстового промпта — меняется только картинка. Нейросеть-редактор перерисовывает схему в реализм, судья выбирает лучший вариант, сохраняя геометрию до пиксельной точности — модель больше не разгадывает абстракцию, она узнаёт знакомую сцену.
Адаптировать под запрос

TL;DR

VIPE — это способ улучшить качество ответа видео-модели, не трогая текстовый промпт, а меняя картинку, которую ей подсовываешь. Берёшь исходное изображение задачи, просишь другую нейросеть-редактор картинок перерисовать его в другом стиле (например, из схематичного рисунка сделать фотореалистичную сцену), и отдаёшь этот новый вариант видео-модели вместо оригинала.

Оказывается, видео-модели плохо «рассуждают» по абстрактным схематичным картинкам — линии, кружочки, чёрно-белые схемы. Модель на таких простых рисунках выдаёт результат близкий к случайному угадыванию. Но если ту же самую задачу нарисовать реалистично — шарик стал бильярдным шаром, линии стали деревянными полками — модель вдруг начинает решать задачу заметно лучше, хотя суть задачи не изменилась ни на йоту.

VIPE решает это в три шага: (1) нейросеть-«генератор идей» предлагает, как можно перерисовать картинку без изменения логики задачи, (2) редактор изображений (например, Nano Banana) рисует несколько вариантов, (3) фильтр (другая модель-судья) выбирает лучший вариант по качеству и верности оригиналу. Готовую картинку отдают видео-модели для решения задачи.


🔬

Схема метода

ШАГ 1 (ИДЕАТОР): Модель придумывает текстовое описание правки → "заменить схему на фотореалистичную сцену, не меняя структуру"
ШАГ 2 (РЕДАКТОР): Модель-редактор картинок генерирует 3-5 вариантов новой картинки по этому описанию → набор изображений-кандидатов
ШАГ 3 (ФИЛЬТР, опционально): Модель-судья выбирает лучший вариант — по качеству и точности сохранения задачи → одна финальная картинка
ШАГ 4 (ОСНОВНАЯ ЗАДАЧА): Финальную картинку + обычный текстовый промпт отдают видео-модели → видео-ответ на задачу

Все шаги можно выполнять как отдельные запросы к разным моделям (в оригинале — так и делали), но принцип применим и в один диалог с картинкой.


🚀

Пример применения

Задача: Вы объясняете видео-нейросети (например, генератору коротких роликов) физическую задачу и хотите получить осмысленную симуляцию, а не бессмысленное видео.

Промпт (шаг 1, генерация улучшенной картинки):

Вот схематичный чертёж: шарик скатывается по наклонным линиям и падает в одну из трёх корзин.
Перерисуй эту сцену так, чтобы она выглядела как фотореалистичная фотография:
- ракурс камеры не менять, смотрим прямо на стену
- белый кружок замени на маленький красный бильярдный шар
- каждую чёрную линию замени на деревянную полку той же длины, ориентации и расположения
- больше ничего не добавляй и не меняй

Промпт (шаг 2, основная задача — отдаётся видео-модели вместе с новой картинкой):

На этом изображении шарик скатывается по деревянным полкам под действием гравитации.
Сгенерируй видео, показывающее, в какую из трёх корзин упадёт шарик.

Результат: Модель-редактор вернёт фотореалистичную версию исходной схемы с сохранённой геометрией. Дальше видео-модель, получив эту более «понятную» ей картинку, сгенерирует видео с траекторией шарика — и вероятность, что итоговое видео физически правдоподобно и правильно предсказывает исход, вырастет заметно по сравнению с тем, если бы вы подали ей исходную схему.


🧠

Почему это работает

Видео-модели обучены на реальных фото и видео из мира, а не на схемах и чертежах. Когда вы даёте им абстрактный рисунок — линии, кружочки, минималистичную сцену — модель попадает в непривычную для себя визуальную зону и «путается», как человек, которому вместо чертежа дали каракули.

Зато с реалистичными сценами модель работает в своей стихии: она видела миллионы видео с шарами, полками, тенями, физикой падения предметов. Дать ей знакомый визуальный контекст — это как дать переводчику текст на языке, который он выучил, а не на языке, который он видел только в учебнике.

VIPE использует эту сильную сторону: не пытается научить модель понимать схемы, а убирает необходимость это делать, заранее переводя задачу на «родной» для модели визуальный язык.

Рычаги управления: - Инструкция редактору (что можно менять, что нельзя) → сузь её жёстко, если задача чувствительна к геометрии — иначе редактор может случайно упростить задачу - Число вариантов-кандидатов → больше вариантов = выше шанс найти удачный, но дороже; для простых задач хватит 2-3 - Наличие фильтра-судьи → без него один случайный вариант может испортить задачу (например, "решить" её за модель); с фильтром выше надёжность - Замена реализма на другой стиль (мультяшный, нуарный, макро) → сам принцип "перерисовать в понятный модели стиль" работает не только с фотореализмом


📋

Шаблон промпта

Шаг 1 — генерация улучшенной картинки (промпт для модели-редактора изображений):
"Вот изображение задачи: {описание сцены и объектов}.
Перерисуй это в фотореалистичном стиле, сохранив:
- ракурс и композицию без изменений
- расположение, размер и пропорции всех объектов точно как в оригинале
Замени {абстрактный элемент 1} на {реалистичный аналог 1}.
Замени {абстрактный элемент 2} на {реалистичный аналог 2}.
Не добавляй новых объектов и не меняй логику задачи."

Шаг 2 — основная задача (промпт для видео-модели, вместе с новой картинкой):
"На этом изображении {описание ситуации}.
{Вопрос или задание к видео-модели: что должно произойти, что нужно предсказать}."

🚀 Быстрый старт — вставь в чат:

Вот шаблон визуального прайм-инжиниринга для видео-задач. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какая у вас исходная картинка, какие элементы в ней абстрактны или схематичны, и в какой реалистичный стиль их лучше перевести — потому что именно точность замены "абстрактное → конкретное" при сохранении геометрии определяет, сработает ли метод.


⚠️

Ограничения

⚠️ Нужна отдельная модель-редактор изображений: метод требует доступа к инструменту генерации/редактирования картинок (Nano Banana, Midjourney с img2img и подобные), просто текстовый чат с LLM без картинок это не воспроизведёт.

⚠️ Риск случайно облегчить задачу: редактор может при перерисовке незаметно исказить геометрию или логику — исследователи вручную проверяли, что задача не стала легче. Без проверки результата есть шанс получить недостоверные результаты.

⚠️ Работает не с любой "абстрактностью": отдельный тест показал, что дело не в переходе от 2D к 3D-виду, а именно в реализме текстур и материалов. Просто "накинуть объём" без реалистичной фактуры почти не помогает.

⚠️ Проверено на видео-моделях, не факт что переносится на обычные LLM без изображений: эффект показан именно там, где модель получает картинку как часть задачи (видео-генерация, визуальное рассуждение) — не применим к чисто текстовым задачам.


🔍

Как исследовали

Команда взяла датасет физических задач VPCT — шарик катится по рампам и падает в одну из трёх корзин, задача изначально нарисована схематично (чёрные линии, белый кружок). Они перерисовали весь датасет в фотореалистичный стиль через модель-редактор (Nano Banana Pro) с чётким текстовым описанием, что можно менять, а что нельзя, и проверили итог вручную, чтобы задача не стала проще.

Дальше сравнили, как разные видео-модели (Wan2.2, Veo 3.1, Omni Flash) решают задачу на схематичной версии против фотореалистичной — на 1000 примеров, усреднённых по 10 прогонам. Разница оказалась огромной: некоторые модели на схемах работали на уровне случайного угадывания, а на реалистичных картинках — заметно выше шанса.

Что удивило: отдельная проверка показала, что дело не в "объёме" картинки (переход от плоской схемы к 3D-виду), а именно в реализме материалов и текстур — версия с 3D-видом, но нереалистичными текстурами, почти не улучшила результат.

Дальше проверили, можно ли автоматизировать поиск удачного визуального стиля — сравнили два подхода (свободная генерация идей моделью и пошаговое редактирование по одному элементу за раз) на 6 разных задачах и 18160 сгенерированных видео. Оба подхода систематически улучшали результат, причём VIPE оказался эффективнее классического приёма test-time scaling (голосование по нескольким попытками) и при этом дешевле — один вариант картинки стоит примерно 1/8 стоимости генерации видео.


💡

Адаптации и экстраполяции

🔧 Техника: замена "фотореализм" → "стиль, релевантный домену модели"

Если у вас задача не про физику, а, например, про схему бизнес-процесса или диаграмму — можно попросить редактор перерисовать её не в фотореализм, а в стиль, который модель "видела" много раз: инфографика с реальных сайтов, скринкаст интерфейса, фото доски с маркером. Принцип тот же — дать модели знакомую визуальную обёртку вместо абстрактной схемы.

Пример: "Перерисуй эту блок-схему как фотографию настоящей белой доски с маркерными надписями и стикерами, сохранив расположение всех блоков и стрелок."

🔧 Техника: комбинация с несколькими попытками (self-consistency)

Исследование показало, что VIPE и классическое "спроси модель несколько раз и возьми большинство" работают независимо и складываются. В чате это можно воспроизвести так: сделать 2-3 разных визуальных варианта задачи, для каждого запросить решение, и сравнить, совпадают ли ответы — совпадающий ответ вероятнее правильный.


🔗

Ресурсы

Visual prompt engineering for video models — Robert Geirhos, Yuxuan Li, Thaddäus Wiedemer, Neha Kalibhat, Zi Wang, Mani Malek, Oyvind Tafjord, Kevin Swersky, Been Kim, Priyank Jaini (Google DeepMind). Примеры видео на проектной странице.


📋 Дайджест исследования

Ключевая суть

Видео-модель тупит на простой схеме с шариком и линиями — выдаёт результат почти случайный. Перерисуй ту же схему в фотореалистичное фото — и точность решения задачи заметно растёт, хотя суть задачи не изменилась ни на йоту. Метод VIPE позволяет улучшить видео-генерацию на физических и логических задачах без единой правки текстового промпта — меняется только картинка. Нейросеть-редактор перерисовывает схему в реализм, судья выбирает лучший вариант, сохраняя геометрию до пиксельной точности — модель больше не разгадывает абстракцию, она узнаёт знакомую сцену.

Принцип работы

Не трогай текст — трогай картинку. Видео-модели учились на реальных видео с шарами, полками и тенями, а не на чертежах с кружочками и линиями. Перевод в фотореализм работает как перевод текста на язык, который переводчик выучил, а не видел только в учебнике. Три шага: придумать правку, нарисовать варианты, выбрать лучший — задача остаётся той же самой, просто в понятной модели «одежде».

Почему работает

Причина проста: модель видела миллионы видео с падающими предметами, полками, физикой гравитации — а схемы почти не встречались в обучении. Абстрактный рисунок для неё — чужой язык, реалистичное фото — родной. Дело не в переходе от 2D к 3D, а именно в реализме текстур и материалов — отдельный тест показал: просто накинуть объём без фактуры почти не помогает.

Когда применять

Видео-генерация и визуальное рассуждение → задачи с абстрактными схемами, чертежами, диаграммами, где нужна физическая симуляция или предсказание исхода. Особенно когда исходная картинка — линии, кружочки, чёрно-белая схема без текстур. НЕ подходит для чисто текстовых задач без картинки — эффект проверен только там, где модель получает изображение как часть задачи.

Мини-рецепт

1. Опиши правку: какие элементы схемы абстрактны и на что их заменить, что нельзя трогать — ракурс, размеры, расположение объектов.
2. Сгенерируй варианты: попроси редактор картинок (Nano Banana или аналог) сделать 3-5 версий перерисовки.
3. Проверь результат: сравни новую картинку с оригиналом — геометрия и логика задачи не изменились, задача не стала легче.
4. Отдай финал видео-модели: новая картинка + обычный текстовый промпт с вопросом о том, что должно произойти.

Примеры

[ПЛОХО] : Вот схема: шарик и три линии-полки. Сгенерируй видео, куда упадёт шарик.
[ХОРОШО] : Перерисуй схему в фотореалистичное фото: белый кружок замени на красный бильярдный шар, чёрные линии — на деревянные полки той же длины и расположения, ракурс не меняй, ничего не добавляй. Затем на новой картинке покажи видео, куда упадёт шарик под действием гравитации.
Источник: Visual Prompt Engineering for Video Models
ArXiv ID: 2607.25537 | Сгенерировано: 2026-07-29 04:22

Проблемы LLM

ПроблемаСутьКак обойти
Модель путается в схематичных картинкахДаёшь модели чертёж, схему, чёрно-белый рисунок с кружочками и линиями. Модель отвечает почти наугад. Та же задача, нарисованная реалистично — с текстурами, фото-подобными объектами — решается заметно лучше. Суть задачи не меняется, а точность ответа скачетПеред основным запросом попроси другую модель перерисовать схему в реалистичном стиле. Сохрани геометрию и расположение объектов, замени абстрактные элементы на реальные аналоги (кружок шар, линия полка)

Методы

МетодСуть
Перерисовка схемы в реалистичный стиль перед основной задачейТри шага. 1) Одна модель придумывает текстовое описание правки — что заменить, чтобы картинка стала реалистичной, но логика задачи не поменялась. 2) Модель-редактор изображений рисует несколько вариантов по этому описанию. 3) Модель-судья выбирает лучший вариант — по качеству и точности сохранения оригинальной геометрии. Готовую картинку отдаёшь основной модели вместе с обычным текстовым вопросом. Почему работает: модели визуального типа обучены на реальных фото и видео, а не на схемах — реалистичная картинка попадает в привычную для неё "зону" данных. Когда применять: любая задача, где модель получает изображение — схему, чертёж, диаграмму — и должна на нём что-то предсказать или сгенерировать. Когда не работает: чисто текстовые задачи без изображения; задачи где перерисовка рискует случайно исказить геометрию — без проверки результата (фильтра-судьи) это может незаметно "решить" задачу за модель
📖 Простыми словами

Visualpromptengineeringfor videomodels

arXiv: 2607.25537

Видео-модели — это не физические движки, которые понимают законы Ньютона, а гигантские библиотеки визуальной памяти. Когда ты скармливаешь им схематичный набросок или чертеж, они впадают в ступор, потому что в их обучающей выборке не было миллионов видео с ожившими схемами. Они привыкли к реальному миру, текстурам и свету. Суть метода VIPE в том, чтобы перестать мучить модель абстракциями и дать ей то, что она понимает на генетическом уровне — качественную «картинку-обманку», которая переводит твою задачу на язык визуального опыта нейросети.

Это как пытаться объяснить профессиональному повару рецепт на языке химических формул: он вроде и поймет, но приготовит какую-то херню. Но стоит показать ему фотографию готового блюда, как у него в голове сразу щелкает правильный алгоритм действий. Метод VIPE работает именно так: он берет твой корявый «чертеж» и с помощью другой нейронки превращает его в фотореалистичный кадр, который служит идеальным фундаментом для генерации видео.

Технически процесс выглядит как двухэтапный конвейер. Сначала ты берешь исходное изображение задачи и прогоняешь его через редактор картинок (Image-to-Image), чтобы сменить стиль. Главная фишка здесь — визуальное перерисовывание: превратить плоский набросок в объемную сцену с тенями и деталями. Видео-модель видит этот «улучшенный» кадр, узнает в нем привычные паттерны из интернета и выдает осмысленную симуляцию вместо каши из пикселей.

Хотя метод тестировали на генерации видео, этот подход — универсальный костыль для любой мультимодальной работы. Если нейронка должна что-то проанализировать или анимировать, качество исходного визуала решает всё. Это применимо в дизайне, архитектурной визуализации или даже в обучении роботов: везде, где нужно перекинуть мостик от схематичной идеи к реальному воплощению. Формально ты не меняешь смысл, но меняешь упаковку, которую модель способна переварить.

Короче, хватит полировать текстовые промпты — это тупиковый путь, если картинка-исходник выглядит как мусор. Визуальный инжиниринг дает гораздо больший буст к качеству, чем попытки подобрать «магические слова». Если хочешь, чтобы видео-модель не лажала, дай ей фотореалистичный референс, а не загадки в виде кружочков и линий. Кто первым поймет, что с глазами нейросети нужно работать через текстуры и свет, тот и получит голливудскую картинку, пока остальные бьются лбом о текстовое поле.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с