TL;DR
Если вы загружаете в ChatGPT или Claude несколько картинок подряд — скриншоты переписки, кадры комикса, слайды презентации — и просите восстановить их правильный порядок или объяснить логику происходящего, модель отлично справится только в одном случае: если картинки и так идут по порядку. Как только реальную последовательность ломают (перемешивают), точность падает в разы — даже у топовых моделей вроде Gemini и GPT.
Исследователи проверили это на китайских мемах из нескольких панелей (комиксы, скриншоты переписки, сетки сравнений). Пока панели шли в правильном порядке, модели легко определяли тип структуры (лучшая — 76% точности). Но стоило перемешать панели и попросить восстановить логичный порядок — у открытых моделей точность рухнула до 6–27%, у лучшей закрытой модели (Gemini) — упала с 90%+ до 75%. Причина простая: модель хорошо распознаёт, что на картинке, но не выстраивает причинно-следственную цепочку между кадрами — она склонна просто повторять порядок, в котором ей эти кадры показали.
Метод исследования — двухшаговый тест: сначала показать модели картинки правильно и спросить про структуру, потом перемешать и попросить восстановить логику. Дополнительно проверили, помогает ли текстовый комментарий («подпись» под мемом) — оказалось, помогает через раз: то улучшает результат, то, наоборот, сбивает модель с толку, если комментарий ироничный.
Схема исследования
ШАГ 1 (Task 1a): Панели в правильном порядке, без подписи → модель определяет тип структуры (диалог, сравнение, нарастание и т.д.)
ШАГ 2 (Task 1b): Панели ПЕРЕМЕШАНЫ, без подписи → модель восстанавливает правильный порядок
ШАГ 3 (CAS): Комбинация "правильный/перемешанный порядок" × "с текстовым комментарием/без" → проверка, спасает ли контекст
ШАГ 4 (Task 2): Модель пишет объяснение мема → три живых человека оценивают текст по 5 критериям (визуал, логика панелей, юмор, контекст, точность)
Каждый шаг — отдельный запрос к модели, без дообучения.
Пример применения
Задача: Менеджер поддержки собрал 6 скриншотов переписки с клиентом, но случайно перепутал порядок при копировании в документ. Просит ИИ восстановить хронологию спора для отчёта руководителю.
Промпт:
Вот 6 скриншотов переписки с клиентом (прикрепляю). Порядок, в котором я их прислал,
может быть НЕПРАВИЛЬНЫМ — не полагайся на него.
Для каждого скриншота опиши:
1. Кто пишет (клиент/менеджер)
2. На что похоже это сообщение — ответ, вопрос, жалоба, извинение
3. Есть ли явные признаки, что это реакция на предыдущее сообщение (слова "да", "но", "хорошо", ссылки на предыдущий текст)
Затем восстанови реальную хронологию диалога и объясни, на основании каких
признаков (не порядка загрузки) ты это сделал. Если уверенности нет —
укажи это явно и предложи 2 возможных варианта порядка.
Результат: Модель распишет содержание каждого скриншота отдельно, затем предложит порядок с аргументацией. Важно — при 4+ скриншотах не доверяйте выводу автоматически: попросите модель показать признаки, на которые она опиралась, и сверьте их сами. Если признаков мало (нет явных отсылок «да, но», «спасибо за ответ») — вероятность ошибки высокая.
Почему это работает
Модель хорошо распознаёт содержание каждой картинки отдельно — это её сильная сторона. Но у неё нет встроенного «чувства времени»: она не отличает реальную причинно-следственную связь между кадрами от простого факта, что кадры лежат друг за другом в вашем сообщении. Из-за этого модель часто просто повторяет порядок предъявления, выдавая его за логичную реконструкцию.
Явная просьба не доверять порядку загрузки и искать конкретные текстовые/визуальные подсказки (реплики-ответы, слова-связки, нарастание действия) заставляет модель переключиться с «угадывания по расположению» на реальный анализ содержания. Это и есть рычаг управления: чем больше вы просите модель аргументировать порядок конкретными признаками — тем меньше она подменяет анализ повторением исходной последовательности.
Рычаги: - Число изображений → до 4 панелей модели справляются относительно неплохо, после 4-6 — точность падает почти до случайного угадывания. Больше 6 картинок — не доверяйте выводу без проверки. - Просьба объяснить признаки → заставляет модель искать реальные подсказки (диалоговые реплики, причина-следствие), а не угадывать по порядку загрузки. - Добавление текстового контекста (подписи, комментарии) → работает нестабильно: если комментарий прямо пересказывает суть — помогает, если ироничный или косвенный — может сбить с толку. Не добавляйте контекст «на автомате», ожидая гарантированного улучшения.
Ограничения
⚠️ Длинные последовательности: начиная с 7+ изображений все модели (включая топовые) работают на уровне случайного угадывания. Не просите ИИ восстанавливать порядок длинных серий скриншотов без ручной проверки.
⚠️ Субъективные границы: модели путают похожие по смыслу типы структур (например, диалог и повествование, сравнение и параллель) — если ваша задача на границе этих категорий, ожидайте ошибок.
⚠️ Контекст не панацея: добавление текстовых подсказок (заголовков, комментариев) помогает лишь в части случаев и может ухудшить результат, если текст ироничный или не прямо связан с порядком.
Как исследовали
Команда собрала 1214 многопанельных мемов с китайских соцсетей (Weibo, Bilibili, Douyin и др.) — комиксы, скриншоты чатов, сетки сравнений. Три человека вручную разметили тип структуры, зависимость от порядка и «блоки» допустимой перестановки панелей — согласие между разметчиками получилось очень высоким (это важно: значит категории объективны, а не выдуманы).
Пять моделей (три открытые, GPT-5.5 и Gemini 3.1 Pro) прогнали через два теста: сначала — панели в правильном порядке, потом — перемешанные. Разница в точности между этими условиями и стала главным доказательством: модели угадывают структуру, но не восстанавливают логику, если порядок сломан искусственно.
Отдельно 3 живых человека вслепую оценили текстовые объяснения мемов от каждой модели по 5 критериям — это добавило человеческую проверку качества, а не только автоматические метрики. Любопытная деталь: согласие оценщиков было умеренным (не высоким) — то есть даже люди расходятся в оценке «хорошего объяснения» мема, что напоминает: подобные задачи изначально субъективны.
Ресурсы
CMPM (Chinese Multi-Panel Meme Benchmark) — Haihan Li, Haihao Li, Zhenfei Xu, Jize Qian (Shanghai Maritime University, Dalian Maritime University). Код и данные будут опубликованы после принятия статьи.
