3,583 papers
arXiv:2608.26866 70 27 авг. 2026 г. FREE

Order Blindness: почему нейросети путают последовательность картинок, если её перемешать

КЛЮЧЕВАЯ СУТЬ
Обнаружено: языковая модель не восстанавливает причинно-следственную связь между картинками — она просто выдаёт порядок загрузки за логичный вывод. Метод позволяет восстановить реальную хронологию скриншотов переписки, кадров комикса или слайдов, даже если файлы перепутаны при загрузке. Фишка — прямо попросить модель игнорировать порядок загрузки и искать текстовые связки типа «да, но», «спасибо за ответ». Цифры бьют: у открытых моделей точность рушится до 6-27%, у лучшей закрытой (Gemini) падает с 90%+ до 75% — просто от перемешивания панелей.
Адаптировать под запрос

TL;DR

Если вы загружаете в ChatGPT или Claude несколько картинок подряд — скриншоты переписки, кадры комикса, слайды презентации — и просите восстановить их правильный порядок или объяснить логику происходящего, модель отлично справится только в одном случае: если картинки и так идут по порядку. Как только реальную последовательность ломают (перемешивают), точность падает в разы — даже у топовых моделей вроде Gemini и GPT.

Исследователи проверили это на китайских мемах из нескольких панелей (комиксы, скриншоты переписки, сетки сравнений). Пока панели шли в правильном порядке, модели легко определяли тип структуры (лучшая — 76% точности). Но стоило перемешать панели и попросить восстановить логичный порядок — у открытых моделей точность рухнула до 6–27%, у лучшей закрытой модели (Gemini) — упала с 90%+ до 75%. Причина простая: модель хорошо распознаёт, что на картинке, но не выстраивает причинно-следственную цепочку между кадрами — она склонна просто повторять порядок, в котором ей эти кадры показали.

Метод исследования — двухшаговый тест: сначала показать модели картинки правильно и спросить про структуру, потом перемешать и попросить восстановить логику. Дополнительно проверили, помогает ли текстовый комментарий («подпись» под мемом) — оказалось, помогает через раз: то улучшает результат, то, наоборот, сбивает модель с толку, если комментарий ироничный.

📌

Схема исследования

ШАГ 1 (Task 1a): Панели в правильном порядке, без подписи → модель определяет тип структуры (диалог, сравнение, нарастание и т.д.)
ШАГ 2 (Task 1b): Панели ПЕРЕМЕШАНЫ, без подписи → модель восстанавливает правильный порядок
ШАГ 3 (CAS): Комбинация "правильный/перемешанный порядок" × "с текстовым комментарием/без" → проверка, спасает ли контекст
ШАГ 4 (Task 2): Модель пишет объяснение мема → три живых человека оценивают текст по 5 критериям (визуал, логика панелей, юмор, контекст, точность)

Каждый шаг — отдельный запрос к модели, без дообучения.


🚀

Пример применения

Задача: Менеджер поддержки собрал 6 скриншотов переписки с клиентом, но случайно перепутал порядок при копировании в документ. Просит ИИ восстановить хронологию спора для отчёта руководителю.

Промпт:

Вот 6 скриншотов переписки с клиентом (прикрепляю). Порядок, в котором я их прислал, 
может быть НЕПРАВИЛЬНЫМ — не полагайся на него.

Для каждого скриншота опиши:
1. Кто пишет (клиент/менеджер)
2. На что похоже это сообщение — ответ, вопрос, жалоба, извинение
3. Есть ли явные признаки, что это реакция на предыдущее сообщение (слова "да", "но", "хорошо", ссылки на предыдущий текст)

Затем восстанови реальную хронологию диалога и объясни, на основании каких 
признаков (не порядка загрузки) ты это сделал. Если уверенности нет — 
укажи это явно и предложи 2 возможных варианта порядка.

Результат: Модель распишет содержание каждого скриншота отдельно, затем предложит порядок с аргументацией. Важно — при 4+ скриншотах не доверяйте выводу автоматически: попросите модель показать признаки, на которые она опиралась, и сверьте их сами. Если признаков мало (нет явных отсылок «да, но», «спасибо за ответ») — вероятность ошибки высокая.


🧠

Почему это работает

Модель хорошо распознаёт содержание каждой картинки отдельно — это её сильная сторона. Но у неё нет встроенного «чувства времени»: она не отличает реальную причинно-следственную связь между кадрами от простого факта, что кадры лежат друг за другом в вашем сообщении. Из-за этого модель часто просто повторяет порядок предъявления, выдавая его за логичную реконструкцию.

Явная просьба не доверять порядку загрузки и искать конкретные текстовые/визуальные подсказки (реплики-ответы, слова-связки, нарастание действия) заставляет модель переключиться с «угадывания по расположению» на реальный анализ содержания. Это и есть рычаг управления: чем больше вы просите модель аргументировать порядок конкретными признаками — тем меньше она подменяет анализ повторением исходной последовательности.

Рычаги: - Число изображений → до 4 панелей модели справляются относительно неплохо, после 4-6 — точность падает почти до случайного угадывания. Больше 6 картинок — не доверяйте выводу без проверки. - Просьба объяснить признаки → заставляет модель искать реальные подсказки (диалоговые реплики, причина-следствие), а не угадывать по порядку загрузки. - Добавление текстового контекста (подписи, комментарии) → работает нестабильно: если комментарий прямо пересказывает суть — помогает, если ироничный или косвенный — может сбить с толку. Не добавляйте контекст «на автомате», ожидая гарантированного улучшения.


⚠️

Ограничения

⚠️ Длинные последовательности: начиная с 7+ изображений все модели (включая топовые) работают на уровне случайного угадывания. Не просите ИИ восстанавливать порядок длинных серий скриншотов без ручной проверки.

⚠️ Субъективные границы: модели путают похожие по смыслу типы структур (например, диалог и повествование, сравнение и параллель) — если ваша задача на границе этих категорий, ожидайте ошибок.

⚠️ Контекст не панацея: добавление текстовых подсказок (заголовков, комментариев) помогает лишь в части случаев и может ухудшить результат, если текст ироничный или не прямо связан с порядком.


🔍

Как исследовали

Команда собрала 1214 многопанельных мемов с китайских соцсетей (Weibo, Bilibili, Douyin и др.) — комиксы, скриншоты чатов, сетки сравнений. Три человека вручную разметили тип структуры, зависимость от порядка и «блоки» допустимой перестановки панелей — согласие между разметчиками получилось очень высоким (это важно: значит категории объективны, а не выдуманы).

Пять моделей (три открытые, GPT-5.5 и Gemini 3.1 Pro) прогнали через два теста: сначала — панели в правильном порядке, потом — перемешанные. Разница в точности между этими условиями и стала главным доказательством: модели угадывают структуру, но не восстанавливают логику, если порядок сломан искусственно.

Отдельно 3 живых человека вслепую оценили текстовые объяснения мемов от каждой модели по 5 критериям — это добавило человеческую проверку качества, а не только автоматические метрики. Любопытная деталь: согласие оценщиков было умеренным (не высоким) — то есть даже люди расходятся в оценке «хорошего объяснения» мема, что напоминает: подобные задачи изначально субъективны.


🔗

Ресурсы

CMPM (Chinese Multi-Panel Meme Benchmark) — Haihan Li, Haihao Li, Zhenfei Xu, Jize Qian (Shanghai Maritime University, Dalian Maritime University). Код и данные будут опубликованы после принятия статьи.


📋 Дайджест исследования

Ключевая суть

Обнаружено: языковая модель не восстанавливает причинно-следственную связь между картинками — она просто выдаёт порядок загрузки за логичный вывод. Метод позволяет восстановить реальную хронологию скриншотов переписки, кадров комикса или слайдов, даже если файлы перепутаны при загрузке. Фишка — прямо попросить модель игнорировать порядок загрузки и искать текстовые связки типа «да, но», «спасибо за ответ». Цифры бьют: у открытых моделей точность рушится до 6-27%, у лучшей закрытой (Gemini) падает с 90%+ до 75% — просто от перемешивания панелей.

Принцип работы

Модель как турист с фотоаппаратом — она отлично описывает что на каждом кадре, но не помнит, в каком порядке снимала. Она распознаёт содержание картинки — это её сильная сторона. Но у неё нет чувства времени: она не отличает «кадры лежат подряд в моём сообщении» от «кадр Б — следствие кадра А». Модель путает порядок загрузки с логикой происходящего — и выдаёт первое за второе.

Почему работает

Явная просьба игнорировать порядок загрузки и искать конкретные признаки — слова-связки, ответы на предыдущее сообщение, нарастание действия — заставляет модель переключиться с угадывания на реальный анализ. До 4 панелей это работает почти идеально: 76% точности на определении структуры. После 6 картинок — даже топовые модели скатываются к случайному угадыванию. Разрыв не в процентах, а в разах: 90%+ против 75% у Gemini, и 6-27% у открытых моделей — просто от перемешивания.

Когда применять

Восстановление хронологии → для скриншотов переписки, кадров комикса, слайдов презентации, когда файлы перепутаны при копировании. Особенно критично при 5+ изображениях — здесь без ручной проверки почти гарантирована ошибка. НЕ подходит для серий из 7+ картинок без верификации человеком — там точность на уровне случайного угадывания.

Мини-рецепт

1. Два прохода: сначала покажи модели картинки в правильном порядке, спроси про структуру — так проверишь, вообще ли модель понимает тип последовательности.
2. Явное предупреждение: перемешай картинки и прямо напиши — порядок загрузки может быть неправильным, не полагайся на него.
3. Требуй признаки: попроси конкретные подсказки — слова-связки («да», «но», «спасибо за ответ»), ответы на предыдущее сообщение, нарастание действия.
4. Проверяй вручную при 5+: если картинок больше 4-6 — точность падает почти до случайной, сверяй выводы модели сам.
5. Осторожно с подписями: добавляй текстовый комментарий только если он прямо описывает суть — ироничный текст может сбить модель с толку.

Примеры

[ПЛОХО] : Вот 6 скриншотов переписки, восстанови порядок и напиши отчёт
[ХОРОШО] : Вот 6 скриншотов переписки. Порядок загрузки может быть неправильным — не полагайся на него. Для каждого скриншота укажи признаки того, что это ответ на предыдущее сообщение (слова "да", "но", ссылки на текст). Затем восстанови хронологию и объясни, на основании каких признаков ты это сделал.
Источник: Order Matters: A Chinese Multi-Panel Meme Benchmark for Vision-Language Reasoning
ArXiv ID: 2608.26866 | Сгенерировано: 2026-08-28 04:29

Проблемы LLM

ПроблемаСутьКак обойти
Модель путает порядок показа картинок с реальной хронологией событийЗагружаешь несколько картинок подряд — скриншоты, кадры комикса, слайды. Модель не понимает, что порядок загрузки может быть случайным. Она подставляет причинно-следственную логику под тот порядок, в котором ты прислал файлы. Если реальный порядок совпал — результат хороший. Если перемешан — точность падает в разы, иногда почти до случайного угадывания. Проблема касается любой задачи на восстановление хронологии: переписки, шаги инструкции, кадры видео, этапы процессаЯвно напиши в запросе: "порядок загрузки может быть неправильным, не полагайся на него". Попроси модель для каждого элемента назвать конкретные признаки связи с соседями — слова-отсылки ("да", "но", "в ответ на"), причинно-следственные маркеры. Модель переключается с угадывания по расположению на анализ содержания

Методы

МетодСуть
Требование явных признаков связи вместо угадывания по порядкуПопроси модель для каждого элемента последовательности (картинка, абзац, шаг) отдельно назвать: что это, на что похоже, есть ли признаки что это реакция на предыдущий элемент. Только потом — просить восстановить порядок, ссылаясь именно на эти признаки, а не на то, как элементы были показаны. Почему работает: порядок предъявления — самый лёгкий заменитель логики, модель хватается за него по умолчанию. Явное требование аргументации заставляет искать настоящие текстовые/визуальные подсказки. Когда да: восстановление хронологии переписок, разбор кадров, сортировка шагов, до 4-5 элементов. Когда нет: элементов больше 6-7 — точность рушится почти до случайной даже с этим приёмом, нужна ручная проверка
📖 Простыми словами

Order Matters: A Chinese Multi-Panel Meme Benchmark for Vision-LanguageReasoning

arXiv: 2608.26866

Мультимодальные модели вроде GPT-4o, Claude и Gemini слепы к хронологии. Когда ты скармливаешь им пачку картинок, они отлично распознают объекты на каждом отдельном кадре, но в упор не видят причинно-следственные связи между ними. У нейросетей нет встроенного чувства времени: они тупо верят, что файлы уже загружены в правильной последовательности.

Это как уронить на пол комикс, собрать страницы в случайную стопку и отдать читать первокласснику. Он бодро прочитает пятую страницу, затем первую, сделает умный вид и на ходу сочинит дикий сюжет, лишь бы не признавать, что страницы перепутаны. Модель делает ровно то же самое — она банально повторяет порядок загрузки, притворяясь гениальным детективом.

В исследовании на бенчмарке Multi-Panel Meme моделям устроили стресс-тест: перемешали кадры комиксов и мемов. Итог — полный провал топовых сеток. Пока картинки идут по порядку, ИИ выдаёт логичный разбор, но стоит нарушить таймлайн, как точность падает в разы. Срабатывает примитивный позиционный сдвиг (positional bias): модель всегда считает первую попавшуюся картинку началом истории.

Тестировали на мемах, но грабли универсальны для любых задач. Закинул пачку несортированных скриншотов из чата поддержки, чтобы выяснить, кто первый начал хамить? Залил слайды презентации или раскадровку видео? Нейросеть не восстановит таймлайн событий — она просто сошьет факты в порядке добавления файлов, выдав уверенный бред за глубокую аналитику.

Короче: не жди, что нейросеть сама распутает перепутанную хронологию. Никакой магии понимания контекста тут нет. Если нужно восстановить ход событий — ручками нумеруй файлы или заставляй модель опираться на явные таймстемпы. Иначе вместо разбора реального факапа ты получишь красивую сказку, где следствие опережает причину, а разгребать последствия придётся тебе.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с