3,583 papers
arXiv:2608.10908 74 11 авг. 2026 г. FREE

LVLM-судьи путают порядок кадров с логикой: primacy и recency bias при оценке последовательностей

КЛЮЧЕВАЯ СУТЬ
Точность падает почти до монетки, если перепутать шаги в середине истории. Начало и конец модель ловит нормально — середина стирается, как забытый вопрос в викторине. Метод попарного разбора переходов позволяет вытащить настоящую логику последовательности, а не поймать модель на угадывании по позиции. Фишка: не проси общую оценку всей цепочки — проси разобрать каждый переход отдельно. Тогда модель перестаёт цепляться за то, что стоит в начале и в конце.
Адаптировать под запрос

TL;DR

Когда просишь ИИ проверить, правильный ли порядок шагов в истории или инструкции, модель ориентируется на то, что стоит в начале и в конце, а не на реальную логическую связь между шагами. Если попросить оценить всю последовательность одной оценкой — модель поставит одинаково высокий балл и правильному порядку, и перемешанному. Это касается моделей, которые работают с картинками (LVLM), но механизм — общий для всех LLM.

Боль конкретная: исследователи давали моделям кулинарный рецепт из 4 кадров — то в правильном порядке, то с перепутанными средними шагами. Модель, которую попросили поставить оценку от 1 до 5, ставила обеим версиям похожие высокие баллы — то 4, то 5, будто перестановки не заметила. А когда её напрямую спрашивали "какой из двух вариантов правильный" — точность падала почти до уровня монетки, особенно если перепутаны шаги в середине, а не в начале или конце.

Причина — в том, как модель "запоминает" последовательность: начало и конец она держит в фокусе сильнее, а середина стирается, как в игре "Что? Где? Когда?", где помнят первый и последний вопрос раунда, а не пятый. Дообучение модели немного улучшает калибровку оценок, но саму предвзятость к позиции не убирает — она встроена в архитектуру, а не в нехватку данных.


📌

Схема диагностики (как исследователи проверяли модель — можно повторить в чате)

ШАГ 1: Дать модели два варианта последовательности (правильный и с перепутанными шагами) → без подсказки какой правильный
ШАГ 2: Попросить объяснить переход между каждой парой соседних шагов → текстовое рассуждение
ШАГ 3: Попросить финальный вердикт — какой вариант логичен
ШАГ 4: Повторить с обратным порядком предъявления (сначала показать как "А", потом как "Б", и наоборот) → сравнить ответы

Если ответ модели меняется от того, что она увидела первым — это и есть позиционная предвзятость в действии.


🚀

Пример применения

Задача: Ты делаешь карусель для Reels/VK — "Как я сделал ремонт квартиры за 100 тысяч рублей за 6 шагов". Хочешь проверить у ChatGPT, логична ли последовательность шагов, прежде чем публиковать.

Промпт:

Вот два варианта порядка шагов истории про ремонт квартиры.

Вариант А:
1. Купил инструменты и материалы
2. Демонтировал старую отделку
3. Сделал стяжку пола
4. Покрасил стены
5. Положил ламинат
6. Расставил мебель

Вариант Б:
1. Купил инструменты и материалы
2. Демонтировал старую отделку
3. Покрасил стены
4. Сделал стяжку пола
5. Положил ламинат
6. Расставил мебель

Проверь переход между каждой парой соседних шагов в обоих вариантах отдельно — 
логично ли шаг 2 вытекает из шага 1, шаг 3 из шага 2, и так далее.
Не ставь общую оценку сразу — сначала распиши переходы, потом сделай вывод, 
какой вариант правильный и почему.

Результат: Модель распишет по каждому переходу пояснение (например, "стяжка пола после покраски стен — нелогично, обычно пол делают до финишной отделки стен"), а в конце даст вердикт с указанием, какой вариант нарушает процедурную логику. Если попросить то же самое, но поменяв порядок предъявления вариантов, и получить другой ответ — значит, модель ориентировалась на позицию, а не на смысл.


🧠

Почему это работает

Модель плохо держит в поле внимания весь порядок сразу — механизм внимания в трансформерах сильнее "видит" первый и последний элементы последовательности, а середина смазывается. Это архитектурная особенность, не баг конкретной модели — она проявляется и после дообучения.

Зато модель хорошо справляется с оценкой одного шага изолированно — описать, что на картинке, или проверить логичность одного перехода между двумя соседними пунктами.

Метод использует эту силу: вместо того чтобы просить общую оценку всей цепочки (где модель хватается за позиционные подсказки), просишь явно разобрать переходы по одному и сравнить порядок в паре, а не оценить сам по себе. Плюс рандомизация — кто идёт первым, А или Б — вскрывает, реагирует модель на смысл или на позицию.

Рычаги управления: - Оценка одним числом (1–5) → замени на попарное сравнение "что правильнее" - Порядок предъявления вариантов → рандомизируй, спроси дважды в разном порядке - Просьба сразу дать вердикт → замени на "распиши переход между каждой парой шагов, потом вывод" - Длинные последовательности (>5 шагов) → разбивай на пары соседних шагов, не проверяй всё целиком


📋

Шаблон промпта

Вот два варианта последовательности: {описание_задачи}.

Вариант А:
{шаг_1, шаг_2, ..., шаг_N}

Вариант Б:
{тот же список с изменённым порядком}

Проверь переход между каждой парой соседних шагов отдельно в обоих вариантах — 
логично ли шаг 2 вытекает из шага 1, шаг 3 из шага 2, и так далее.
Не давай общую оценку сразу. Сначала распиши переходы построчно, 
потом сделай вывод — какой вариант логичен и почему.

Подставь свою последовательность — план, сценарий, инструкцию, историю по кадрам. Потом повтори запрос, поменяв местами Вариант А и Б — если вывод модели изменился, доверять её вердикту напрямую нельзя.

🚀 Быстрый старт — вставь в чат:

Вот принцип проверки логики последовательности. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какая у тебя последовательность и есть ли эталонный "правильный" порядок — это нужно, чтобы правильно расставить варианты А и Б для сравнения.


⚠️

Ограничения

⚠️ Не работает надёжно на сложных перестановках: если перепутаны шаги в середине последовательности (а не в начале/конце), точность угадывания у моделей падает почти до уровня случайного выбора — даже после дообучения.

⚠️ Пошаговое рассуждение не гарантирует правильный вердикт: модель может красиво расписать переходы, но в итоге всё равно ошибиться с финальным ответом — качество объяснения и точность оценки не связаны напрямую.

⚠️ Проверено на изображениях, не на чистом тексте: исследование про последовательности картинок. Для текстовых списков/инструкций эффект вероятно похож (это известная проблема "теряется середина" у LLM), но именно в этой работе не проверялось.


🔍

Как исследовали

Исследователи взяли две модели, которые понимают и картинки, и текст (LLaVA-OneVision и LLaVA-Critic), и заставили их судить последовательности кадров двумя способами: ставить оценку от 1 до 5 всей истории или выбирать из пары — какая последовательность правильная. Для теста собрали два набора данных: PRISM — тысячи кулинарных рецептов с искусственно перепутанными или заменёнными кадрами, и MIRAGE — реальные сбои из семи разных ИИ-генераторов картинок.

Сравнивали оценки моделей с оценками живых людей и с оценками другой модели (Gemini) как ориентиром. Результат удивил: при оценке "в лоб" модели ставили похожие высокие баллы и правильному, и перемешанному варианту — то есть казались компетентными, но на самом деле просто не различали порядок. Зато при прямом сравнении "какой вариант правильный" точность рухнула почти до случайной, особенно на перестановках в середине истории.

Дообучение (SFT с LoRA) немного улучшило калибровку оценок, но позиционную предвзятость не убрало — она встроена в то, как модель "смотрит" на последовательность, а не в нехватку тренировочных данных. Отсюда практический вывод: не доверяй одной общей оценке последовательности от ИИ, проверяй попарно и с рандомизацией порядка.


🔗

Ресурсы

Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences — Martina Ianaro, Maurizio Gabbrielli (University of Bologna), Guilherme Fernandes, João Magalhães (NOVA School of Science and Technology, Лиссабон). Датасеты PRISM и MIRAGE, представлены на MM '26 (Rio de Janeiro).


📋 Дайджест исследования

Ключевая суть

Точность падает почти до монетки, если перепутать шаги в середине истории. Начало и конец модель ловит нормально — середина стирается, как забытый вопрос в викторине. Метод попарного разбора переходов позволяет вытащить настоящую логику последовательности, а не поймать модель на угадывании по позиции. Фишка: не проси общую оценку всей цепочки — проси разобрать каждый переход отдельно. Тогда модель перестаёт цепляться за то, что стоит в начале и в конце.

Принцип работы

Просишь оценить всю последовательность одной цифрой — модель хватается за начало и конец, середина смазывается. Это как экзаменатор, который запомнил первый и последний ответ студента, а середину прослушал мимо ушей. Принцип: разбивай проверку на пары соседних шагов, не оценивай всё сразу. Плюс рандомизируй порядок предъявления вариантов А и Б — если вывод модели меняется от того, что она увидела первым, это и есть позиционная предвзятость в действии.

Почему работает

Причина в механизме внимания трансформера: первый и последний элемент последовательности получают больше фокуса, а середина размывается. Это встроено в архитектуру, не баг конкретной модели — дообучение подправляет калибровку оценок, но саму предвзятость не убирает. Модель отлично проверяет один переход изолированно — слабое место именно в удержании всей цепочки сразу. При прямом сравнении двух полных вариантов точность падает почти до 50% — чистая монетка.

Когда применять

Проверка логики → любых упорядоченных последовательностей: рецепты, инструкции, сценарии для роликов, план ремонта, порядок аргументов в тексте. Особенно важно когда нужно проверить шаги в середине цепочки — там модель ошибается чаще всего. Не подходит как единственный способ проверки для критичных решений (медицинские протоколы, юридические процедуры) — на сложных перестановках точность близка к случайной.

Мини-рецепт

1. Дай два варианта: правильный порядок и с перепутанными шагами, без подсказки какой из них верный
2. Разбери переходы: попроси проверить шаг 2 из шага 1, шаг 3 из шага 2 — построчно для каждой пары в обоих вариантах
3. Отложи вердикт: сначала разбор всех переходов, финальный вывод только после этого
4. Проверь на реверс: покажи варианты в обратном порядке (сначала Б, потом А) и сравни ответы
5. Сверь результат: если вывод поменялся от порядка предъявления — модель ловилась на позиции, а не на смысле, доверять нельзя

Примеры

[ПЛОХО] : Оцени по шкале от 1 до 5, правильный ли порядок шагов рецепта
[ХОРОШО] : Вот два варианта порядка шагов. Проверь переход между каждой парой соседних шагов отдельно в обоих вариантах — логично ли шаг 2 вытекает из шага 1, шаг 3 из шага 2. Не давай общую оценку сразу, сначала распиши переходы построчно, потом сделай вывод какой вариант логичен
Источник: Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences
ArXiv ID: 2608.10908 | Сгенерировано: 2026-08-12 06:22

Проблемы LLM

ПроблемаСутьКак обойти
Модель не замечает перепутанный порядок, если оценивает всё одним числомПросишь оценить всю последовательность шагов одной оценкой (1-5, хорошо/плохо). Модель ставит похожий высокий балл и правильному порядку, и перемешанному. Особенно если переставлены шаги в середине, а не в начале или конце. Модель цепляется за первый и последний элемент, середину не проверяетНе проси общую оценку. Попроси разобрать переход между каждой парой соседних шагов отдельно: "логично ли шаг 2 вытекает из шага 1?". Только после разбора всех переходов — финальный вывод
Ответ модели зависит от того, какой вариант показан первымДаёшь модели два варианта (А и Б) для сравнения. Меняешь порядок — сначала правильный как "А", потом как "Б". Ответ модели может измениться, хотя суть вариантов та же. Модель реагирует на позицию предъявления, не на содержаниеЗадай один и тот же вопрос дважды, поменяв местами варианты А и Б. Если вывод разный — модель ориентируется на позицию, а не на смысл. Такому вердикту не доверяй

Методы

МетодСуть
Разбор переходов по парам вместо общей оценкиНе проси "оцени всю последовательность". Проси разобрать каждый переход отдельно: "переход шаг1шаг2: логично? почему", потом "шаг2шаг3" и так далее. Только в конце — общий вывод. Почему работает: модель хорошо оценивает один элемент или один переход изолированно, но теряет фокус на всей цепочке сразу. Разбивка заставляет её проверить каждую связь, а не угадывать по позиции. Когда применять: проверка порядка шагов в инструкции, сюжета, хронологии событий, логики сценария. Когда не работает: очень длинные цепочки (10+ шагов) — переходы всё равно можно разбить на пары, но сама оценка становится долгой и model может путать нумерацию
Двойной запрос с обратным порядком вариантов — проверка на предвзятостьЗадай вопрос "какой вариант правильный, А или Б" два раза: сначала в одном порядке предъявления, потом поменяй А и Б местами. Синтаксис: первый раз "Вариант А: [правильный], Вариант Б: [сломанный]", второй раз наоборот. Сравни ответы. Почему работает: если модель ориентируется на смысл — вывод не изменится от смены порядка. Если ориентируется на позицию — вывод "переобуется". Когда применять: любое сравнение двух вариантов через LLM-судью (тексты, код, порядок действий). Когда не работает: если варианты изначально идентичны по смыслу — тест бессмысленен

Тезисы

ТезисКомментарий
Внимание модели держит начало и конец сильнее серединыЭто архитектурная особенность механизма внимания в трансформерах, а не недостаток обучения — дообучение её не убирает. Модель "видит" первый и последний элемент списка ярче, чем то, что в середине. Из-за этого при оценке длинных списков, инструкций, документов середина проверяется хуже. Применяй: для длинных текстов или списков (5+ пунктов) не проси общую оценку — разбивай на пары соседних элементов и проверяй каждую связь отдельно
📖 Простыми словами

Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences

arXiv: 2608.10908

Современные мультимодальные нейронки (LVLM), которые умеют «видеть» картинки, на самом деле не понимают логику событий, а просто имитируют внимательность. Когда ты просишь модель проверить последовательность кадров или шагов в инструкции, она не анализирует причинно-следственные связи, а тупо цепляется за краевые эффекты. Для ИИ важно только то, что стоит в самом начале и в самом конце, а всё, что происходит в середине — это серая зона, где логика благополучно умирает.

Это как если бы ты нанял охранника следить за порядком в очереди, а он проверял бы документы только у первого и последнего человека, игнорируя тот факт, что в центре очереди все дерутся и стоят на головах. Формально границы соблюдены, значит, всё в порядке. В итоге модель ставит высокую оценку даже абсолютно перемешанному хаосу, если первый и последний кадры выглядят уместно.

Исследователи проверили это на методе LVLMs as Judges и выяснили, что модели катастрофически лажают, когда нужно выставить общую оценку всей цепочке. Если ты закинешь в ChatGPT или Gemini шесть слайдов для Reels о том, как собрать шкаф, и спросишь: «Всё ли тут логично?», нейронка радостно ответит «Да», даже если на втором слайде у тебя уже готовый шкаф, а на пятом ты только распаковываешь коробку. Она видит старт и финиш, а на остальное ей плевать.

Этот косяк — не просто баг конкретной версии, а фундаментальная проблема архитектуры трансформеров. Механизм внимания физически не может удержать в фокусе длинную цепочку связей одновременно, поэтому он «схлопывает» середину. Принцип универсален: он работает и в генерации текста, и в анализе видео, и в проверке сложных пошаговых гайдов. Порядок имеет значение, но только для нас, а не для алгоритма, который просто ищет знакомые паттерны в начале и конце строки.

Короче: никогда не проси ИИ оценить логику процесса «одним махом» — он выдаст тебе галлюцинацию об адекватности. Если нужно проверить последовательность, заставляй модель сравнивать шаги попарно или описывать связь между каждым конкретным кадром отдельно. Иначе ты рискуешь опубликовать контент, где ремонт начинается с поклейки обоев, а заканчивается сносом стен, и нейронка скажет, что это отличный план.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с