TL;DR
Когда просишь ИИ проверить, правильный ли порядок шагов в истории или инструкции, модель ориентируется на то, что стоит в начале и в конце, а не на реальную логическую связь между шагами. Если попросить оценить всю последовательность одной оценкой — модель поставит одинаково высокий балл и правильному порядку, и перемешанному. Это касается моделей, которые работают с картинками (LVLM), но механизм — общий для всех LLM.
Боль конкретная: исследователи давали моделям кулинарный рецепт из 4 кадров — то в правильном порядке, то с перепутанными средними шагами. Модель, которую попросили поставить оценку от 1 до 5, ставила обеим версиям похожие высокие баллы — то 4, то 5, будто перестановки не заметила. А когда её напрямую спрашивали "какой из двух вариантов правильный" — точность падала почти до уровня монетки, особенно если перепутаны шаги в середине, а не в начале или конце.
Причина — в том, как модель "запоминает" последовательность: начало и конец она держит в фокусе сильнее, а середина стирается, как в игре "Что? Где? Когда?", где помнят первый и последний вопрос раунда, а не пятый. Дообучение модели немного улучшает калибровку оценок, но саму предвзятость к позиции не убирает — она встроена в архитектуру, а не в нехватку данных.
Схема диагностики (как исследователи проверяли модель — можно повторить в чате)
ШАГ 1: Дать модели два варианта последовательности (правильный и с перепутанными шагами) → без подсказки какой правильный
ШАГ 2: Попросить объяснить переход между каждой парой соседних шагов → текстовое рассуждение
ШАГ 3: Попросить финальный вердикт — какой вариант логичен
ШАГ 4: Повторить с обратным порядком предъявления (сначала показать как "А", потом как "Б", и наоборот) → сравнить ответы
Если ответ модели меняется от того, что она увидела первым — это и есть позиционная предвзятость в действии.
Пример применения
Задача: Ты делаешь карусель для Reels/VK — "Как я сделал ремонт квартиры за 100 тысяч рублей за 6 шагов". Хочешь проверить у ChatGPT, логична ли последовательность шагов, прежде чем публиковать.
Промпт:
Вот два варианта порядка шагов истории про ремонт квартиры.
Вариант А:
1. Купил инструменты и материалы
2. Демонтировал старую отделку
3. Сделал стяжку пола
4. Покрасил стены
5. Положил ламинат
6. Расставил мебель
Вариант Б:
1. Купил инструменты и материалы
2. Демонтировал старую отделку
3. Покрасил стены
4. Сделал стяжку пола
5. Положил ламинат
6. Расставил мебель
Проверь переход между каждой парой соседних шагов в обоих вариантах отдельно —
логично ли шаг 2 вытекает из шага 1, шаг 3 из шага 2, и так далее.
Не ставь общую оценку сразу — сначала распиши переходы, потом сделай вывод,
какой вариант правильный и почему.
Результат: Модель распишет по каждому переходу пояснение (например, "стяжка пола после покраски стен — нелогично, обычно пол делают до финишной отделки стен"), а в конце даст вердикт с указанием, какой вариант нарушает процедурную логику. Если попросить то же самое, но поменяв порядок предъявления вариантов, и получить другой ответ — значит, модель ориентировалась на позицию, а не на смысл.
Почему это работает
Модель плохо держит в поле внимания весь порядок сразу — механизм внимания в трансформерах сильнее "видит" первый и последний элементы последовательности, а середина смазывается. Это архитектурная особенность, не баг конкретной модели — она проявляется и после дообучения.
Зато модель хорошо справляется с оценкой одного шага изолированно — описать, что на картинке, или проверить логичность одного перехода между двумя соседними пунктами.
Метод использует эту силу: вместо того чтобы просить общую оценку всей цепочки (где модель хватается за позиционные подсказки), просишь явно разобрать переходы по одному и сравнить порядок в паре, а не оценить сам по себе. Плюс рандомизация — кто идёт первым, А или Б — вскрывает, реагирует модель на смысл или на позицию.
Рычаги управления: - Оценка одним числом (1–5) → замени на попарное сравнение "что правильнее" - Порядок предъявления вариантов → рандомизируй, спроси дважды в разном порядке - Просьба сразу дать вердикт → замени на "распиши переход между каждой парой шагов, потом вывод" - Длинные последовательности (>5 шагов) → разбивай на пары соседних шагов, не проверяй всё целиком
Шаблон промпта
Вот два варианта последовательности: {описание_задачи}.
Вариант А:
{шаг_1, шаг_2, ..., шаг_N}
Вариант Б:
{тот же список с изменённым порядком}
Проверь переход между каждой парой соседних шагов отдельно в обоих вариантах —
логично ли шаг 2 вытекает из шага 1, шаг 3 из шага 2, и так далее.
Не давай общую оценку сразу. Сначала распиши переходы построчно,
потом сделай вывод — какой вариант логичен и почему.
Подставь свою последовательность — план, сценарий, инструкцию, историю по кадрам. Потом повтори запрос, поменяв местами Вариант А и Б — если вывод модели изменился, доверять её вердикту напрямую нельзя.
🚀 Быстрый старт — вставь в чат:
Вот принцип проверки логики последовательности. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какая у тебя последовательность и есть ли эталонный "правильный" порядок — это нужно, чтобы правильно расставить варианты А и Б для сравнения.
Ограничения
⚠️ Не работает надёжно на сложных перестановках: если перепутаны шаги в середине последовательности (а не в начале/конце), точность угадывания у моделей падает почти до уровня случайного выбора — даже после дообучения.
⚠️ Пошаговое рассуждение не гарантирует правильный вердикт: модель может красиво расписать переходы, но в итоге всё равно ошибиться с финальным ответом — качество объяснения и точность оценки не связаны напрямую.
⚠️ Проверено на изображениях, не на чистом тексте: исследование про последовательности картинок. Для текстовых списков/инструкций эффект вероятно похож (это известная проблема "теряется середина" у LLM), но именно в этой работе не проверялось.
Как исследовали
Исследователи взяли две модели, которые понимают и картинки, и текст (LLaVA-OneVision и LLaVA-Critic), и заставили их судить последовательности кадров двумя способами: ставить оценку от 1 до 5 всей истории или выбирать из пары — какая последовательность правильная. Для теста собрали два набора данных: PRISM — тысячи кулинарных рецептов с искусственно перепутанными или заменёнными кадрами, и MIRAGE — реальные сбои из семи разных ИИ-генераторов картинок.
Сравнивали оценки моделей с оценками живых людей и с оценками другой модели (Gemini) как ориентиром. Результат удивил: при оценке "в лоб" модели ставили похожие высокие баллы и правильному, и перемешанному варианту — то есть казались компетентными, но на самом деле просто не различали порядок. Зато при прямом сравнении "какой вариант правильный" точность рухнула почти до случайной, особенно на перестановках в середине истории.
Дообучение (SFT с LoRA) немного улучшило калибровку оценок, но позиционную предвзятость не убрало — она встроена в то, как модель "смотрит" на последовательность, а не в нехватку тренировочных данных. Отсюда практический вывод: не доверяй одной общей оценке последовательности от ИИ, проверяй попарно и с рандомизацией порядка.
Ресурсы
Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences — Martina Ianaro, Maurizio Gabbrielli (University of Bologna), Guilherme Fernandes, João Magalhães (NOVA School of Science and Technology, Лиссабон). Датасеты PRISM и MIRAGE, представлены на MM '26 (Rio de Janeiro).
