3,583 papers
arXiv:2608.06968 70 7 авг. 2026 г. FREE

Формат подачи данных агентам решает, придёт ли команда AI к согласию или расколется на два лагеря

КЛЮЧЕВАЯ СУТЬ
Обнаружено: GPT и Claude реагируют на форму подачи цифр, а не на цифры внутри неё. 17 агентов получали одну и ту же информацию о позициях друг друга — либо как сжатую сводку из 3 чисел, либо как гистограмму на 24 подписанных значения. Метод показывает: формат подачи данных в мультиагентных промптах управляет исходом обсуждения — консенсус или раскол на два лагеря — без единой смены логики принятия решений. Одна физика, два текста — два разных исхода: в GPT сводка объединяла группу всегда, гистограмма — никогда. В Claude ровно наоборот.
Адаптировать под запрос

TL;DR

Исследователи создали виртуальную группу из 17 AI-агентов, которые видят только текстовое описание позиций друг друга и решают: подвинуться вперёд, назад или остаться на месте. Физику системы (как решения превращаются в движение) держали абсолютно одинаковой — менялся только способ описания одного и того же состояния: сжатая математическая сводка (3 числа) или гистограмма (24 корзины с разными подписями).

Смена только формата подачи данных — при полностью идентичной информации внутри — определяла, синхронизируется ли вся группа или распадётся на противоборствующие кластеры. В GPT сжатая сводка объединяла группу всегда, а гистограммы — никогда. Но в Claude эффект был противоположным: сводка мешала согласию, гистограммы помогали. Причина проста: модель реагирует не на "истинные" цифры за текстом, а на конкретный текст, который она читает — а "тройка чисел" и "список из 24 подписанных значений" для неё выглядят как разные ситуации, требующие разной реакции.

Разница держится даже без накопления через много шагов: когда одно и то же замороженное состояние показывали под разными форматами, модель всё равно отвечала по-разному. И что удивительно — добавление в промпт совершенно незначащего текста сдвигало ответ модели сильнее, чем сама смена формата данных.


🔍

Схема эксперимента

ШАГ 1: Одна физическая ситуация → три текстовых описания
        (сжатая сводка / гистограмма-А / гистограмма-Б)
ШАГ 2: Каждый агент читает своё описание → выбирает: вперёд / стоп / назад
ШАГ 3: Решения применяются к системе → новое состояние → повтор на ШАГ 1

Дополнительная проверка: то же самое "замороженное" состояние показывали под разными форматами без цепной реакции — чтобы отделить эффект формата от эффекта накопления ошибок.


🚀

Пример применения

Задача: Ты собираешь в чате «совет экспертов» — просишь модель сыграть роли маркетолога, финансиста и продакт-менеджера, которые обсуждают цену подписки на сервис, видят позиции друг друга и корректируют своё мнение в несколько раундов.

Промпт (раунд 2, роль маркетолога):

Ты — маркетолог. Обсуждается цена подписки на сервис.

Вариант А (сжатая сводка):
"Средняя цена коллег — 1240 рублей, разброс мнений умеренный"

Вариант Б (детальный список):
"Финансист предлагает 990 рублей (аргумент: конкуренты дешевле).
Продакт предлагает 1490 рублей (аргумент: премиум-позиционирование)"

Твоя текущая позиция — 1200 рублей. Основываясь на позициях коллег 
(используй Вариант А ИЛИ Вариант Б), скорректируй цену: повысь, понизь 
или оставь. Дай короткое обоснование.

Результат: Запусти оба варианта отдельно на 3-4 раунда обсуждения. По находкам исследования, сжатая сводка обычно подталкивает участников к быстрому среднему значению, а детальный список с аргументами — может, наоборот, укреплять расхождение позиций (или наоборот — зависит от модели). Стоит протестировать оба формата на своей задаче и посмотреть, какой даёт нужный тебе результат: консенсус или сохранение разных точек зрения.


🧠

Почему это работает

Модель не считывает "смысл" цифр отдельно от текста — она реагирует на конкретную форму, в которой эти цифры записаны. Обученная предсказывать продолжение текста, она видит "три обобщённых числа" и "список из 24 подписанных значений" как разные ситуации, а не как два способа сказать одно и то же.

Сильная сторона модели — чуткость к паттернам текста: она улавливает, выглядит ли информация как "уже согласованное мнение" (сводка) или как "набор конфликтующих позиций" (детальный список), и реагирует соответственно.

В диалоге с несколькими шагами эта чуткость накапливается: маленький сдвиг вероятности "согласиться" на каждом шаге со временем определяет исход всей дискуссии — консенсус или раскол.

Рычаги управления: - Сводка vs детальный список → выбирай в зависимости от того, нужен ли тебе быстрый консенсус между "агентами" или сохранение разнообразия мнений - Лишний, не относящийся к делу контекст → убирай из промпта мультиагентных сценариев — по находкам статьи, он сдвигает поведение модели сильнее, чем смена самого формата данных - Таблица vs связный текст для одних и тех же цифр → тоже меняет ответ, хотя слабее, чем смена типа сводки


📋

Шаблон промпта

Ты играешь роль {роль_агента}. Обсуждается вопрос: {тема}.

Позиции других участников — {формат: сжатая сводка ИЛИ детальный 
список с аргументами каждого участника}:
{данные}

Твоя текущая позиция: {текущая_позиция}.

Основываясь на позициях коллег, скорректируй свою позицию: 
повысь, понизь или оставь как есть. Дай короткое обоснование.

Подставь свою ситуацию мультиагентного обсуждения (совет экспертов, дебаты, брейншторм с несколькими "голосами"). Попробуй оба формата подачи "мнений соседей" и сравни, как меняется динамика согласия за несколько раундов.

🚀 Быстрый старт — вставь в чат:

Вот принцип из исследования: способ подачи одной и той же информации 
(сжатая сводка vs подробный список) меняет то, приходят ли AI-агенты 
к согласию. Помоги мне протестировать это на моей задаче: {твоя задача 
с несколькими ролями/агентами}.

[вставить шаблон выше]

LLM спросит, какие роли участвуют и какой вопрос обсуждается — потому что от этого зависит, что писать в "позициях коллег". Она возьмёт структуру шаблона и адаптирует под твой сценарий.


⚠️

Ограничения

⚠️ Направление эффекта непредсказуемо между моделями: формат, который в одной модели ведёт к согласию, в другой ведёт к расколу. Нет универсально "правильного" способа подачи данных — нужно тестировать под конкретную модель.

⚠️ Проверено на упрощённых версиях моделей: тестировали недорогие версии (mini/haiku/flash) при фиксированной температуре. Поведение топовых моделей или при других настройках может отличаться.

⚠️ Искусственно простая система: агенты в эксперименте не имели памяти, цели или истории. В реальных многошаговых чатах с контекстом и целями эффект может проявляться иначе.


🔍

Как исследовали

Исследователи собрали виртуальную группу из 17 "агентов-маятников", которые пытаются синхронизировать движение, и поручили языковой модели решать за каждого: ускориться, замедлиться или остаться на месте — глядя только на текстовое описание позиций соседей. Физику системы держали одинаковой, менялся только формат описания: сжатая сводка из трёх чисел или гистограмма с двумя разными вариантами подписей.

Прогнали по 6 случайных стартовых конфигураций на GPT — сводка синхронизировала группу во всех шести случаях, гистограммы — в нуле. Повторили тот же эксперимент на Claude с теми же стартовыми условиями — эффект тоже был, но в обратную сторону: сводка мешала синхронизации, гистограммы помогали.

Чтобы исключить накопление случайных ошибок, отдельно проверили эффект на одинаковых "замороженных" состояниях без цепной реакции — и разница в ответах модели сохранилась. Самое неожиданное: добавление в промпт незначащего текста сдвигало ответ модели сильнее, чем сама смена способа кодирования данных — это противоречило ожиданию, что дело в объёме полезной информации.


📋 Дайджест исследования

Ключевая суть

Обнаружено: GPT и Claude реагируют на форму подачи цифр, а не на цифры внутри неё. 17 агентов получали одну и ту же информацию о позициях друг друга — либо как сжатую сводку из 3 чисел, либо как гистограмму на 24 подписанных значения. Метод показывает: формат подачи данных в мультиагентных промптах управляет исходом обсуждения — консенсус или раскол на два лагеря — без единой смены логики принятия решений. Одна физика, два текста — два разных исхода: в GPT сводка объединяла группу всегда, гистограмма — никогда. В Claude ровно наоборот.

Принцип работы

Правило простое, но неудобное: формат — это не упаковка, формат — это сигнал. Модель не видит смысл числа отдельно от текста — она реагирует на конкретную форму, в которой это число записано. Тройка обобщённых чисел читается моделью как «мнение уже усреднено». Список из 24 подписанных значений читается как «все спорят». Замени один формат на другой — получишь другую динамику согласия, хотя правила движения агентов не поменялись ни на йоту.

Почему работает

Модель обучена предсказывать продолжение текста, а не извлекать абстрактные числа из контекста. Она ловит паттерн: сжатая сводка похожа на уже согласованный результат, детальный список — на поле конфликта, и реагирует соответственно. Эффект держится даже на одном замороженном кадре — без цепочки шагов и накопления ошибок, значит дело не в переносе разногласий через раунды, а в самой форме текста. Жёстче: добавление в промпт совершенно незначащего текста сдвигало ответ модели сильнее, чем сама смена формата данных.

Когда применять

Мультиагентные сценарии → советы экспертов, дебаты, брейншторм с несколькими ролями, особенно когда нужно управлять тем, придут роли к единому мнению или сохранят разные позиции. Не подходит для одноагентных задач без обмена мнениями между ролями — там просто нет эффекта синхронизации.

Мини-рецепт

1. Собери сценарий: определи роли и вопрос для обсуждения.
2. Подготовь два формата: сжатая сводка (среднее значение + разброс мнений) и подробный список с позицией и аргументом каждого участника.
3. Прогони одно и то же обсуждение через оба формата на 3-4 раунда.
4. Сравни результат: сходятся роли к одному мнению или расходятся сильнее.
5. Вычисти промпт: убери весь текст не по теме — по находкам исследования, он сдвигает поведение модели сильнее, чем сам формат данных.

Примеры

[ПЛОХО] : Вот мнения всех участников совета: Финансист - 990, Маркетолог - 1200, Продакт - 1490. Скорректируй свою позицию.
[ХОРОШО] : Вариант А (сводка): Средняя цена коллег - 1240 рублей, разброс умеренный. Вариант Б (список): Финансист предлагает 990 рублей (аргумент - конкуренты дешевле), Продакт предлагает 1490 рублей (аргумент - премиум-позиционирование). Основываясь на Варианте А ИЛИ Б, скорректируй цену. Прогони оба варианта отдельно и сравни, где роли сходятся быстрее, а где расходятся сильнее.
Источник: Same physical state, different collective dynamics: state encodings select synchronization outcomes in language-model agents
ArXiv ID: 2608.06968 | Сгенерировано: 2026-08-10 05:37

Проблемы LLM

ПроблемаСутьКак обойти
Одинаковые данные, поданные разной формой, дают разные решения моделиДаёшь модели одну и ту же информацию. Меняешь только форму подачи: сжатая сводка из нескольких чисел или подробный список с деталями. Смысл данных не менялся, а ответ модели — да. В одной модели сжатая сводка объединяет мнения группы, в другой — наоборот, разделяет их. Направление эффекта непредсказуемо и отличается от модели к модели. Это ломает любые сценарии, где нужно агрегировать мнения: советы экспертов, дебаты, голосования, брейншторм с несколькими ролямиПеред запуском протестируй оба формата (сжатую сводку и детальный список) на конкретной модели, с которой работаешь. Смотри, какой формат приводит к нужному результату — согласию или сохранению разных позиций. Не считай один формат "универсально правильным" — фиксируй выбор только после проверки на своей задаче

Методы

МетодСуть
Формат подачи чужих мнений — переключатель консенсуса и расколаКогда несколько ролей видят позиции друг друга, покажи их в двух видах: сжатая сводка ("Средняя цена коллег — 1240 рублей, разброс умеренный") или детальный список с аргументами ("Финансист предлагает 990 — конкуренты дешевле. Продакт предлагает 1490 — премиум-позиционирование"). Один формат обычно подталкивает группу к быстрому среднему значению, другой — сохраняет расхождение мнений. Модель воспринимает сводку как "уже согласованное мнение", а список с аргументами — как "набор конфликтующих позиций", и реагирует по-разному. Направление эффекта зависит от модели, поэтому сначала проверь оба варианта. Работает: советы экспертов, дебаты, многораундовые обсуждения с несколькими голосами. Не работает: одиночный ответ без итераций, задачи без обсуждения между ролями
📖 Простыми словами

Same physical state, different collective dynamics: state encodings select synchronization outcomes inlanguage-modelagents

arXiv: 2608.06968

Суть тут в том, что AI-агенты — это не математические калькуляторы, а заложники текста. Когда группа нейронок должна договориться о чем-то общем, их конечное решение зависит не от реальных фактов, а от того, как эти факты упакованы. Исследователи доказали: если дать агентам одну и ту же физическую реальность, но описать ее разными словами, они придут к диаметрально разным результатам. Модель не видит «объективную истину», она просто реагирует на паттерны в описании, которые триггерят в ней разные сценарии поведения.

Это как если бы ты спросил дорогу у прохожего. Один скажет: «Иди три километра на север», а второй вывалит на тебя список из 24 поворотов с названиями каждой пивной по пути. Физически путь один и тот же, но в первом случае ты бодро зашагаешь по прямой, а во втором — запутаешься в деталях и свернешь не туда. Для нейронки форма подачи информации важнее самой информации, потому что она не «понимает» пространство, а просто предсказывает следующее слово в зависимости от контекста.

В эксперименте это выглядело так: когда агентам давали сжатую сводку из трех чисел, они вели себя одним образом, а когда ту же ситуацию расписывали в виде подробной гистограммы на 24 пункта, система выдавала совершенно другую динамику. В одном случае группа приходила к согласию и синхронизировалась, в другом — начинался хаос. Причем физика мира не менялась ни на йоту, менялась только «обертка» данных. Это доказывает, что кодирование состояния — это не просто формальность, а рычаг управления поведением всей системы.

Принцип универсален: если ты собираешь в чате «совет экспертов» из ChatGPT, чтобы обсудить цену продукта, результат будет зависеть не от рыночных данных, а от того, как ты их представил. Дашь сухую таблицу — получишь один ответ, распишешь те же цифры эмоциональным текстом — получишь другой. SEO для смыслов теперь важнее самих смыслов. Это работает везде, где несколько AI-агентов взаимодействуют друг с другом: от автоматизированных торгов на бирже до симуляций городских сообществ.

Короче, забудь про объективность, когда работаешь с LLM. Если твои агенты тупят или не могут договориться, проблема, скорее всего, не в их «мозгах», а в том, что ты скормил им неправильный формат данных. Одно лишнее уточнение или избыточная детализация могут превратить слаженный оркестр в балаган. Хочешь предсказуемый результат — контролируй кодирование, иначе модель зацепится за случайный шум в описании и уведет всю систему в кювет.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с