TL;DR
Исследователи создали виртуальную группу из 17 AI-агентов, которые видят только текстовое описание позиций друг друга и решают: подвинуться вперёд, назад или остаться на месте. Физику системы (как решения превращаются в движение) держали абсолютно одинаковой — менялся только способ описания одного и того же состояния: сжатая математическая сводка (3 числа) или гистограмма (24 корзины с разными подписями).
Смена только формата подачи данных — при полностью идентичной информации внутри — определяла, синхронизируется ли вся группа или распадётся на противоборствующие кластеры. В GPT сжатая сводка объединяла группу всегда, а гистограммы — никогда. Но в Claude эффект был противоположным: сводка мешала согласию, гистограммы помогали. Причина проста: модель реагирует не на "истинные" цифры за текстом, а на конкретный текст, который она читает — а "тройка чисел" и "список из 24 подписанных значений" для неё выглядят как разные ситуации, требующие разной реакции.
Разница держится даже без накопления через много шагов: когда одно и то же замороженное состояние показывали под разными форматами, модель всё равно отвечала по-разному. И что удивительно — добавление в промпт совершенно незначащего текста сдвигало ответ модели сильнее, чем сама смена формата данных.
Схема эксперимента
ШАГ 1: Одна физическая ситуация → три текстовых описания
(сжатая сводка / гистограмма-А / гистограмма-Б)
ШАГ 2: Каждый агент читает своё описание → выбирает: вперёд / стоп / назад
ШАГ 3: Решения применяются к системе → новое состояние → повтор на ШАГ 1
Дополнительная проверка: то же самое "замороженное" состояние показывали под разными форматами без цепной реакции — чтобы отделить эффект формата от эффекта накопления ошибок.
Пример применения
Задача: Ты собираешь в чате «совет экспертов» — просишь модель сыграть роли маркетолога, финансиста и продакт-менеджера, которые обсуждают цену подписки на сервис, видят позиции друг друга и корректируют своё мнение в несколько раундов.
Промпт (раунд 2, роль маркетолога):
Ты — маркетолог. Обсуждается цена подписки на сервис.
Вариант А (сжатая сводка):
"Средняя цена коллег — 1240 рублей, разброс мнений умеренный"
Вариант Б (детальный список):
"Финансист предлагает 990 рублей (аргумент: конкуренты дешевле).
Продакт предлагает 1490 рублей (аргумент: премиум-позиционирование)"
Твоя текущая позиция — 1200 рублей. Основываясь на позициях коллег
(используй Вариант А ИЛИ Вариант Б), скорректируй цену: повысь, понизь
или оставь. Дай короткое обоснование.
Результат: Запусти оба варианта отдельно на 3-4 раунда обсуждения. По находкам исследования, сжатая сводка обычно подталкивает участников к быстрому среднему значению, а детальный список с аргументами — может, наоборот, укреплять расхождение позиций (или наоборот — зависит от модели). Стоит протестировать оба формата на своей задаче и посмотреть, какой даёт нужный тебе результат: консенсус или сохранение разных точек зрения.
Почему это работает
Модель не считывает "смысл" цифр отдельно от текста — она реагирует на конкретную форму, в которой эти цифры записаны. Обученная предсказывать продолжение текста, она видит "три обобщённых числа" и "список из 24 подписанных значений" как разные ситуации, а не как два способа сказать одно и то же.
Сильная сторона модели — чуткость к паттернам текста: она улавливает, выглядит ли информация как "уже согласованное мнение" (сводка) или как "набор конфликтующих позиций" (детальный список), и реагирует соответственно.
В диалоге с несколькими шагами эта чуткость накапливается: маленький сдвиг вероятности "согласиться" на каждом шаге со временем определяет исход всей дискуссии — консенсус или раскол.
Рычаги управления: - Сводка vs детальный список → выбирай в зависимости от того, нужен ли тебе быстрый консенсус между "агентами" или сохранение разнообразия мнений - Лишний, не относящийся к делу контекст → убирай из промпта мультиагентных сценариев — по находкам статьи, он сдвигает поведение модели сильнее, чем смена самого формата данных - Таблица vs связный текст для одних и тех же цифр → тоже меняет ответ, хотя слабее, чем смена типа сводки
Шаблон промпта
Ты играешь роль {роль_агента}. Обсуждается вопрос: {тема}.
Позиции других участников — {формат: сжатая сводка ИЛИ детальный
список с аргументами каждого участника}:
{данные}
Твоя текущая позиция: {текущая_позиция}.
Основываясь на позициях коллег, скорректируй свою позицию:
повысь, понизь или оставь как есть. Дай короткое обоснование.
Подставь свою ситуацию мультиагентного обсуждения (совет экспертов, дебаты, брейншторм с несколькими "голосами"). Попробуй оба формата подачи "мнений соседей" и сравни, как меняется динамика согласия за несколько раундов.
🚀 Быстрый старт — вставь в чат:
Вот принцип из исследования: способ подачи одной и той же информации
(сжатая сводка vs подробный список) меняет то, приходят ли AI-агенты
к согласию. Помоги мне протестировать это на моей задаче: {твоя задача
с несколькими ролями/агентами}.
[вставить шаблон выше]
LLM спросит, какие роли участвуют и какой вопрос обсуждается — потому что от этого зависит, что писать в "позициях коллег". Она возьмёт структуру шаблона и адаптирует под твой сценарий.
Ограничения
⚠️ Направление эффекта непредсказуемо между моделями: формат, который в одной модели ведёт к согласию, в другой ведёт к расколу. Нет универсально "правильного" способа подачи данных — нужно тестировать под конкретную модель.
⚠️ Проверено на упрощённых версиях моделей: тестировали недорогие версии (mini/haiku/flash) при фиксированной температуре. Поведение топовых моделей или при других настройках может отличаться.
⚠️ Искусственно простая система: агенты в эксперименте не имели памяти, цели или истории. В реальных многошаговых чатах с контекстом и целями эффект может проявляться иначе.
Как исследовали
Исследователи собрали виртуальную группу из 17 "агентов-маятников", которые пытаются синхронизировать движение, и поручили языковой модели решать за каждого: ускориться, замедлиться или остаться на месте — глядя только на текстовое описание позиций соседей. Физику системы держали одинаковой, менялся только формат описания: сжатая сводка из трёх чисел или гистограмма с двумя разными вариантами подписей.
Прогнали по 6 случайных стартовых конфигураций на GPT — сводка синхронизировала группу во всех шести случаях, гистограммы — в нуле. Повторили тот же эксперимент на Claude с теми же стартовыми условиями — эффект тоже был, но в обратную сторону: сводка мешала синхронизации, гистограммы помогали.
Чтобы исключить накопление случайных ошибок, отдельно проверили эффект на одинаковых "замороженных" состояниях без цепной реакции — и разница в ответах модели сохранилась. Самое неожиданное: добавление в промпт незначащего текста сдвигало ответ модели сильнее, чем сама смена способа кодирования данных — это противоречило ожиданию, что дело в объёме полезной информации.
