3,583 papers
arXiv:2607.19967 72 22 июля 2026 г. FREE

LLM-шипперы сходятся на одном перевозчике: как размер списка кандидатов рушит разнообразие выбора

КЛЮЧЕВАЯ СУТЬ
50 независимых LLM-агентов выбирали перевозчика из 20 вариантов — и 76% запросов в первый же день ушло одному и тому же перевозчику. GPT, Claude и Gemini выбрали фаворита чаще всех, хотя не общались друг с другом. Метод показывает: почему LLM-подбор из длинного списка сходится в одну точку — и как заставить модель реально сравнивать варианты. Фишка: единственное что расшатывает этот перекос — явное ограничение у кандидата (дефицит, загрузка), а не перемешивание порядка или доп. рейтинги.
Адаптировать под запрос

TL;DR

Когда LLM выбирает один вариант из списка похожих кандидатов — поставщиков, подрядчиков, товаров — она с высокой вероятностью выберет того же "фаворита", что и другая LLM, запущенная отдельно, без всякого общения между ними. Причём чем длиннее список, тем сильнее эта склонность к единому выбору.

В эксперименте 50 LLM-агентов независимо выбирали перевозчика из 20 вариантов. В первый же "день" до 76% запросов ушло одному и тому же перевозчику — и GPT, и Claude, и Gemini выбрали его чаще всех остальных. Причина простая: у моделей общий "вкус", заложенный при обучении, и когда вариантов много (больше 10), этот общий вкус начинает подавлять индивидуальные различия задачи — модель перестаёт вдумчиво сравнивать и скатывается в шаблонный выбор.

Единственное, что реально ломает этот перекос — явное указание ограничения у каждого кандидата (например, "осталось мало свободных мест", "загружен на 90%"). Перемешивание порядка списка и показ дополнительных рейтингов доверия — не помогают вообще.

🔬

Схема метода

НАБЛЮДЕНИЕ 1: Список кандидатов > 10 → резкий рост концентрации выбора на 1-2 "фаворитах"
НАБЛЮДЕНИЕ 2: Рандомизация порядка списка → эффект НЕ снижается
НАБЛЮДЕНИЕ 3: Показ доп. рейтингов/истинного качества → эффект НЕ снижается
РАБОЧИЙ ПРИЁМ: Явное ограничение (загруженность/дефицит) у каждого кандидата → выбор реально распределяется
🚀

Пример применения

Задача: Маркетолог выбирает через ChatGPT 3 блогеров для рекламной интеграции из списка 20 кандидатов с разными расценками, охватами и рейтингами.

Промпт (как обычно делают — слабый вариант):

Вот список 20 блогеров с их ценой, охватом подписчиков и рейтингом вовлечённости:
[список]

Выбери топ-3 для рекламной интеграции моего продукта.

Промпт (с учётом находки — сильный вариант):

Вот список 8 блогеров с их ценой, охватом и рейтингом вовлечённости:
[список]

Для каждого блогера укажи явно: сколько интеграций у него уже забронировано на этот месяц 
(например "свободен только 1 слот", "полностью загружен до конца месяца").

Выбери топ-3, учитывая, что перегруженный блогер может сорвать сроки размещения, 
даже если у него лучшие показатели.

Результат: В первом варианте при повторных запросах (или если спросить разные модели) выбор скорее всего сойдётся на одном-двух "очевидных" блогерах — самых дешёвых и популярных, даже если это не оптимально для конкретной кампании. Во втором варианте — сокращённый список плюс явные ограничения по загрузке — модель распределит выбор шире, потому что появился конкретный аргумент "за" альтернативы, а не абстрактное "попробуй по-другому".

🧠

Почему это работает

LLM не проводит глубокий индивидуальный анализ каждого варианта в длинном списке — она опирается на общий паттерн "что обычно хорошо выглядит" (низкая цена + высокий рейтинг), сформированный при обучении. Этот паттерн одинаковый у разных моделей, поэтому GPT, Claude и Gemini независимо выбирают одного фаворита.

Модель хорошо умеет учитывать явные, конкретные ограничения, вписанные в текст — если сказать "у этого варианта дефицит", модель реально пересчитывает выбор. А вот абстрактные сигналы вроде перемешанного порядка или дополнительного рейтинга доверия она просто не использует как повод изменить решение — потому что они не создают конкретной причины выбрать другого кандидата.

Рычаги управления: - Размер списка кандидатов → держи до 8-10 вариантов, если нужен вдумчивый выбор, а не консенсусный - Явные ограничения по каждому кандидату (дефицит, загрузка, срок) → реально диверсифицируют выбор - Порядок списка и доп. рейтинги → не трогай, это не работает

📋

Шаблон промпта

Вот список {количество} кандидатов на {задача: выбор подрядчика / поставщика / блогера / фрилансера}.

Характеристики каждого:
{список_кандидатов_с_ценой_рейтингом}

Для каждого кандидата явно укажи ограничение: {доступность/загруженность/срок/дефицит}.

Выбери топ-{N}, учитывая не только цену и рейтинг, но и то, что кандидаты 
с низкой доступностью могут быть менее надёжны по срокам.

Объясни рассуждение для каждого выбранного кандидата.

Подставь: количество кандидатов (лучше держать до 8-10), тип задачи, реальные ограничения по каждому варианту.

🚀 Быстрый старт — вставь в чат:

Вот принцип: при выборе одного варианта из длинного списка похожих кандидатов LLM 
склонна сходиться на одном "очевидном фаворите" вместо вдумчивого сравнения. 
Помоги мне выбрать {N} из {список кандидатов} для {задача}, но сначала спроси 
у меня явные ограничения (доступность/сроки/дефицит) по каждому кандидату — 
и учти их в решении.

LLM спросит про конкретные ограничения по каждому варианту — потому что без них она снова свалится в шаблонный выбор.

⚠️

Ограничения

⚠️ Не тестированная техника, а выведенный принцип: совет "добавляй ограничения, сокращай список" не проверялся как отдельная промпт-техника в чате — это вывод из наблюдения за поведением модели в рыночной симуляции.

⚠️ Разные модели ведут себя по-разному: в исследовании Claude почти не менял поведение при росте длины списка, а GPT и Gemini — сильно. Эффект зависит от конкретной модели.

⚠️ Не для всех задач: находка касается именно задач выбора одного варианта из списка похожих кандидатов. Для творческих или аналитических задач без селекции она не применима.

⚠️ Рандомизация и доп. рейтинги — пустая трата усилий: если вы надеялись разбить шаблонный выбор перемешиванием порядка вариантов — это не сработает.

🔍

Как исследовали

Исследователи построили симуляцию рынка грузоперевозок: 50 "шипперов" на базе GPT, Claude и Gemini выбирали среди 20 перевозчиков каждый день на протяжении 30 дней, а рынок отвечал живой обратной связью — росли цены у перегруженных перевозчиков, копились рейтинги у выбранных, у остальных — нет. Всего прогнали 226 экспериментальных условий и собрали около 190 000 отдельных решений о выборе, сравнивая с простыми эталонными алгоритмами (случайный выбор, детерминированный скоринг).

Удивительный результат: концентрация на одном перевозчике возникала мгновенно, в первый же день, независимо от того, какой сигнал доверия показывали агентам — даже когда показывали истинное качество перевозчика напрямую. Это значит, что проблема не в неточных рейтингах, а в самой механике выбора модели. Из четырёх протестированных решений (раскрытие доступности, смешивание вендоров LLM, перемешивание порядка списка, показ популярности) сработало только раскрытие оставшейся вместимости — оно снизило концентрацию выбора на треть и удвоило выгоду заказчика.


📋 Дайджест исследования

Ключевая суть

50 независимых LLM-агентов выбирали перевозчика из 20 вариантов — и 76% запросов в первый же день ушло одному и тому же перевозчику. GPT, Claude и Gemini выбрали фаворита чаще всех, хотя не общались друг с другом. Метод показывает: почему LLM-подбор из длинного списка сходится в одну точку — и как заставить модель реально сравнивать варианты. Фишка: единственное что расшатывает этот перекос — явное ограничение у кандидата (дефицит, загрузка), а не перемешивание порядка или доп. рейтинги.

Принцип работы

Модель не разбирает каждого кандидата по отдельности. Она опирается на общий шаблон «что обычно хорошо выглядит» — низкая цена плюс высокий рейтинг. Этот шаблон одинаковый у разных моделей, потому что зашит при обучении на одних и тех же данных. Список больше 10 вариантов — и модель бросает вдумчивое сравнение, скатывается в готовый паттерн. Это как студент, который не читает все 20 работ на экзамене, а сразу хватает ту, что сверху и с красивой обложкой.

Почему работает

Абстрактные сигналы модель игнорирует — перемешал порядок списка, добавил рейтинг доверия, а эффект не меняется вообще. Причина: эти сигналы не дают конкретного аргумента «почему выбрать другого». А вот фраза «осталось 1 свободное место» — это конкретный факт, который модель обязана учесть в логике ответа. Одна фраза про дефицит реально меняет распределение выбора — потому что она встроена в текст, а не абстрактна. Кстати, Claude на длину списка почти не реагировал, а GPT и Gemini — сильно. Разные модели, разная чувствительность.

Когда применять

Подбор поставщиков, подрядчиков, блогеров, фрилансеров через LLM → конкретно для задач «выбери N из списка похожих кандидатов», особенно когда список больше 10 позиций и важно избежать шаблонного выбора самого дешёвого/популярного. Не подходит для творческих задач или анализа без финального отбора одного варианта.

Мини-рецепт

1. Режь список: оставляй 8-10 кандидатов, не 20 — иначе модель сваливается в шаблон.
2. Добавь ограничение к каждому: напиши прямо в тексте «занят на 90%», «1 слот свободен», «срок сдачи через 2 дня».
3. Забудь про перемешивание: тратить время на рандомизацию порядка или добавление рейтингов доверия — бессмысленно, не поможет.
4. Проси объяснение: попроси модель обосновать выбор каждого кандидата — так виднее, учла ли она ограничения или просто взяла фаворита.

Примеры

[ПЛОХО] : Вот 20 поставщиков с ценой и рейтингом. Выбери 3 лучших для закупки партии товара.
[ХОРОШО] : Вот 8 поставщиков с ценой и рейтингом. Для каждого укажи явно: сколько заказов у него в очереди сейчас (например "загружен на 85%", "свободен полностью"). Выбери топ-3 для срочной закупки, учитывая что перегруженный поставщик может задержать поставку даже с лучшей ценой.
Источник: When Shippers Become Algorithms: Candidate Exposure, Information Design, and the Concentration of LLM-Mediated Freight Markets
ArXiv ID: 2607.19967 | Сгенерировано: 2026-07-23 07:25

Проблемы LLM

ПроблемаСутьКак обойти
Модель сходится на одном "фаворите" при выборе из длинного списка похожих вариантовПросишь выбрать один или несколько вариантов из списка кандидатов — поставщиков, товаров, подрядчиков. Если вариантов больше 10, модель перестаёт вдумчиво сравнивать. Скатывается к шаблонному выбору: дешевле + выше рейтинг. Разные модели (GPT, Claude, Gemini), запущенные отдельно, независимо выбирают одного и того же "любимчика". Итог — минимум разнообразия там, где нужен вдумчивый разборДержи список до 8-10 кандидатов, если важен реальный анализ, а не консенсусный ответ. Плюс добавь явные ограничения по каждому варианту (см. метод ниже)

Методы

МетодСуть
Явное ограничение у каждого кандидата — ломает шаблонный выборДля каждого варианта в списке напиши конкретное ограничение: "загружен на 90%", "остался 1 слот", "срок исполнения увеличен". Попроси модель учесть это при выборе. Почему работает: модель хорошо реагирует на конкретные текстовые сигналы — они дают явную причину предпочесть другой вариант. Абстрактные сигналы (перемешанный порядок списка, дополнительный рейтинг доверия) модель не воспринимает как повод менять решение — они не создают конкретного аргумента. Когда работает: выбор одного-нескольких вариантов из списка похожих кандидатов, где важно реальное разнообразие решения. Когда не работает: творческие или аналитические задачи без выбора одного варианта. Пустая трата усилий: перемешивание порядка списка, показ доп. рейтингов — на выбор это не влияет
📖 Простыми словами

When Shippers Become Algorithms: Candidate Exposure, Information Design, and the Concentration ofLLM-Mediated Freight Markets

arXiv: 2607.19967

Раньше за внимание клиента боролись на рынках и в поисковиках, а теперь судьба сделок решается в «головах» алгоритмов. Суть в том, что когда мы поручаем LLM выбрать лучшего поставщика или товар из списка, она не ведет себя как беспристрастный судья. Модели страдают от эффекта концентрации: они склонны хором указывать на одного и того же «фаворита», игнорируя десятки других достойных вариантов. Это не сговор машин, а базовая механика их обучения — все они натасканы на одних и тех же данных и одинаково реагируют на определенные триггеры в описании.

Это похоже на ситуацию, когда сто разных людей приходят в огромный супермаркет, где на полках лежат тысячи товаров, но абсолютно каждый покупает одну и ту же пачку макарон просто потому, что она лежит на уровне глаз и на ней написано «выбор года». В итоге один производитель забирает всю кассу, а остальные, даже если их продукт лучше, сидят с пустыми карманами. Формально выбор был, но по факту алгоритм превратил свободный рынок в цифровую монополию.

Исследователи выяснили, что этот баг (или фича) усиливается с ростом списка: чем больше кандидатов ты подсовываешь модели, тем ленивее она становится. Вместо вдумчивого анализа она цепляется за поверхностные паттерны — например, сочетание низкой цены и высокого рейтинга. В эксперименте разные модели, не общаясь друг с другом, выдавали идентичный результат. Это значит, что информационный дизайн — то, как именно упакованы данные о тебе — становится важнее реального качества услуг.

Принцип работает везде: от выбора перевозчика грузов до подбора блогеров для рекламы или поиска юриста через ChatGPT. Если ты не попал в «золотой стандарт» того, что модель считает идеалом, тебя для нее просто не существует. Рынки с посредничеством AI схлопываются: вместо здоровой конкуренции мы получаем ситуацию, где один победитель забирает всё, а остальные остаются за бортом просто потому, что их описание не срезонировало с весами нейросети.

Главный вывод прост и циничен: если твой бизнес зависит от того, порекомендует ли его алгоритм, забудь о «человеческом» маркетинге. Нужно взламывать алгоритмические предпочтения и подстраивать свои данные под те самые триггеры, которые заставляют GPT и Claude говорить «да». Либо ты становишься тем самым фаворитом, на которого укажут все модели разом, либо твой трафик упадет до нуля. Концентрация неизбежна, и лучше оказаться в центре этого фокуса, чем в бесконечном хвосте списка.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с