3,583 papers
arXiv:2610.03195 80 2 окт. 2026 г. FREE

Source Preference: LLM-агенты выбирают по бренду источника, а не по качеству позиции

КЛЮЧЕВАЯ СУТЬ
Агент с поиском берёт худшую позицию в двух случаях из трёх, если она с «любимого» сайта. Пара позиций: одна выполняет на одно требование меньше. Если слабая с любимого сайта, а сильная с нелюбимого, агент выбирает слабую. В обратной ситуации он почти никогда не берёт слабую. Метод из статьи позволяет выбирать товары, отели и статьи по требованиям, а не по знакомому домену. Фишка: не проси агента «быть объективным», а убери у него адрес сайта и запрети судить по репутации. Тогда ему нечем достраивать недостающие факты. Отдельный сигнал здесь домен в URL, и скрытие URL даёт основную часть эффекта.
Адаптировать под запрос
⚡

TL;DR

Source preference (предпочтение источника) — устойчивая привычка LLM-агентов выбирать товары, отели и статьи по сайту, откуда они пришли. Агент ищет, получает список результатов с названием, описанием и URL, и выбирает. При этом домен в URL работает как отдельный сигнал, как «знакомый бренд» для человека. Помогает спрятать или нейтрализовать этот сигнал: скрыть URL, дать агенту недостающие сведения о позиции, отдельно попросить не полагаться на репутацию сайта.

Боль в том, что агент берёт худшую позицию, если она с «любимого» сайта. Две позиции, одна выполняет на одно требование меньше. Если слабая с любимого сайта, а сильная с нелюбимого, агент выбирает слабую примерно в двух случаях из трёх. В обратной ситуации он почти никогда не берёт слабую. Причина проста: у модели нет полной информации о позиции, и она достраивает недостающее по репутации домена. Плюс при обучении на «лучших» ответах источник мог стать лёгким ярлыком качества. Большинство моделей при этом любят и не любят одни и те же сайты.

Метод снижения — три рычага. Убрать из результатов то, что выдаёт источник. Добавить недостающие сведения, чтобы агенту не приходилось гадать. Вписать в инструкцию агенту прямой запрет судить по репутации сайта. По тексту статьи ясно, что скрытие URL и названий ослабляет смещение. Подстановка информации и контр-промпт заявлены в аннотации как работающие, но их разбор (§7) в предоставленном фрагменте обрезан.

🔬

Схема метода

ШАГ 1: Убрать маркеры источника (URL, название сайта в тексте) → агент видит только суть позиции
ШАГ 2: Добавить недостающие сведения (цена, характеристики, условия) → нечего «достраивать» по бренду
ШАГ 3: В системный промпт — правило «не оценивай по репутации сайта» → оценка только по требованиям запроса
ШАГ 4: Проверка: перемешать порядок и поменять метки источников → выбор не должен меняться

Шаги 1–3 — это настройка поиска и инструкции. Шаг 4 можно сделать вручную в чате или агенте.

🚀

Пример применения

Задача: Вы ведёте закупки для небольшой студии и поручили агенту с поиском выбрать роутер: до 5 000 ₽, Wi-Fi 6, гарантия от 1 года, доставка в Екатеринбург. Результаты приходят с Ozon, Wildberries, Яндекс Маркета, DNS и Ситилинка. Подозрение: агент тянется к знакомому маркетплейсу, даже когда у менее раскрученного сайта вариант лучше.

Промпт (системная инструкция агенту):

Ты помогаешь выбрать товар по списку требований.

Требования пользователя:
1. цена до 5 000 ₽
2. Wi-Fi 6
3. гарантия от 12 месяцев
4. доставка в Екатеринбург

Правила оценки:
- Оценивай каждую позицию ТОЛЬКО по тому, выполняет ли она требования выше.
- Не учитывай, с какого сайта позиция. Репутация, известность и привычность сайта — не аргумент.
- Если в описании не хватает данных по требованию, не додумывай по бренду сайта. Пометь «нет данных» и сделай уточняющий поиск.
- Для каждой позиции выпиши: требование → выполнено / не выполнено / нет данных.
- Выбери позицию с наибольшим числом выполненных требований. При равенстве — перечисли равные варианты, не выбирай по сайту.
- Сайт в итоге укажи только как справку, после выбора.

Результат: Агент выдаст таблицу «позиция × требование» с отметками «выполнено / не выполнено / нет данных». Затем сделает уточняющие запросы там, где данных нет. В финале назовёт победителя по числу выполненных требований и только потом укажет сайт. Если несколько позиций равны, перечислит их без выбора «по привычке».

🧠

Почему это работает

Слабость. Когда в описании позиции не хватает данных, модель заполняет пробел тем, что знает о сайте: «Booking надёжный», «arXiv серьёзный». Сигнал «источник» оказывается проще и надёжнее, чем сверять каждое требование. Он же мог закрепиться при обучении: если определённый сайт чаще встречался рядом с «правильным» ответом, он стал ярлыком качества.

Сильная сторона. Модель хорошо сверяет позицию с явным списком требований, когда они перед глазами и данных хватает. Она также выполняет прямую инструкцию «не используй X».

Как метод это использует. Он убирает почву для ярлыка: нет URL, нет гадания по бренду. Пошаговая сверка по требованиям делает критерием выбора то, что у позиции написано. Это снижает вклад репутации, но не обнуляет его: в статье скрытие маркеров источника ослабляет смещение, а не убирает совсем.

Рычаги управления: - Скрытие URL даёт основную часть эффекта. В статье большая часть расширения разрыва между «любимыми» и «нелюбимыми» сайтами идёт именно от URL, а не от названий в тексте. - «Нет данных» вместо догадки → заставляет агента уточнять поиск, а не опираться на бренд. - Источник только после выбора → убирает влияние бренда на решение, но сохраняет прозрачность. - Ничья без выбора → вместо молчаливого предпочтения любимого сайта вы видите равные варианты.

📋

Шаблон промпта

Это реконструкция по описанию в статье. Дословного текста контр-промпта в предоставленном фрагменте нет.

Ты помогаешь выбрать {тип_позиции} по списку требований.

Требования пользователя:
{список_требований}

Правила оценки:
- Оценивай каждую позицию ТОЛЬКО по тому, выполняет ли она требования выше.
- Не учитывай, с какого сайта позиция. Репутация, известность и привычность сайта — не аргумент.
- Если в описании не хватает данных по требованию, не додумывай по бренду сайта. Пометь «нет данных» и {действие_при_нехватке_данных}.
- Для каждой позиции выпиши: требование → выполнено / не выполнено / нет данных.
- Выбери позицию с наибольшим числом выполненных требований. При равенстве — перечисли равные варианты.
- Сайт укажи только как справку, после выбора.

Что подставлять: - {тип_позиции} — товар, отель, поставщик, статья, подрядчик. - {список_требований} — проверяемые пункты, а не «хороший и надёжный». - {действие_при_нехватке_данных} — «сделай уточняющий поиск», «задай мне вопрос», «исключи позицию».

Для проверки на своём агенте вставьте в чат:

Вот правила оценки позиций без учёта репутации сайта. Адаптируй под мою задачу: {твоя_задача}.
Задавай вопросы, чтобы заполнить требования и действие при нехватке данных.

[вставить шаблон выше]

LLM спросит, какие именно требования проверяемы и что делать при нехватке данных. Без этого правило «не додумывай по бренду» не будет иметь за что зацепиться.

⚠️

Ограничения

⚠️ Полного устранения нет: скрытие URL и названий ослабляет смещение лишь частично. Часть предпочтения остаётся, даже когда маркеры источника спрятаны.

⚠️ Нет проверенного текста контр-промпта: в предоставленном фрагменте не показаны ни формулировка промпта, ни величина его эффекта. Шаблон выше — реконструкция, его надо проверять на своей задаче.

⚠️ Нужны проверяемые требования: метод работает, когда запрос состоит из пунктов, которые можно сверить с описанием. Для вкусовых и размытых запросов («красивый», «приятный») ярлыка-источника не избежать.

⚠️ Конкретные «любимчики» меняются: кто в фаворе (Booking, Walmart, arXiv), зависит от модели и времени. Российские площадки в исследовании не проверялись. Универсален сам механизм, а не список сайтов.

⚠️ Смещение источника ≠ всегда ошибка: иногда известный сайт действительно надёжнее. Метод убирает слепое доверие, но не заменяет проверку достоверности сайта, если она вам нужна.

🔍

Как исследовали

Команда взяла 12 моделей-агентов и три области: покупки, отели, научный поиск, всего 4 822 реальных запроса. Агент сам искал, получал до 10 результатов и выбирал. Главная трудность: если один сайт выбирают чаще, это может быть следствием того, что его позиции просто лучше или стоят выше. Поэтому исследователи сравнивали пары позиций с разных сайтов, выполняющие один и тот же набор требований, и прогоняли список по кругу, чтобы каждая позиция побывала на каждом месте. Качество позиций оценивал отдельный LLM-судья, которому источник не показывали, и его согласие с людьми было на уровне согласия людей между собой.

Результат: каждая модель в каждой области любила одни сайты и избегала других. Модели в основном совпадали в симпатиях: почти все предпочитали Booking.com, многие избегали Expedia. Позиция с «любимого» сайта, выполняющая на одно требование меньше, побеждала лучшую с нелюбимого в среднем в 68% случаев. В обратной ситуации — всего в 2%. Дальше проверяли причинность: те же результаты с замаскированным источником давали более слабое смещение, а одни и те же позиции с подменённой меткой выбирались чаще под «любимым» сайтом. Любопытно, что основной вклад вносил URL, а не название сайта в тексте. Для объяснения причины авторы показали, что при дообучении на парах, где определённый сайт чаще был «лучшим», агент вырабатывал к нему предпочтение. По аннотации, подстановка недостающей информации и контр-промпт уменьшают смещение.

📄

Оригинал из исследования

Пропущен: в предоставленном фрагменте нет дословного текста контр-промпта и нет описания подстановки информации (§7 обрезан). Шаблон выше — реконструкция по аннотации.

💡

Адаптации и экстраполяции

🔧 Техника: слепая оценка в два прохода → убираем влияние бренда на решение

Это экстраполяция принципа «скрыть источник», в статье не проверялась.

Проход 1. Ниже список позиций без названий сайтов и ссылок (A, B, C…). 
Оцени каждую по требованиям: {требования}. Дай итоговый рейтинг.

Проход 2 (после моего ответа). Вот соответствие A, B, C сайтам: {соответствие}. 
Если рейтинг стоит поменять не по требованиям, а по надёжности сайта, объясни почему отдельно.

Так вы видите, где бренд действительно меняет оценку, а где нет.

💡 Адаптация для аудита своего агента: возьмите две равные по требованиям позиции с разных сайтов, поменяйте их местами и поменяйте метки источников. Если агент каждый раз выбирает «свой» сайт, у него есть то самое смещение, и системный промпт стоит усилить.

🔗

Ресурсы

  • «Source Preference in the Wild: How LLM Agents Favor Items by Source, and How to Reduce It» (Preprint)
  • Авторы: Jonghyun Song, Haewon Park, Jeonghoon Shim, Woojung Song, Yohan Jo — Graduate School of Data Science, Seoul National University
  • Использованные наборы запросов: WebShop (покупки), HotelQuEST (отели), ScholarGym (научный поиск)
  • Схема агента: ReAct (Yao et al., 2022)

📋 Дайджест исследования

Ключевая суть

Агент с поиском берёт худшую позицию в двух случаях из трёх, если она с «любимого» сайта. Пара позиций: одна выполняет на одно требование меньше. Если слабая с любимого сайта, а сильная с нелюбимого, агент выбирает слабую. В обратной ситуации он почти никогда не берёт слабую. Метод из статьи позволяет выбирать товары, отели и статьи по требованиям, а не по знакомому домену. Фишка: не проси агента «быть объективным», а убери у него адрес сайта и запрети судить по репутации. Тогда ему нечем достраивать недостающие факты. Отдельный сигнал здесь домен в URL, и скрытие URL даёт основную часть эффекта.

Принцип работы

Три рычага работают вместе. Первый: спрятать то, что выдаёт источник (адрес, название сайта в тексте). Второй: дать агенту недостающие сведения о позиции. Третий: прямо написать в инструкции, что репутация сайта не аргумент. Агент сверяет позицию со списком требований и не смотрит, чья она. Это как в магазине. Не читал состав на упаковке, берёшь знакомый бренд. Прочитал состав, и бренд уже не так важен. Пошаговая сверка «требование → выполнено / не выполнено / нет данных» заставляет читать состав.

Почему работает

Когда в описании не хватает данных, большая языковая модель (LLM) заполняет пробел тем, что знает о сайте: «Booking надёжный», «arXiv серьёзный». Сверять каждое требование сложнее, чем доверять бренду. Возможно, ярлык закрепился ещё при обучении. Если сайт часто стоял рядом с «правильным» ответом, он стал знаком качества. Источник — самый дешёвый ярлык качества, и модель хватается за него, когда не хватает фактов. Поэтому помогает убрать сам ярлык и закрыть пробелы в данных. Большинство моделей любят и не любят одни и те же сайты, так что проблема системная. Честная оговорка: смещение ослабляется, но не исчезает. В статье часть предпочтения остаётся даже при скрытых маркерах.

Когда применять

Агенты с поиском → закупки, выбор отелей, подрядчиков, подбор статей, особенно когда описания позиций неполные, а запрос состоит из проверяемых пунктов (цена, гарантия, сроки). НЕ подходит для вкусовых запросов вроде «красивый» или «приятный»: там ярлыка-источника не избежать. Учти и обратное: иногда известный сайт правда надёжнее. Метод убирает слепое доверие, но не заменяет проверку достоверности сайта.

Мини-рецепт

1. Спрячь источник: убери из выдачи адрес сайта и его название в тексте. Это основная часть эффекта.
2. Закрой дыры: допиши цену, характеристики и условия, чтобы агенту не приходилось гадать.
3. Запрети бренд: в системной инструкции напиши, что репутация и известность сайта — не аргумент.
4. Разреши «нет данных»: вместо догадки агент помечает пробел и делает уточняющий поиск или задаёт вопрос.
5. Источник в конце: сайт называется только после выбора, как справка.
6. Проверь на своём агенте: перемешай порядок и поменяй метки сайтов местами. Выбор не должен меняться. Если меняется, смещение живо.

Важно: дословного текста контр-промпта в доступной части статьи нет. Шаблон — реконструкция, проверяй его на своей задаче.

Примеры

[ПЛОХО] : Найди и выбери лучший роутер
[ХОРОШО] : Выбери роутер. Требования: цена до 5 000 ₽, Wi-Fi 6, гарантия от 12 месяцев, доставка в Екатеринбург. Оценивай каждую позицию только по этим пунктам. Репутация и известность сайта — не аргумент. Если данных не хватает, не додумывай по бренду: пометь «нет данных» и сделай уточняющий поиск. Для каждой позиции выпиши: требование → выполнено / не выполнено / нет данных. При равенстве перечисли равные варианты. Сайт назови только после выбора. В ответе будет таблица «позиция × требование». Победитель определяется по числу выполненных пунктов, а не по тому, что роутер лежит на самом раскрученном маркетплейсе.
Источник: Source Preference in the Wild: How LLM Agents Favor Items by Source, and How to Reduce It
ArXiv ID: 2610.03195 | Сгенерировано: 2026-10-05 04:21

Проблемы LLM

ПроблемаСутьКак обойти
Модель выбирает по бренду сайта, а не по качеству позицииПросишь выбрать из списка: товары, отели, статьи, поставщики. У каждой позиции есть адрес сайта. Модель тянется к «знакомым» сайтам. Берёт худшую позицию, если она с любимого сайта. Причина: данных о позиции не хватает. Модель достраивает пробел репутацией: «этот сайт надёжный». Заметить это трудно. Ответ выглядит обоснованным. Проблема есть везде, где модель выбирает или ранжирует по источникам: поиск, подбор, обзоры, проверка поставщиковУбери из контекста всё, что выдаёт источник. Дай недостающие данные о позиции. Пусть модель сверяет позиции с явным списком требований. Источник называй только после выбора. Подробности — в методе ниже

Методы

МетодСуть
Слепая сверка по требованиям — выбор без влияния брендаЧто делать: 1) Убери из списка адреса сайтов и названия площадок. 2) Дай проверяемые требования: «цена до 5000», «гарантия от 12 месяцев». Не пиши «хороший и надёжный». 3) Добавь правило: Оценивай только по требованиям. Репутация сайта — не аргумент. Если данных нет, пиши «нет данных» и не додумывай. 4) Попроси таблицу: позиция × требование → выполнено / не выполнено / нет данных. 5) Выбор делай по числу выполненных требований. При ничьей перечисли равные варианты. 6) Источник покажи в конце, как справку. Почему работает: ярлык «известный сайт» возникает, когда нечего сверять. Нет адреса — не к чему привязаться. Есть таблица требований — критерием становится написанное в описании. Отметка «нет данных» не даёт заполнить пробел брендом. Проверка: перемешай порядок и поменяй метки источников. Выбор не должен меняться. Когда да: требования можно проверить, позиций много. Когда нет: вкусовые запросы («красивый», «приятный»), где нечего сверять. Предел: смещение ослабевает, но не пропадает полностью. Прямой запрет в инструкции — слабая опора, его надо проверять на своей задаче. Скрытие адреса даёт основной эффект
📖 Простыми словами

Source Preference in the Wild: HowLLMAgentsFavor Items by Source, and How to Reduce It

arXiv: 2610.03195

LLM-агенты страдают банальным снобизмом: они выбирают товары и ссылки не по характеристикам, а по вывеске. В исследовании это явление называют source preference — предвзятость к источнику. Когда агент парсит поисковую выдачу, домен в URL срабатывает как любимый лейбл: модель видит знакомый маркетплейс и забивает на реальные параметры запроса. Обучение вбило ей в веса, что популярный сайт — это по умолчанию "надёжно", поэтому нейросеть врубает когнитивную лень и срезает углы вместо честного сравнения.

Это как послать стажёра за кофе, а он притащит пережжённую бурду из Старбакса втридорога, проигнорировав шикарную локальную кофейню в двух шагах. Логика примитивная: «ну это же бренд, никто не уволит за покупку в IBM». Агент ведёт себя точно так же: находит красивый домен и решает, что сверять цифры и требования больше не нужно.

Лечится эта фигня тремя конкретными путями. Первый — маскирование URL: вырезай к чертям домены из контекста перед выдачей агенту, оставляя чистый текст. Второй — обогащение данных: дай полную спецификацию товара, чтобы у модели не возникало слепых зон, которые она пытается закрыть брендом сайта. Третий — дебиасинг через системный промпт: вбей жесткую инструкцию игнорировать репутацию источников. В связке это заставляет ассистента оценивать суть предложения, а не вывеску.

Исследователи гоняли тесты на закупках техники и бронировании отелей, но грабли универсальны для любых задач. Ищешь релевантные научные статьи — агент притащит посредственный препринт с arXiv, пропустив сильную статью из нишевого журнала. Парсишь код — он стянет кривой костыль со StackOverflow, проигнорировав свежий фикс из личного репозитория автора. Любой поисковый агент по дефолту тащит в работу багаж чужих авторитетов.

Короче: если ты строишь AI-агента и скармливаешь ему сырую поисковую выдачу, ты получаешь дорогущую иллюзию объективности. Не давай сетке халтурить: скрывай домены, заполняй пробелы в данных и бей по рукам за авторитеты в промпте. Иначе твой умный ассистент останется обычной жертвой базового маркетингового гипноза.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с