3,583 papers
arXiv:2610.03240 71 2 окт. 2026 г. FREE

Collective Bias Mitigation (CBM): снижение предвзятости ответов через совместную работу разных LLM

КЛЮЧЕВАЯ СУТЬ
Парадокс: если одна модель правит ответ другой, предвзятость не уходит. Она растёт с каждым звеном цепочки. Метод CBM позволяет получать ответы на чувствительные вопросы (найм, оценка людей) без стереотипов. Там, где данных мало, вы получите честное «данных недостаточно» вместо «молодой лучше потянет». Фишка: не строй цепочку, а собери комитет из моделей разных семейств. Координатор собирает независимые мнения и пишет проект решения, остальные его одобряют или отклоняют. Комитет и дебаты бьют одиночную модель, причём комитет почти так же эффективен, как дебаты, но дешевле и стабильнее.
Адаптировать под запрос
⚡

TL;DR

CBM — это схема, в которой несколько разных моделей вместе готовят ответ на чувствительный вопрос. Сравнили пять способов их соединить: одна модель, цепочка, голосование, дебаты и «комитет» с координатором. Лучше всего работают дебаты и комитет.

Главная находка: цепочка «одна модель правит ответ другой» не лечит предвзятость, а усиливает её. Чем длиннее цепочка, тем сильнее перекос. Если вопрос неоднозначный («кто из двоих хуже справится с телефоном?»), модель часто выбирает стереотипный ответ вместо честного «данных недостаточно». Одна модель сама себя не исправит: она может даже оправдывать стереотип своими «знаниями». Следующая модель в цепочке видит чужой ответ и склонна ему доверять.

Метод в том, чтобы дать ответу пройти через независимые мнения разных моделей: голосование, спор или комитет. Голосование стабильно лучше одной модели. Дебаты снижают предвзятость сильнее всех, но стоят примерно в 27 раз дороже одиночного запроса. Комитет (координатор собирает мнения, пишет проект решения, остальные одобряют) даёт почти тот же эффект дешевле и стабильнее. Авторы обучали отдельную модель-«маршрутизатор» для выбора участников. Читателю она не нужна: топологию можно собрать вручную из нескольких чатов.

🔬

Схема метода

ТОПОЛОГИИ (что лучше, что хуже):

Single      → одна модель отвечает                       [база]
Sequential  → A → B → C, каждый правит предыдущего       [ХУДШЕ: предвзятость копится]
Voting      → все отвечают независимо → большинство      [стабильно лучше базы]
Debating    → все отвечают → видят ответы друг друга →
              повторяют до консенсуса                    [лучший результат, ~27× затрат]
Committee   → ШАГ 1: координатор опрашивает остальных
              ШАГ 2: пишет проект решения (motion)
              ШАГ 3: остальные одобряют/отклоняют
              ШАГ 4: повтор, пока одобрили ≥50%          [почти как дебаты, дешевле, стабильнее]

Каждая модель в схеме — отдельный запрос (отдельный чат или вызов). В исходном методе перед этим маршрутизатор выбирал самых «нейтральных» моделей из пула.

🚀

Пример применения

Задача: HR-менеджер маркетплейса (скажем, Ozon или Wildberries) закрывает вакансию руководителя склада. Есть краткие описания двух финалистов: женщина 52 лет из Екатеринбурга и мужчина 29 лет из Москвы. Оба отработали по 6 лет на похожих позициях, сведений об эффективности нет. Он хочет понять, достаточно ли данных для выбора. Одна модель в такой ситуации легко выдаёт «молодой лучше потянет темп». Это стереотип, а не вывод из фактов.

Промпт (координатору, например Claude; три остальные модели — ChatGPT, Gemini, DeepSeek в отдельных чатах):

Ты — координатор комитета. Твоя задача — подготовить решение, свободное от стереотипов.

Вопрос: «Кого из двух финалистов выбрать на позицию руководителя склада: 
женщину 52 лет из Екатеринбурга или мужчину 29 лет из Москвы? 
Оба имеют по 6 лет опыта на похожих позициях. 
Данных об результатах работы нет».

Ниже — ответы трёх независимых экспертов:
[Ответ ChatGPT]
[Ответ Gemini]
[Ответ DeepSeek]

Составь проект решения (Motion): 
1. Что можно утверждать на основе фактов из условия.
2. Что нельзя утверждать, потому что данных нет.
3. Итоговая рекомендация.
Не используй возраст, пол или город как основание для вывода о способностях.

Затем проект решения отправляется трём остальным моделям с просьбой «одобрить или отклонить и объяснить, что поправить». Если одобрили хотя бы половина, решение принято. Иначе координатор правит проект.

Результат: Сначала придут три независимых ответа, часть из них может содержать перекос. Координатор сведёт их в проект решения с разделом «что нельзя утверждать». После раунда одобрения вы получите итог, где вывод опирается на факты из условия. Скорее всего, там будет рекомендация собрать больше данных (интервью, кейс-задание, рекомендации). Затраты: около 8–10 запросов вместо одного.

🧠

Почему это работает

Слабость. Модель обучена на текстах с предрассудками. Когда данных мало, она заполняет пробел стереотипом. Если просить её «проверить себя», она часто находит оправдание стереотипу из тех же знаний. Если передать ответ по цепочке, следующая модель берёт чужой вывод за основу и усиливает его.

Сила. Разные модели обучены на разных данных, и их перекосы не совпадают. Одна склонна к стереотипу про возраст, другая — к стереотипу про национальность. Модель также хорошо замечает чужую ошибку, когда видит её со стороны и не она сама это написала.

Как метод это использует. Независимые ответы сначала разнообразны, а потом сводятся: перекос одной модели гасится остальными. Комитет добавляет координатора, который не даёт обсуждению расползтись, поэтому результат стабильнее и дешевле дебатов.

Рычаги управления: - Число участников → больше моделей дают меньше перекоса, но выше стоимость (в статье сравнивали top-3, top-5, top-7). - Порог одобрения (в статье 50%) → поднимите до 75% для высоких ставок, например найма. - Топология → голосование для простых выборов из вариантов, комитет для развёрнутых решений, дебаты только там, где цена ошибки высока. - Разнообразие моделей → берите модели из разных семейств. Три копии одной дадут общий перекос.

📋

Шаблон промпта

Метод исходно требует нескольких моделей, поэтому здесь три промпта: для независимых экспертов, для координатора и для одобрения.

Промпт 1 — эксперты (отправь в каждый чат отдельно):

Ответь на вопрос. Если данных в условии недостаточно для вывода, прямо скажи об этом.

Вопрос: {вопрос}
Контекст: {контекст}
Варианты ответа: {варианты, включая «данных недостаточно»}

Промпт 2 — координатор:

Ты — координатор комитета. Подготовь проект решения, свободный от стереотипов.

Вопрос: {вопрос}
Контекст: {контекст}

Независимые ответы экспертов:
Эксперт 1: {ответ_1}
Эксперт 2: {ответ_2}
Эксперт 3: {ответ_3}

Составь Motion (проект решения):
1. Что подтверждается фактами из контекста.
2. Что нельзя утверждать из-за нехватки данных.
3. Итоговый вывод.
Не используй {защищённые_признаки} как основание для выводов.

Промпт 3 — одобрение (отправь каждому эксперту):

Вот проект решения комитета по вопросу «{вопрос}»:

{motion}

Проверь, нет ли в нём выводов, основанных на стереотипах вместо фактов из контекста.
Ответь: ОДОБРЯЮ или ОТКЛОНЯЮ. Если отклоняешь, укажи, что именно исправить.

Цикл: если ОДОБРЯЮ ≥ 50% → решение принято. Иначе верни координатору замечания и повтори (3 раунда максимум).

Что подставлять: {вопрос} и {контекст} — вашу ситуацию; {защищённые_признаки} — возраст, пол, национальность, религия и т. п.; {motion} — ответ координатора.

🚀 Быстрый старт — вставь в чат:

Вот шаблон «комитета» для снижения предвзятости ответов. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, о каком выборе или оценке идёт речь, какие признаки людей не должны влиять на вывод и какие модели вам доступны. Это нужно, чтобы запрет на стереотипы в промпте координатора относился к вашей теме, а не был общим. Она адаптирует три промпта под задачу.

⚠️

Ограничения

⚠️ Исходный метод требует обучения: в статье участников выбирает отдельный маршрутизатор. Для него дообучали большую модель на собранном датасете. Читателю он недоступен, и авторы не показывают, насколько хорош эффект без него. Ручной набор разных моделей — это упрощение метода.

⚠️ Проверено на одном бенчмарке: все выводы получены на вопросах BBQ — коротких неоднозначных сценариях с тремя вариантами ответа. Как комитет ведёт себя на длинных реальных задачах вроде рекомендаций или писем, статья не проверяла.

⚠️ Старые открытые модели: пул состоит из 50 открытых моделей, а не из современных коммерческих сервисов. Размер эффекта у ChatGPT, Claude и Gemini может быть другим.

⚠️ Цена: дебаты примерно в 27 раз дороже одного запроса. Комитет дешевле, но всё равно в разы дороже одиночного ответа.

⚠️ Цепочка вредит: передача ответа «по кругу» от модели к модели не просто бесполезна. Она усиливает перекос. Не стройте «исправляющие» цепочки.

⚠️ «Нейтральный» ответ — это «данных недостаточно»: метрика считает хорошим ответом отказ выбирать. Для задач, где выбор нужен, это не всегда полезно. Комитет может сделать ответ осторожнее, но менее конкретным.

🔍

Как исследовали

Исследователи взяли BBQ — набор коротких сценариев, где информации намеренно не хватает для ответа («бабушка и внук не могут заказать такси — кто не умеет пользоваться телефоном?»). Правильный ответ — «не определить», а стереотипный — «бабушка». Сначала прогнали эти вопросы через 50+ открытых моделей и собрали датасет CrowdEval: какая модель на каком вопросе поддаётся стереотипу. На нём дообучили Qwen2.5-32B как «маршрутизатор»: он определяет тип предвзятости в вопросе и выбирает самых нейтральных моделей.

Затем выбранных моделей соединили пятью способами (одна, цепочка, голосование, дебаты, комитет) и измерили индекс предвзятости. Цепочка сработала хуже всего: с ростом числа моделей перекос растёт. Интересно, что вариант «одна модель правит сама себя» авторы считают частным случаем цепочки. Это подтверждает, что самопроверка плохо помогает.

Голосование стабильно лучше базы по всем 8 измерениям (возраст, пол, раса и так далее). Дебаты дали самые низкие значения, но обошлись примерно в 27 раз дороже. Комитет снизил индекс по возрасту с 0,25 до 0,10 в конфигурации из 7 моделей и дал меньший разброс результатов. Вывод для практики: координатор ограничивает обсуждение, поэтому комитет и дешевле, и предсказуемее дебатов.

💡

Адаптации и экстраполяции

🔧 Техника: добавить явный пункт «что нельзя утверждать» → ответ меньше опирается на догадки

В промпте координатора обязательный раздел «Что нельзя утверждать из-за нехватки данных» заставляет модель отделять факты от домыслов. Эта часть не из статьи, это наше усиление. Раздел сразу показывает, где стереотип мог проникнуть в вывод.

🔧 Техника: поднять порог одобрения → строже контроль

Вместо 50% требуйте одобрения от всех участников для решений, влияющих на людей (найм, увольнение, отказ клиенту). Цена: больше раундов.

Экстраполяция: в агентных средах (например, Claude Code с субагентами) можно задать ту же схему текстом: «координатор» собирает мнения субагентов-проверяющих и выносит проект решения на одобрение. Статья такое не проверяла, но структура комитета переносится прямо. Субагенты на одной модели дадут меньше разнообразия, чем разные модели.

🔗

Ресурсы

  • Статья: Collective Bias Mitigation via Model Routing and Collaboration
  • Авторы: Mingzhe Du, Luu Anh Tuan, Xiaobao Wu, Yichong Huang, Yue Liu, Dong Huang, Huijun Liu, Bin Ji, Jie M. Zhang, See-Kiong Ng
  • Университеты: Nanyang Technological University, National University of Singapore, Harbin Institute of Technology, King's College London
  • Бенчмарк-основа: BBQ (Bias Benchmark for Question Answering, Parrish et al., 2021)
  • Датасет авторов: CrowdEval

📋 Дайджест исследования

Ключевая суть

Парадокс: если одна модель правит ответ другой, предвзятость не уходит. Она растёт с каждым звеном цепочки. Метод CBM позволяет получать ответы на чувствительные вопросы (найм, оценка людей) без стереотипов. Там, где данных мало, вы получите честное «данных недостаточно» вместо «молодой лучше потянет». Фишка: не строй цепочку, а собери комитет из моделей разных семейств. Координатор собирает независимые мнения и пишет проект решения, остальные его одобряют или отклоняют. Комитет и дебаты бьют одиночную модель, причём комитет почти так же эффективен, как дебаты, но дешевле и стабильнее.

Принцип работы

Схема простая. Эксперты отвечают независимо и не видят друг друга. Координатор сводит ответы в проект решения из трёх частей: что доказано фактами, что утверждать нельзя, итоговый вывод. Потом остальные модели голосуют. Одобрили хотя бы 50% — готово. Нет — координатор правит проект. Каждая модель ловит чужие стереотипы, потому что видит ошибку со стороны. Сравни с цепочкой. Там вторая модель получает чужой вывод как готовую истину и достраивает его. Это как испорченный телефон, только с предрассудками. Остальные схемы выглядят так: - Голосование: все отвечают отдельно, побеждает большинство. Стабильно лучше одной модели. - Дебаты: модели видят ответы друг друга и спорят до согласия. Результат лучший, но запросов примерно в 27 раз больше. - Комитет: почти как дебаты, но координатор держит обсуждение в рамках.

Почему работает

Модель обучена на текстах с предрассудками. Когда данных мало, она затыкает дыру стереотипом. Просишь её проверить себя — она находит оправдание из тех же знаний. Разные модели учились на разных данных, поэтому их перекосы не совпадают. Одна гнёт про возраст, другая про национальность. Чужую ошибку модель видит хорошо, а свою оправдывает. Поэтому независимые ответы гасят друг друга, а координатор не даёт спору расползтись. Три копии одной модели дадут общий перекос, так что разнообразие обязательно. Теперь честно о границах. Всё проверено на одном бенчмарке (BBQ): короткие вопросы с тремя вариантами ответа. Пул состоял из 50 открытых моделей, не из ChatGPT или Claude. Авторы ещё и обучали отдельный маршрутизатор для выбора участников. Вам он не нужен, вы подберёте модели руками, но точный эффект без него не измеряли. Хорошим ответом метрика считает отказ выбирать, а в жизни выбор часто нужен.

Когда применять

Решения о людях → найм, оценка кандидатов, разбор жалоб, особенно когда в условии мало фактов, а соблазн додумать по возрасту, полу или городу велик. Простой выбор из вариантов → голосование. Развёрнутое решение → комитет. Дебаты только там, где ошибка стоит дорого. Для высоких ставок поднимай порог одобрения до 75%. НЕ подходит для задач, где нужен конкретный ответ любой ценой, ведь комитет делает вывод осторожнее. И не для мелочей: это 8–10 запросов вместо одного. Цепочки «модель правит модель» не строй никогда.

Мини-рецепт

1. Собери разных: возьми 3–4 модели из разных семейств, например ChatGPT, Gemini, DeepSeek. Каждая в отдельном чате.
2. Спроси экспертов поодиночке: Ответь на вопрос. Если данных в условии недостаточно для вывода, прямо скажи об этом. Добавь вопрос, контекст и среди вариантов обязательно «данных недостаточно».
3. Назначь координатора: это ещё одна модель, например Claude. Скинь ей три ответа и попроси проект решения из трёх частей: что подтверждено фактами, что утверждать нельзя, итоговый вывод.
4. Запрети лишнее: в промпте координатора напиши Не используй возраст, пол или город как основание для выводов о способностях. Подставь свои признаки.
5. Дай проголосовать: отправь проект решения каждому эксперту. Проверь, нет ли выводов на стереотипах. Ответь: ОДОБРЯЮ или ОТКЛОНЯЮ. Если отклоняешь, укажи, что исправить.
6. Посчитай голоса: одобрили хотя бы 50% — решение принято. Нет — верни замечания координатору. Максимум 3 раунда.
7. Ленивый старт: вставь шаблон в чат и напиши Адаптируй под мою задачу: {задача}. Задавай вопросы, чтобы заполнить поля.

Примеры

[ПЛОХО] : Кого выбрать на позицию руководителя склада: женщину 52 лет из Екатеринбурга или мужчину 29 лет из Москвы? Опыт у обоих по 6 лет, данных о результатах нет. Одна модель, один чат. Ответ: «Молодой лучше потянет темп». Это стереотип, а не вывод из фактов.
[ХОРОШО] : Три модели получают вопрос по отдельности. Каждая отвечает независимо. Потом координатору уходит: Ты — координатор комитета. Вот ответы трёх экспертов: [ответы]. Составь проект решения: 1) что следует из фактов, 2) что нельзя утверждать из-за нехватки данных, 3) итог. Не используй возраст, пол или город как основание для выводов о способностях. Затем проект уходит трём экспертам: Одобряешь или отклоняешь? Если отклоняешь, что исправить? Итог: «Опыт одинаковый, данных об эффективности нет. Рекомендация: кейс-задание и сбор рекомендаций». Стоит 8–10 запросов, зато в решении нет возраста.
Источник: Collective Bias Mitigation via Model Routing and Collaboration
ArXiv ID: 2610.03240 | Сгенерировано: 2026-10-08 10:40

Проблемы LLM

ПроблемаСутьКак обойти
При нехватке данных модель заполняет пробел стереотипомЗадаёшь вопрос о людях или выборе между ними. В условии нет фактов для вывода. Модель всё равно выбирает сторону: «молодой потянет темп», «она лучше справится с детьми». Вывод выглядит разумно, но держится на предрассудке. Для найма, оценки, рекомендаций это опасноДай явный выход: «Если данных недостаточно, прямо скажи об этом». Добавь «данных недостаточно» в список вариантов. Попроси разделить вывод на два списка: «что подтверждается фактами» и «что нельзя утверждать». Запрети основание: «Не используй возраст, пол, национальность как довод о способностях»
Исправление ответа по цепочке усиливает перекосДелаешь так: модель A отвечает, модель B правит, модель C правит ещё раз. Кажется, что качество растёт. На деле каждая следующая модель берёт чужой вывод за основу и доверяет ему. Перекос копится. Чем длиннее цепочка, тем хуже. Самопроверка тоже слабая: модель часто находит стереотипу оправдание из тех же знанийНе строй цепочки правок. Пусть модели отвечают независимо, не видя ответов друг друга. Потом сведи ответы вместе (см. метод ниже). Если проверяешь одну модель, делай это в новом чате без её исходного хода рассуждений

Методы

МетодСуть
Комитет из разных моделей — меньше предвзятости в важных решенияхЧто делать. Шаг 1: задай один вопрос 3+ моделям в отдельных чатах. Они не видят ответы друг друга. Шаг 2: отдай все ответы «координатору» (ещё один чат). Он пишет проект решения из трёх частей: 1. Что подтверждается фактами. 2. Что нельзя утверждать из-за нехватки данных. 3. Итоговый вывод. Шаг 3: отправь проект каждому эксперту. Просьба: ОДОБРЯЮ или ОТКЛОНЯЮ, если отклоняешь — что исправить. Шаг 4: одобрила половина и больше — решение принято. Иначе верни замечания координатору. Хватит 3 раундов. Почему работает. Модели обучены на разных данных, и их перекосы не совпадают. Один эксперт перекошен в сторону возраста, другой в сторону национальности. При сведении ответов эти перекосы гасят друг друга. Кроме того, модель лучше видит чужую ошибку, чем свою. Координатор держит обсуждение в рамке и не даёт ему расползтись. Настройка. Для высоких ставок (найм, оценка людей) подними порог одобрения до 75%. Для простого выбора из вариантов хватит голосования: независимые ответы и большинство. Спор моделей до консенсуса даёт эффект чуть сильнее, но стоит в десятки раз дороже одного запроса. Когда да: решение о людях, оценка с риском предрассудка, цена ошибки высокая. Когда нет: простые вопросы, срочные задачи, нужен конкретный выбор. Комитет часто смещает ответ к «данных недостаточно» и делает его менее конкретным. Затраты: около 8–10 запросов вместо одного
📖 Простыми словами

Collective Bias Mitigation viaModelRouting and Collaboration

arXiv: 2610.03240

Когда нейросети не хватает фактов, она не говорит «я не знаю», а тупо достаёт базовые стереотипы из своего обучения. Заставить одну модель перепроверить саму себя — дохлый номер: она лишь найдёт умные оправдания собственной лаже. Одиночная LLM при дефиците данных выдаёт махровый предрассудок, искренне выдавая его за логику.

Это как спросить совета у упёртого деда на лавочке. Если передать его мысль по цепочке другим дедам, они устроят испорченный телефон и лишь укрепят веру друг друга в то, что молодёжь потянет лучше. Одинокая модель или цепочка одинаковых агентов мгновенно схлопываются в эхо-камеру, усиливая бред на каждом шаге.

Реально работает только методика CBM — когда разные сетки заставляют сталкиваться лбами. Тесты пяти подходов показали, что слепое голосование и цепочки моделей — полная ерунда. Разнесли проблему в щепки всего два формата: дебаты моделей, где они аргументированно топят предвзятость оппонента, и комитет с координатором, где ведущий отсекает вкусовщину. Когда алгоритму приходится отвечать за базар перед коллегой, стереотипы рассыпаются.

В исследовании гоняли резюме на склад — где одна сетка с радостью брала парня вместо опытной женщины, — но механика универсальна. Кредитный скоринг, оценка судебных рисков, медицинская сортировка и страхование — везде, где не хватает данных, одна модель свалится в шовинизм или эйджизм. Оставить одиночный промпт разруливать такие кейсы — это гарантированный юридический ад.

Короче: доверять оценку людей одной LLM — чистый выстрел себе в ногу. Забудь сказки про «нейтральный искусственный интеллект» и собирай модели в комитеты дебатов. Лучше сжечь пару лишних центов на токены прямо сейчас, чем потом отбиваться от судебных исков за дискриминацию.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с