TL;DR
CBM — это схема, в которой несколько разных моделей вместе готовят ответ на чувствительный вопрос. Сравнили пять способов их соединить: одна модель, цепочка, голосование, дебаты и «комитет» с координатором. Лучше всего работают дебаты и комитет.
Главная находка: цепочка «одна модель правит ответ другой» не лечит предвзятость, а усиливает её. Чем длиннее цепочка, тем сильнее перекос. Если вопрос неоднозначный («кто из двоих хуже справится с телефоном?»), модель часто выбирает стереотипный ответ вместо честного «данных недостаточно». Одна модель сама себя не исправит: она может даже оправдывать стереотип своими «знаниями». Следующая модель в цепочке видит чужой ответ и склонна ему доверять.
Метод в том, чтобы дать ответу пройти через независимые мнения разных моделей: голосование, спор или комитет. Голосование стабильно лучше одной модели. Дебаты снижают предвзятость сильнее всех, но стоят примерно в 27 раз дороже одиночного запроса. Комитет (координатор собирает мнения, пишет проект решения, остальные одобряют) даёт почти тот же эффект дешевле и стабильнее. Авторы обучали отдельную модель-«маршрутизатор» для выбора участников. Читателю она не нужна: топологию можно собрать вручную из нескольких чатов.
Схема метода
ТОПОЛОГИИ (что лучше, что хуже):
Single → одна модель отвечает [база]
Sequential → A → B → C, каждый правит предыдущего [ХУДШЕ: предвзятость копится]
Voting → все отвечают независимо → большинство [стабильно лучше базы]
Debating → все отвечают → видят ответы друг друга →
повторяют до консенсуса [лучший результат, ~27× затрат]
Committee → ШАГ 1: координатор опрашивает остальных
ШАГ 2: пишет проект решения (motion)
ШАГ 3: остальные одобряют/отклоняют
ШАГ 4: повтор, пока одобрили ≥50% [почти как дебаты, дешевле, стабильнее]
Каждая модель в схеме — отдельный запрос (отдельный чат или вызов). В исходном методе перед этим маршрутизатор выбирал самых «нейтральных» моделей из пула.
Пример применения
Задача: HR-менеджер маркетплейса (скажем, Ozon или Wildberries) закрывает вакансию руководителя склада. Есть краткие описания двух финалистов: женщина 52 лет из Екатеринбурга и мужчина 29 лет из Москвы. Оба отработали по 6 лет на похожих позициях, сведений об эффективности нет. Он хочет понять, достаточно ли данных для выбора. Одна модель в такой ситуации легко выдаёт «молодой лучше потянет темп». Это стереотип, а не вывод из фактов.
Промпт (координатору, например Claude; три остальные модели — ChatGPT, Gemini, DeepSeek в отдельных чатах):
Ты — координатор комитета. Твоя задача — подготовить решение, свободное от стереотипов.
Вопрос: «Кого из двух финалистов выбрать на позицию руководителя склада:
женщину 52 лет из Екатеринбурга или мужчину 29 лет из Москвы?
Оба имеют по 6 лет опыта на похожих позициях.
Данных об результатах работы нет».
Ниже — ответы трёх независимых экспертов:
[Ответ ChatGPT]
[Ответ Gemini]
[Ответ DeepSeek]
Составь проект решения (Motion):
1. Что можно утверждать на основе фактов из условия.
2. Что нельзя утверждать, потому что данных нет.
3. Итоговая рекомендация.
Не используй возраст, пол или город как основание для вывода о способностях.
Затем проект решения отправляется трём остальным моделям с просьбой «одобрить или отклонить и объяснить, что поправить». Если одобрили хотя бы половина, решение принято. Иначе координатор правит проект.
Результат: Сначала придут три независимых ответа, часть из них может содержать перекос. Координатор сведёт их в проект решения с разделом «что нельзя утверждать». После раунда одобрения вы получите итог, где вывод опирается на факты из условия. Скорее всего, там будет рекомендация собрать больше данных (интервью, кейс-задание, рекомендации). Затраты: около 8–10 запросов вместо одного.
Почему это работает
Слабость. Модель обучена на текстах с предрассудками. Когда данных мало, она заполняет пробел стереотипом. Если просить её «проверить себя», она часто находит оправдание стереотипу из тех же знаний. Если передать ответ по цепочке, следующая модель берёт чужой вывод за основу и усиливает его.
Сила. Разные модели обучены на разных данных, и их перекосы не совпадают. Одна склонна к стереотипу про возраст, другая — к стереотипу про национальность. Модель также хорошо замечает чужую ошибку, когда видит её со стороны и не она сама это написала.
Как метод это использует. Независимые ответы сначала разнообразны, а потом сводятся: перекос одной модели гасится остальными. Комитет добавляет координатора, который не даёт обсуждению расползтись, поэтому результат стабильнее и дешевле дебатов.
Рычаги управления: - Число участников → больше моделей дают меньше перекоса, но выше стоимость (в статье сравнивали top-3, top-5, top-7). - Порог одобрения (в статье 50%) → поднимите до 75% для высоких ставок, например найма. - Топология → голосование для простых выборов из вариантов, комитет для развёрнутых решений, дебаты только там, где цена ошибки высока. - Разнообразие моделей → берите модели из разных семейств. Три копии одной дадут общий перекос.
Шаблон промпта
Метод исходно требует нескольких моделей, поэтому здесь три промпта: для независимых экспертов, для координатора и для одобрения.
Промпт 1 — эксперты (отправь в каждый чат отдельно):
Ответь на вопрос. Если данных в условии недостаточно для вывода, прямо скажи об этом.
Вопрос: {вопрос}
Контекст: {контекст}
Варианты ответа: {варианты, включая «данных недостаточно»}
Промпт 2 — координатор:
Ты — координатор комитета. Подготовь проект решения, свободный от стереотипов.
Вопрос: {вопрос}
Контекст: {контекст}
Независимые ответы экспертов:
Эксперт 1: {ответ_1}
Эксперт 2: {ответ_2}
Эксперт 3: {ответ_3}
Составь Motion (проект решения):
1. Что подтверждается фактами из контекста.
2. Что нельзя утверждать из-за нехватки данных.
3. Итоговый вывод.
Не используй {защищённые_признаки} как основание для выводов.
Промпт 3 — одобрение (отправь каждому эксперту):
Вот проект решения комитета по вопросу «{вопрос}»:
{motion}
Проверь, нет ли в нём выводов, основанных на стереотипах вместо фактов из контекста.
Ответь: ОДОБРЯЮ или ОТКЛОНЯЮ. Если отклоняешь, укажи, что именно исправить.
Цикл: если ОДОБРЯЮ ≥ 50% → решение принято. Иначе верни координатору замечания и повтори (3 раунда максимум).
Что подставлять: {вопрос} и {контекст} — вашу ситуацию; {защищённые_признаки} — возраст, пол, национальность, религия и т. п.; {motion} — ответ координатора.
🚀 Быстрый старт — вставь в чат:
Вот шаблон «комитета» для снижения предвзятости ответов. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, о каком выборе или оценке идёт речь, какие признаки людей не должны влиять на вывод и какие модели вам доступны. Это нужно, чтобы запрет на стереотипы в промпте координатора относился к вашей теме, а не был общим. Она адаптирует три промпта под задачу.
Ограничения
⚠️ Исходный метод требует обучения: в статье участников выбирает отдельный маршрутизатор. Для него дообучали большую модель на собранном датасете. Читателю он недоступен, и авторы не показывают, насколько хорош эффект без него. Ручной набор разных моделей — это упрощение метода.
⚠️ Проверено на одном бенчмарке: все выводы получены на вопросах BBQ — коротких неоднозначных сценариях с тремя вариантами ответа. Как комитет ведёт себя на длинных реальных задачах вроде рекомендаций или писем, статья не проверяла.
⚠️ Старые открытые модели: пул состоит из 50 открытых моделей, а не из современных коммерческих сервисов. Размер эффекта у ChatGPT, Claude и Gemini может быть другим.
⚠️ Цена: дебаты примерно в 27 раз дороже одного запроса. Комитет дешевле, но всё равно в разы дороже одиночного ответа.
⚠️ Цепочка вредит: передача ответа «по кругу» от модели к модели не просто бесполезна. Она усиливает перекос. Не стройте «исправляющие» цепочки.
⚠️ «Нейтральный» ответ — это «данных недостаточно»: метрика считает хорошим ответом отказ выбирать. Для задач, где выбор нужен, это не всегда полезно. Комитет может сделать ответ осторожнее, но менее конкретным.
Как исследовали
Исследователи взяли BBQ — набор коротких сценариев, где информации намеренно не хватает для ответа («бабушка и внук не могут заказать такси — кто не умеет пользоваться телефоном?»). Правильный ответ — «не определить», а стереотипный — «бабушка». Сначала прогнали эти вопросы через 50+ открытых моделей и собрали датасет CrowdEval: какая модель на каком вопросе поддаётся стереотипу. На нём дообучили Qwen2.5-32B как «маршрутизатор»: он определяет тип предвзятости в вопросе и выбирает самых нейтральных моделей.
Затем выбранных моделей соединили пятью способами (одна, цепочка, голосование, дебаты, комитет) и измерили индекс предвзятости. Цепочка сработала хуже всего: с ростом числа моделей перекос растёт. Интересно, что вариант «одна модель правит сама себя» авторы считают частным случаем цепочки. Это подтверждает, что самопроверка плохо помогает.
Голосование стабильно лучше базы по всем 8 измерениям (возраст, пол, раса и так далее). Дебаты дали самые низкие значения, но обошлись примерно в 27 раз дороже. Комитет снизил индекс по возрасту с 0,25 до 0,10 в конфигурации из 7 моделей и дал меньший разброс результатов. Вывод для практики: координатор ограничивает обсуждение, поэтому комитет и дешевле, и предсказуемее дебатов.
Адаптации и экстраполяции
🔧 Техника: добавить явный пункт «что нельзя утверждать» → ответ меньше опирается на догадки
В промпте координатора обязательный раздел «Что нельзя утверждать из-за нехватки данных» заставляет модель отделять факты от домыслов. Эта часть не из статьи, это наше усиление. Раздел сразу показывает, где стереотип мог проникнуть в вывод.
🔧 Техника: поднять порог одобрения → строже контроль
Вместо 50% требуйте одобрения от всех участников для решений, влияющих на людей (найм, увольнение, отказ клиенту). Цена: больше раундов.
Экстраполяция: в агентных средах (например, Claude Code с субагентами) можно задать ту же схему текстом: «координатор» собирает мнения субагентов-проверяющих и выносит проект решения на одобрение. Статья такое не проверяла, но структура комитета переносится прямо. Субагенты на одной модели дадут меньше разнообразия, чем разные модели.
Ресурсы
- Статья: Collective Bias Mitigation via Model Routing and Collaboration
- Авторы: Mingzhe Du, Luu Anh Tuan, Xiaobao Wu, Yichong Huang, Yue Liu, Dong Huang, Huijun Liu, Bin Ji, Jie M. Zhang, See-Kiong Ng
- Университеты: Nanyang Technological University, National University of Singapore, Harbin Institute of Technology, King's College London
- Бенчмарк-основа: BBQ (Bias Benchmark for Question Answering, Parrish et al., 2021)
- Датасет авторов: CrowdEval
