TL;DR
Когда несколько разных ИИ смотрят на один и тот же сложный случай, они почти никогда не соглашаются друг с другом — и вместо того чтобы это разногласие "гасить" (усреднением или голосованием), можно явно анализировать, где и почему мнения расходятся, и строить финальный вывод именно на этих точках напряжения. RareLens — система, которая берёт ответы от пачки разных языковых моделей по одному медицинскому случаю и через отдельный обучаемый слой сводит их в одно решение.
Главная находка: врачи, оценивая сложный случай, держат в голове несколько конкурирующих гипотез параллельно и сходятся к диагнозу через обсуждение — а не идут по одной линии рассуждений. Разные ИИ-модели делают то же самое неосознанно: на одном и том же случае две модели дают одинаковую оценку риска менее чем в 20% случаев, а расхождение в баллах риска доходит до 26 пунктов. Раньше это считали шумом. Оказалось — это полезный сигнал: чем сильнее модели расходятся между собой на конкретном случае, тем больше в нём скрытой сложности, которую стоит разобрать отдельно, а не усреднить и забыть.
Метод в трёх шагах: (1) несколько разных LLM независимо разбирают один случай и каждая выдаёт структурированный ответ — вывод + ключевые факторы + объяснение; (2) отдельный обучаемый слой сравнивает все эти ответы и вычленяет закономерности в их разногласиях; (3) на основе этого рождается одно финальное решение, точнее любой отдельной модели — и точнее простого усреднения или голосования.
Схема метода
ШАГ 1: N разных LLM независимо анализируют один случай →
каждая выдаёт: {вывод} + {ключевые факторы} + {объяснение}
(отдельные независимые запросы к разным моделям)
ШАГ 2: Обучаемый ML-слой сравнивает все ответы →
находит закономерность в том, ГДЕ и КАК модели расходятся
(требует отдельного обучения — не делается в чате)
ШАГ 3: Финальное конвергентное решение,
учитывающее паттерн разногласий, а не просто "средний" ответ
Оригинальная система требует обучения отдельной модели на массиве данных. Но принцип шага 1–2 можно приблизительно воспроизвести вручную, заменив ML-слой на LLM, которая анализирует чужие ответы текстом.
Пример применения
Задача: Предприниматель решает, стоит ли вписываться в партнёрство с производством — сумма сделки крупная, данные неполные, риск на глаз не оценить.
Промпт (шаг 1 — задать одному и тому же запросу разным моделям, например ChatGPT, Claude, Gemini, DeepSeek):
Проанализируй ситуацию и дай структурированный ответ:
Ситуация: [описание сделки — сумма, партнёр, условия, что известно]
Ответь в формате:
1. Вердикт (входить в сделку / не входить / входить с условиями)
2. Три ключевых фактора, которые повлияли на твой вывод
3. Короткое объяснение логики
Промпт (шаг 2 — свести ответы в одном чате):
Вот 4 независимых заключения от разных ИИ по одной и той же ситуации:
[вставить все 4 ответа]
Сделай так:
1. Найди пункты, где мнения совпадают — это надёжные выводы.
2. Найди пункты максимального разногласия — что один считает решающим фактором, другие игнорируют.
3. Для каждого разногласия объясни, почему модели могли увидеть ситуацию по-разному.
4. Дай финальный вывод, который учитывает совпадения как базу, а разногласия — как зоны риска, которые нужно проверить отдельно перед решением.
Результат: модель покажет таблицу или список — что все ИИ увидели одинаково (это можно считать надёжным), и в чём мнения разошлись сильнее всего. По каждой точке разногласия — гипотезу, почему модели расходятся. В конце — финальный вывод с явным указанием, какие 1-2 момента стоит перепроверить у человека-эксперта, потому что именно там ИИ "спорят" между собой.
Почему это работает
Одна модель, спрошенная один раз, застревает на одной интерпретации ситуации — она не видит альтернативных гипотез, потому что генерирует один связный текст по одной логике. Это её слабость на неопределённых, сложных задачах.
Сильная сторона LLM — она хорошо резюмирует и сравнивает чужие тексты, находит закономерности в наборе мнений, если её явно попросить это сделать.
Метод использует эту сильную сторону: вместо того чтобы полагаться на одну модель или усреднять несколько ответов (что стирает информацию о том, ГДЕ именно есть неопределённость), он превращает разногласие в отдельный объект анализа. Точки максимального спора между моделями — это подсказка, где в задаче скрыта настоящая сложность.
Рычаги управления: - Количество моделей-мнений → 2 для быстрой проверки, 4-5 для надёжного покрытия разных углов - Структура ответа (вывод + факторы + объяснение) → можно расширить дополнительными полями под свою задачу (например, "риски", "альтернативы") - Порог значимого разногласия → попроси модель явно выделять только те пункты, где мнения различаются кардинально, а не в деталях формулировок
Шаблон промпта
Вот структура для сведения нескольких независимых мнений ИИ по одной задаче.
ШАГ 1 — задай это одному и тому же запросу в разных ИИ (ChatGPT, Claude, Gemini, DeepSeek):
"Проанализируй ситуацию: {описание задачи}.
Ответь в формате:
1. Вердикт
2. Ключевые факторы (3-5 пунктов)
3. Объяснение логики"
ШАГ 2 — собери все ответы и вставь в один чат с промптом:
"Вот {количество} независимых заключений разных ИИ по одной задаче:
{вставить все ответы}
1. Найди совпадения — это надёжная база.
2. Найди пункты максимального разногласия.
3. Объясни вероятную причину каждого разногласия.
4. Дай финальный вывод, отметив зоны риска, где мнения ИИ расходятся сильнее всего."
Подставь: {описание задачи} — конкретная ситуация с деталями, {количество} — сколько ответов собрал.
🚀 Быстрый старт — вставь в чат:
Вот шаблон метода RareLens (сведение разногласий разных ИИ в одно решение).
Адаптируй под мою задачу: [твоя задача].
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какие модели ты используешь и сколько мнений собрал — потому что метод работает только если есть реальное расхождение между независимыми источниками, а не одна модель, спрошенная дважды.
Ограничения
⚠️ Нужны разные модели, не одна: метод основан на том, что разные архитектуры LLM по-разному интерпретируют одну задачу. Если спросить одну и ту же модель несколько раз — разногласия будут случайным шумом, а не сигналом.
⚠️ Точность ручной версии ниже оригинала: в исследовании разногласия анализирует отдельно обученный ML-слой на данных о 150+ тысячах случаев. Вручную в чате можно только приблизительно повторить логику через текстовый анализ — это не даст той же точности.
⚠️ Избыточно для простых задач: если вопрос однозначный, модели не разойдутся во мнениях, и весь процесс сведения ответов — трата времени.
⚠️ Требует нескольких подписок или доступов: для реального разнообразия мнений нужно спросить хотя бы 2-3 разные модели (ChatGPT + Claude + Gemini), а не только одну.
Ресурсы
RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning. Авторы — коллектив из West China Hospital (Sichuan University), CUHK-Shenzhen, Carnegie Mellon University, NTU Singapore и др. Датасет RareBench — 157 525 случаев, все 33 категории Orphanet, более 7000 редких заболеваний.
