3,583 papers
arXiv:2607.23290 73 25 июля 2026 г. FREE

RareLens: расхождение мнений разных ИИ — это сигнал, а не шум, который нужно усреднять

КЛЮЧЕВАЯ СУТЬ
Парадокс: две разные ИИ-модели, разбирая один и тот же сложный случай, соглашаются друг с другом меньше чем в 20% случаев — разброс оценки риска доходит до 26 баллов. Метод RareLens позволяет превратить этот разброс в диагностический сигнал, а не терять его в усреднении. Фишка: искать не согласие, а точки максимального спора между моделями — именно там прячется настоящая сложность случая. Финальный ответ строится не на среднем арифметическом, а на паттерне того, где и почему модели расходятся.
Адаптировать под запрос

TL;DR

Когда несколько разных ИИ смотрят на один и тот же сложный случай, они почти никогда не соглашаются друг с другом — и вместо того чтобы это разногласие "гасить" (усреднением или голосованием), можно явно анализировать, где и почему мнения расходятся, и строить финальный вывод именно на этих точках напряжения. RareLens — система, которая берёт ответы от пачки разных языковых моделей по одному медицинскому случаю и через отдельный обучаемый слой сводит их в одно решение.

Главная находка: врачи, оценивая сложный случай, держат в голове несколько конкурирующих гипотез параллельно и сходятся к диагнозу через обсуждение — а не идут по одной линии рассуждений. Разные ИИ-модели делают то же самое неосознанно: на одном и том же случае две модели дают одинаковую оценку риска менее чем в 20% случаев, а расхождение в баллах риска доходит до 26 пунктов. Раньше это считали шумом. Оказалось — это полезный сигнал: чем сильнее модели расходятся между собой на конкретном случае, тем больше в нём скрытой сложности, которую стоит разобрать отдельно, а не усреднить и забыть.

Метод в трёх шагах: (1) несколько разных LLM независимо разбирают один случай и каждая выдаёт структурированный ответ — вывод + ключевые факторы + объяснение; (2) отдельный обучаемый слой сравнивает все эти ответы и вычленяет закономерности в их разногласиях; (3) на основе этого рождается одно финальное решение, точнее любой отдельной модели — и точнее простого усреднения или голосования.


🔬

Схема метода

ШАГ 1: N разных LLM независимо анализируют один случай → 
        каждая выдаёт: {вывод} + {ключевые факторы} + {объяснение}
        (отдельные независимые запросы к разным моделям)

ШАГ 2: Обучаемый ML-слой сравнивает все ответы → 
        находит закономерность в том, ГДЕ и КАК модели расходятся
        (требует отдельного обучения — не делается в чате)

ШАГ 3: Финальное конвергентное решение, 
        учитывающее паттерн разногласий, а не просто "средний" ответ

Оригинальная система требует обучения отдельной модели на массиве данных. Но принцип шага 1–2 можно приблизительно воспроизвести вручную, заменив ML-слой на LLM, которая анализирует чужие ответы текстом.


🚀

Пример применения

Задача: Предприниматель решает, стоит ли вписываться в партнёрство с производством — сумма сделки крупная, данные неполные, риск на глаз не оценить.

Промпт (шаг 1 — задать одному и тому же запросу разным моделям, например ChatGPT, Claude, Gemini, DeepSeek):

Проанализируй ситуацию и дай структурированный ответ:

Ситуация: [описание сделки — сумма, партнёр, условия, что известно]

Ответь в формате:
1. Вердикт (входить в сделку / не входить / входить с условиями)
2. Три ключевых фактора, которые повлияли на твой вывод
3. Короткое объяснение логики

Промпт (шаг 2 — свести ответы в одном чате):

Вот 4 независимых заключения от разных ИИ по одной и той же ситуации:

[вставить все 4 ответа]

Сделай так:
1. Найди пункты, где мнения совпадают — это надёжные выводы.
2. Найди пункты максимального разногласия — что один считает решающим фактором, другие игнорируют.
3. Для каждого разногласия объясни, почему модели могли увидеть ситуацию по-разному.
4. Дай финальный вывод, который учитывает совпадения как базу, а разногласия — как зоны риска, которые нужно проверить отдельно перед решением.

Результат: модель покажет таблицу или список — что все ИИ увидели одинаково (это можно считать надёжным), и в чём мнения разошлись сильнее всего. По каждой точке разногласия — гипотезу, почему модели расходятся. В конце — финальный вывод с явным указанием, какие 1-2 момента стоит перепроверить у человека-эксперта, потому что именно там ИИ "спорят" между собой.


🧠

Почему это работает

Одна модель, спрошенная один раз, застревает на одной интерпретации ситуации — она не видит альтернативных гипотез, потому что генерирует один связный текст по одной логике. Это её слабость на неопределённых, сложных задачах.

Сильная сторона LLM — она хорошо резюмирует и сравнивает чужие тексты, находит закономерности в наборе мнений, если её явно попросить это сделать.

Метод использует эту сильную сторону: вместо того чтобы полагаться на одну модель или усреднять несколько ответов (что стирает информацию о том, ГДЕ именно есть неопределённость), он превращает разногласие в отдельный объект анализа. Точки максимального спора между моделями — это подсказка, где в задаче скрыта настоящая сложность.

Рычаги управления: - Количество моделей-мнений → 2 для быстрой проверки, 4-5 для надёжного покрытия разных углов - Структура ответа (вывод + факторы + объяснение) → можно расширить дополнительными полями под свою задачу (например, "риски", "альтернативы") - Порог значимого разногласия → попроси модель явно выделять только те пункты, где мнения различаются кардинально, а не в деталях формулировок


📋

Шаблон промпта

Вот структура для сведения нескольких независимых мнений ИИ по одной задаче.

ШАГ 1 — задай это одному и тому же запросу в разных ИИ (ChatGPT, Claude, Gemini, DeepSeek):

"Проанализируй ситуацию: {описание задачи}.
Ответь в формате:
1. Вердикт
2. Ключевые факторы (3-5 пунктов)
3. Объяснение логики"

ШАГ 2 — собери все ответы и вставь в один чат с промптом:

"Вот {количество} независимых заключений разных ИИ по одной задаче:
{вставить все ответы}

1. Найди совпадения — это надёжная база.
2. Найди пункты максимального разногласия.
3. Объясни вероятную причину каждого разногласия.
4. Дай финальный вывод, отметив зоны риска, где мнения ИИ расходятся сильнее всего."

Подставь: {описание задачи} — конкретная ситуация с деталями, {количество} — сколько ответов собрал.

🚀 Быстрый старт — вставь в чат:

Вот шаблон метода RareLens (сведение разногласий разных ИИ в одно решение). 
Адаптируй под мою задачу: [твоя задача]. 
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какие модели ты используешь и сколько мнений собрал — потому что метод работает только если есть реальное расхождение между независимыми источниками, а не одна модель, спрошенная дважды.


⚠️

Ограничения

⚠️ Нужны разные модели, не одна: метод основан на том, что разные архитектуры LLM по-разному интерпретируют одну задачу. Если спросить одну и ту же модель несколько раз — разногласия будут случайным шумом, а не сигналом.

⚠️ Точность ручной версии ниже оригинала: в исследовании разногласия анализирует отдельно обученный ML-слой на данных о 150+ тысячах случаев. Вручную в чате можно только приблизительно повторить логику через текстовый анализ — это не даст той же точности.

⚠️ Избыточно для простых задач: если вопрос однозначный, модели не разойдутся во мнениях, и весь процесс сведения ответов — трата времени.

⚠️ Требует нескольких подписок или доступов: для реального разнообразия мнений нужно спросить хотя бы 2-3 разные модели (ChatGPT + Claude + Gemini), а не только одну.


🔗

Ресурсы

RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning. Авторы — коллектив из West China Hospital (Sichuan University), CUHK-Shenzhen, Carnegie Mellon University, NTU Singapore и др. Датасет RareBench — 157 525 случаев, все 33 категории Orphanet, более 7000 редких заболеваний.


📋 Дайджест исследования

Ключевая суть

Парадокс: две разные ИИ-модели, разбирая один и тот же сложный случай, соглашаются друг с другом меньше чем в 20% случаев — разброс оценки риска доходит до 26 баллов. Метод RareLens позволяет превратить этот разброс в диагностический сигнал, а не терять его в усреднении. Фишка: искать не согласие, а точки максимального спора между моделями — именно там прячется настоящая сложность случая. Финальный ответ строится не на среднем арифметическом, а на паттерне того, где и почему модели расходятся.

Принцип работы

Работает как консилиум врачей, а не как один специалист с одной гипотезой в голове. Один запрос к одной модели — это одна линия рассуждений, без альтернатив. RareLens запускает несколько независимых мнений параллельно, потом отдельный слой сравнивает их и ищет закономерность в разногласиях. Не усреднение ответов, а разбор структуры их несовпадения — вот что даёт точность выше любой отдельной модели.

Почему работает

Одна модель, спрошенная один раз, застревает на первой правдоподобной версии — она физически не видит других гипотез, потому что генерирует один связный текст по одной логике. Зато LLM отлично умеет сравнивать чужие тексты и находить в них закономерности, если её прямо об этом попросить. Разногласие между моделями — не шум, а карта того, где в задаче спрятана неопределённость. В оригинале это проверено на 157 525 медицинских случаях: чем сильнее модели расходятся, тем выше шанс редкого и сложного диагноза.

Когда применять

Сложные неочевидные решения с высокой неопределённостью → конкретно для случаев, где данных мало, а ставка высокая: бизнес-сделки, юридические риски, стратегические развилки. Не подходит для простых однозначных вопросов — там модели просто согласятся, и весь процесс сведения ответов будет пустой тратой времени.

Мини-рецепт

1. Собери мнения: задай один и тот же вопрос 3-4 разным моделям (ChatGPT, Claude, Gemini, DeepSeek) в одинаковом структурированном формате — вывод, ключевые факторы, объяснение логики.
2. Сведи ответы: вставь все ответы в один чат, попроси найти совпадения (это надёжная база) и точки максимального разногласия.
3. Разбери споры: для каждого разногласия попроси объяснить, почему модели могли увидеть ситуацию по-разному.
4. Финализируй: получи итоговый вывод с явным списком зон риска — мест, где мнения ИИ расходятся сильнее всего, их нужно проверить у эксперта-человека.

Примеры

[ПЛОХО] : Оцени риск этой сделки — спросил одну модель один раз и взял ответ как истину, хотя ситуация неоднозначная.
[ХОРОШО] : Проанализируй сделку: [детали]. Ответь: 1) Вердикт 2) Три ключевых фактора 3) Объяснение логики — задать этот промпт в ChatGPT, Claude и Gemini, затем вторым промптом Вот 3 независимых заключения по одной ситуации: [вставить]. Найди совпадения, найди точки максимального разногласия, объясни их причину, дай финальный вывод с зонами риска свести все ответы в одно решение.
Источник: RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning
ArXiv ID: 2607.23290 | Сгенерировано: 2026-07-28 04:30

Проблемы LLM

ПроблемаСутьКак обойти
Одна модель застревает на одной версии сложной ситуацииМодель генерирует один связный текст по одной логике. Она не видит альтернативные гипотезы, даже если они реально возможны. На неопределённых задачах (данных мало, риск неочевиден) это опасно — модель уверенно выдаёт один взгляд, а не спектр вариантовСпроси несколько разных моделей (ChatGPT, Claude, Gemini, DeepSeek) один и тот же вопрос. Сравни их ответы вручную — там где они расходятся, там и скрытая сложность задачи

Методы

МетодСуть
Сведение разногласий разных моделей вместо усредненияЗадай один и тот же вопрос 2-5 разным моделям в структурированном формате: вывод + ключевые факторы + объяснение логики. Затем в отдельном чате попроси LLM сравнить все ответы: найти совпадения (надёжная база), найти точки максимального расхождения, объяснить возможную причину каждого расхождения, дать финальный вывод с указанием зон риска для проверки человеком. Работает потому что усреднение или голосование стирает информацию о том, ГДЕ именно неопределённость — а явный анализ разногласий превращает её в конкретные пункты для проверки. Работает: сложные неоднозначные решения (бизнес, юридические риски, диагностика). Не работает: простые однозначные вопросы (модели не разойдутся, анализ — трата времени), и не работает если спросить одну и ту же модель дважды (разница будет случайным шумом, а не сигналом)
📖 Простыми словами

RareLens: Towards End-to-End Rare Disease Care via Aligning DivergentLargeLanguageModelReasoning

arXiv: 2607.23290

Когда речь заходит о редких болезнях или сверхсложных бизнес-сделках, обычный AI начинает безбожно тупить, потому что данных мало, а цена ошибки — космос. Фундаментальная проблема в том, что любая LLM — это заложник своей единственной логической цепочки: если она в начале свернула не туда, то до конца будет уверенно обосновывать бред. Система RareLens меняет саму механику принятия решений: вместо того чтобы верить одной «умной» модели, она заставляет целую толпу разных нейронок спорить друг с другом, а потом анализирует не их согласие, а именно точки конфликта.

Это как если бы ты пришел к консилиуму врачей, где каждый — узкий специалист со своими закидонами. Вместо того чтобы просто проголосовать большинством, ты нанимаешь отдельного супер-эксперта, который не слушает диагнозы, а внимательно следит, из-за каких именно симптомов врачи начали орать друг на друга. Истина зарыта там, где мнения расходятся, потому что именно в этих зонах скрыта самая важная и неочевидная информация, которую одна модель просто проскочила бы на автопилоте.

Внутри это работает через выравнивание расходящихся рассуждений: система берет сырые ответы от пачки моделей (например, GPT-4, Claude и Llama), прогоняет их через специальный обучаемый слой и ищет когнитивный диссонанс. Если одна модель говорит «это редкий синдром», а вторая — «это обычное отравление», RareLens не усредняет их до «чего-то среднего», а заставляет систему перепроверить конкретные факты, вызвавшие спор. В итоге получается финальный вердикт, который точнее любого одиночного предсказания, потому что он прошел через фильтр жесткой критики.

Хотя метод обкатывали на медицине, принцип универсален для любой ситуации с высокой неопределенностью. Это идеально ложится на венчурные инвестиции, юридические споры или запуск инновационных продуктов, где данных кот наплакал, а риск полного провала маячит на горизонте. Везде, где нужно оценить «черного лебедя», стандартное SEO-мышление или простые промпты пасуют, а работа с полярными мнениями дает тот самый объемный взгляд на проблему.

Короче: завязывай полагаться на один «самый мощный» чат-бот в критических задачах — он обязательно что-нибудь галлюцинирует. Будущее за системами вроде RareLens, которые превращают хаос и споры нейронок в структурированное решение. Нужно не гасить конфликты в выводах моделей, а выжимать из них максимум пользы, ведь именно в разногласиях прячется реальная экспертиза. Кто научится стравливать модели и синтезировать результат, тот перестанет играть в угадайку с AI-галлюцинациями.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с