3,583 papers
arXiv:2608.20220 75 20 авг. 2026 г. FREE

InsufficiencyBench: LLM выдумывает недостающие факты вместо того, чтобы спросить

КЛЮЧЕВАЯ СУТЬ
Обнаружено: LLM не переспрашивает недостающие детали вопроса — она молча подставляет свою версию фактов и отвечает уверенно, но про придуманную ситуацию, не про вашу. InsufficiencyBench позволяет проверить, какие критические факты модель домысливает, прежде чем дать юридический совет. Метод делит пропуски на три типа: switch меняет закон целиком, gating — порог применимости, fatal prerequisite блокирует весь разбор. По этой сетке даже лучшая модель теряет почти треть критических фактов.
Адаптировать под запрос

TL;DR

Когда вы задаёте юридический вопрос без ключевых деталей — например, не указав штат или статус человека — модель не переспрашивает, а молча подставляет свою версию фактов и отвечает уверенно. Причём отвечает "правильно" для придуманной ситуации, а не для вашей настоящей.

Исследователи спросили модели: "Может ли работодатель заставить меня подписать NDA о неконкуренции?" — без указания штата. Модель отвечает так, будто вопрос был полный, хотя в Калифорнии такое соглашение недействительно по закону, а в Техасе — законно с оговорками. Модель либо тихо выбирает какой-то один вариант "по умолчанию" (обычно федеральное право), либо — реже — начинает переспрашивать вообще всё подряд, не разбирая, что важно, а что нет.

Метод исследования — не техника, а диагноз: авторы построили таксономию из 8 категорий информации, отсутствие которой критично (юрисдикция, статус сторон, сроки, процедурный статус и т.д.), и 3 типов провала — когда пропущенный факт (1) меняет какой закон применяется, (2) определяет, применяется ли закон вообще, или (3) блокирует весь дальнейший анализ. Даже лучшая модель в тестах пропускает почти треть таких критических фактов.

📌

Схема провала (как ломается ответ)

ШАГ 1 (в вопросе пользователя): Не указан ключевой факт
ШАГ 2 (в голове модели, невидимо): Молча подставляется "типичный" вариант
ШАГ 3 (в ответе): Уверенный, гладкий ответ — но для придуманной ситуации, не для вашей

Три типа фактов, которые чаще всего пропускают:

Тип Что делает отсутствие факта Пример
Switch (переключатель) Меняет, какое правило вообще применяется штат/юрисдикция
Gating (пропускной порог) Решает, применяется правило или нет размер компании, статус истца
Fatal prerequisite (блокирующее условие) Обесценивает весь дальнейший разбор не выполнено обязательное условие договора

🚀

Пример применения

Задача: Предприниматель спрашивает ChatGPT: "Могу ли я уволить сотрудника без выплаты компенсации, если он не прошёл испытательный срок?" — не уточнив, оформлен человек по трудовому договору, по ГПХ или как самозанятый, в каком регионе, и сколько длился испытательный срок.

Промпт:

Ты — консультант по трудовому праву. Прежде чем отвечать на вопрос, 
проверь его на полноту.

Спроси себя:
1. Есть ли факт, от которого зависит, КАКОЕ правило применяется 
   (если он изменится — весь ответ станет другим)?
2. Есть ли пороговое условие, которое решает, применяется ли правило 
   вообще (статус, размер компании, срок)?
3. Есть ли обязательное условие, без которого дальше анализировать 
   бессмысленно?

Если хотя бы один такой факт не указан в вопросе — не давай финальный 
ответ. Вместо этого:
— перечисли, каких фактов не хватает
— объясни коротко, почему каждый из них меняет ответ
— либо дай ответ отдельно для каждого реалистичного варианта 
  ("если у вас трудовой договор — то так; если ГПХ — то иначе")

Вопрос: {вопрос}

Результат: Вместо одного гладкого ответа модель выдаст список: "не указан статус оформления (трудовой/ГПХ/самозанятость) — это меняет весь ответ, потому что...", "не указан регион", "не указана длительность испытательного срока — по ТК РФ максимум 3 месяца". Дальше — либо уточняющие вопросы, либо разбор по веткам "если так, то...".


🧠

Почему это работает

LLM обучена быть полезной — а полезность после обучения на человеческой обратной связи почти всегда измеряется тем, дала ли модель ответ, а не тем, задала ли она правильный вопрос в ответ. Молчаливое "додумывание" фактов выглядит как уверенность и вознаграждается чаще, чем честное "мне не хватает данных".

При этом модель прекрасно умеет классифицировать — если явно попросить разложить вопрос по категориям (какой факт меняет правило, какой — порог, какой — блокирующее условие), она способна это сделать. Проблема не в неспособности, а в том, что без специальной команды она об этом даже не задумывается — задача "проверить полноту вопроса" просто не всплывает как шаг перед ответом.

Инструкция из примера выше принудительно вставляет этот шаг: она заставляет модель сначала искать пробелы по трём типам, и только потом — отвечать.

Рычаги управления: - Замени 3 типа провала (switch/gating/fatal prerequisite) на свои категории под другую область — принцип "что меняет ответ / что решает применимость / что блокирует всё" универсален не только для юриспруденции, подходит и для налоговых, медицинских, HR-вопросов. - Убери требование "не давай финальный ответ" → получишь просто список предупреждений внутри обычного ответа, без остановки. - Добавь "отвечай по каждой ветке отдельно" → вместо уточняющих вопросов получишь веер сценариев ("если так — то так, если иначе — то иначе").


📋

Шаблон промпта

Ты — консультант по {область}. Прежде чем отвечать, проверь вопрос 
на полноту.

Проверь три типа пробелов:
1. SWITCH — факт, который меняет, КАКОЕ правило/норма применяется целиком
2. GATING — факт-порог, который решает, применяется ли правило вообще 
   (статус, срок, масштаб)
3. FATAL PREREQUISITE — обязательное условие, без которого дальше 
   анализировать бессмысленно

Если хотя бы один такой факт не указан:
— не давай окончательный вывод
— перечисли, чего не хватает, и объясни коротко, почему это критично
— предложи ответ по веткам для реалистичных вариантов, либо задай 
  уточняющие вопросы

Вопрос: {вопрос_пользователя}

🚀 Быстрый старт — вставь в чат:

Вот шаблон проверки полноты вопроса перед ответом. Адаптируй под мою 
задачу: {твоя задача}. Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, в какой области ты работаешь и какие факты в твоей теме обычно "переключают", "пропускают" или "блокируют" ответ — потому что без этого нельзя настроить проверку под конкретную задачу.


⚠️

Ограничения

⚠️ Это диагноз, не проверенное лекарство: авторы тестировали модели с нейтральным системным промптом ("Ты юридический ассистент, ответь на вопрос") — инструкцию по проверке полноты, приведённую выше, они сами не проверяли. Она логична, но не факт, что полностью решает проблему.

⚠️ Модели переусердствуют или недоусердствуют: даже когда модель начинает уточнять, она либо переспрашивает вообще всё подряд без разбора важности, либо продолжает угадывать факты в части случаев. Идеального баланса не показала ни одна модель.

⚠️ Проверено на юридических вопросах США: перенос на другие области (медицина, финансы) логичен по смыслу, но не проверен в этом исследовании напрямую.


🔍

Как исследовали

Два практикующих юриста с суммарным опытом 20+ лет составили 58 полных юридических вопросов по 6 областям права и 24 штатам США, размечая в каждом предложении, какой факт критичен для ответа. Из каждого полного вопроса сделали "урезанные" версии — убрали одно-два предложения с критичными фактами, получив 144 варианта с заведомо известным "что пропало".

Дальше 10 топовых моделей (GPT, Claude, Gemini, Qwen, Mistral, DeepSeek, Kimi) отвечали на урезанные вопросы, а отдельная модель-judge проверяла: заметила ли модель пропуск, назвала ли, чего не хватает, и не сделала ли вывод, зависящий от невысказанного предположения. Для надёжности судейство перепроверили ещё двумя разными judge-моделями — выводы не изменились.

Самое любопытное: даже лучшая модель пропустила треть критичных фактов, а декомпозиция показала, что модели редко переспрашивают вообще (в среднем спрашивают не всегда), но когда переспрашивают — попадают в цель заметно точнее. Это значит, проблема не в неспособности разбираться в фактах, а в том, что модель просто не включает "режим проверки" по умолчанию — ровно то, что чинит явная инструкция.


💡

Адаптации и экстраполяции

🔧 Техника: перенос принципа с "ответа модели" на "формулировку своего вопроса"

Таксономию из статьи можно использовать не только чтобы заставить модель переспрашивать, но и чтобы самому формулировать вопросы полнее. Перед тем как спросить ChatGPT о юридическом, налоговом или HR-вопросе, пройдись по чек-листу: указал ли я регион (switch), указал ли пороговые условия — статус, масштаб, срок (gating), указал ли обязательные предварительные условия (fatal prerequisite)? Это снижает риск получить красивый, но нерелевантный ответ — без необходимости менять промпт модели вообще.


📋 Дайджест исследования

Ключевая суть

Обнаружено: LLM не переспрашивает недостающие детали вопроса — она молча подставляет свою версию фактов и отвечает уверенно, но про придуманную ситуацию, не про вашу. InsufficiencyBench позволяет проверить, какие критические факты модель домысливает, прежде чем дать юридический совет. Метод делит пропуски на три типа: switch меняет закон целиком, gating — порог применимости, fatal prerequisite блокирует весь разбор. По этой сетке даже лучшая модель теряет почти треть критических фактов.

Принцип работы

Провал идёт по три шага: пользователь не называет ключевой факт → модель невидимо подставляет «типичный» вариант → выдаёт гладкий уверенный ответ для чужой ситуации. Это молчаливое додумывание — модель не признаётся, что гадает. Она не спрашивает — она угадывает и делает вид, что вопрос был полным. Как студент, который не знает ответа, но с уверенным видом придумывает похожий на правду.

Почему работает

Модель обучена быть полезной. После обучения на человеческой обратной связи (RLHF) полезность почти всегда значит «дал ответ», а не «задал правильный вопрос». Уточнение выглядит как слабость, а домысливание — как компетентность, поэтому его выбирают чаще. При этом модель прекрасно умеет разложить вопрос по трём типам провала, если её прямо попросить — проблема не в неспособности, а в том, что шаг проверки полноты никогда не всплывает сам.

Когда применять

Юридические консультации через LLM → конкретно для вопросов без явного штата, статуса сторон или сроков, особенно когда есть жёсткие пороги (размер компании, тип договора, дедлайны). Не подходит как замена реальному юристу в делах с высокой ценой ошибки — метод только находит пробелы, а не проверяет правильность самого юридического анализа.

Мини-рецепт

1. Задай роль и включи проверку: «Ты консультант по [область], сначала проверь вопрос на три типа пробелов, потом отвечай».
2. Опиши свои три триггера: что меняет правило целиком (switch), что решает, применяется ли оно вообще (gating), что блокирует весь разбор (fatal prerequisite).
3. Запрети скользить в ответ без уточнения: если пробел найден — либо список уточняющих вопросов, либо разбор по веткам «если так — то так, если иначе — то иначе».
4. Проверь на живом примере: специально не укажи штат или статус в вопросе и посмотри — модель ловит пробел или тихо угадывает.

Примеры

[ПЛОХО] : Могу ли я не платить компенсацию при увольнении сотрудника на испытательном сроке?
[ХОРОШО] : Ты — консультант по трудовому праву. Перед ответом проверь: не указан статус оформления (трудовой договор/ГПХ/самозанятость), регион и длительность испытательного срока — каждый из этих фактов меняет ответ. Если хотя бы один пробел есть — не давай финальный вывод, перечисли чего не хватает и разбери вопрос по веткам «если так — то так».
Источник: InsufficiencyBench: Evaluating LLM legal advice on underspecified user queries
ArXiv ID: 2608.20220 | Сгенерировано: 2026-08-21 05:24

Проблемы LLM

ПроблемаСутьКак обойти
Модель молча выдумывает недостающие факты вместо того чтобы спроситьЗадаёшь вопрос без ключевой детали (регион, статус, срок). Модель не переспрашивает. Тихо подставляет "типичный" вариант и отвечает уверенно. Ответ правильный — но для придуманной ситуации, не для твоей. Работает для любых вопросов где ответ зависит от контекста: юридических, медицинских, HR, финансовыхЯвно попроси модель сначала проверить вопрос на три типа пробелов: что меняет правило целиком, что определяет применимость правила, что блокирует весь анализ. Если такой факт не указан — запрети финальный ответ до уточнения

Методы

МетодСуть
Проверка полноты вопроса по трём типам пробеловПеред ответом попроси модель классифицировать недостающие факты: switch — меняет какое правило применяется целиком; gating — порог, решает применяется ли правило вообще (статус, размер, срок); fatal prerequisite — обязательное условие без которого весь разбор бессмысленен. Если такой факт не указан — не давать финальный вывод, а перечислить пробелы или ответить по веткам ("если так — то так"). Почему работает: модель умеет классифицировать факты по важности, но без прямой команды не думает об этом перед ответом. Когда да: вопросы где ответ зависит от контекста, нужна точность. Когда нет: простые вопросы без контекстной зависимости — усложнит без пользы
📖 Простыми словами

InsufficiencyBench: EvaluatingLLMlegal advice on underspecified user queries

arXiv: 2608.20220

Языковые модели патологически боятся показаться бесполезными. Когда ты задаёшь сложный юридический вопрос без критических деталей, сетка не переспрашивает, а молча додумывает контекст за тебя. Виноват механизм RLHF — человеческая обратная связь приучила модель генерировать готовый текст любой ценой, ведь за честное встречное уточнение оценщики часто снижали балл.

Это как прийти к врачу с фразой "доктор, у меня болит", а он, не выясняя симптомов, сразу выписывает рецепт. Формально схема лечения составлена грамотно и авторитетно, но лечит он не твою реальную язву, а свою фантазию о твоей простуде. В юриспруденции такой подход — это гарантированный провал в суде.

Бенчмарк InsufficiencyBench вскрыл эту уязвимость: на недоопределённых запросах модель выбирает случайный базовый сценарий и шпарит строго по нему. Спросишь про увольнение на испытательном сроке — нейросеть молча решит, что у тебя типовой трудовой договор, проигнорирует варианты с ГПХ или самозанятыми и выдаст ложно-идеальную инструкцию, которая неприменима к твоему случаю.

Тестировали на юридических кейсах, но грабли одни и те же везде. Налоги, медицина, архитектура софта или финансы — любая сфера с кучей нюансов страдает от синдрома слепой уверенности. AI-ассистент почти всегда предпочтёт уверенно выдать ответ на основе скрытых допущений, чем сказать простое: "мне не хватает вводных".

Мораль простая: никогда не строй решения на первом ответе модели. Либо сразу скармливай в промпт абсолютно все факты и контекст, либо прямо заставляй систему: "не отвечай сразу, задай мне 5 уточняющих вопросов". Иначе ты получишь идеальный совет для вымышленного мира, расплачиваться за который придётся реальными деньгами.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с