TL;DR
Когда вы задаёте юридический вопрос без ключевых деталей — например, не указав штат или статус человека — модель не переспрашивает, а молча подставляет свою версию фактов и отвечает уверенно. Причём отвечает "правильно" для придуманной ситуации, а не для вашей настоящей.
Исследователи спросили модели: "Может ли работодатель заставить меня подписать NDA о неконкуренции?" — без указания штата. Модель отвечает так, будто вопрос был полный, хотя в Калифорнии такое соглашение недействительно по закону, а в Техасе — законно с оговорками. Модель либо тихо выбирает какой-то один вариант "по умолчанию" (обычно федеральное право), либо — реже — начинает переспрашивать вообще всё подряд, не разбирая, что важно, а что нет.
Метод исследования — не техника, а диагноз: авторы построили таксономию из 8 категорий информации, отсутствие которой критично (юрисдикция, статус сторон, сроки, процедурный статус и т.д.), и 3 типов провала — когда пропущенный факт (1) меняет какой закон применяется, (2) определяет, применяется ли закон вообще, или (3) блокирует весь дальнейший анализ. Даже лучшая модель в тестах пропускает почти треть таких критических фактов.
Схема провала (как ломается ответ)
ШАГ 1 (в вопросе пользователя): Не указан ключевой факт
ШАГ 2 (в голове модели, невидимо): Молча подставляется "типичный" вариант
ШАГ 3 (в ответе): Уверенный, гладкий ответ — но для придуманной ситуации, не для вашей
Три типа фактов, которые чаще всего пропускают:
| Тип | Что делает отсутствие факта | Пример |
|---|---|---|
| Switch (переключатель) | Меняет, какое правило вообще применяется | штат/юрисдикция |
| Gating (пропускной порог) | Решает, применяется правило или нет | размер компании, статус истца |
| Fatal prerequisite (блокирующее условие) | Обесценивает весь дальнейший разбор | не выполнено обязательное условие договора |
Пример применения
Задача: Предприниматель спрашивает ChatGPT: "Могу ли я уволить сотрудника без выплаты компенсации, если он не прошёл испытательный срок?" — не уточнив, оформлен человек по трудовому договору, по ГПХ или как самозанятый, в каком регионе, и сколько длился испытательный срок.
Промпт:
Ты — консультант по трудовому праву. Прежде чем отвечать на вопрос,
проверь его на полноту.
Спроси себя:
1. Есть ли факт, от которого зависит, КАКОЕ правило применяется
(если он изменится — весь ответ станет другим)?
2. Есть ли пороговое условие, которое решает, применяется ли правило
вообще (статус, размер компании, срок)?
3. Есть ли обязательное условие, без которого дальше анализировать
бессмысленно?
Если хотя бы один такой факт не указан в вопросе — не давай финальный
ответ. Вместо этого:
— перечисли, каких фактов не хватает
— объясни коротко, почему каждый из них меняет ответ
— либо дай ответ отдельно для каждого реалистичного варианта
("если у вас трудовой договор — то так; если ГПХ — то иначе")
Вопрос: {вопрос}
Результат: Вместо одного гладкого ответа модель выдаст список: "не указан статус оформления (трудовой/ГПХ/самозанятость) — это меняет весь ответ, потому что...", "не указан регион", "не указана длительность испытательного срока — по ТК РФ максимум 3 месяца". Дальше — либо уточняющие вопросы, либо разбор по веткам "если так, то...".
Почему это работает
LLM обучена быть полезной — а полезность после обучения на человеческой обратной связи почти всегда измеряется тем, дала ли модель ответ, а не тем, задала ли она правильный вопрос в ответ. Молчаливое "додумывание" фактов выглядит как уверенность и вознаграждается чаще, чем честное "мне не хватает данных".
При этом модель прекрасно умеет классифицировать — если явно попросить разложить вопрос по категориям (какой факт меняет правило, какой — порог, какой — блокирующее условие), она способна это сделать. Проблема не в неспособности, а в том, что без специальной команды она об этом даже не задумывается — задача "проверить полноту вопроса" просто не всплывает как шаг перед ответом.
Инструкция из примера выше принудительно вставляет этот шаг: она заставляет модель сначала искать пробелы по трём типам, и только потом — отвечать.
Рычаги управления: - Замени 3 типа провала (switch/gating/fatal prerequisite) на свои категории под другую область — принцип "что меняет ответ / что решает применимость / что блокирует всё" универсален не только для юриспруденции, подходит и для налоговых, медицинских, HR-вопросов. - Убери требование "не давай финальный ответ" → получишь просто список предупреждений внутри обычного ответа, без остановки. - Добавь "отвечай по каждой ветке отдельно" → вместо уточняющих вопросов получишь веер сценариев ("если так — то так, если иначе — то иначе").
Шаблон промпта
Ты — консультант по {область}. Прежде чем отвечать, проверь вопрос
на полноту.
Проверь три типа пробелов:
1. SWITCH — факт, который меняет, КАКОЕ правило/норма применяется целиком
2. GATING — факт-порог, который решает, применяется ли правило вообще
(статус, срок, масштаб)
3. FATAL PREREQUISITE — обязательное условие, без которого дальше
анализировать бессмысленно
Если хотя бы один такой факт не указан:
— не давай окончательный вывод
— перечисли, чего не хватает, и объясни коротко, почему это критично
— предложи ответ по веткам для реалистичных вариантов, либо задай
уточняющие вопросы
Вопрос: {вопрос_пользователя}
🚀 Быстрый старт — вставь в чат:
Вот шаблон проверки полноты вопроса перед ответом. Адаптируй под мою
задачу: {твоя задача}. Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, в какой области ты работаешь и какие факты в твоей теме обычно "переключают", "пропускают" или "блокируют" ответ — потому что без этого нельзя настроить проверку под конкретную задачу.
Ограничения
⚠️ Это диагноз, не проверенное лекарство: авторы тестировали модели с нейтральным системным промптом ("Ты юридический ассистент, ответь на вопрос") — инструкцию по проверке полноты, приведённую выше, они сами не проверяли. Она логична, но не факт, что полностью решает проблему.
⚠️ Модели переусердствуют или недоусердствуют: даже когда модель начинает уточнять, она либо переспрашивает вообще всё подряд без разбора важности, либо продолжает угадывать факты в части случаев. Идеального баланса не показала ни одна модель.
⚠️ Проверено на юридических вопросах США: перенос на другие области (медицина, финансы) логичен по смыслу, но не проверен в этом исследовании напрямую.
Как исследовали
Два практикующих юриста с суммарным опытом 20+ лет составили 58 полных юридических вопросов по 6 областям права и 24 штатам США, размечая в каждом предложении, какой факт критичен для ответа. Из каждого полного вопроса сделали "урезанные" версии — убрали одно-два предложения с критичными фактами, получив 144 варианта с заведомо известным "что пропало".
Дальше 10 топовых моделей (GPT, Claude, Gemini, Qwen, Mistral, DeepSeek, Kimi) отвечали на урезанные вопросы, а отдельная модель-judge проверяла: заметила ли модель пропуск, назвала ли, чего не хватает, и не сделала ли вывод, зависящий от невысказанного предположения. Для надёжности судейство перепроверили ещё двумя разными judge-моделями — выводы не изменились.
Самое любопытное: даже лучшая модель пропустила треть критичных фактов, а декомпозиция показала, что модели редко переспрашивают вообще (в среднем спрашивают не всегда), но когда переспрашивают — попадают в цель заметно точнее. Это значит, проблема не в неспособности разбираться в фактах, а в том, что модель просто не включает "режим проверки" по умолчанию — ровно то, что чинит явная инструкция.
Адаптации и экстраполяции
🔧 Техника: перенос принципа с "ответа модели" на "формулировку своего вопроса"
Таксономию из статьи можно использовать не только чтобы заставить модель переспрашивать, но и чтобы самому формулировать вопросы полнее. Перед тем как спросить ChatGPT о юридическом, налоговом или HR-вопросе, пройдись по чек-листу: указал ли я регион (switch), указал ли пороговые условия — статус, масштаб, срок (gating), указал ли обязательные предварительные условия (fatal prerequisite)? Это снижает риск получить красивый, но нерелевантный ответ — без необходимости менять промпт модели вообще.
