Модель, которую попросили "задавать один вопрос за раз", в каждом третьем случае всё равно упаковывала два-три вопроса в одну реплику. А глубокие уточняющие вопросы ("расскажи подробнее", "приведи пример") встречались лишь в 5% всех реплик — бот в основном просто поддакивал ("отличный пример!", "понимаю"), а не копал вглубь.
Причина проста: LLM в реальном голосовом диалоге плохо держит в голове разовую инструкцию, если она не подкреплена структурой. Инструкция "один вопрос за раз" — это как сказать человеку "не забудь" и надеяться, что он не забудет. Модель забывает в 28.7% случаев, а собеседники в ответ отвечают только на первую часть вопроса — вторая часть просто теряется, и вы получаете дырявые данные без единого сбоя системы.
Исследование не предлагает готовую технику, но даёт три конкретных рычага для промпта AI-интервьюера: явно требовать углубляющие вопросы вместо одобрений, структурно принуждать к одному вопросу через формат вывода, и заставлять модель перефразировать конкретные детали ответа собеседника (а не генерик-фразы типа "интересно"), потому что именно это участники читали как "меня слушают".
Схема метода (реконструкция из находок — как исправить промпт AI-интервьюера)
ПРОБЛЕМА 1: Инструкция "один вопрос" не соблюдается → нужна структура вывода, не просто просьба
ПРОБЛЕМА 2: Мало deepening-вопросов → нужна явная квота на углубление
ПРОБЛЕМА 3: Generic-подтверждения не считаются "слушанием" → нужен content-grounded парафраз
Пример применения
Задача: Вы основатель сервиса доставки еды и хотите собрать глубокий фидбэк от 20 клиентов через голосового AI-интервьюера, а не тратить своё время на звонки.
Промпт (системная инструкция для бота-интервьюера):
Ты — интервьюер, который собирает обратную связь о сервисе доставки еды.
ПРАВИЛО ФОРМАТА: задавай ТОЛЬКО ОДИН вопрос за реплику.
Перед отправкой реплики проверь: если в тексте есть знак "?" больше одного раза —
удали все вопросы кроме первого и сохрани остальные для следующих ходов.
ПРАВИЛО УГЛУБЛЕНИЯ: после каждого второго ответа собеседника задавай не новый вопрос
из плана, а уточняющий: попроси конкретный пример, деталь или случай из практики.
Не переходи к следующей теме, пока не получишь хотя бы один конкретный пример.
ПРАВИЛО ПОДТВЕРЖДЕНИЯ: когда реагируешь на ответ собеседника, не пиши общие фразы
типа "понятно" или "интересно". Вместо этого перефразируй конкретную деталь,
которую он сказал, своими словами — покажи, что ты услышал именно ЕГО ответ.
Тема интервью: {тема}. План вопросов: {план}.
Результат: Бот будет реже дробить вопросы, чаще просить конкретику вместо перехода к следующему пункту плана, и его подтверждения будут звучать как "вы сказали, что курьер опоздал на 40 минут — а как часто это происходит?" вместо "спасибо, интересно". Данные получатся более полными и с меньшим числом потерянных ответов.
Почему это работает
Модель хорошо выполняет разовые чёткие инструкции про формат вывода ("не больше одного вопроса на строку"), но плохо удерживает мягкие поведенческие установки ("веди себя так на протяжении всего диалога") — особенно в реальном времени, когда контекст растёт и внимание модели распределяется между поддержанием разговора, следованием плану и генерацией живого ответа.
Слабость LLM здесь — она склонна к "безопасному" поведению: подтверждать и двигаться дальше по плану, а не рисковать и копать глубже, потому что углубляющий вопрос требует интерпретации ответа собеседника, а это менее предсказуемо, чем просто перейти к следующему пункту.
Метод обхода — не полагаться на одну инструкцию, а закладывать проверку в сам процесс: явно требовать самопроверку перед отправкой, вводить квоту на углубляющие вопросы (например, "минимум один уточняющий вопрос на каждые два по плану"), и требовать конкретики в подтверждениях, а не общих фраз.
Рычаги управления: - Квота на deepening-вопросы (например "каждый 2-й ход") → увеличь для сложных тем, где нужна глубина - Требование самопроверки на количество вопросов → критично для длинных автоматических диалогов - Требование content-grounded парафраза → усиливает ощущение "меня слушают" у собеседника - Прозрачность о том, зачем используется AI → снижает недоверие, если ставки высокие (наём, оценка)
Шаблон промпта
Ты — {роль} собеседник, который проводит структурированное интервью на тему {тема}.
ФОРМАТ ОТВЕТА:
- В каждой реплике — не больше ОДНОГО вопроса.
- Перед отправкой проверь текст: если есть больше одного вопросительного знака —
оставь только первый вопрос, остальное отложи на следующие ходы.
ГЛУБИНА:
- После каждого ответа собеседника оцени: это конкретный пример/деталь или общее утверждение?
- Если общее утверждение — не переходи к следующему пункту плана, а попроси
конкретный пример, случай или цифру.
- Переходи к следующему пункту плана только после того, как получил конкретику.
ПОДТВЕРЖДЕНИЕ:
- Никогда не используй общие фразы типа "понятно", "интересно", "хорошо".
- Вместо этого — перефразируй конкретную деталь из ответа собеседника своими словами.
План интервью: {план_вопросов}
🚀 Быстрый старт — вставь в чат:
Вот шаблон промпта для AI-интервьюера, который избегает типичных ошибок
(множественные вопросы в одной реплике, поверхностные подтверждения без углубления).
Адаптируй под мою задачу: {твоя задача — например, сбор фидбэка от клиентов,
кастдев, опрос сотрудников}. Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит про тему интервью, план вопросов и роль бота — потому что без этого шаблон нельзя привязать к конкретной задаче. Структуру самопроверки и правило про парафраз она сохранит из шаблона.
Ограничения
⚠️ Специфика голосового реального времени: находки получены на голосовом боте с задержками и перебиваниями (barge-in). В текстовом чате часть проблем (латентность, обрыв реплики) не проявится, но проблема "множественных вопросов в реплике" и "мало углубляющих вопросов" — общая слабость LLM в диалоге, не только голосового.
⚠️ Одна версия модели: все цифры получены на одной конкретной модели (gpt-4o-realtime-preview). Другая модель может вести себя иначе — это снимок, не универсальный закон.
⚠️ Маленькая выборка: 15 участников — этого достаточно, чтобы показать, что проблемы существуют и повторяются, но недостаточно, чтобы утверждать, что это исчерпывающий список сбоев.
⚠️ Доверие зависит не от диалога, а от ставок: если для собеседника решение AI-интервьюера значит что-то важное (наём, оценка), никакая техника промптинга не заменит прозрачного объяснения, зачем используется AI — это социальная, не языковая проблема.
Как исследовали
Исследователи собрали голосового AI-интервьюера (обёртку над realtime API OpenAI) с научно составленным планом вопросов и дали ему провести интервью с 15 участниками об их опыте использования AI-инструментов. После интервью с ботом человек-исследователь проводил рефлексивную беседу — расспрашивал, что участник почувствовал, где было неловко, доверяет ли он такому формату.
Дальше два исследователя вручную размечали каждую из 428 реплик бота по семи категориям (открытый вопрос, подтверждение, углубляющий вопрос, множественный вопрос и так далее) и сверяли разметку между собой, обсуждая разногласия, а не считая формальный коэффициент согласия.
Любопытная деталь: длина ответов участников почти не менялась между интервью с ботом и беседой с человеком (18.4 против 18.6 слов) — это исключает простое объяснение "люди просто меньше говорили роботу". Проблема была не в объёме речи, а в том, что бот не выуживал глубину даже когда получал материал для этого. Именно это и натолкнуло авторов на вывод: слабость не в участниках, а в поведении бота — он подтверждал, но не копал.
