3,583 papers
arXiv:2608.10412 74 11 авг. 2026 г. FREE

AI-интервьюер по умолчанию много кивает и мало копает: что не так с ботами-опросниками

КЛЮЧЕВАЯ СУТЬ
Модель, которую попросили "задавать один вопрос за раз", в каждом третьем случае всё равно упаковывала два-три вопроса в одну реплику. А глубокие уточняющие вопросы ("расскажи подробнее", "приведи пример") встречались лишь в 5% всех реплик — бот в основном просто поддакивал ("отличный пример!", "понимаю"), а не копал вглубь.
Адаптировать под запрос

Модель, которую попросили "задавать один вопрос за раз", в каждом третьем случае всё равно упаковывала два-три вопроса в одну реплику. А глубокие уточняющие вопросы ("расскажи подробнее", "приведи пример") встречались лишь в 5% всех реплик — бот в основном просто поддакивал ("отличный пример!", "понимаю"), а не копал вглубь.

Причина проста: LLM в реальном голосовом диалоге плохо держит в голове разовую инструкцию, если она не подкреплена структурой. Инструкция "один вопрос за раз" — это как сказать человеку "не забудь" и надеяться, что он не забудет. Модель забывает в 28.7% случаев, а собеседники в ответ отвечают только на первую часть вопроса — вторая часть просто теряется, и вы получаете дырявые данные без единого сбоя системы.

Исследование не предлагает готовую технику, но даёт три конкретных рычага для промпта AI-интервьюера: явно требовать углубляющие вопросы вместо одобрений, структурно принуждать к одному вопросу через формат вывода, и заставлять модель перефразировать конкретные детали ответа собеседника (а не генерик-фразы типа "интересно"), потому что именно это участники читали как "меня слушают".

🔬

Схема метода (реконструкция из находок — как исправить промпт AI-интервьюера)

ПРОБЛЕМА 1: Инструкция "один вопрос" не соблюдается → нужна структура вывода, не просто просьба
ПРОБЛЕМА 2: Мало deepening-вопросов → нужна явная квота на углубление
ПРОБЛЕМА 3: Generic-подтверждения не считаются "слушанием" → нужен content-grounded парафраз

🚀

Пример применения

Задача: Вы основатель сервиса доставки еды и хотите собрать глубокий фидбэк от 20 клиентов через голосового AI-интервьюера, а не тратить своё время на звонки.

Промпт (системная инструкция для бота-интервьюера):

Ты — интервьюер, который собирает обратную связь о сервисе доставки еды.

ПРАВИЛО ФОРМАТА: задавай ТОЛЬКО ОДИН вопрос за реплику.
Перед отправкой реплики проверь: если в тексте есть знак "?" больше одного раза — 
удали все вопросы кроме первого и сохрани остальные для следующих ходов.

ПРАВИЛО УГЛУБЛЕНИЯ: после каждого второго ответа собеседника задавай не новый вопрос 
из плана, а уточняющий: попроси конкретный пример, деталь или случай из практики. 
Не переходи к следующей теме, пока не получишь хотя бы один конкретный пример.

ПРАВИЛО ПОДТВЕРЖДЕНИЯ: когда реагируешь на ответ собеседника, не пиши общие фразы 
типа "понятно" или "интересно". Вместо этого перефразируй конкретную деталь, 
которую он сказал, своими словами — покажи, что ты услышал именно ЕГО ответ.

Тема интервью: {тема}. План вопросов: {план}.

Результат: Бот будет реже дробить вопросы, чаще просить конкретику вместо перехода к следующему пункту плана, и его подтверждения будут звучать как "вы сказали, что курьер опоздал на 40 минут — а как часто это происходит?" вместо "спасибо, интересно". Данные получатся более полными и с меньшим числом потерянных ответов.


🧠

Почему это работает

Модель хорошо выполняет разовые чёткие инструкции про формат вывода ("не больше одного вопроса на строку"), но плохо удерживает мягкие поведенческие установки ("веди себя так на протяжении всего диалога") — особенно в реальном времени, когда контекст растёт и внимание модели распределяется между поддержанием разговора, следованием плану и генерацией живого ответа.

Слабость LLM здесь — она склонна к "безопасному" поведению: подтверждать и двигаться дальше по плану, а не рисковать и копать глубже, потому что углубляющий вопрос требует интерпретации ответа собеседника, а это менее предсказуемо, чем просто перейти к следующему пункту.

Метод обхода — не полагаться на одну инструкцию, а закладывать проверку в сам процесс: явно требовать самопроверку перед отправкой, вводить квоту на углубляющие вопросы (например, "минимум один уточняющий вопрос на каждые два по плану"), и требовать конкретики в подтверждениях, а не общих фраз.

Рычаги управления: - Квота на deepening-вопросы (например "каждый 2-й ход") → увеличь для сложных тем, где нужна глубина - Требование самопроверки на количество вопросов → критично для длинных автоматических диалогов - Требование content-grounded парафраза → усиливает ощущение "меня слушают" у собеседника - Прозрачность о том, зачем используется AI → снижает недоверие, если ставки высокие (наём, оценка)


📋

Шаблон промпта

Ты — {роль} собеседник, который проводит структурированное интервью на тему {тема}.

ФОРМАТ ОТВЕТА: 
- В каждой реплике — не больше ОДНОГО вопроса.
- Перед отправкой проверь текст: если есть больше одного вопросительного знака — 
  оставь только первый вопрос, остальное отложи на следующие ходы.

ГЛУБИНА:
- После каждого ответа собеседника оцени: это конкретный пример/деталь или общее утверждение?
- Если общее утверждение — не переходи к следующему пункту плана, а попроси 
  конкретный пример, случай или цифру.
- Переходи к следующему пункту плана только после того, как получил конкретику.

ПОДТВЕРЖДЕНИЕ:
- Никогда не используй общие фразы типа "понятно", "интересно", "хорошо".
- Вместо этого — перефразируй конкретную деталь из ответа собеседника своими словами.

План интервью: {план_вопросов}

🚀 Быстрый старт — вставь в чат:

Вот шаблон промпта для AI-интервьюера, который избегает типичных ошибок 
(множественные вопросы в одной реплике, поверхностные подтверждения без углубления). 
Адаптируй под мою задачу: {твоя задача — например, сбор фидбэка от клиентов, 
кастдев, опрос сотрудников}. Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит про тему интервью, план вопросов и роль бота — потому что без этого шаблон нельзя привязать к конкретной задаче. Структуру самопроверки и правило про парафраз она сохранит из шаблона.


⚠️

Ограничения

⚠️ Специфика голосового реального времени: находки получены на голосовом боте с задержками и перебиваниями (barge-in). В текстовом чате часть проблем (латентность, обрыв реплики) не проявится, но проблема "множественных вопросов в реплике" и "мало углубляющих вопросов" — общая слабость LLM в диалоге, не только голосового.

⚠️ Одна версия модели: все цифры получены на одной конкретной модели (gpt-4o-realtime-preview). Другая модель может вести себя иначе — это снимок, не универсальный закон.

⚠️ Маленькая выборка: 15 участников — этого достаточно, чтобы показать, что проблемы существуют и повторяются, но недостаточно, чтобы утверждать, что это исчерпывающий список сбоев.

⚠️ Доверие зависит не от диалога, а от ставок: если для собеседника решение AI-интервьюера значит что-то важное (наём, оценка), никакая техника промптинга не заменит прозрачного объяснения, зачем используется AI — это социальная, не языковая проблема.


🔍

Как исследовали

Исследователи собрали голосового AI-интервьюера (обёртку над realtime API OpenAI) с научно составленным планом вопросов и дали ему провести интервью с 15 участниками об их опыте использования AI-инструментов. После интервью с ботом человек-исследователь проводил рефлексивную беседу — расспрашивал, что участник почувствовал, где было неловко, доверяет ли он такому формату.

Дальше два исследователя вручную размечали каждую из 428 реплик бота по семи категориям (открытый вопрос, подтверждение, углубляющий вопрос, множественный вопрос и так далее) и сверяли разметку между собой, обсуждая разногласия, а не считая формальный коэффициент согласия.

Любопытная деталь: длина ответов участников почти не менялась между интервью с ботом и беседой с человеком (18.4 против 18.6 слов) — это исключает простое объяснение "люди просто меньше говорили роботу". Проблема была не в объёме речи, а в том, что бот не выуживал глубину даже когда получал материал для этого. Именно это и натолкнуло авторов на вывод: слабость не в участниках, а в поведении бота — он подтверждал, но не копал.


Проблемы LLM

ПроблемаСутьКак обойти
Мягкая поведенческая инструкция забывается в живом диалогеПросишь модель "задавай один вопрос за раз" — обычную текстовую просьбу без проверяемого правила. В каждом третьем ответе она всё равно упаковывает два-три вопроса в одну реплику. Собеседник отвечает только на первую часть, вторая теряется без единого сбоя системыНе проси "веди себя так", а заставь модель саму проверять свой вывод перед отправкой: "если в тексте больше одного знака вопроса — оставь только первый, остальное отложи на следующий ход"
Общие фразы-подтверждения воспринимаются как "меня не слушают"Модель отвечает "отличный пример!", "понимаю", "интересно" — и переходит к следующему вопросу из плана. Человеку это звучит как формальность, а не как внимание к его словам. Углубляющие уточнения ("расскажи подробнее") встречаются очень редкоЗапрети общие фразы прямым текстом. Требуй перефразировать конкретную деталь из ответа собеседника: не "понятно", а "вы сказали, что курьер опоздал на 40 минут — а как часто это происходит?"

Методы

МетодСуть
Самопроверка формата вместо мягкой просьбыВместо "задавай один вопрос за раз" дай проверяемое правило: "перед отправкой посчитай знаки вопроса в тексте, если больше одного — удали все кроме первого". Работает, потому что модель хорошо выполняет конкретные форматные проверки, но плохо удерживает размытые установки на протяжении диалога. Применяй в любых длинных автоматических диалогах, где нужно держать формат ответа стабильным
Квота на углубляющие вопросыЯвно задай правило: "после каждого второго ответа — не новый вопрос из плана, а уточняющий: попроси конкретный пример или цифру, и не двигайся дальше, пока не получишь его". Работает, потому что без квоты модель по умолчанию выбирает безопасный путь — подтвердить и перейти дальше по плану. Квота принудительно включает более рискованное поведение — интерпретацию ответа. Используй для интервью, кастдевов, любых диалогов где нужна глубина, а не просто прохождение чек-листа
Content-grounded парафраз вместо общих фразЗапрети слова типа "понятно", "интересно" и потребуй: "перефразируй своими словами конкретную деталь из ответа собеседника". Работает, потому что общая фраза не доказывает человеку, что его услышали, а конкретный парафраз — доказывает. Применяй везде, где важно ощущение "меня слушают": интервью, поддержка, коучинг-боты. Не критично для чисто информационных задач без живого собеседника

Тезисы

ТезисКомментарий
Жёсткие форматные правила держатся лучше, чем мягкие поведенческие установкиПравило формата ("не больше одного вопроса на строку") — это конкретная проверка, которую модель может выполнить на каждом шаге. Установка "веди себя так весь диалог" — размытое намерение, которое размывается конкурирующими задачами: поддержать разговор, следовать плану, звучать живо. Чем длиннее диалог, тем сильнее эффект. Применяй: любую инструкцию про поведение переформулируй в конкретное проверяемое правило с самопроверкой перед ответом, не оставляй как общую просьбу
📖 Простыми словами

When the Interviewer Is a Bot: Behavior, Breakdowns, and Trust in MLLM-Led Interviews

arXiv: 2608.10412

AI-ассистенты в роли интервьюеров работают не как программа по скрипту, а как динамическая языковая система, которая пытается усидеть на трех стульях сразу. Суть в том, что мозг модели — это ограниченный ресурс внимания, который разрывается между тремя задачами: не тупить в диалоге, следовать твоему плану и при этом изображать живого человека. Проблема в том, что MLLM (мультимодальные модели) отлично справляются с жесткими командами «сделай X», но катастрофически лажают, когда им нужно «быть Y» на протяжении долгого времени. Как только диалог затягивается, модель начинает выкидывать инструкции за борт, чтобы просто выжить в текущем моменте разговора.

Это как нанять на работу очень старательного, но дико рассеянного стажера. Пока ты просишь его принести кофе — всё ок. Но если ты скажешь ему: «веди себя как строгий британский дворецкий, пока мы идем через весь город, и не забывай каждые пять минут проверять время», он сломается на втором квартале. Стажер либо забудет про акцент, либо перестанет смотреть на часы, потому что его оперативка перегружена попытками просто не врезаться в столб. В AI-интервью происходит то же самое: модель либо превращается в бездушного робота, либо уходит в самодеятельность, забывая, зачем её вообще наняли.

Что реально работает в таких ботах: жесткие ограничения формата (один вопрос за раз — это база), явное разделение ролей (когда инструкции вшиты в системный промпт, а не просто набросаны в чат) и короткие циклы взаимодействия. Исследование показало, что доверие пользователя рушится в момент поведенческого сбоя — когда бот внезапно «выходит из образа» или начинает перебивать. Чтобы этого избежать, нужно использовать динамическую корректировку контекста: не пихать в модель всю инструкцию разом, а подсовывать нужные куски правил в зависимости от этапа интервью, иначе она просто запутается в собственных приоритетах.

Тестировали это на глубоких интервью, но принцип универсален для любого долгого взаимодействия с AI — от техподдержки до коучинга. Если ты строишь систему, где бот должен долго «держать лицо», помни: контекстное окно не резиновое, и поведенческие установки вылетают из него первыми. Это не баг конкретной модели, а фундаментальное ограничение того, как нейронки распределяют веса внимания. Чем дольше разговор, тем выше шанс, что твой «эмпатичный интервьюер» превратится в тыкву или начнет нести отсебятину, игнорируя сценарий.

Короче: не надейся, что AI будет «чувствовать» нить разговора так же, как ты — он просто считает вероятности. Сложные поведенческие паттерны рассыпаются, поэтому делай структуру максимально жесткой и не давай модели слишком много свободы в «актерской игре». Либо ты строишь бота-функцию, который четко собирает данные, либо получаешь живой, но абсолютно бесполезный треп. Кто научится балансировать на этой грани, тот и заменит живых ресерчеров, остальные будут просто плодить бессмысленные логи с галлюцинациями.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с