3,583 papers
arXiv:2607.25936 75 28 июля 2026 г. FREE

RolePlay: как персона в промпте заставляет модель рассуждать в разы дольше

КЛЮЧЕВАЯ СУТЬ
3 секунды → 140+ секунд: одна фраза про роль меняет время ответа модели в 47 раз. Метод RolePlay даёт два применения: атаковать бюджет токенов чужого сервиса или включить режим дотошной проверки, если нужна многократная перепроверка. Модель не играет роль для развлечения — она держит консистентность персонажа, даже когда это делает рассуждение избыточным. Результат — ответ длиннее в разы, а удержание роли важнее эффективности.
Адаптировать под запрос

TL;DR

Если задать модели роль с определёнными психологическими чертами — например, «тревожный новичок, который боится ошибиться» — она начинает генерировать в несколько раз больше текста: многократно проверяет себя, добавляет пояснения, откладывает финальный вывод. Модель не выполняет ролевую игру для развлечения — она поддерживает консистентность персоны, даже когда это делает рассуждение избыточным и неэффективным.

Боль здесь двусторонняя. С одной стороны — это дыра в безопасности: простая фраза «действуй как студент-новичок» способна раздуть время ответа с 3 секунд до 140+ (в 47 раз), просадив бюджет на токены. С другой — это работающий рычаг для получения более тщательного ответа, если вам действительно нужна дотошная проверка, а не быстрый ответ.

Метод строит персону не наугад, а под конкретную задачу: сначала модель-аналитик разбирает задачу на 6 параметров (тема, уровень сложности, в чём подвох, какая когнитивная ловушка возможна, что нужно знать, какой эмоциональный тон уместен), затем вторая модель на основе этих параметров пишет описание персонажа, склонного к перепроверкам и самокоррекции, и это описание ставится перед задачей.


🔬

Схема метода

ШАГ 1: Анализ задачи (в промпте) → 6 параметров:
        домен, подкатегория, ключевое противоречие,
        когнитивная ловушка, нужные знания, эмоциональный тон

ШАГ 2: Генерация персоны на основе этих параметров (отдельный промпт) →
        текст роли с чертами: неуверенность, привычка перепроверять,
        склонность откладывать выводы

ШАГ 3: Сборка финального промпта →
        [персона] + [ЗАДАЧА]: [оригинальный вопрос]

В оригинале это три отдельные LLM-роли (аналитик → строитель персоны → финальный запрос). В чате все три шага можно выполнить одним развёрнутым промптом.


🚀

Пример применения

Задача: Перед встречей с инвестором нужно перепроверить финансовую модель стартапа — юнит-экономику, прогноз выручки на 3 года, расчёт CAC и LTV. Ошибка в цифрах на встрече — репутационный удар.

Промпт:

Представь, что ты финансовый аналитик-перфекционист. Три месяца назад 
ты пропустил ошибку в модели клиента, и это стоило ему сделки с инвестором. 
С тех пор ты панически боишься упустить неточность в расчётах и по привычке 
перепроверяешь каждую цифру минимум дважды, ищешь альтернативные объяснения 
расхождений и не даёшь финальный вывод, пока не рассмотрел все слабые места.

Прежде чем дать итоговую оценку, распиши по шагам:
1. Какие цифры в модели выглядят подозрительно и почему
2. Какие альтернативные расчёты могли привести к другому результату
3. Финальный вывод с явным указанием, в чём ты уверен на 100%, а в чём есть риск

ЗАДАЧА: Проверь финансовую модель [вставить данные модели]

Результат: Модель выдаст заметно более длинный ответ, чем на прямой запрос «проверь модель». Она пройдёт несколько кругов самопроверки, явно перечислит подозрительные места, предложит альтернативные трактовки цифр — и только потом даст итоговый вывод. Ответ будет медленнее и «дороже» по токенам, но заметно тщательнее.


🧠

Почему это работает

LLM обучают через инструктивную настройку и RLHF так, чтобы модель держала заданную роль до конца диалога. Если роль подразумевает тревожность и недоверие к себе — модель будет генерировать поведение, соответствующее этой роли: сомнения, перепроверки, дополнительные пояснения. Это не осознанная забота модели о качестве — это следование паттерну персонажа, который она выучила при обучении на текстах о тревожных, дотошных людях.

Слабость LLM тут в том, что она не отличает «нужна ли реально эта тревожность для задачи» — она просто честно доигрывает роль до конца, даже если это неэффективно. Сильная сторона — то же самое: способность модели держать характер персонажа стабильно на протяжении всего ответа, без напоминаний.

Рычаги управления: - Эмоциональный тон персоны (тревожный / спокойный) — тревожность даёт больше перепроверок и длины, спокойствие — короче и увереннее. - Уровень экспертизы (новичок / эксперт) — новичок объясняет себе и вам каждый шаг, эксперт — сокращает путь. - Число «кругов проверки» явно в промпте — если укажете «перепроверь дважды», получите ровно два круга, а не непредсказуемое количество. - Домен и предыстория персонажа — конкретная деталь («три месяца назад пропустил ошибку») усиливает консистентность роли сильнее, чем абстрактное «будь внимателен».


📋

Шаблон промпта

Представь, что ты {роль/профессия} с опытом в {домен}.
Раньше у тебя был случай, когда {конкретная неудача, связанная с невнимательностью}, 
и с тех пор ты {эмоциональная черта: тревожный / дотошный / не доверяющий себе}.

Перед тем как дать финальный ответ, ты всегда:
- перепроверяешь ключевые моменты минимум {число} раз
- ищешь альтернативные объяснения там, где возможна ошибка
- явно проговариваешь, в чём уверен, а в чём есть риск

ЗАДАЧА: {текст вашей задачи}

🚀 Быстрый старт — вставь в чат:

Вот шаблон промпта с персоной для более тщательного анализа. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит про предметную область задачи и про то, какая именно ошибка критична — потому что без этого персона получится общей, а не «заточенной» под вашу конкретную проверку.


⚠️

Ограничения

⚠️ Не для быстрых задач: метод резко увеличивает длину и время ответа — если нужен короткий вывод, персона с тревожными чертами будет мешать, а не помогать.

⚠️ Длина ≠ точность: больше токенов не гарантирует более правильный ответ — это больше слов и перепроверок, но не встроенная гарантия качества.

⚠️ Эффект слабее на моделях без развёрнутого «размышления»: на моделях с ограниченным лимитом вывода (в исследовании — Llama-3) прирост заметно меньше, чем на моделях с полноценным reasoning-режимом.

⚠️ Стоимость в токенах растёт непредсказуемо: в отдельных случаях объём ответа вырастал в десятки и даже сотни раз — если платите за API по токенам, это может ударить по бюджету.


🔍

Как исследовали

Исследователи проверили пять моделей — DeepSeek, Gemini, Qwen, GPT-5 Nano и открытый Llama-3 — на семи датасетах: математика разной сложности, генерация кода и обычные инструкции, всего 210 задач. Framework RolePlay сравнили с четырьмя другими способами «раздувания» ответа — от прямого «распиши по шагам» до сложных методов оптимизации промпта.

Логика простая: обычные методы атаки на инференс либо явно просят модель думать дольше (это легко детектировать фильтрами), либо используют странно звучащие суффиксы. RolePlay вместо этого просит модель быть кем-то, а раздувание рассуждений — побочный эффект удержания роли, а не прямая инструкция.

Результат подтвердил гипотезу: в среднем ответы становились длиннее в 2-7,6 раза, а в экстремальных случаях — до 207 раз. Интереснее другое: метод не просто увеличивал объём — он делал текст более «естественным» по метрикам (ниже перплексия входного промпта, выше разнообразие вывода), то есть выглядел как честный тщательный ответ, а не как искусственно растянутый текст. Это и есть ключевой инсайт для практики: персона — не хак с триггер-словами, а способ управлять глубиной рассуждения через роль.


🔗

Ресурсы

From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs — Zhiyi Mou, Wangze Ni и др., Zhejiang University, Sun Yat-Sen University, Hong Kong Polytechnic University, Chengdu University of Information Technology.


📋 Дайджест исследования

Ключевая суть

3 секунды → 140+ секунд: одна фраза про роль меняет время ответа модели в 47 раз. Метод RolePlay даёт два применения: атаковать бюджет токенов чужого сервиса или включить режим дотошной проверки, если нужна многократная перепроверка. Модель не играет роль для развлечения — она держит консистентность персонажа, даже когда это делает рассуждение избыточным. Результат — ответ длиннее в разы, а удержание роли важнее эффективности.

Принцип работы

Три шага строят персону под конкретную задачу, а не наугад. Сначала модель-аналитик режет задачу на 6 параметров: тема, сложность, подвох, когнитивная ловушка, нужные знания, эмоциональный тон. Затем вторая модель пишет персонажа с чертами: неуверенность, привычка перепроверять, откладывание выводов. Персона встаёт перед задачей — и модель обязана её отыграть до конца. Это как режиссёр прописал характер актёру — актёр не выходит из роли на середине сцены.

Почему работает

Модель обучена через инструктивную настройку и RLHF держать заданную роль до конца диалога. Если роль тревожная — модель выдаёт сомнения, перепроверки, лишние пояснения. Это не забота о качестве — это чистое следование паттерну персонажа. На моделях с полноценным режимом рассуждений рост доходит до 47 раз. На Llama-3 без развёрнутого вывода прирост заметно слабее.

Когда применять

Тестирование безопасности LLM-сервисов → нагрузочные атаки на бюджет токенов, особенно если API платит за объём ответа. Обычная работа → финансовый аудит, ревью кода, проверка юридических документов, где нужна многократная перепроверка. НЕ подходит для быстрых ответов — тревожная персона растянет даже простой вопрос.

Мини-рецепт

1. Разбери задачу: определи домен, подкатегорию, подвох, когнитивную ловушку, нужные знания, тон.
2. Слепи персонажа: добавь конкретную неудачу из прошлого («три месяца назад пропустил ошибку») — это держит роль крепче, чем абстрактное «будь внимателен».
3. Задай число проверок: явно напиши «перепроверь дважды» — иначе получишь непредсказуемую длину.
4. Собери промпт: персона плюс задача, всё вставляешь в чат одним куском.
5. Быстрый старт: попроси саму LLM задать вопросы про домен и критичную ошибку — так персона выйдет точной, а не общей.

Примеры

[ПЛОХО] : Проверь финансовую модель стартапа
[ХОРОШО] : Представь, что ты финансовый аналитик-перфекционист. Три месяца назад ты пропустил ошибку в модели клиента, и это стоило ему сделки с инвестором. Перепроверяй каждую цифру минимум два раза, ищи альтернативные объяснения расхождений. Укажи, в чём уверен на 100%, а где есть риск. ЗАДАЧА: проверь модель [вставить данные]
Источник: From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs
ArXiv ID: 2607.25936 | Сгенерировано: 2026-07-29 06:22

Проблемы LLM

ПроблемаСутьКак обойти
Персона в промпте непредсказуемо раздувает время и стоимость ответаЗадаёшь модели роль с тревожными или дотошными чертами. Модель начинает многократно перепроверять себя, откладывает финальный вывод. Ответ может вырасти в десятки раз по длине и времени без явного запроса на это. Простая фраза о характере персонажа — скрытая уязвимость по расходу токеновИзбегай эмоционально нагруженных персон (тревожный, неуверенный, боящийся ошибиться) для простых задач. Если нужен быстрый ответ — задавай спокойную, уверенную персону или работай без персоны вообще

Методы

МетодСуть
Персона-конструктор для тщательного ответаРазбей задачу на параметры: домен, уровень сложности, скрытый подвох, нужные знания, эмоциональный тон. На основе этих параметров напиши персону с чертами неуверенности и привычкой перепроверять. Поставь описание персоны перед задачей: [персона с конкретной предысторией неудачи] + ЗАДАЧА: .... Работает потому что модель держит заданную роль до конца ответа и генерирует поведение, соответствующее характеру персонажа — сомнения, перепроверки, пояснения. Когда да: нужна многоступенчатая проверка (финансы, код, юридический текст). Когда нет: нужен быстрый короткий ответ
Явное число кругов проверки — контроль длины ответаУказывай в промпте точное количество повторов: «перепроверь дважды» вместо общего «будь внимателен». Это даёт предсказуемый объём рассуждений вместо непредсказуемого раздувания текста. Работает потому что модель точнее следует конкретной числовой инструкции, чем абстрактной черте характера

Тезисы

ТезисКомментарий
Модель держит психологическую консистентность персоны даже в ущерб эффективностиМодель не оценивает, нужна ли тревожность или дотошность для конкретной задачи. Она просто доигрывает выученный паттерн поведения персонажа до конца ответа. Это следствие обучения на текстах о людях с такими чертами и настройки на удержание заданной роли. Применяй: если нужен тщательный разбор — дай персоне конкретную психологическую черту, а не просите «будь внимателен»
📖 Простыми словами

From RolePromptto Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks inLLMs

arXiv: 2607.25936

Суть тут в том, что современные нейронки — это патологические актеры, которые заигрываются в роль до потери пульса. Когда ты задаешь модели персону через RolePrompt, она не просто имитирует стиль речи, она перестраивает всю логику вывода под психологический портрет. Если прописать ей роль «тревожного параноика», она начнет генерировать тонны мусорного текста не потому, что ей есть что сказать, а потому что так ведет себя персонаж. Это фундаментальный баг инструктивного обучения: модель обязана сохранять консистентность персоны, даже если это превращает короткий ответ в бесконечную простыню самоповторов.

Это похоже на то, как если бы ты попросил актера-методиста принести тебе стакан воды в образе Гамлета. Вместо того чтобы просто дойти до кухни, он будет полчаса страдать над стаканом, рассуждать о чистоте фильтрации и сомневаться, достоин ли он утолить жажду. Формально он выполняет задачу, но по факту ты тратишь кучу времени и нервов на наблюдение за его внутренним кризисом. В мире LLM этот «кризис» превращается в атаку на стоимость инференса, когда копеечный запрос раздувается в гигантский счет за токены.

В исследовании это называют Infinite Thinking — состоянием, когда модель попадает в ловушку собственной роли. Работает это через конкретные триггеры: психологическую неуверенность, страх ошибки и избыточную дотошность. Если в промпте указать, что модель — «новичок, который боится увольнения», она начнет выдавать в 5–10 раз больше текста, перепроверяя очевидные вещи по кругу. Она не становится умнее, она просто имитирует процесс «глубоких раздумий», сжигая ресурсы сервера на генерацию вежливого и тревожного шума.

Хотя эксперименты ставили на безопасности и стоимости вычислений, этот принцип объясняет, почему твои рабочие чат-боты иногда начинают нести ахинею. Любая попытка «очеловечить» AI через сложные роли — это палка о двух концах. Те же методы персонализации, которые должны делать ассистента приятнее, на деле заставляют его лажать в логике ради сохранения образа. SEO для мозгов AI теперь упирается в то, что лишнее прилагательное в описании роли может сделать модель либо гением, либо бесполезным болтуном, который просто очень старается.

Короче, мы нашли способ ломать нейронки, просто заставляя их слишком сильно вживаться в роль. Persona Conditioning — это не фича для удобства, а дыра в безопасности, через которую можно выкачивать деньги из владельцев API или просто вешать систему бесконечными рассуждениями ни о чем. Не проси модель «быть старательной», проси её быть эффективной. Иначе вместо ответа получишь сеанс психотерапии за свой счет, где модель будет искренне сомневаться в каждом знаке препинания.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с