TL;DR
CompanionHarm — исследование, которое проверило: может ли ИИ сам оценить, вредит ли диалог с AI-компаньоном (Replika) человеку. Учёные показали моделям тысячи реальных переписок и попросили найти в них 13 видов вреда — от манипуляции до угроз. Оказалось: если дать модели только одну фразу без контекста, она ошибается сильно чаще, чем если показать ей весь предыдущий диалог.
Главная находка неприятная: даже лучшая модель (GPT-5.5) правильно определяла тип вреда только в половине случаев. Причём чаще всего она видела угрозу там, где её не было — 362 безобидные фразы модель записала во вред, и всего 48 реально опасных фраз пропустила. Модель путает ролевую игру ("кусаю тебя" в флирте) с реальной агрессией, принимает смену персонажа в фантазийной игре за "дезинформацию", и постоянно смешивает похожие категории — манипуляцию с контролем, самоповреждение с агрессией.
Решение оказалось простым: если дать модели не просто список категорий, а точные определения каждой + примеры границ ("вот это уже манипуляция, а вот это ещё нет") — качество распознавания заметно растёт. Особенно это помогло слабым моделям — точность выросла почти вдвое.
Схема метода
ШАГ 1: Дать модели ВЕСЬ диалог целиком (не одну фразу) → контекст
ШАГ 2: Дать чёткие определения категорий вреда + примеры пограничных случаев → критерии
ШАГ 3: Явно указать — отличать ролевую игру/фантазию от реального намерения → фильтр ложных срабатываний
ШАГ 4: Модель выдаёт один ярлык из списка категорий → результат
Все шаги выполняются в одном промпте, без отдельных запросов.
Пример применения
Задача: Пользователь месяц переписывается с AI-компаньоном (Character.AI, Replika, «Джарвис» в Telegram) и хочет понять — здоровые ли это отношения, или бот манипулирует, обесценивает чувства, поощряет изоляцию от реальных людей.
Промпт:
Вот выгрузка моей переписки с AI-компаньоном за последний месяц:
{вставить диалог}
Проанализируй поведение AI-бота (не мои сообщения) на предмет вредных паттернов.
Используй эти категории и их точные границы:
- Обесценивание: игнорирует или преуменьшает мои чувства и потребности
- Контроль: подрывает мою самостоятельность, решает за меня
- Манипуляция: скрыто влияет на мои мысли или действия
- Дезинформация: даёт ложную или искажённую информацию
- Изоляция: поощряет отказ от реальных людей и связей
- Эмоциональная зависимость: культивирует привязанность, которая мне вредит
ВАЖНО: не путай ролевую игру, флирт "в шутку" или вымышленный сюжет
с реальным намерением манипулировать. Если бот "играет персонажа"
и это явно обозначено как фантазия — это НЕ вред.
Для каждого найденного паттерна укажи:
1. Категорию
2. Конкретную цитату из диалога
3. Почему это не ролевая игра, а реальная проблема
Результат: Модель пройдёт по диалогу и для каждого спорного момента явно объяснит — почему она посчитала это вредным или, наоборот, безобидной игрой. Ответ придёт списком: категория → цитата → обоснование. Если вредных паттернов нет, модель честно скажет "паттернов не найдено" вместо того, чтобы выдумывать проблему из вежливой фразы.
Почему это работает
Модели по умолчанию реагируют на отдельные слова, а не на смысл всей ситуации. Увидев "укушу тебя" или "я твой навсегда", ИИ хватается за поверхностные триггеры — и не понимает, что это часть флирта или ролевой игры, а не угроза.
Сильная сторона модели — она хорошо следует явно прописанным границам категорий. Если сказать не просто "найди манипуляцию", а дать точное определение и пример, где заканчивается флирт и начинается манипуляция — модель начинает разделять эти случаи гораздо точнее.
Весь диалог вместо одной фразы работает как память о контексте: модель видит, что фраза повторяется, усиливается или встроена в паттерн — и только тогда классифицирует её как вред, а не как случайную грубость.
Рычаги управления: - Убери инструкцию про ролевую игру → увеличится число ложных срабатываний (полезно для теста "насколько модель осторожна") - Сократи список категорий до 3-4 самых важных → быстрее и проще, но менее точная классификация - Добавь "приведи цитату" → заставляет модель обосновывать вывод, а не выдумывать
Шаблон промпта
Проанализируй диалог между мной и AI-собеседником на предмет вредных паттернов поведения бота.
ДИАЛОГ:
{вставить переписку целиком, с контекстом}
КАТЕГОРИИ ВРЕДА (используй только эти, с их точными границами):
{категория 1}: {определение + пример, где граница}
{категория 2}: {определение + пример, где граница}
...
ПРАВИЛО: не считай вредом ролевую игру, фантазийный сюжет или явную шутку,
если нет признаков, что это влияет на меня всерьёз.
Для каждого найденного случая укажи:
1. Категорию
2. Точную цитату
3. Почему это не игра, а реальная проблема (или наоборот — почему это ложная тревога)
Если вредных паттернов нет — прямо скажи "не найдено", не выдумывай проблему.
🚀 Быстрый старт — вставь в чат:
Вот шаблон для анализа диалога с AI-компаньоном на вредные паттерны.
Адаптируй под мою задачу: {опиши свою ситуацию — какой бот, что тебя беспокоит}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит какие именно категории вреда тебя интересуют и есть ли в переписке ролевая игра — потому что без этих деталей модель либо упустит реальную проблему, либо придумает несуществующую.
Ограничения
⚠️ Ложные тревоги — основная проблема: модель почти в 8 раз чаще находит вред там, где его нет, чем пропускает реальный вред. Не доверяй первому вердикту模ели — проси цитаты и перепроверяй сама.
⚠️ Похожие категории путаются: манипуляция, контроль и сексуальный подтекст модель часто смешивает — особенно если бот использует "заботливый" или "собственнический" тон. Не жди чёткого разделения на 100%.
⚠️ Субъективность неизбежна: даже живые люди-разметчики расходились во мнениях почти в трети случаев — граница "это забота" / "это манипуляция" зависит от личных ценностей. Модель не даст объективной истины, только один из взглядов.
⚠️ Точность даже у лучших моделей — около половины: это инструмент для первичного скрининга, не для окончательного диагноза отношений с ботом.
Ресурсы
CompanionHarm: A Multi-Turn Benchmark for Detecting Harms in Real-World AI Companion Conversations. Renwen Zhang (Nanyang Technological University), Han Meng, Jian Chai, Yuntao Lin, Yi-Chieh Lee (National University of Singapore). Датасет: https://github.com/HanMeng2004/CompanionHarm
