TL;DR
Исследование показывает, что детектор ИИ-текста нельзя считать надёжным раз и навсегда. Это не метод, а находка. Детектор учат на текстах, которые переписали конкретные версии моделей. Пока он проверяет тексты тех же версий, он ловит почти всё. Когда выходит новое поколение модели, он может внезапно перестать видеть её тексты.
Боль в том, что вы проверили детектор на бенчмарке, увидели «99% точности» и начали им пользоваться. Потом вышла новая версия модели. Теперь детектор пропускает почти всё, а ложных срабатываний на людях по-прежнему мало. Поэтому сбой не заметен: человеческие тексты никто не обвиняет, проверка выглядит рабочей. Причина простая: детектор запомнил «почерк» старых версий, то есть набор любимых слов и оборотов. Если почерк новой модели другой, ловить нечего.
Вывод для практики: точность детектора — временная характеристика. Её надо перепроверять при каждом выходе новой версии модели, в том числе заново проверять и старые версии. Если собрать много детекторов вместе, пропусков станет меньше, но примерно каждый восьмой текст живого автора получит ложный флаг. Если обучить один общий детектор, он почти не обвиняет людей, но всё равно может пропускать целые версии моделей.
Схема исследования (как устроена проверка)
ШАГ 1: Берём 4000 научных аннотаций, написанных людьми до ChatGPT
ШАГ 2: 23 версии моделей переписывают каждую аннотацию → пары «человек / ИИ-перепись»
ШАГ 3: Обучаем детекторы в 4 сценариях:
• на самой проверяемой версии
• на ней и всех предыдущих
• только на предыдущих (самая частая ситуация в жизни)
• один раз на самой старой версии и больше не обновляем
ШАГ 4: Порог настраиваем так, чтобы ложно обвинять только 1% людей
ШАГ 5: Смотрим, какая доля ИИ-переписей ловится
ШАГ 6: Сравниваем словари версий → где словарь сильно сменился, там детектор слепнет
ШАГ 7: Собираем детекторы вместе (union / pooled) → смотрим цену ошибок
Пример применения
Метод исследования требует обучения детекторов, поэтому читателю он напрямую не нужен. Нужен вывод и способ проверки своего детектора, на готовых инструментах и без кода.
Задача: Вы главред корпоративного блога или проверяете тексты подрядчиков. Вы пользуетесь платным детектором ИИ-текста и по его «процентам ИИ» решаете, платить ли автору. Вчера вышла новая версия модели, которой пользуется половина копирайтеров. Вы хотите понять, не слеп ли ваш детектор на её текстах.
Промпт (для новой модели, чтобы получить тестовый набор):
Перепиши следующий текст своими словами. Сохрани смысл, факты и примерно ту же длину. Выдай только результат, без комментариев.
{текст}
Исходные тексты — 20–30 абзацев, которые заведомо написали люди до 2022 года. Это старые статьи вашего блога, архивные тексты, ваши собственные заметки.
Как использовать результат: 1. Прогоните через детектор оригиналы и перепись новой моделью. 2. Посмотрите: детектор пометил оригиналы как «человек», а перепись как «ИИ»? 3. Если перепись проходит как «человек», детектор слеп к этой версии. Доказательством его больше считать нельзя.
Результат: Вы получите две стопки оценок детектора: на человеческих оригиналах и на переписях новой версии. Если оценки почти не различаются, детектор для этой версии бесполезен. Такой тест занимает минут двадцать. Он не доказывает общую точность детектора. Он показывает только, видит ли детектор конкретную свежую модель. Промпт выше — моя реконструкция: в доступной части статьи точная формулировка авторов не приведена.
Почему это работает
Слабость детектора. Детектор не понимает, «написал ли это ИИ». Он выучил статистические отпечатки конкретных версий: частоты слов, привычные обороты. Это как отличать подделку по почерку определённого фальсификатора. Фальсификатор сменился, и старый эксперт ничего не видит.
Сильная сторона данных. Различие между версиями измеримо. Чем сильнее отличается словарь переписей двух версий, тем хуже детектор, обученный на одной, ловит другую. Связь сильная и держится внутри одного производителя и между разными. Самые резкие провалы совпали с самыми большими сдвигами словаря: там, где новое поколение «заговорило» иначе.
Рычаги, которые следуют из результатов: - Состав обучающих версий. Детектор на «текущей» версии ловит почти всё. Детектор только на прошлых версиях провалился на двух границах поколений, а на остальных держался. - Объединение детекторов. Набор детекторов «хоть один сработал» ловит почти всё, но ложно обвиняет примерно каждого восьмого человека. Один общий детектор обвиняет людей редко, но пропускает отдельные версии: у худшей он пропустил около трети. - Старые версии тоже важны. Детекторы, обученные на новейших версиях, почти не видят тексты старых. Проверять надо в обе стороны.
Шаблон промпта
Это прикладной шаблон проверки, а не промпт из статьи. В статье основной метод — обучение детекторов, а не промпт. Шаблон для получения тестовых переписей:
Ты редактор. Перепиши текст ниже своими словами.
Правила:
- сохрани смысл и все факты;
- длина — {длина}, жанр — {жанр};
- выдай только готовый текст, без вступления и пояснений.
Текст:
{текст}
Что подставлять:
- {текст} — абзац, заведомо написанный человеком до появления ChatGPT.
- {длина} — «примерно столько же слов, сколько в исходнике».
- {жанр} — «научная аннотация», «пост в блоге», «письмо клиенту». Тот жанр, который вы проверяете.
Запустите шаблон в каждой новой версии модели, которую используют ваши авторы. Результаты прогоняйте через свой детектор.
Ограничения
⚠️ Узкий жанр: Исследовали только научные аннотации. Переносится ли картина на посты, письма и маркетинг, авторы не показали. Логика вероятно та же, но это догадка.
⚠️ Только перефраз: Детектору давали тексты, переписанные моделью из человеческих. Тексты, написанные с нуля, или тексты, которые автор правил руками, не проверяли.
⚠️ Один язык: Материал на английском. На русском детекторы могут вести себя иначе, и это не проверено.
⚠️ Свои детекторы обучали сами: Детекторы обучали на том же жанре, который потом проверяли. Это выгодные для детектора условия. Публичные готовые детекторы без обучения на этих данных пропустили больше двух третей переписей любой версии. На практике всё может быть хуже, чем в статье.
⚠️ Нет готового промпта: Статья не даёт приёмов для промптинга. Читатель получает знание о границе надёжности и идею проверки, а не технику.
⚠️ Коммерческий детектор: Авторы проверили один коммерческий детектор. Он пропустил большинство переписей версии после самой резкой границы и почти не флагал людей. Сравнивать разные продукты это не позволяет.
Как исследовали
Идея была простой. Авторы взяли 4000 аннотаций журнала PNAS за 2009–2018 годы, то есть тексты, которые точно написали люди до ChatGPT. Каждую аннотацию переписали 23 версии моделей от OpenAI, Meta и Alibaba, и получилось почти 92 тысячи переписей. Затем обучили детекторы в четырёх сценариях обслуживания, от «переобучаем на каждую новую версию» до «обучили один раз и забыли». Порог настроили так, чтобы ошибочно обвинять ровно 1% живых текстов. Так честно сравниваются не «абстрактные» детекторы, а детекторы, которыми можно пользоваться в редакции.
Что удивило. Детекторы, обученные на предыдущих версиях, в основном работали хорошо: у большинства версий ловилось более 85% переписей. Но на двух границах поколений они рухнули: до около четверти на GPT-5 и до 3,8% на первой модели семейства Muse от Meta. Детектор, «замороженный» на GPT-4, ловил не больше 0,6% переписей любой версии начиная с GPT-5. Провал работает и в обратную сторону: детекторы на новейших версиях почти не видят тексты GPT-4.
Объяснение нашли через словарь. Авторы посчитали «расстояние» между словарями переписей каждой пары версий. Чем больше расстояние, тем хуже один детектор ловит тексты другой версии. Связь очень сильная и держится при разных настройках порога и при другом способе переписывания. Самые большие словарные скачки совпали с двумя провалами.
Самое неприятное открытие касается попытки «собрать всё»: - Набор из 23 детекторов ловит почти всё, но ложно обвиняет около 12% живых текстов. - Один общий детектор обвиняет менее 1% людей, но всё равно пропускает около трети текстов самой проблемной версии, хотя видел её при обучении.
Инсайт для практики: любая проверка торгуется между ложными обвинениями и пропусками. Без перепроверки с каждым релизом точность — иллюзия.
Адаптации и экстраполяции
🔧 Техника: добавь свой «контрольный набор» → узнаешь, жив ли детектор
Соберите 30 текстов, заведомо написанных людьми. Каждый раз, когда выходит новая версия популярной модели, делайте перепись по шаблону выше и прогоняйте. Сохраняйте результаты в таблицу: версия, дата, доля пойманных. Резкое падение — сигнал не доверять детектору.
🔧 Техника: не принимай решения по одному баллу детектора
Статья показывает, что ложные обвинения ложатся на живых авторов, а пропуски на редакторов. Поэтому флаг детектора стоит считать поводом для разговора, а не приговором. Если вам важно решение, добавляйте человеческую проверку: запрос черновиков, истории правок, расспрос автора о его тексте.
Оба пункта — мои выводы из результатов статьи, а не проверенные авторами процедуры.
Ресурсы
- Название работы: Large Language Model Turnover Undermines Screening for Artificial Intelligence-Assisted Scientific Writing
- Авторы: Kazuki Nakajima (Tokyo Metropolitan University), Takayuki Mizuno (National Institute of Informatics)
- Данные: аннотации PNAS 2009–2018; публичные детекторы для сравнения: GPT-2 output detector, RADAR, FastDetectGPT, Binoculars
