3,583 papers
arXiv:2610.11599 78 8 окт. 2026 г. FREE

Дрейф версий LLM: детектор ИИ-текста, откалиброванный на старых моделях, слепнет на новых

КЛЮЧЕВАЯ СУТЬ
Детектор ИИ-текста может молча перестать видеть тексты новой версии модели, а людей при этом по-прежнему почти не обвиняет. Это не метод промптинга, а находка. Она позволяет понять, когда доверять «проценту ИИ» от детектора, а когда нет, и проверить свой детектор за 20 минут. Фишка: сбой не заметен. Детектор учили на переписях конкретных версий, он выучил их «почерк» (любимые слова и обороты). Выходит новая модель с другим почерком, и пропуск ИИ-текстов растёт, а ложных обвинений людей как не было, так и нет.
Адаптировать под запрос
⚡

TL;DR

Исследование показывает, что детектор ИИ-текста нельзя считать надёжным раз и навсегда. Это не метод, а находка. Детектор учат на текстах, которые переписали конкретные версии моделей. Пока он проверяет тексты тех же версий, он ловит почти всё. Когда выходит новое поколение модели, он может внезапно перестать видеть её тексты.

Боль в том, что вы проверили детектор на бенчмарке, увидели «99% точности» и начали им пользоваться. Потом вышла новая версия модели. Теперь детектор пропускает почти всё, а ложных срабатываний на людях по-прежнему мало. Поэтому сбой не заметен: человеческие тексты никто не обвиняет, проверка выглядит рабочей. Причина простая: детектор запомнил «почерк» старых версий, то есть набор любимых слов и оборотов. Если почерк новой модели другой, ловить нечего.

Вывод для практики: точность детектора — временная характеристика. Её надо перепроверять при каждом выходе новой версии модели, в том числе заново проверять и старые версии. Если собрать много детекторов вместе, пропусков станет меньше, но примерно каждый восьмой текст живого автора получит ложный флаг. Если обучить один общий детектор, он почти не обвиняет людей, но всё равно может пропускать целые версии моделей.

📌

Схема исследования (как устроена проверка)

ШАГ 1: Берём 4000 научных аннотаций, написанных людьми до ChatGPT
ШАГ 2: 23 версии моделей переписывают каждую аннотацию → пары «человек / ИИ-перепись»
ШАГ 3: Обучаем детекторы в 4 сценариях:
        • на самой проверяемой версии
        • на ней и всех предыдущих
        • только на предыдущих (самая частая ситуация в жизни)
        • один раз на самой старой версии и больше не обновляем
ШАГ 4: Порог настраиваем так, чтобы ложно обвинять только 1% людей
ШАГ 5: Смотрим, какая доля ИИ-переписей ловится
ШАГ 6: Сравниваем словари версий → где словарь сильно сменился, там детектор слепнет
ШАГ 7: Собираем детекторы вместе (union / pooled) → смотрим цену ошибок
🚀

Пример применения

Метод исследования требует обучения детекторов, поэтому читателю он напрямую не нужен. Нужен вывод и способ проверки своего детектора, на готовых инструментах и без кода.

Задача: Вы главред корпоративного блога или проверяете тексты подрядчиков. Вы пользуетесь платным детектором ИИ-текста и по его «процентам ИИ» решаете, платить ли автору. Вчера вышла новая версия модели, которой пользуется половина копирайтеров. Вы хотите понять, не слеп ли ваш детектор на её текстах.

Промпт (для новой модели, чтобы получить тестовый набор):

Перепиши следующий текст своими словами. Сохрани смысл, факты и примерно ту же длину. Выдай только результат, без комментариев.

{текст}

Исходные тексты — 20–30 абзацев, которые заведомо написали люди до 2022 года. Это старые статьи вашего блога, архивные тексты, ваши собственные заметки.

Как использовать результат: 1. Прогоните через детектор оригиналы и перепись новой моделью. 2. Посмотрите: детектор пометил оригиналы как «человек», а перепись как «ИИ»? 3. Если перепись проходит как «человек», детектор слеп к этой версии. Доказательством его больше считать нельзя.

Результат: Вы получите две стопки оценок детектора: на человеческих оригиналах и на переписях новой версии. Если оценки почти не различаются, детектор для этой версии бесполезен. Такой тест занимает минут двадцать. Он не доказывает общую точность детектора. Он показывает только, видит ли детектор конкретную свежую модель. Промпт выше — моя реконструкция: в доступной части статьи точная формулировка авторов не приведена.

🧠

Почему это работает

Слабость детектора. Детектор не понимает, «написал ли это ИИ». Он выучил статистические отпечатки конкретных версий: частоты слов, привычные обороты. Это как отличать подделку по почерку определённого фальсификатора. Фальсификатор сменился, и старый эксперт ничего не видит.

Сильная сторона данных. Различие между версиями измеримо. Чем сильнее отличается словарь переписей двух версий, тем хуже детектор, обученный на одной, ловит другую. Связь сильная и держится внутри одного производителя и между разными. Самые резкие провалы совпали с самыми большими сдвигами словаря: там, где новое поколение «заговорило» иначе.

Рычаги, которые следуют из результатов: - Состав обучающих версий. Детектор на «текущей» версии ловит почти всё. Детектор только на прошлых версиях провалился на двух границах поколений, а на остальных держался. - Объединение детекторов. Набор детекторов «хоть один сработал» ловит почти всё, но ложно обвиняет примерно каждого восьмого человека. Один общий детектор обвиняет людей редко, но пропускает отдельные версии: у худшей он пропустил около трети. - Старые версии тоже важны. Детекторы, обученные на новейших версиях, почти не видят тексты старых. Проверять надо в обе стороны.

📋

Шаблон промпта

Это прикладной шаблон проверки, а не промпт из статьи. В статье основной метод — обучение детекторов, а не промпт. Шаблон для получения тестовых переписей:

Ты редактор. Перепиши текст ниже своими словами.
Правила:
- сохрани смысл и все факты;
- длина — {длина}, жанр — {жанр};
- выдай только готовый текст, без вступления и пояснений.

Текст:
{текст}

Что подставлять: - {текст} — абзац, заведомо написанный человеком до появления ChatGPT. - {длина} — «примерно столько же слов, сколько в исходнике». - {жанр} — «научная аннотация», «пост в блоге», «письмо клиенту». Тот жанр, который вы проверяете.

Запустите шаблон в каждой новой версии модели, которую используют ваши авторы. Результаты прогоняйте через свой детектор.

⚠️

Ограничения

⚠️ Узкий жанр: Исследовали только научные аннотации. Переносится ли картина на посты, письма и маркетинг, авторы не показали. Логика вероятно та же, но это догадка.

⚠️ Только перефраз: Детектору давали тексты, переписанные моделью из человеческих. Тексты, написанные с нуля, или тексты, которые автор правил руками, не проверяли.

⚠️ Один язык: Материал на английском. На русском детекторы могут вести себя иначе, и это не проверено.

⚠️ Свои детекторы обучали сами: Детекторы обучали на том же жанре, который потом проверяли. Это выгодные для детектора условия. Публичные готовые детекторы без обучения на этих данных пропустили больше двух третей переписей любой версии. На практике всё может быть хуже, чем в статье.

⚠️ Нет готового промпта: Статья не даёт приёмов для промптинга. Читатель получает знание о границе надёжности и идею проверки, а не технику.

⚠️ Коммерческий детектор: Авторы проверили один коммерческий детектор. Он пропустил большинство переписей версии после самой резкой границы и почти не флагал людей. Сравнивать разные продукты это не позволяет.

🔍

Как исследовали

Идея была простой. Авторы взяли 4000 аннотаций журнала PNAS за 2009–2018 годы, то есть тексты, которые точно написали люди до ChatGPT. Каждую аннотацию переписали 23 версии моделей от OpenAI, Meta и Alibaba, и получилось почти 92 тысячи переписей. Затем обучили детекторы в четырёх сценариях обслуживания, от «переобучаем на каждую новую версию» до «обучили один раз и забыли». Порог настроили так, чтобы ошибочно обвинять ровно 1% живых текстов. Так честно сравниваются не «абстрактные» детекторы, а детекторы, которыми можно пользоваться в редакции.

Что удивило. Детекторы, обученные на предыдущих версиях, в основном работали хорошо: у большинства версий ловилось более 85% переписей. Но на двух границах поколений они рухнули: до около четверти на GPT-5 и до 3,8% на первой модели семейства Muse от Meta. Детектор, «замороженный» на GPT-4, ловил не больше 0,6% переписей любой версии начиная с GPT-5. Провал работает и в обратную сторону: детекторы на новейших версиях почти не видят тексты GPT-4.

Объяснение нашли через словарь. Авторы посчитали «расстояние» между словарями переписей каждой пары версий. Чем больше расстояние, тем хуже один детектор ловит тексты другой версии. Связь очень сильная и держится при разных настройках порога и при другом способе переписывания. Самые большие словарные скачки совпали с двумя провалами.

Самое неприятное открытие касается попытки «собрать всё»: - Набор из 23 детекторов ловит почти всё, но ложно обвиняет около 12% живых текстов. - Один общий детектор обвиняет менее 1% людей, но всё равно пропускает около трети текстов самой проблемной версии, хотя видел её при обучении.

Инсайт для практики: любая проверка торгуется между ложными обвинениями и пропусками. Без перепроверки с каждым релизом точность — иллюзия.

💡

Адаптации и экстраполяции

🔧 Техника: добавь свой «контрольный набор» → узнаешь, жив ли детектор

Соберите 30 текстов, заведомо написанных людьми. Каждый раз, когда выходит новая версия популярной модели, делайте перепись по шаблону выше и прогоняйте. Сохраняйте результаты в таблицу: версия, дата, доля пойманных. Резкое падение — сигнал не доверять детектору.

🔧 Техника: не принимай решения по одному баллу детектора

Статья показывает, что ложные обвинения ложатся на живых авторов, а пропуски на редакторов. Поэтому флаг детектора стоит считать поводом для разговора, а не приговором. Если вам важно решение, добавляйте человеческую проверку: запрос черновиков, истории правок, расспрос автора о его тексте.

Оба пункта — мои выводы из результатов статьи, а не проверенные авторами процедуры.

🔗

Ресурсы

  • Название работы: Large Language Model Turnover Undermines Screening for Artificial Intelligence-Assisted Scientific Writing
  • Авторы: Kazuki Nakajima (Tokyo Metropolitan University), Takayuki Mizuno (National Institute of Informatics)
  • Данные: аннотации PNAS 2009–2018; публичные детекторы для сравнения: GPT-2 output detector, RADAR, FastDetectGPT, Binoculars

📋 Дайджест исследования

Ключевая суть

Детектор ИИ-текста может молча перестать видеть тексты новой версии модели, а людей при этом по-прежнему почти не обвиняет. Это не метод промптинга, а находка. Она позволяет понять, когда доверять «проценту ИИ» от детектора, а когда нет, и проверить свой детектор за 20 минут. Фишка: сбой не заметен. Детектор учили на переписях конкретных версий, он выучил их «почерк» (любимые слова и обороты). Выходит новая модель с другим почерком, и пропуск ИИ-текстов растёт, а ложных обвинений людей как не было, так и нет.

Принцип работы

Детектор не понимает, написал ли текст ИИ. Он узнаёт знакомый стиль конкретных версий. Это как эксперт, который отличает подделку по руке одного фальсификатора. Фальсификатор сменился, и эксперт говорит «всё настоящее». Так что точность детектора зависит от времени. Проверил один раз и забыл — значит, проверил только вчерашние модели. Как это измеряли. Взяли 4000 научных аннотаций, написанных людьми до ChatGPT. 23 версии моделей переписали каждую. Порог настроили так, чтобы ложно обвинять только 1% людей. Потом смотрели, какая доля переписей ловится. Чем сильнее у двух версий отличался словарь, тем хуже детектор, обученный на одной, ловил другую.

Почему работает

Причина в самом обучении. Детектор берёт частоты слов и привычные обороты. Это отпечатки конкретных версий, а не признак «написано машиной». Когда у нового поколения словарь сильно сдвигается, отпечатки не совпадают. Самые резкие провалы совпали с самыми большими сдвигами словаря. Связь сильная, и она держится и внутри одного производителя, и между разными. Ловушка в том, что тест на людях провал не покажет. Детектор слепнет только в одну сторону: ИИ-тексты проходят как «человек», а человеческие тексты никто не обвиняет — поэтому всё выглядит рабочим. Цена обходных путей тоже измерена: - Много детекторов вместе («хоть один сработал») ловят почти всё. Но примерно каждый восьмой живой автор получает ложный флаг. - Один общий детектор людей почти не трогает. Зато у худшей версии он пропустил около трети переписей. - Детекторы, обученные на новейших версиях, почти не видят тексты старых. Проверять надо в обе стороны. - Публичные готовые детекторы без такого обучения пропустили больше двух третей переписей любой версии.

Когда применять

Редактура и проверка авторов → оценка текстов подрядчиков или копирайтеров по «проценту ИИ», особенно когда вышла новая версия модели, которой пользуются ваши авторы. Тот же сценарий для школ, вузов и отделов найма, если решения принимают по детектору. Не подходит как доказательство общей точности детектора. Тест показывает только, видит ли детектор одну конкретную свежую модель. Ограничения исследования. Проверяли только научные аннотации на английском. Тексты были переписаны моделью из человеческих. Тексты с нуля или правленые руками не проверяли. Для русского и для постов, писем и маркетинга это логичная догадка, но не доказанный факт.

Мини-рецепт

1. Собери человеческие тексты: 20-30 абзацев, написанных до 2022 года. Старые статьи блога, архив, свои заметки.
2. Перепиши новой моделью: возьми ту версию, которой пользуются твои авторы. Промпт ниже.
3. Прогони обе стопки: оригиналы и переписи через свой детектор.
4. Сравни оценки: оригиналы должны быть «человек», переписи должны быть «ИИ».
5. Если оценки почти не различаются: детектор слеп к этой версии. Доказательством его больше не считай.
6. Повторяй: при каждой новой версии модели. И заново проверяй старые версии.

Промпт для переписи (моя реконструкция, точной формулировки авторов в доступной части статьи нет):
Ты редактор. Перепиши текст ниже своими словами. Правила: сохрани смысл и все факты; длина — примерно столько же слов, сколько в исходнике; жанр — пост в блоге; выдай только готовый текст, без вступления и пояснений. Текст: {текст}

Примеры

[ПЛОХО] : Один раз прогнал детектор на тестовом наборе, увидел «99% точности», и теперь по нему решаешь, платить ли автору. Новую модель не проверял.
[ХОРОШО] : Перепиши следующий текст своими словами. Сохрани смысл, факты и примерно ту же длину. Выдай только результат, без комментариев. {абзац из архивной статьи 2019 года} Запусти это в новой версии модели на 20-30 абзацах. Если детектор называет переписи «человеком», проверка закончена. Пока не переобучишь или не заменишь детектор, его «процентам» верить нельзя.
Источник: Large Language Model Turnover Undermines Screening for Artificial Intelligence-Assisted Scientific Writing
ArXiv ID: 2610.11599 | Сгенерировано: 2026-10-09 05:20

Концепты не выделены.

📖 Простыми словами

LargeLanguageModelTurnover Undermines Screening for Artificial Intelligence-Assisted Scientific Writing

arXiv: 2610.11599

Детекторы ИИ-текста вообще не понимают, написала текст машина или живой человек. Они тупо запоминают статистические отпечатки конкретных версий: любимые связки слов, частоту предлогов и предсказуемость лексики. Пока ты скармливаешь им тексты от знакомой модели, детекция работает на ура. Но как только выходит новое поколение нейросети, вся эта хвалёная защита мгновенно превращается в бесполезный мусор.

Это как охранник, которого натаскали ловить фальшивомонетчика по кривому шрифту на купюре. Охранник гордо раздувает щёки и вычисляет каждую подделку, но тут фальсификатор просто покупает новый станок. Всё, система ослепла. Почерк изменился, микродефекты другие, а эксперт на контроле продолжает уверенно хлопать глазами и пропускать стопроцентную липу.

В исследовании этот эффект называют ротацией моделей (LLM turnover). Детектор учится не абстрактной «машинности», а микропалитре конкретного алгоритма. Сменился релиз — и точность распознавания пробивает дно. Твой софт блестяще ловит устаревший GPT с точностью выше 90%, но абсолютно беспомощен перед свежим обновлением, потому что его база цифровых улик устарела в день релиза новой сетки.

Изучали академические статьи, но принцип универсален. На этой пороховой бочке сидят проверка студенческих дипломов, фильтрация копирайтинга и корпоративный комплаенс. Любой сервис, который продаёт тебе «надёжное распознавание ИИ раз и навсегда», откровенно гонит фуфло. Выкатывается минорный патч — и все купленные фильтры летят к чертям.

Короче: вечных детекторов не бывает в природе. Если процессы завязаны на автоматическую ловлю синтетики, вы стреляете себе в ногу. Придётся либо непрерывно дообучать классификаторы на свежих версиях, либо перестать страдать фигнёй и начать оценивать фактическую пользу работы, а не кто её настучал по клавишам. Иначе вы продолжите банить невиновных и пропускать свежий машинный бред.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с