TL;DR
Если попросить ИИ оценить чужой текст — эссе, резюме, коммерческое предложение — модель может завышать оценку за вычурные, "умные" слова, даже если это не признак качества. Исследователи сравнили, как один и тот же "замороженный" ИИ-рецензент (не переобученный, с одним и тем же промптом) и живые люди оценивали научные тексты с 2018 по 2025 год.
Раньше сложная лексика была признаком, что автор долго работал над текстом — значит, стоило потратить время на осмысленность. Теперь любой генерирует заумный текст одним промптом за секунду, и люди перестали воспринимать сложные слова как сигнал качества — их "вес" в оценке упал с явно позитивного до нуля. А вот ИИ-судья, если его не переучивать заново, продолжает вознаграждать сложную лексику по старым правилам — как будто дорогая работа автора, хотя это больше ничего не стоит.
Интереснее другое: люди переключились на признак, который ИИ вообще не замечает — разнообразие длины предложений (то короткое, рубленое, то длинное, развёрнутое — живой стиль). Значит, если хочешь получить оценку текста, близкую к человеческому вкусу, — нужно явно указать модели, на что смотреть, а не доверять её "внутреннему чувству стиля".
Схема метода
Это не техника, а находка про предубеждение LLM-судей. Практическое применение — коррекция промпта для оценки текста:
БЕЗ коррекции: "Оцени качество текста" → модель ассоциирует сложные слова с качеством (устаревший критерий)
С коррекцией: явно указать критерии → модель оценивает по структуре, не по вычурности словаря
Пример применения
Задача: Ты просишь ChatGPT оценить сопроводительное письмо кандидата на вакансию или коммерческое предложение перед отправкой клиенту.
Промпт:
Оцени качество этого текста для менеджера по найму.
Важно: не считай сложные и редкие слова признаком качества сами по себе.
Сейчас такой текст легко сгенерировать нейросетью за секунду —
это больше не показатель усердия или глубины мысли.
Оцени по критериям:
1. Разнообразие длины предложений (смесь коротких и длинных — признак живого, а не шаблонного текста)
2. Ясность и конкретность мысли
3. Не является ли сложная терминология искусственным "надуванием" текста
Текст: {текст}
Результат: Модель даст структурированную оценку по трём критериям вместо общей оценки "хорошо/плохо написано". Ты увидишь, не завышена ли оценка за счёт вычурных слов, и получишь более честный взгляд, ближе к тому, как текст воспримет живой человек.
Почему это работает
LLM, когда её просят оценить "качество текста", неосознанно тянет за собой старую ассоциацию: сложные слова = усилие автора = хороший текст. Это устаревший сигнал — раньше он и правда что-то значил, потому что писать заумно было дорого по времени. Сейчас это стоит один промпт, и сигнал обесценился, но модель этого "не знает" — если её не переучивать под новые данные.
Сильная сторона LLM — она отлично выполняет явные, конкретные инструкции. Если просто сказать "оцени качество" — она использует свои внутренние (и устаревшие) критерии красоты текста. Если явно расписать, на что смотреть, модель это выполнит.
Рычаг управления: замени общий запрос "оцени качество" на список конкретных критериев — это works как прямая инъекция актуального человеческого вкуса вместо устаревшего вкуса модели.
Шаблон промпта
Оцени текст {текст} для аудитории {аудитория}.
Не считай сложную терминологию и редкие слова признаком качества —
сейчас такой текст легко сгенерировать, и сложность лексики
не означает глубину мысли.
Оцени по критериям:
1. Разнообразие длины предложений — есть ли живой ритм (короткие и длинные фразы),
или текст монотонный
2. Ясность и конкретность каждой мысли
3. Соответствует ли сложность слов сути, или это искусственное усложнение
Дай оценку по каждому пункту и итоговый вывод: {что нужно решить —
взять кандидата/отправить клиенту/опубликовать}
Что подставлять: {текст} — то, что оцениваешь; {аудитория} — кто читатель (заказчик, HR, редактор); последний плейсхолдер — конкретное решение, которое зависит от оценки.
🚀 Быстрый старт — вставь в чат:
Вот шаблон для честной оценки текста без предубеждения к "умным словам".
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какой текст оценивать и для какой аудитории — потому что без этого критерии "разнообразие предложений" и "ясность мысли" нельзя применить конкретно.
Ограничения
⚠️ Это находка, не готовая техника. Она показывает предубеждение, а не даёт протестированный метод его исправления — коррекция промпта выше это разумная экстраполяция автора саммари, не то, что проверяли исследователи.
⚠️ Домен исследования — научные рецензии, не резюме и не коммерческие тексты. Перенос вывода на другие типы текстов логичен, но не проверен напрямую.
⚠️ Эффект статистически значим, но не огромный на уровне одного текста. Речь о сдвиге в среднем по тысячам оценок, а не о резком провале конкретной вычурной фразы.
Как исследовали
Исследователи взяли 32 638 заявок на топовую конференцию по ИИ (ICLR) за 2018–2025 годы. У каждой заявки — реальные отзывы людей-рецензентов (124 615 штук) и отзывы от одной и той же ИИ-модели с одним и тем же промптом, сгенерированные все сразу, в одном коротком окне времени (февраль–апрель 2025).
Идея простая: если "судья" не менялся, а тексты за 8 лет изменились — то разница в оценках между годами у ИИ отражает только изменение текстов. А если у людей разница больше — значит, поменялся именно человеческий вкус, а не только тексты.
Результат подтвердил гипотезу: вес "сложных редких слов" у людей упал с явно позитивного (+0,142) почти до нуля и даже в минус, а у застывшей модели остался на прежнем уровне (+0,08). Чтобы убедиться, что это не случайность, прогнали то же самое на 40 случайных бессмысленных списках слов — там эффекта не было, всё центрировалось около нуля. Неожиданный поворот: люди стали больше ценить разнообразие длины предложений — то, что ИИ-судья вообще не воспринимает как сигнал.
Ресурсы
Do Reviewers Still Reward Lexical Complexity? A Frozen-Rater Study of Preference Drift in 124K ICLR Reviews, Jiabin Zheng, Peking University. Данные — корпус GenReview (машинные рецензии ICLR).
