3,583 papers
arXiv:2609.08475 73 8 сент. 2026 г. FREE

Устаревший вкус ИИ-судьи: LLM продолжает ценить вычурные слова, хотя люди уже перестали

КЛЮЧЕВАЯ СУТЬ
Парадокс: живые рецензенты давно перестали цениться вычурные слова — их вес в оценке обвалился до нуля. А ИИ-судья, если его не переучивать, до сих пор щедро накидывает баллы за заумную лексику, как в 2018-м. Находка позволяет поймать это скрытое предубеждение ИИ-оценщика и подправить промпт так, чтобы итоговая оценка была ближе к живому человеческому вкусу, а не к застывшим критериям модели. Модель тащит за собой старую формулу: сложные слова = усилие автора = хороший текст — сигнал, который обесценился с приходом генеративных нейросетей, но модель этого не знает. Люди же переключились на другой признак — разнообразие длины предложений — а его ИИ-судья вообще не замечает.
Адаптировать под запрос

TL;DR

Если попросить ИИ оценить чужой текст — эссе, резюме, коммерческое предложение — модель может завышать оценку за вычурные, "умные" слова, даже если это не признак качества. Исследователи сравнили, как один и тот же "замороженный" ИИ-рецензент (не переобученный, с одним и тем же промптом) и живые люди оценивали научные тексты с 2018 по 2025 год.

Раньше сложная лексика была признаком, что автор долго работал над текстом — значит, стоило потратить время на осмысленность. Теперь любой генерирует заумный текст одним промптом за секунду, и люди перестали воспринимать сложные слова как сигнал качества — их "вес" в оценке упал с явно позитивного до нуля. А вот ИИ-судья, если его не переучивать заново, продолжает вознаграждать сложную лексику по старым правилам — как будто дорогая работа автора, хотя это больше ничего не стоит.

Интереснее другое: люди переключились на признак, который ИИ вообще не замечает — разнообразие длины предложений (то короткое, рубленое, то длинное, развёрнутое — живой стиль). Значит, если хочешь получить оценку текста, близкую к человеческому вкусу, — нужно явно указать модели, на что смотреть, а не доверять её "внутреннему чувству стиля".


🔬

Схема метода

Это не техника, а находка про предубеждение LLM-судей. Практическое применение — коррекция промпта для оценки текста:

БЕЗ коррекции: "Оцени качество текста" → модель ассоциирует сложные слова с качеством (устаревший критерий)
С коррекцией: явно указать критерии → модель оценивает по структуре, не по вычурности словаря

🚀

Пример применения

Задача: Ты просишь ChatGPT оценить сопроводительное письмо кандидата на вакансию или коммерческое предложение перед отправкой клиенту.

Промпт:

Оцени качество этого текста для менеджера по найму.

Важно: не считай сложные и редкие слова признаком качества сами по себе. 
Сейчас такой текст легко сгенерировать нейросетью за секунду — 
это больше не показатель усердия или глубины мысли.

Оцени по критериям:
1. Разнообразие длины предложений (смесь коротких и длинных — признак живого, а не шаблонного текста)
2. Ясность и конкретность мысли
3. Не является ли сложная терминология искусственным "надуванием" текста

Текст: {текст}

Результат: Модель даст структурированную оценку по трём критериям вместо общей оценки "хорошо/плохо написано". Ты увидишь, не завышена ли оценка за счёт вычурных слов, и получишь более честный взгляд, ближе к тому, как текст воспримет живой человек.


🧠

Почему это работает

LLM, когда её просят оценить "качество текста", неосознанно тянет за собой старую ассоциацию: сложные слова = усилие автора = хороший текст. Это устаревший сигнал — раньше он и правда что-то значил, потому что писать заумно было дорого по времени. Сейчас это стоит один промпт, и сигнал обесценился, но модель этого "не знает" — если её не переучивать под новые данные.

Сильная сторона LLM — она отлично выполняет явные, конкретные инструкции. Если просто сказать "оцени качество" — она использует свои внутренние (и устаревшие) критерии красоты текста. Если явно расписать, на что смотреть, модель это выполнит.

Рычаг управления: замени общий запрос "оцени качество" на список конкретных критериев — это works как прямая инъекция актуального человеческого вкуса вместо устаревшего вкуса модели.


📋

Шаблон промпта

Оцени текст {текст} для аудитории {аудитория}.

Не считай сложную терминологию и редкие слова признаком качества — 
сейчас такой текст легко сгенерировать, и сложность лексики 
не означает глубину мысли.

Оцени по критериям:
1. Разнообразие длины предложений — есть ли живой ритм (короткие и длинные фразы), 
   или текст монотонный
2. Ясность и конкретность каждой мысли
3. Соответствует ли сложность слов сути, или это искусственное усложнение

Дай оценку по каждому пункту и итоговый вывод: {что нужно решить — 
взять кандидата/отправить клиенту/опубликовать}

Что подставлять: {текст} — то, что оцениваешь; {аудитория} — кто читатель (заказчик, HR, редактор); последний плейсхолдер — конкретное решение, которое зависит от оценки.

🚀 Быстрый старт — вставь в чат:

Вот шаблон для честной оценки текста без предубеждения к "умным словам". 
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какой текст оценивать и для какой аудитории — потому что без этого критерии "разнообразие предложений" и "ясность мысли" нельзя применить конкретно.


⚠️

Ограничения

⚠️ Это находка, не готовая техника. Она показывает предубеждение, а не даёт протестированный метод его исправления — коррекция промпта выше это разумная экстраполяция автора саммари, не то, что проверяли исследователи.

⚠️ Домен исследования — научные рецензии, не резюме и не коммерческие тексты. Перенос вывода на другие типы текстов логичен, но не проверен напрямую.

⚠️ Эффект статистически значим, но не огромный на уровне одного текста. Речь о сдвиге в среднем по тысячам оценок, а не о резком провале конкретной вычурной фразы.


🔍

Как исследовали

Исследователи взяли 32 638 заявок на топовую конференцию по ИИ (ICLR) за 2018–2025 годы. У каждой заявки — реальные отзывы людей-рецензентов (124 615 штук) и отзывы от одной и той же ИИ-модели с одним и тем же промптом, сгенерированные все сразу, в одном коротком окне времени (февраль–апрель 2025).

Идея простая: если "судья" не менялся, а тексты за 8 лет изменились — то разница в оценках между годами у ИИ отражает только изменение текстов. А если у людей разница больше — значит, поменялся именно человеческий вкус, а не только тексты.

Результат подтвердил гипотезу: вес "сложных редких слов" у людей упал с явно позитивного (+0,142) почти до нуля и даже в минус, а у застывшей модели остался на прежнем уровне (+0,08). Чтобы убедиться, что это не случайность, прогнали то же самое на 40 случайных бессмысленных списках слов — там эффекта не было, всё центрировалось около нуля. Неожиданный поворот: люди стали больше ценить разнообразие длины предложений — то, что ИИ-судья вообще не воспринимает как сигнал.


🔗

Ресурсы

Do Reviewers Still Reward Lexical Complexity? A Frozen-Rater Study of Preference Drift in 124K ICLR Reviews, Jiabin Zheng, Peking University. Данные — корпус GenReview (машинные рецензии ICLR).


📋 Дайджест исследования

Ключевая суть

Парадокс: живые рецензенты давно перестали цениться вычурные слова — их вес в оценке обвалился до нуля. А ИИ-судья, если его не переучивать, до сих пор щедро накидывает баллы за заумную лексику, как в 2018-м. Находка позволяет поймать это скрытое предубеждение ИИ-оценщика и подправить промпт так, чтобы итоговая оценка была ближе к живому человеческому вкусу, а не к застывшим критериям модели. Модель тащит за собой старую формулу: сложные слова = усилие автора = хороший текст — сигнал, который обесценился с приходом генеративных нейросетей, но модель этого не знает. Люди же переключились на другой признак — разнообразие длины предложений — а его ИИ-судья вообще не замечает.

Принцип работы

Правило простое: не спрашивай модель 'оцени качество текста' — она достанет из памяти старые критерии красоты. Замороженный судья сам себе вкус не обновляет, ему нужно прямо сказать, на что смотреть. Явные критерии в промпте работают как инъекция актуального человеческого вкуса вместо устаревшего вкуса модели.

Почему работает

Раньше вычурный текст стоил дорого — время и усилия автора, и это было сигналом глубины мысли. Теперь такой текст пишется одним промптом за секунду, и сигнал обесценился. Жесть — за 7 лет наблюдений (2018-2025) вес сложных слов у людей упал с явно позитивного до нуля. Модель же не в курсе — её никто не переучивал под новую реальность генерируемого текста.

Когда применять

Оценка текста через ИИ → сопроводительные письма, резюме, коммерческие предложения, особенно когда автор мог написать текст нейросетью за секунду. НЕ подходит как прямая замена метода — вывод сделан на научных рецензиях (124 тысячи отзывов ICLR), перенос на другие типы текстов логичен, но не проверен напрямую.

Мини-рецепт

1. Замени общий запрос: вместо "оцени качество текста" дай список из 2-3 конкретных критериев.
2. Явно исключи вычурность: напиши прямо — "не считай сложные и редкие слова признаком качества, сейчас такой текст легко сгенерировать".
3. Добавь человеческий критерий: попроси оценить разнообразие длины предложений — то, что модель сама не заметит.
4. Привяжи к решению: попроси финальный вывод под конкретную задачу — взять кандидата, отправить клиенту, опубликовать.

Примеры

[ПЛОХО] : Оцени качество этого сопроводительного письма кандидата
[ХОРОШО] : Оцени письмо по критериям: 1) разнообразие длины предложений (короткие и длинные фразы вперемешку — признак живого текста) 2) ясность и конкретность мысли 3) не искусственно ли усложнена терминология. Важно: не считай редкие и сложные слова признаком качества сами по себе — сейчас такой текст легко сгенерировать нейросетью
Источник: Do Reviewers Still Reward Lexical Complexity? A Frozen-Rater Study of Preference Drift in 124K ICLR Reviews
ArXiv ID: 2609.08475 | Сгенерировано: 2026-09-09 06:22

Проблемы LLM

ПроблемаСутьКак обойти
Судья-модель ценит вычурные слова как признак качестваПросишь оценить текст. Модель выше оценивает тексты со сложной, редкой лексикой. Раньше это было оправдано — заумный текст требовал усилий автора. Теперь любой генерирует такой текст одним запросом, но модель этого "не знает" и продолжает считать сложность признаком глубины мыслиЯвно напиши в запросе: "не считай сложные слова признаком качества". Дай конкретные критерии оценки вместо общего "оцени качество"
Модель не замечает разнообразие ритма текстаЖивой текст — это смесь коротких и длинных предложений. Люди ценят такой ритм как признак не-шаблонности. Модель это игнорирует при оценке, если её не попросить явноДобавь в критерии оценки пункт "разнообразие длины предложений — есть ли живой ритм или текст монотонный"

Методы

МетодСуть
Явные критерии вместо "оцени качество"Замени общий запрос на список конкретных пунктов: разнообразие длины предложений, ясность мысли, не является ли сложная лексика искусственным "надуванием". Оцени по критериям: 1) ... 2) ... 3) ... Работает потому что модель хорошо выполняет конкретные инструкции, но при их отсутствии подставляет свои внутренние (и часто устаревшие) представления о "хорошем тексте". Применяй: для любой оценки текста — резюме, письма, эссе, коммерческого предложения. Не работает: если критерии качества для твоей задачи сами неочевидны и их сложно сформулировать явно
📖 Простыми словами

Do Reviewers Still Reward Lexical Complexity? A Frozen-Rater Study of Preference Drift in 124K ICLR Reviews

arXiv: 2609.08475

Нейросети оценивают тексты с глупым системным багом: они путают вычурные слова с реальным качеством. В обучающих данных модели усвоили шаблон: если автор заворачивает лексическую сложность и сыплет терминами — значит, он проделал огромную работу. Раньше сложный язык был дорогим сигналом, но сегодня нейросеть генерирует любую заумь за секунду, а LLM-судьи всё ещё ведутся на эту мишуру и завышают баллы за словесный мусор.

Это как замшелый профессор, который ставит пятёрку за реферат просто потому, что вставил слово «детерминированность». Формально звучит солидно, но внутри — полная пустышка. Для непроинструктированного ИИ кандидат, выкативший простыню умных терминов, всегда выглядит привлекательнее профи, показавшего конкретный результат в двух предложениях.

Учёные прогнали 124 тысячи рецензий ICLR через замороженную языковую модель и наглядно доказали этот дрейф предпочтений. ИИ-оценщики упорно вознаграждают текст за лексическую сложность, полностью игнорируя тот факт, что заумные фразы давно обесценились. Единственный способ заставить модель судить объективно — напрямую вбивать в промпт штрафы за канцелярит и псевдонаучный пафос.

Тестировали на академических статьях, но грабли те же самые в любом бизнесе. Просишь ChatGPT оценить отклики на вакансию, коммерческое предложение или лендинг конкурента — модель забракует простой и ёмкий оффер и похвалит напыщенную кашу, сгенерированную другим ботом. Без чётких рамок ИИ судит ИИ по устаревшим правилам, выкашивая нормальный человеческий язык.

Короче: перестал работать дефолтный промпт «оцени качество текста». Если используешь нейросеть как рекрутера, редактора или критика, явно прописывай запрет на заумь и требуй наказывать за «умничание». Иначе ты выберешь не лучший проект, а того, кто просто нажал кнопку «сделай профессиональнее», и забудешь, что ясность мысли всегда бьёт словарный запас.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с