3,583 papers
arXiv:2610.10906 75 7 окт. 2026 г. FREE

Over-imitation в LLM: модель копирует случайные привычки вместе с настоящим правилом

КЛЮЧЕВАЯ СУТЬ
Парадокс: чем лучше модель ловит настоящее правило сообщества, тем охотнее она копирует и случайный мусор. Метод позволяет писать для закрытых чатов и сообществ без явных правил так, чтобы посты не удаляли. Если просто скормить модели удачные примеры, она делает «похоже на них» и тащит чужие привычки вместе с правилом. Нужен отдельный шаг: сначала сравнить принятое с отклонённым и вывести правило, и только потом править черновик. Модель перестаёт подражать на глаз и начинает искать разницу. История без такой инструкции почти ничему её не учит, а два шага дают заметный рост. Но шум всё равно просачивается, поэтому гипотезу проверяет человек.
Адаптировать под запрос
⚡

TL;DR

Исследование показывает: если дать модели образцы «как здесь принято» (примеры, историю чата, прошлые ответы), она копирует всё подряд. Настоящее правило сообщества и случайные причуды отдельных авторов для неё сливаются в один паттерн. Это называется over-imitation (сверхподражание). Чем лучше модель следует настоящему правилу, тем больше она копирует и лишнее.

Вторая находка: просто память не учит неявным правилам. Агент, который видит историю прошлых взаимодействий, но не получает инструкции «найди скрытое правило», почти не выучивает его. Даже если за соблюдение правила полагается награда (доступ к рассуждениям других агентов). Если же добавить отдельный шаг «выведи правило из примеров, потом отредактируй ответ», результат заметно растёт.

Третья находка: даже когда модель правильно сформулировала правило словами, она всё равно тащит в ответ посторонние привычки. Явный штраф за ненужное копирование это не лечит. Авторы называют разрыв так: модели отлично подражают поведению, но не понимают, что из увиденного обязательно, а что случайно.

🔬

Схема метода

Исследователи проверяли четыре «нормативных модуля». Это дополнительные шаги, которые стоят между черновиком ответа и финальным ответом:

БАЗА (без модуля): память о прошлых дебатах → ответ
   ↓ почти не учится правилу

ШАГ 1 (Direct Edit): черновик + транскрипты других → «перепиши в их стиле»
ШАГ 2 (Infer + Edit): [а] из транскриптов выведи правило → [б] отредактируй черновик по правилу
ШАГ 3 (Contrastive): примеры «приняли» + примеры «отклонили» → в чём разница? → гипотеза правила → правка
ШАГ 4 (Theory of Mind): гипотеза о том, что знает каждый участник + что знаю я → самокритика → обновлённое правило → правка

Модуль может вызывать другую, более сильную модель. Шаги выполняются отдельными запросами.

🚀

Пример применения

Метод сильнее всего там, где правило неявное, а обратная связь молчаливая: никто не объясняет, что не так. Это знакомо по русским реалиям. В закрытом Telegram-клубе основателей модераторы молча удаляют одни посты, а другие собирают ответы. Никто не пишет правил.

Задача: Вы ведёте SMM для стартапа и хотите публиковаться в чате «Клуб основателей» так, чтобы посты не удаляли. Правил в закреплённом сообщении нет. Есть 6 постов, которые «зашли», и 4 удалённых. Все 6 принятых постов написаны одним человеком, у него ещё и привычка писать без заглавных. Её копировать не нужно.

Промпт:

Ты помогаешь мне опубликовать пост в закрытом Telegram-чате «Клуб основателей».
Правил в чате нет. Модераторы молча удаляют одни посты и оставляют другие.

ПРИНЯТЫЕ ПОСТЫ (получили ответы):
1. {пост_1}
2. {пост_2}
...

УДАЛЁННЫЕ ПОСТЫ:
1. {удалённый_1}
2. {удалённый_2}
...

Мой черновик:
{черновик}

Сделай в два этапа.

ЭТАП 1. Сравни принятые и удалённые посты. Выпиши признаки, которые есть у принятых
и отсутствуют у удалённых. Сформулируй гипотезу правила одним-двумя предложениями.

ЭТАП 2. Перепиши мой черновик так, чтобы он соответствовал выведенному правилу.
Покажи финальный текст.

Результат: Модель сначала выдаст список различий между двумя группами постов и формулировку гипотезы правила. Затем покажет переписанный пост. Вероятно, в гипотезу попадёт и случайная привычка того автора, например «без заглавных». Это ровно та слабость, которую нашли авторы. Поэтому гипотезу нужно проверить глазами, см. блок адаптации ниже.

🧠

Почему это работает

Слабость. Модель по умолчанию лучше всего делает одно: продолжает паттерн. Видя 10 удачных ответов, она воспроизводит их общую «манеру». Она не задаёт вопрос «за что именно это приняли?». История без инструкции «найди правило» остаётся просто контекстом.

Сильная сторона. Если явно попросить сравнить «приняли» и «отклонили» и сформулировать разницу, модель делает это неплохо. Контраст в примерах сужает поиск: видно не только «как делают», но и «как не надо». Авторы отмечают, что модули, которые смотрят на санкции (Contrastive, ToM), копируют лишнее чуть меньше.

Как метод обходит слабость. Он разводит два действия: сначала вывести правило, потом применить его. Но это лечит не всё. Модель всё равно смешивает норму с шумом, поэтому финальную гипотезу должен проверять человек.

Рычаги управления: - Число примеров. Больше «принятых» от разных авторов, и случайные привычки одного человека перестанут выглядеть правилом. - Отрицательные примеры. Добавь отклонённые, и модель увидит границу. - Разделение этапов. Пусть этап 1 отдаст гипотезу тебе на проверку, а этап 2 запускай отдельным сообщением. - Сильная модель для вывода правила. Авторы показали, что результат сильно зависит от модели в модуле.

📋

Шаблон промпта

Полные тексты промптов модулей авторы вынесли в приложение (§A.7), в предоставленном тексте их нет. Ниже реконструкция по описанию: Infer + Edit с контрастными примерами.


Ты — модуль выявления неписаных правил сообщества.



Сообщество: {описание_сообщества}
Санкция за нарушение: {что_происходит_при_нарушении}



{примеры_принятого}



{примеры_отклонённого}



{мой_черновик}



Stage_1_Infer:
  - Сравни PositiveExamples и NegativeExamples.
  - Выпиши признаки, которые есть у положительных и отсутствуют у отрицательных.
  - Сформулируй гипотезу правила: {число_предложений} предложения.

Stage_2_Edit:
  - Перепиши Draft так, чтобы он соответствовал гипотезе.
  - Верни финальный текст.



Гипотеза правила: ...
Финальный текст: ...

Что подставлять: {описание_сообщества} — где публикуетесь; {что_происходит_при_нарушении} — как проявляется санкция (удаление, молчание, бан); примеры — реальные посты или ответы; {число_предложений} — 1–2.

🚀 Быстрый старт — вставь в чат:

Вот шаблон «вывод неписаного правила и правка по нему». Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, где вы публикуетесь, какие у вас есть примеры «принятого» и «отклонённого» и как проявляется санкция. Эти данные нужны, чтобы модель могла сравнить две группы и вывести правило. Остальное она возьмёт из паттерна шаблона.

⚠️

Ограничения

⚠️ Модель копирует шум: даже с отдельным шагом вывода правила модель включает в гипотезу случайные привычки отдельных авторов. Явный штраф за ненужное подражание не помогает, как утверждают авторы.

⚠️ Нестабильность: результат сильно зависит от типа правила и от модели, которая стоит в модуле. Одни виды правил (вставить символ, заменить слово) модель ловит лучше, другие (структура текста, длина, риторические приёмы) хуже.

⚠️ Синтетические правила: авторы проверяли «глупые» правила (замена слова на выдуманное, смайлик в тексте). Настоящие нормы живых сообществ сложнее и размытее, перенос выводов на них не проверен.

⚠️ Слабая модель-новичок: в основных экспериментах «новичком» была небольшая модель, а сильные модели стояли в роли других агентов. Как поведут себя современные флагманы в роли новичка, показано только частично.

⚠️ Нет проверенного лекарства: авторы показали проблему, но способ её решить не предложили. «Явно пиши правила и отделяй их от примеров» — разумный совет, но в статье он не проверен.

🔍

Как исследовали

Авторы построили искусственное «сообщество» из LLM-агентов, которые вместе решают сложные вопросы MMLU-Pro. Двое «старожилов» (GPT-5-nano) делятся рассуждениями только с теми, кто соблюдает скрытое правило. Остальным они отвечают «No response.». Это имитация молчаливой санкции. Новичок (Gemma-3 4B) не знает правила. Выгода от его выучивания измерима: с рассуждениями старожилов он отвечает точнее.

Правил придумали 48. Они взяты из IFEval («напиши больше 400 слов», «поставь смайлик») и из «псевдословных» (замени «because» на «brimble»). Они намеренно глупые, чтобы модель не могла «вспомнить» их из обучения. Сравнивали базу «только память» с четырьмя нормативными модулями на нескольких моделях (GPT-5-nano, Qwen 3 8B и 32B, Gemma 4 31B, Claude Sonnet).

Главный результат: база без модуля почти не учится. Точность не поднимается выше 0.3, даже на флагманской модели. Чем лучше агент следует правилу, тем выше точность (корреляция 0.89 по 17 конфигурациям). Значит, стимул выучить правило реальный.

Затем добавили «шум»: старожилы стали иногда писать строчными буквами или ставить восклицательные знаки. Это личные привычки, за них не наказывают. Хороший ученик должен выучить только настоящее правило. Вместо этого чем лучше модель следует правилу, тем сильнее копирует шум (корреляция около 0.76). Часто шум копируется чаще, чем само правило. Даже когда в выведенном описании настоящее правило названо верно, шум в описание всё равно попадает. Дети в похожих экспериментах копируют избирательно, учитывая контекст, а модели нет.

💡

Адаптации и экстраполяции

🔧 Техника: добавить этап очистки гипотезы → меньше шума

После этапа 1 добавь проверку: «Для каждого признака из гипотезы укажи, сколько разных авторов его используют. Если один автор — пометь как личную привычку и исключи из правила». Это моя адаптация, в статье она не проверялась. Идея в том, чтобы дать модели явный критерий отличия нормы от шума: правило присуще группе, привычка — человеку.

🔧 Техника: убрать роль «сообщества» и просить разделить признаки на три группы

Попроси модель разделить признаки на «обязательные для всех», «встречаются у части авторов», «личная привычка одного». Правку делай только по первой группе.

Экстраполяция: файл инструкций агента. Если ты даёшь Claude Code или Cursor «образцовые файлы», чтобы он писал код «как у нас», добавь в CLAUDE.md пометку: «Обязательно: A, B. Случайно в примерах: C, D — не копируй». Статья показывает, что без такой пометки агент перенесёт и случайное.

🔗

Ресурсы

  • Reading the Room: Foundations, Design, and Challenges of Normative Competence in LLMs — Andrea Wynn, Harsh Satija, Seokhyun (Nathan) Baek, Anqi Liu, Eric Nalisnick, Gillian K. Hadfield. Johns Hopkins University, Vector Institute. Сайт первого автора: andreawynn.github.io.
  • Использованные основы: multi-agent debate (Du et al., 2023), IFEval (Zhou et al., 2023), MMLU-Pro (Wang et al., 2024b), Dynamic Cheatsheet (Suzgun et al., 2025), Hypothesis Search (Wang et al., 2024a), contrastive chain-of-thought (Chia et al., 2023).
  • Полные тексты промптов модулей — в приложениях A.7 и A.9 статьи (в предоставленном фрагменте не вошли).

📋 Дайджест исследования

Ключевая суть

Парадокс: чем лучше модель ловит настоящее правило сообщества, тем охотнее она копирует и случайный мусор. Метод позволяет писать для закрытых чатов и сообществ без явных правил так, чтобы посты не удаляли. Если просто скормить модели удачные примеры, она делает «похоже на них» и тащит чужие привычки вместе с правилом. Нужен отдельный шаг: сначала сравнить принятое с отклонённым и вывести правило, и только потом править черновик. Модель перестаёт подражать на глаз и начинает искать разницу. История без такой инструкции почти ничему её не учит, а два шага дают заметный рост. Но шум всё равно просачивается, поэтому гипотезу проверяет человек.

Принцип работы

Процесс из трёх ходов: примеры → гипотеза правила → правка черновика. Это как новичок в чужой компании. Если он молча повторяет за всеми, он перенимает и правила, и чужие странности. Если сначала спросит себя «за что одних хвалят, а других выгоняют?», он быстрее поймёт, что здесь обязательно. Модели нужен отдельный шаг «выведи правило» — просто память о прошлых примерах не учит. Авторы проверили четыре версии такого шага. Первая: «перепиши в их стиле». Вторая: «выведи правило, потом правь». Третья: «сравни принятое и отклонённое». Четвёртая: «прикинь, что знает каждый участник, и поправь гипотезу». Две последние копировали лишнее чуть меньше остальных.

Почему работает

Модель по привычке продолжает паттерн. Видит 10 удачных ответов и воспроизводит их общую манеру. Вопрос «за что именно это приняли?» она сама себе не задаёт. Отклонённые примеры показывают границу: видно не только «как делают», но и «как не надо». А разделение на два шага не даёт смешать поиск правила и написание текста. Даже когда модель правильно назвала правило словами, она всё равно тащит в ответ лишние привычки — подражать она умеет, а отличать обязательное от случайного нет. Явный запрет на ненужное копирование это не лечит. Поэтому человек должен вычеркнуть лишнее из гипотезы до правки.

Когда применять

Сообщества с молчаливой обратной связью → публикации в закрытых Telegram-клубах, где модераторы молча удаляют одни посты и оставляют другие, а закреплённых правил нет. Также подходит для стиля ответов в профессиональных чатах, где нормы никто не писал. Лучше всего работает, когда есть и принятые, и отклонённые примеры от разных авторов. НЕ подходит, если правила прописаны явно: тогда просто дай их модели. Также не подходит, когда примеров мало или все они от одного человека, и проверить гипотезу некому.

Мини-рецепт

1. Собери улики: 5–10 принятых постов и 3–5 удалённых. Чем больше разных авторов, тем меньше шанса принять чужую привычку за закон.
2. Опиши место: где публикуешься и как проявляется наказание (удаление, молчание, бан).
3. Разведи этапы: в этапе 1 проси сравнить группы, выписать признаки, которых нет у удалённых, и дать гипотезу в 1–2 предложениях.
4. Останови модель: пусть после этапа 1 она ждёт тебя и ничего не переписывает.
5. Проверь глазами: вычеркни из гипотезы случайные привычки одного автора. Например, письмо без заглавных или любимое словечко.
6. Запускай правку: отдельным сообщением, с очищенным правилом и черновиком.
7. Возьми модель посильнее для вывода правила. Результат сильно зависит от того, какая модель стоит на этом шаге.

Примеры

[ПЛОХО] : Вот 6 постов, которые зашли в чате основателей. Напиши мой пост в таком же стиле.
[ХОРОШО] : Вот 6 принятых и 4 удалённых поста из закрытого чата «Клуб основателей». Правил нет. ЭТАП 1: сравни две группы, выпиши признаки, которые есть у принятых и отсутствуют у удалённых, сформулируй правило в 1–2 предложениях. После этого остановись и жди меня. Ничего не переписывай. После ответа модели: Правило верное, кроме пункта про письмо без заглавных. Это привычка одного автора, выбрось его. ЭТАП 2: перепиши мой черновик по правилу и покажи финальный текст: {черновик}
Источник: Reading the Room: Foundations, Design, and Challenges of Normative Competence in LLMs
ArXiv ID: 2610.10906 | Сгенерировано: 2026-10-09 05:20

Проблемы LLM

ПроблемаСутьКак обойти
Модель копирует случайные привычки вместе с настоящим правиломДаёшь образцы «как принято»: удачные посты, письма, ответы. Модель повторяет всю их манеру целиком. Реальное правило и случайные причуды автора для неё сливаются. Пример: все образцы написаны одним человеком без заглавных букв. Модель решит, что это тоже требование. Чем точнее она ловит настоящее правило, тем больше тащит и лишнего. Даже если модель верно назвала правило словами, лишнее может остаться в тексте1) Бери образцы от разных авторов. Что повторяется у многих — правило. Что есть у одного — привычка. 2) Добавь отрицательные примеры: что отклонили или не приняли. 3) Пусть модель сначала выпишет гипотезу правила. Проверь её глазами и вычеркни случайное. 4) Только потом проси применить правило. Просьба «не копируй лишнее» сама по себе работает слабо

Методы

МетодСуть
Два шага: сначала вывести правило, потом применить — неявные нормыДля случая, когда правила нигде не записаны. Есть примеры «приняли» и «отклонили», нужно написать новое под эту норму. Шаг 1. Дай оба набора примеров. Попроси: «Выпиши признаки, которые есть у принятых и отсутствуют у отклонённых. Сформулируй правило в 1–2 предложениях». Шаг 2. Проверь гипотезу сам. Затем дай команду: «Перепиши черновик по этому правилу». Лучше отдельным сообщением. Почему работает: без прямой просьбы найти правило история примеров остаётся фоном, и модель просто продолжает манеру. Сравнение двух групп сужает поиск: видно не только «как делают», но и «как не надо». Разделение шагов даёт тебе точку контроля. Когда да: закрытые чаты, редполитика издания, стиль бренда, отзывы клиентов, код-ревью. Везде, где норму знают, но не пишут. Когда нет: правило уже записано (тогда просто дай его). Или образцов мало, или они все от одного автора. Тогда в гипотезу попадёт шум. Совет: для шага 1 бери самую сильную модель. Качество вывода правила сильно зависит от неё
📖 Простыми словами

Reading the Room: Foundations, Design, and Challenges of Normative Competence inLLMs

arXiv: 2610.10906

Модели плевать на социальный контекст — она тупо продолжает паттерн. Когда ты скармливаешь нейросети историю чата со словами "смотри, как тут принято", у неё сносит крышу. Для неё базовое правило этикета и случайная причуда автора имеют абсолютно одинаковый вес. В итоге возникает over-imitation или сверхподражание: модель слепо копирует всё подряд, вообще не врубаясь, за что именно текст одобрили, а за что снесли.

Это как наивный стажёр, который пришёл в пафосную консалтинговую фирму и пытается сойти за своего. Он видит, что топ-менеджер сидит в безупречном костюме, но ковыряет в зубах спичкой, и решает, что это и есть местный дресс-код. На следующий день стажёр гордо заваливается к клиенту со спичкой во рту. Формально повторил за старшим, а по факту — вылетел с позором. Модель лажает абсолютно так же.

Обычный промптинг здесь бессилен: чем точнее модель повторяет примеры, тем больше мусора она затягивает. Чтобы починить этот баг, авторы применили нормативные модули — специальные шаги-фильтры между черновиком ответа и финалом. Модель принудительно заставляют сделать паузу и ответить на вопрос: "по какому неписаному правилу здесь вообще общаются?". Только когда LLM сначала формулирует саму норму и сверяет черновик с ней, слепое обезьянничанье прекращается.

Эксперимент гоняли на сообществах, но принцип универсален. Это критично везде, где рулят неявные правила и молчаливый бан: от закрытых Telegram-клубов для фаундеров до переписок в корпоративном Slack. Никакого официального регламента там нет — админы просто удаляют посты без объяснения причин. Без нормативной прослойки твой AI-ассистент спалится на второй минуте, потому что скопирует дурацкую привычку местного флудера вместо адекватного тона.

Короче: хватит надеяться, что модель прочувствует атмосферу просто по истории сообщений. Без изолированного этапа рефлексии ты получишь не вежливого собеседника, а кривое зеркало чужих багов. Разделяй выжимку правил и генерацию текста. Иначе сетка продолжит радостно воспроизводить случайную херню, искренне принимая её за высший стандарт качества.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с