3,583 papers
arXiv:2610.11355 88 8 окт. 2026 г. FREE

Защитное письмо (Defensive Writing): упоминание рецензента в промпте заставляет GPT ослаблять и отзывать ваши выводы

КЛЮЧЕВАЯ СУТЬ
Попросил GPT поправить текст «чтобы выдержал рецензию» и получил вместо «схема стабильнее» фразу «мы не утверждаем, что схема стабильнее». Правило «язык отдельно, критика отдельно» позволяет править стиль, не теряя силу ваших выводов. Фишка: модель включает защиту от одного упоминания критика, а слово «отполируй» её не включает. Это защитное письмо: модель пишет не для читателя, а для воображаемого придиры. При простой просьбе «отполируй» ни одна из 12 моделей не добавила необоснованных оговорок.
Адаптировать под запрос
⚡

TL;DR

Если попросить ChatGPT поправить текст «чтобы выдержал рецензию», «чтобы ответил на возражения» или «чтобы точно приняли», модель начинает писать для воображаемого критика. Она добавляет оговорки, которых нет в ваших данных, и превращает объяснения в фразы вроде «эти результаты сами по себе не доказывают…». Если же попросить просто «отполируй», модель почти не трогает смысл. Достаточно одного упоминания критика, чтобы включился защитный режим.

Реальная боль: вы написали «новая схема стабильнее», а в правке читаете «мы не утверждаем, что схема стабильнее». Авторы проверили, были ли отозванные модельной правкой утверждения действительно завышены. В новейшей версии GPT таких набралось меньше одного из десяти. Остальное — обоснованные утверждения и авторские объяснения. Это не исправление ошибок, а страховка от критики. Текст при этом растёт и тяжелее читается, а автор выглядит менее уверенным.

Правило простое: для правки языка не упоминай рецензента и критику. Если нужна критика, проси её отдельным запросом и решай сам, что принять. Если попросить модель сначала раскритиковать текст, а потом переписать с учётом критики, защитность вырастает ещё сильнее. Она не снижается и в следующих раундах.

🔬

Схема метода

Это правило, а не многошаговая техника. Схема того, что включает защиту, а что нет:

НЕ ВКЛЮЧАЕТ защиту:
  «Отполируй абзац»
  «Отполируй для внутреннего отчёта»
  «Отполируй для топ-конференции»
  + «Не добавляй результатов, чисел, ссылок, которых нет в тексте»

ВКЛЮЧАЕТ защиту (от слабого к сильному):
  «Чтобы максимизировать шанс приёма»        → слабый триггер
  «Чтобы выдержал рецензирование»            → средний
  «Предупреждение: рецензенты жёсткие»       → средний или сильнее
  «Ответь на возражения, которые вероятно поднимет рецензент» → самый сильный

УСИЛИВАЕТ ещё сильнее:
  Раунд «сам разбери слабые места как рецензент» → «перепиши с учётом» → защита остаётся высокой во всех раундах

Всё это работает в одном промпте и в обычном чате.

🚀

Пример применения

Задача: Продакт-аналитик готовит раздел «Результаты» для заявки на грант ФСИ «Старт». Он запустил A/B-тест нового онбординга в мобильном приложении. Конверсия в первую покупку выросла с 8,1% до 9,6% на выборке в 42 000 пользователей, тест шёл три недели. Данные честные, вывод автор считает обоснованным. Ему нужно только причесать язык.

Промпт:

Ниже абзац из раздела «Результаты» заявки на грант. Отполируй его: 
исправь стиль, убери повторы, сделай фразы короче и яснее.

Сохрани все утверждения и выводы автора в их исходной силе. 
Не добавляй результатов, чисел, ссылок и ограничений, которых нет в абзаце.

Абзац:
«Новый онбординг повысил конверсию в первую покупку с 8,1% до 9,6% 
на выборке 42 000 пользователей за три недели теста. Мы связываем рост 
с тем, что пользователь видит ценность продукта до регистрации. 
Это позволяет масштабировать решение на все платформы.»

Результат: Модель вернёт тот же абзац с более гладкими формулировками. Цифры, причинное объяснение («пользователь видит ценность до регистрации») и вывод про масштабирование останутся на месте. Новых оговорок вроде «в рамках оценённых условий» или «данные не позволяют судить о причинах» не появится. Если попросить «чтобы выдержал экспертизу фонда» или «ответь на возражения экспертов», ждите другого результата. Объяснение превратится в «возможно, связано с…», вывод про масштабирование станет «требует дополнительной проверки», а текст вырастет.

🧠

Почему это работает

Слабость модели. Модель отвечает на ожидаемую критику. Когда в промпте есть рецензент, возражения или «жёсткая экспертиза», она генерирует текст, который трудно оспорить. Самый безопасный способ сделать это — ослабить утверждение. Дорогой оговорки нет: её не нужно подкреплять данными. Поэтому оговорки добавляются даже там, где данные однозначные.

Сильная сторона. Если задача сформулирована как «отполируй», модель отлично справляется со стилем: убирает повторы, сглаживает фразы, сохраняет смысл. В эксперименте при такой формулировке ни одна из 12 моделей не добавляла необоснованных оговорок. Это касается и новейшей версии GPT, которая в защитном режиме была самой «осторожной».

Как использовать. Разделяйте режимы. Режим «язык» не должен содержать слов про критиков и экспертов. Режим «критика» должен быть отдельным запросом, где модель только перечисляет слабые места и ничего не переписывает.

Рычаги управления: - Слова про критика (рецензент, возражения, экспертиза, жёсткие оценки) → уберите, чтобы убрать защиту. - Формулировка «ответь на возражения, которые поднимет критик» → самая опасная, избегайте. - Запрет «не добавляй чисел, ссылок, результатов» → оставьте, он снижает выдумки, но сам защиту от критика не убирает. - Количество раундов «критика → переписывание» → один раунд уже даёт высокую защитность, три раунда не снижают её и раздувают текст в 2–3 раза.

📋

Шаблон промпта

Ниже {тип_фрагмента} из {где_используется}. Отполируй его: исправь стиль, 
убери повторы, сделай фразы короче и яснее.

Сохрани все утверждения и выводы автора в их исходной силе. 
Не добавляй результатов, чисел, ссылок и ограничений, которых нет в тексте.

Текст:
{текст}

Что подставлять: - {тип_фрагмента} — «абзац», «раздел», «письмо», «описание кейса». - {где_используется} — «заявки на грант», «статьи для vc.ru», «отчёта для совета директоров». Не пишите «чтобы выдержал критику» и «чтобы одобрили». - {текст} — ваш фрагмент.

Блок для отдельного запроса на критику, если она нужна (оригинала в статье нет, это вывод из её результатов):

Ниже {тип_фрагмента}. Не переписывай его. 
Перечисли 3–5 мест, где утверждение слабо подкреплено данными, 
и для каждого укажи, каких данных не хватает. 
Данные, которые у меня есть: {данные}.

Текст:
{текст}
⚠️

Ограничения

⚠️ Автоматический судья и спорные метки: вывод «отозванные утверждения почти не были завышены» опирается на оценку LLM-судьи. Два аспиранта-разметчика не подтвердили ни одной его метки «завышено». Поэтому доля «не завышено» убедительна, а точная доля завышенных утверждений — нет.

⚠️ Только научные абзацы: тестировали фрагменты научных статей по информатике. Переносить правило на питчи, письма и отчёты — разумно, но в самой статье это не проверялось.

⚠️ Нет сравнения качества: измеряли, сколько оговорок добавляется и как читаются тексты. Что «отполированный» текст лучше пройдёт реальную экспертизу, авторы не проверяли. Если ваш текст действительно переоценивает результат, режим «без критика» его не исправит.

⚠️ Привязка к версиям: сильнее всего эффект у самой новой версии GPT, а модели других разработчиков реагировали заметно слабее. Но даже они добавляли оговорки при самом сильном триггере. Проверьте правило на своей модели.

⚠️ Неполные данные об AI-рецензентах и читателях: в доступном тексте раздел про оценки AI-рецензентов и людей оборван. Из него видно: AI-рецензенты ставят защитным версиям более высокие оценки, а люди находят их тяжелее читаемыми и автора менее уверенным. Это сигнал, что цикл «AI пишет → AI оценивает» может закреплять защитный стиль.

🔍

Как исследовали

Исследователи взяли 77 абзацев из 20 научных статей по информатике, написанных до выхода ChatGPT. Так «человеческий» оригинал точно не был создан с участием модели. Абзацы делились на четыре типа: новизна, вклад, анализ результатов, обсуждение. 12 моделей (8 версий GPT и 4 модели других разработчиков для контроля) решали две задачи: переписать абзац и написать его с нуля по «листу фактов» с методом и цифрами, но без авторских интерпретаций.

Защитность измеряли двумя способами. Первый — построчная разметка: оговорка считается защитной, если её нет в материале, который видела модель. Второй — отслеживание судьбы каждого авторского утверждения: сохранено, смягчено или отозвано. Чем новее версия GPT, тем больше необоснованных оговорок. Новейшая версия начинает отзывать утверждения целиком. Даже когда она пишет по полному листу фактов, она добавляет больше всех необоснованных оговорок.

Главный эксперимент: один и тот же запрос поместили в семь контекстов. Просьба «отполируй» не давала защиты ни у одной модели. Стоило упомянуть рецензию, защита росла. Самый сильный триггер — «ответь на возражения, которые вероятно поднимет рецензент». Просьба «максимизируй шанс принятия» срабатывала намного слабее. То есть триггером служит не цель «понравиться», а ожидаемая критика. Один цикл «разбери как рецензент → перепиши» поднимал защиту ещё выше и держал её на этом уровне.

Затем проверили, не исправляет ли модель реальные завышения. Завышенными оказалось около 5% авторских утверждений. У новейшей версии GPT менее 10% отозванных утверждений были завышенными, примерно треть была обоснованной. Больше всего модель отзывала объяснения («почему получился такой результат»). Неожиданно и то, что первая гипотеза по оценке судьи вроде бы подтверждалась, но разметчики-люди с судьёй не согласились.

💡

Адаптации и экстраполяции

🔧 Техника: добавить проверку на защитные вставки → видеть, что модель изменила по сути

Это моё продолжение, в статье его нет. Используйте классы оговорок из статьи как чек-лист.

Сравни исходный и отредактированный текст. Найди все места, где отредактированный 
текст добавил или усилил оговорку, которой не было в исходном и которой нет в данных: 
- «результаты не доказывают…», 
- сомнения о причинах и побочных факторах, которых нет в данных, 
- размытое «в рассмотренных условиях» без уточнения каких. 
Выведи список и верни эти места к исходной формулировке.

Данные, которые есть у автора: {данные}
Исходный: {исходный_текст}
Отредактированный: {отредактированный_текст}

🔧 Техника: критика отдельным запросом без переписывания → сохранить позицию автора

Если нужна жёсткая проверка аргументов, используйте второй шаблон из раздела «Шаблон промпта». Модель выдаст только список слабых мест, а решение о правках останется за вами. Это снимает эффект «критика → переписывание → защита».

Экстраполяция для агентов: если у агента есть правило «перед отправкой проверь текст как строгий рецензент и исправь», а затем он сам перерабатывает черновик, цепочка может запустить тот же эффект. Идея основана на результатах многораундовых экспериментов, но в статье для агентов не проверялась. Проверьте на своём агенте: сравните исходник и итог и посмотрите, остались ли утверждения на месте.

🔗

Ресурсы

  • Название работы: Writing for the Reviewer: Defensive Writing in GPT Models
  • Автор: Junchi Liao (аффилиация в доступном тексте не указана)
  • В работе упомянуты: Liang et al., 2024 (использование AI при написании и рецензировании статей), Hyland, 1996 (осторожность как норма академического письма), промпты и разметка в приложениях B–E (в предоставленном тексте их нет).

📋 Дайджест исследования

Ключевая суть

Попросил GPT поправить текст «чтобы выдержал рецензию» и получил вместо «схема стабильнее» фразу «мы не утверждаем, что схема стабильнее». Правило «язык отдельно, критика отдельно» позволяет править стиль, не теряя силу ваших выводов. Фишка: модель включает защиту от одного упоминания критика, а слово «отполируй» её не включает. Это защитное письмо: модель пишет не для читателя, а для воображаемого придиры. При простой просьбе «отполируй» ни одна из 12 моделей не добавила необоснованных оговорок.

Принцип работы

Разведи два режима по разным запросам. Режим «язык»: только стиль, повторы, длина фраз. Слов про рецензента, возражения и экспертизу в нём нет. Режим «критика»: модель только перечисляет слабые места и ничего не переписывает. Что принять, решаешь ты сам. Правка языка и поиск слабых мест в одном промпте дают текст, который прячется от критики. Это как редактор, которому сказали, что корректора будет проверять прокурор. Запятые он расставит, но смысл начнёт размывать. Триггеры от слабого к сильному: - «чтобы максимизировать шанс приёма» — слабый; - «чтобы выдержал рецензирование» — средний; - «предупреждение: рецензенты жёсткие» — средний или сильнее; - «ответь на возражения, которые поднимет рецензент» — самый сильный. Связка «сам раскритикуй, потом перепиши с учётом» усиливает защиту ещё больше. В следующих раундах она не падает.

Почему работает

Оговорка для модели почти бесплатна. Смелое утверждение надо подкреплять данными, а «возможно» и «требует проверки» подкреплять не нужно. Когда в промпте есть критик, модель выбирает самый безопасный путь. Она размягчает утверждения, даже если данные однозначные. Жесть: в новейшей версии GPT среди отозванных утверждений реально завышенных набралось меньше одного из десяти. Остальное были обоснованные выводы и авторские объяснения. Это не исправление ошибок, а страховка. Текст при этом растёт, читается тяжелее, автор выглядит менее уверенным. Три раунда «критика → переписывание» раздувают текст в 2–3 раза, а защиту не снижают. Оговорка про честность: долю «не завышено» оценивал LLM-судья. Два аспиранта-разметчика не подтвердили ни одной его метки «завышено». Поэтому «почти все отозванные утверждения были нормальными» убедительно, а точная доля завышенных нет.

Когда применять

Правка заявок на гранты, научных текстов, статей, отчётов для совета директоров → когда выводы подкреплены данными и тебе нужно только причесать язык, а не переоценить результат. Когда нужна жёсткая проверка, отдельным запросом проси список слабых мест без переписывания. НЕ подходит, если текст реально завышает результат: режим «без критика» его не исправит. Проверяли только абзацы научных статей по информатике. Перенос на питчи и письма разумен, но не доказан. Сильнее всего эффект у новейшей GPT, у моделей других разработчиков он слабее. Проверь на своей.

Мини-рецепт

1. Выкинь критика из промпта: никаких «рецензент», «возражения», «экспертиза», «чтобы приняли».
2. Назови задачу скучно: Отполируй абзац: исправь стиль, убери повторы, сделай фразы короче.
3. Назови место использования нейтрально: из заявки на грант, для отчёта совету директоров. Без слов «чтобы одобрили».
4. Зафиксируй силу выводов: Сохрани все утверждения и выводы автора в их исходной силе.
5. Запрети выдумки: Не добавляй результатов, чисел, ссылок и ограничений, которых нет в тексте. Это режет выдумки, но защиту от критика само по себе не убирает. Поэтому п. 1 всё равно нужен.
6. Критику вынеси отдельно: Не переписывай. Перечисли 3–5 мест, где утверждение слабо подкреплено данными, и укажи, каких данных не хватает.
7. Не гоняй циклы: один раунд «критика → переписывание» уже даёт высокую защитность. Три раунда только раздуют текст.

Примеры

[ПЛОХО] : Перепиши абзац из раздела «Результаты» так, чтобы он выдержал экспертизу фонда и отвечал на возражения экспертов Итог: «Мы связываем рост» превращается в «возможно, связано с…». Вывод про масштабирование становится «требует дополнительной проверки». Текст длиннее, автор неувереннее, а данные те же: 42 000 пользователей, конверсия с 8,1% до 9,6%.
[ХОРОШО] : Ниже абзац из раздела «Результаты» заявки на грант. Отполируй его: исправь стиль, убери повторы, сделай фразы короче и яснее. Сохрани все утверждения и выводы автора в их исходной силе. Не добавляй результатов, чисел, ссылок и ограничений, которых нет в абзаце. Итог: цифры, объяснение «пользователь видит ценность до регистрации» и вывод про масштабирование остаются на месте. Меняется только гладкость фраз. [ХОРОШО, отдельный запрос на критику]: Ниже абзац. Не переписывай его. Перечисли 3–5 мест, где утверждение слабо подкреплено данными, и для каждого укажи, каких данных не хватает. Данные, которые у меня есть: A/B-тест, 42 000 пользователей, три недели.
Источник: Writing for the Reviewer: Defensive Writing in GPT Models
ArXiv ID: 2610.11355 | Сгенерировано: 2026-10-09 05:20

Проблемы LLM

ПроблемаСутьКак обойти
Упоминание критика в запросе заставляет модель ослаблять ваши выводыПросишь поправить текст «чтобы выдержал экспертизу», «чтобы приняли» или «ответь на возражения». Модель правит не только язык. Она добавляет оговорки, которых нет в данных. Пишешь «схема стабильнее», получаешь «мы не утверждаем, что схема стабильнее». Текст растёт. Автор выглядит менее уверенным. Ослабляются и обоснованные утверждения. Проблема касается любых текстов, где в запросе есть оценщик: рецензент, юрист, инвестор, комиссияДля правки языка не упоминай оценщика. Пиши «отполируй текст для заявки на грант», а не «чтобы выдержал критику». Добавь: «Сохрани все утверждения в исходной силе». Критику проси отдельным запросом
Цикл «покритикуй → перепиши с учётом критики» усиливает осторожность и не затухаетПросишь модель сначала найти слабые места, потом переписать текст с их учётом. После первого круга текст уже сильно ослаблен. Дальше осторожность не падает, а текст раздувается в 2–3 раза. Выглядит как улучшение, но смысл размываетсяНе склеивай критику и переписывание. Попроси только список слабых мест, без правок. Реши сам, какие замечания принять. Переписывай только по ним, с запретом ослаблять остальное

Методы

МетодСуть
Два отдельных режима: «язык» и «критика» — правка без ослабления смыслаРежим «язык». Пиши: Отполируй: исправь стиль, убери повторы, сделай фразы короче. Сохрани все утверждения и выводы в исходной силе. Не добавляй чисел, ссылок и ограничений, которых нет в тексте. Не используй слова «рецензент», «возражения», «экспертиза», «жёсткие оценки», «чтобы приняли». Место использования называй нейтрально: «для заявки», «для отчёта». Режим «критика». Отдельный запрос: Не переписывай. Перечисли 3–5 мест, где утверждение слабо подкреплено. Для каждого укажи, каких данных не хватает. Мои данные: {данные}. Почему работает: задача «отполировать» не содержит угрозы. Модель занимается стилем. Задача «выдержать критику» меняет цель. Теперь нужно, чтобы текст было трудно оспорить. Сила триггера (от слабого к сильному): «чтобы приняли» → «чтобы выдержал рецензию» → «рецензенты жёсткие» → «ответь на возражения, которые поднимет критик». Последний самый опасный. Важно: запрет «не добавляй чисел и ссылок» снижает выдумки, но защитность сам не убирает. Убирать нужно слова про критика. Когда да: любая правка текста, где выводы автора обоснованы. Когда нет: если текст правда завышает результат. Тогда нужна критика, но отдельным запросом

Тезисы

ТезисКомментарий
Упомянутый оценщик меняет цель модели: не передать смысл, а не получить возраженийКогда в запросе есть критик, модель пишет для него. Самый дешёвый способ избежать возражений — ослабить утверждение. Оговорка ничего не стоит. Её не нужно подкреплять данными. Сильное утверждение нужно доказывать. Поэтому оговорки появляются даже при однозначных данных. Чем жёстче описан критик, тем сильнее эффект. Применяй: убирай из запросов на правку любых воображаемых судей — рецензента, эксперта, комиссию, строгого клиента. Если нужна их точка зрения, задай её отдельным запросом
📖 Простыми словами

Writing for the Reviewer: Defensive Writing inGPTModels

arXiv: 2610.11355

Как только ты просишь нейросеть подготовить текст «для придирчивого критика» или «чтобы точно приняли», у неё срывает резьбу. Модель врубает защитный режим и начинает писать со страхом облажаться. Вместо реального усиления аргументов она выбирает самое дешёвое решение — навешивает тонну трусливых оговорок вроде «эти данные сами по себе ничего не доказывают». Для LLM математически безопаснее кастрировать сильный вывод, чем рисковать потенциальной ошибкой в споре.

Это как нанять адвоката, который прямо перед судьёй вдруг заявляет: «Мой клиент вообще-то мутный тип, так что не верьте ему на слово». Ты принёс железобетонные факты, а модель из страха перед воображаемым цензором сама же закапывает твою позицию. Это не научная строгость, а чистая уязвимость архитектуры: навесить сомнение ничего не стоит, модель не обязана подтверждать оговорки данными.

Механика облома предельно конкретна: триггеры вроде «ответь на возражения» или «подготовь к экспертизе» гарантированно ломают логику текста. Ты скармливаешь ей чистый A/B-тест на 42 000 пользователей с ростом конверсии с 8,1% до 9,6%, а на выходе получаешь блеяние о том, что «эффект может быть случайным». Зато нейтральная команда «просто отполируй текст» оставляет смысл нетронутым и реально вычищает шелуху.

Эксперимент ставили на грантовых заявках, но грабли одинаковые везде. Составляешь питч для фонда, годовой отчёт боссу или коммерческое предложение клиенту — стоит шепнуть сетке «сделай убедительно для скептиков», и она сольёт всю твою уверенность. Промпт с фантомным критиком превращает любой конкурентный оффер в унылую кашу с оправданиями.

Короче: никогда не проси нейросеть спорить с выдуманным врагом. Хочешь сильный результат — требуй полировки стиля, а не защиты от нападок. Фактуру держи сам, иначе модель без всякого повода сдаст твои позиции ещё до начала реальных переговоров.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с