TL;DR
Файлы с правилами проекта — AGENTS.md, CLAUDE.md — которые автоматически подгружаются в память AI-агента при каждой сессии, не увеличивают процент успешно решённых задач. Ни постоянная загрузка всего файла, ни выборочное чтение по запросу не меняют результат — агент решает задачи одинаково хорошо (или плохо) с файлом и без него.
Причина неожиданная: агент проваливает задачи не потому что не знает правил проекта, а потому что не умеет спроектировать решение — выбрать правильный паттерн, точно состыковать код с существующей архитектурой, учесть скрытый эджкейс. Исследователи проверили это отдельно: даже когда агент был в одном шаге от успеха (1-4 несданных теста из многих), настоящий качественный файл с правилами проекта никогда не превращал "почти получилось" в "получилось" — ни на одном из двух протестированных агентов.
Вывод простой: если ошибка модели — это пробел в умении, а не в знании фактов, то заваливать её ещё большим количеством инструкций и правил бессмысленно. Помогает другое — конкретный пример правильного решения и разбивка задачи на маленькие шаги, где сложность архитектурного выбора не отдаётся модели целиком.
Схема исследования
Тестировали 3 способа подать контекст агенту на одной и той же задаче:
СТРАТЕГИЯ 1 (NONE) — файла с правилами нет вообще → агент работает "с нуля"
СТРАТЕГИЯ 2 (ALWAYS ON) — весь файл правил вставляется в промпт каждый раз
СТРАТЕГИЯ 3 (SELECTIVE) — правила разбиты на темы, агент читает нужный кусок сам, когда решит, что он нужен
Каждую задачу прогоняли 3 раза на двух разных ИИ-агентах (Claude Code и Codex), результат проверяли скрытыми тестами — агент не видел, по каким критериям его оценят.
Пример применения
Задача: Вы настраиваете кастомные инструкции в Claude Projects для регулярной генерации отчётов по продажам в фирменном стиле компании. Написали подробный документ: "используй такую структуру, такой тон, такие обозначения метрик, не используй канцелярит" — и всё равно каждый третий отчёт получается не тем, что нужно: не так посчитана динамика, перепутаны разделы.
Промпт (то, что НЕ работает так, как ожидалось):
[Система]: Вот правила оформления отчётов компании: [длинный список правил на 2 страницы]
Составь отчёт по продажам за октябрь на основе данных: {данные}
Что вместо этого стоит попробовать:
Вот пример отчёта, который сделан ПРАВИЛЬНО (с нужной структурой и тоном):
{готовый пример отчёта}
Составь отчёт за октябрь по той же структуре и стилю, на основе этих данных:
{данные}
Сначала выпиши, какие разделы и цифры будут в отчёте — я проверю план,
потом пиши финальный текст.
Результат: Модель получит не абстрактное правило "как надо", а конкретный образец для копирования паттерна — это ближе к тому, в чём модель действительно сильна. Разбивка на "план → проверка → финальный текст" убирает ситуацию, когда модели приходится самой додумывать архитектуру решения за один шаг, где чаще всего и происходит ошибка.
Почему это работает
Языковая модель плохо придумывает архитектуру решения с нуля по абстрактным инструкциям — здесь она чаще ошибается не потому, что не знает нужный факт, а потому что не может правильно "спроектировать" правильную последовательность действий. Добавление ещё одного правила в инструкцию не лечит эту проблему — правило остаётся таким же абстрактным, как и предыдущие.
Зато модель хорошо копирует паттерн из конкретного примера. Показать готовое решение похожей задачи — это не про знания, а про имитацию структуры, а это модели удаётся куда лучше, чем самостоятельное проектирование.
Рычаг управления: если замечаете, что модель раз за разом ошибается в одном месте (структура, логика, стыковка частей) — не дописывайте ещё одно правило в system prompt. Замените абстрактное правило на конкретный пример правильного результата. Если задача сложная — разбейте её на этапы с промежуточной проверкой, вместо того чтобы отдавать модели всё сразу.
Ограничения
⚠️ Домен исследования: проверяли на автономных coding-агентах (Claude Code, Codex CLI), работающих с Python-репозиториями. В обычном диалоговом чате механика может отличаться — там нет "рабочей директории", которую агент читает сам.
⚠️ Не проверяли task-specific контекст: исследовали только общие файлы-гайды (стиль кода, архитектурные принципы). Возможно, узкоспециализированный контекст — конкретные примеры кода нужного паттерна — работает иначе. Именно это и советуют авторы вместо общих правил.
⚠️ Слабая статистическая мощность: задач было немного (15-17), поэтому исследование гарантированно не заметило бы эффект меньше 10-15 процентных пунктов. Небольшой позитивный эффект от контекстных файлов теоретически мог остаться незамеченным.
Как исследовали
Исследователь взял 3 настоящих репозитория с реальными файлами правил (пакетный менеджер, облачный SDK, компилятор) и 17 задач, вытащенных из реальных слитых pull request — то есть с настоящими тестами, которые агент никогда не видел. Каждую задачу прогнали 3 раза на двух разных агентах (Claude Code и Codex) под тремя стратегиями подачи контекста — итого 288 оценённых прогонов.
Самое интересное — "проверка на живучесть эффекта": исследователи специально отобрали задачи-пограничники, которые агент решает то так, то так (не 0% и не 100% успеха) — именно там манипуляция с контекстом теоретически должна проявиться сильнее всего. Даже там контекст не помог.
Отдельно проверили: а вдруг файл правил просто "не читается" моделью и поэтому эффекта нет? Взяли задачи, где агент был буквально в одном шаге от успеха, и подсунули настоящий файл правил высокого качества. Ни разу это не превратило провал в успех — значит, дело не в том, что контекст "не сработал технически", а в том, что он решает не ту проблему, которая мешает агенту.
Любопытная деталь: одна и та же задача может быть легкой для Claude и трудной для Codex, и наоборот (корреляция сложности между агентами всего 0.75) — это объясняет, почему предыдущие исследования на разных агентах приходили к противоположным выводам: они просто ловили разные модели в разных "зонах сложности".
Ресурсы
Prakhar Khatri, независимый исследователь. "Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories". Код, данные и анализ опубликованы автором в открытом доступе.
