3,583 papers
arXiv:2608.08453 77 9 авг. 2026 г. FREE

Чек-лист живучести AI-инструкций: почему 92% файлов-навыков не работают за пределами своего чата

КЛЮЧЕВАЯ СУТЬ
92 из 100 файлов-навыков для AI-агентов ломаются при переносе в другой чат — и почти всегда виновата не сама инструкция, а её ярлык. Чек-лист из 7 пунктов позволяет проверить любую инструкцию или промпт на переносимость перед тем, как отдать её команде или засунуть в Custom GPT. Фишка в том, что агент вообще не читает тело инструкции при выборе — он смотрит только на короткое описание в 1-2 строки. Если там нет ответа на что делает и когда применять — инструкция просто не всплывёт, даже если внутри золото.
Адаптировать под запрос

TL;DR

Большинство файлов-инструкций (Agent Skills — текстовые файлы, которые ИИ-агент подгружает, чтобы повторно применять готовую процедуру в разных задачах) работают только там, где их написали — в одном чате, репозитории или задаче. Исследователи проверили 138 тысяч таких файлов по 31 критерию и нашли: почти каждый (92%) содержит хотя бы один дефект, который мешает использовать его где-то ещё.

Самая частая проблема — слабое описание навыка. Агент решает, загружать инструкцию или нет, глядя только на короткое описание (пара строк). Оно должно чётко отвечать на два вопроса: что делает и когда использовать. У больше половины файлов описание либо не объясняет "когда", либо вообще не работает как триггер — и агент просто не находит нужную инструкцию, даже если её содержимое отличное.

Вывод простой: чтобы инструкция реально переживала перенос в другой чат, другому человеку или на другую платформу, её нужно проверить по семи направлениям: чёткое описание-триггер, компактное тело без мусора (истории правок, TODO, install-заметок), без захардкоженных путей/секретов/имён моделей, без переопределения роли агента.


🔬

Схема метода

Это не пошаговая техника, а диагностический чек-лист из 7 категорий — можно применять к любой инструкции, которую хочешь переиспользовать:

1. МАРШРУТИЗАЦИЯ → описание чётко говорит ЧТО делает и КОГДА использовать (не слишком коротко, не слишком длинно, без воды)
2. ТЕЛО ИНСТРУКЦИИ → компактно, без очевидных объяснений, без дублирования названия как заголовка
3. ОРГАНИЗАЦИЯ РЕСУРСОВ → не заваливай инлайн-кодом и примерами, выноси в отдельные блоки
4. ЗАПРЕЩЁННЫЙ КОНТЕНТ → убери install-инструкции, changelog, лицензии, TODO/FIXME
5. БЕЗОПАСНОСТЬ ПОВЕДЕНИЯ → без хардкода паролей/ключей, без опасных команд, без путей к твоим локальным файлам
6. ПЕРЕНОСИМОСТЬ → без привязки к конкретной модели, платформе, ОС
7. РОЛЬ И ГРАНИЦЫ → не переопределяй личность/роль ассистента без необходимости

🚀

Пример применения

Задача: Ты сделал в Claude Project или Custom GPT инструкцию «Проверка коммерческого предложения перед отправкой клиенту» и хочешь, чтобы её использовала вся команда в разных чатах — не только ты.

Промпт:

Вот инструкция, которую я хочу сделать переиспользуемой командой:

{текст_инструкции}

Проверь её по чек-листу и найди проблемы:
1. Есть ли в начале чёткое описание (1-2 предложения): что она делает и КОГДА её нужно применять? Без этого коллеги не поймут, когда её включать.
2. Не раздута ли она лишними пояснениями, историей правок, заметками "как я это придумал"?
3. Есть ли в тексте мои личные пути к файлам, конкретные названия сервисов/моделей, которые сузят её до моего окружения?
4. Не переопределяет ли инструкция роль ассистента ("теперь ты — юрист X") без явной необходимости — это может конфликтовать с другими задачами в том же чате?

Перепиши инструкцию с исправлениями, сохранив суть.

Результат: Модель разберёт инструкцию по каждому пункту — укажет, например, что описание слишком общее и не говорит "когда" её включать, или что в тексте зашит путь к твоей папке на компьютере. Потом выдаст переписанную компактную версию, готовую к передаче другим людям.


🧠

Почему это работает

Когда агент решает, какую инструкцию подгрузить, он не читает весь текст — только короткое описание-заголовок. Если оно расплывчатое, агент физически не может понять, для какой ситуации инструкция подходит, и пропускает её — даже если содержимое хорошее.

При этом LLM отлично считывает явные, конкретные триггеры: "что делает" + "когда использовать" в паре строк работает как ярлык на файле. Модель не гадает — она сопоставляет описание с задачей напрямую.

Метод переносит фокус с "что написать внутри инструкции" на "как её подписать снаружи". Хорошее описание-триггер решает проблему выбора раньше, чем содержимое самой инструкции успевает сыграть роль.

Рычаги управления: - Длина описания — слишком короткое (нет контекста) или слишком длинное (модель не считывает суть) одинаково вредны - Явные триггерные слова ("используй когда...", "нужен для...") — резко повышают шанс, что инструкцию найдут - Удаление истории правок, install-заметок — экономит контекст и не путает модель "рабочими" инструкциями - Удаление конкретных путей/имён моделей — единственный способ сделать инструкцию переносимой между чатами и платформами


📋

Шаблон промпта

Вот моя инструкция/промпт, который я хочу использовать многократно в разных чатах:

{текст_инструкции}

Проверь её как диагност и найди проблемы по этим направлениям:
1. МАРШРУТИЗАЦИЯ: есть ли чёткое описание (что делает + когда применять) в 1-3 предложениях?
2. РАЗДУТОСТЬ: нет ли лишних пояснений, истории правок, заметок для себя?
3. ЖЁСТКАЯ ПРИВЯЗКА: нет ли личных путей к файлам, имён конкретных сервисов/моделей, которые сузят применимость?
4. РОЛЬ: не переопределяет ли инструкция роль ассистента без необходимости, не конфликтует ли с другими задачами?

Для каждого пункта: ✅ если ок, ⚠️ с объяснением если проблема.
Затем перепиши инструкцию с исправлениями.

Подставь свою инструкцию, промпт, шаблон Custom GPT или Claude Project — что угодно, что планируешь использовать больше одного раза.

🚀 Быстрый старт — вставь в чат:

Вот шаблон чек-листа переиспользуемости инструкций. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, для какой платформы или контекста инструкция будет использоваться (Custom GPT, Claude Project, командный документ) — потому что это влияет на то, какие ограничения (переносимость, роль) критичны, а какие нет.


⚠️

Ограничения

⚠️ Не генерирует контент, только диагностирует: метод не пишет инструкцию с нуля — он находит проблемы в готовой и помогает почистить её.

⚠️ Работает для reusable-артефактов, не для разовых промптов: если ты пишешь промпт для одной задачи в одном чате — чек-лист избыточен. Ценность появляется, когда инструкцию будут использовать другие люди или в других чатах.

⚠️ Прямые доказательства есть только для описания-триггера: исследователи напрямую замерили, что плохое описание снижает шанс найти инструкцию. Для остальных пунктов чек-листа (раздутость, безопасность) влияние показано только косвенно — через прошлые исследования и жалобы пользователей, не через отдельный тест.


🔍

Как исследовали

Команда собрала 138 133 файла SKILL.md из 20 556 публичных репозиториев — через поиск по GitHub, клонирование репозиториев и API реестра навыков. Дальше построили таксономию дефектов в три захода: сначала выписали все требования из официальной спецификации, потом вручную разметили 300 файлов на реальные проблемы, которые в спецификации не прописаны (захардкоженные пароли, переопределение роли), и наконец сверили список с 761 реальной жалобой пользователей на GitHub — чтобы убедиться, что каждая категория дефекта реально кому-то мешала.

Самое интересное — тест на "находимость": исследователи построили поисковый индекс по описаниям 20 000 навыков и проверили, находит ли агент нужный файл по запросу. Навыки с чистым описанием находились с вероятностью 88,5%, с дефектным описанием — только 82,6%. Разница не гигантская, но стабильная и показывает: плохое описание в буквальном смысле "прячет" хорошую инструкцию от агента.

Удивительно, что доминируют не экзотические угрозы (инъекции, взломы), а банальная небрежность в оформлении — треть всех навыков вообще не объясняет, когда их применять.


🔗

Ресурсы

What Keeps Agent Skills from Being Reusable? Evidence from 138K SKILL.md Files — Chi Zhang, Xinze Chen (CUNY Graduate Center), Yimin Liu (Ohio State University), Ping Ji (Hunter College, CUNY). Ссылки на связанные работы: SkillsBench, SkillReducer, agnix linter, официальная спецификация Agent Skills.


📋 Дайджест исследования

Ключевая суть

92 из 100 файлов-навыков для AI-агентов ломаются при переносе в другой чат — и почти всегда виновата не сама инструкция, а её ярлык. Чек-лист из 7 пунктов позволяет проверить любую инструкцию или промпт на переносимость перед тем, как отдать её команде или засунуть в Custom GPT. Фишка в том, что агент вообще не читает тело инструкции при выборе — он смотрит только на короткое описание в 1-2 строки. Если там нет ответа на что делает и когда применять — инструкция просто не всплывёт, даже если внутри золото.

Принцип работы

Правило простое: инструкция должна пройти 7 фильтров, чтобы выжить вне родного чата — описание-триггер, компактное тело, вынесенные ресурсы, отсутствие мусора (changelog, TODO), отсутствие хардкода путей и секретов, независимость от конкретной модели, и роль ассистента без лишних переопределений. Описание работает как ярлык на файле в шкафу — если на ярлыке написано что-то расплывчатое, никто не будет открывать папку, чтобы проверить содержимое.

Почему работает

Причина проста и немного обидна: агент не читает весь текст инструкции при выборе, только описание. Если оно не говорит явно что и когда — модель физически не сопоставляет задачу с инструкцией и пропускает её мимо. Явные фразы типа «используй когда...» резко повышают шанс, что инструкцию найдут — это не магия, а прямое совпадение слов в описании и в запросе пользователя. При этом слишком длинное описание вредит так же, как слишком короткое — модель теряет суть в воде.

Когда применять

Работа с командными шаблонами → конкретно для инструкций в Custom GPT, Claude Project или общих документах, которые будут использовать другие люди или в других чатах. Особенно важно, когда инструкцию писал один человек, а пользоваться ей будут десятки. НЕ подходит для разового промпта в одном чате — там чек-лист избыточен, ценность появляется только при повторном использовании.

Мини-рецепт

1. Проверь ярлык: есть ли в начале 1-3 предложения с чётким «что делает» + «когда применять»?
2. Найди мусор: история правок, install-заметки, TODO/FIXME — всё это выкидываем, оно только жрёт контекст.
3. Ищи привязки: личные пути к файлам, имена конкретных моделей или сервисов — сузят инструкцию до твоего окружения.
4. Проверь роль: не переопределяет ли инструкция личность ассистента без необходимости — это может конфликтовать с другими задачами в том же чате.
5. Перепиши: отдай модели инструкцию с этими 4 пунктами и попроси выдать компактную версию, готовую к передаче другим людям.

Примеры

[ПЛОХО] : Вот файл: анализирует резюме кандидатов и даёт рекомендации. (без указания когда применять, агент просто пропустит файл мимо)
[ХОРОШО] : Проверка резюме перед собеседованием. Используй когда: нужно оценить soft skills кандидата по 5 критериям перед звонком с HR. Не используй для: технических тестов и код-ревью.
Источник: What Keeps Agent Skills from Being Reusable? Evidence from 138K SKILL.md Files
ArXiv ID: 2608.08453 | Сгенерировано: 2026-08-11 05:39

Проблемы LLM

ПроблемаСутьКак обойти
Слабое описание убивает навык — хорошую инструкцию просто не находятАгент решает подключать инструкцию или нет по короткому описанию. Всё содержимое сразу он не читает. Если описание не говорит прямо "когда это применять" — агент не поймёт для какой задачи это подходит. Пропустит инструкцию, даже если внутри всё отлично написано. Это касается любой системы с выбором из списка: подключаемые навыки, инструменты в function calling, промпты-персоны, поиск по базе знанийПиши описание в 1-3 предложения по формуле: что делает + когда использовать. Добавляй явные фразы-триггеры: "используй когда...", "нужен для...". Не делай описание слишком коротким (нет контекста для выбора) и не слишком длинным (модель не считывает главное)

Методы

МетодСуть
Формула описания-триггера — "что делает + когда"В начале любой переиспользуемой инструкции пиши короткое описание из двух частей. Что: делает X. Когда: применяй для Y. Работает потому что при выборе среди нескольких вариантов агент сопоставляет описание с текущей задачей напрямую, не вчитываясь в тело инструкции. Явные фразы-триггеры резко повышают шанс что агент подберёт нужный вариант из списка. Применяй для: файлов-навыков, описаний инструментов, системных промптов среди нескольких персон, метаданных для поиска. Не нужно если: инструкция единственная и выбирать не из чего
📖 Простыми словами

What KeepsAgentSkills from Being Reusable? Evidence from 138K SKILL.md Files

arXiv: 2608.08453

Суть проблемы в том, что Agent Skills — те самые инструкции, которые должны превращать ИИ в универсального солдата — на деле оказываются одноразовым мусором. ИИ-агенты не умеют «переиспользовать» опыт, потому что 92% таких файлов написаны криво. Проблема в самой архитектуре: агент не вчитывается в суть, он сканирует метаданные и заголовки, чтобы понять, подходит ли инструмент под задачу. Если описание мутное, агент просто проходит мимо, даже если внутри лежит гениальный алгоритм.

Это как если бы ты собрал идеальный набор инструментов, но сложил их в одинаковые серые коробки без надписей. Вроде всё есть, а найти ничего нельзя. В итоге ты каждый раз идешь покупать новый молоток, потому что не помнишь, в каком ящике лежит старый. Исследование 138 тысяч файлов показало, что мы плодим цифровой хлам, который работает только в том чате, где его создали, и дохнет при попытке переноса.

Чтобы инструкция не превратилась в тыкву, нужно прогнать её через диагностический чек-лист. Главное правило: четкое позиционирование. Если ты делаешь навык для проверки коммерческих предложений, заголовок должен орать об этом, а не мямлить про «анализ текста». Работают конкретные триггеры, понятные форматы ввода-вывода и отсутствие привязки к локальному контексту — если в инструкции есть фраза «как мы обсуждали выше», она официально профнепригодна для повторного использования.

Тестировали это на огромном массиве данных из SKILL.md, но принцип применим к любому «промпт-инжинирингу» для командной работы. Будь то Custom GPT, инструкции для Claude Projects или сложные цепочки в LangChain — везде одна и та же беда. Если навык не автономен и не описан как товар на полке магазина, он бесполезен для масштабирования. SEO для агентов становится важнее, чем само содержание кода или текста.

Короче: хватит писать инструкции «для себя» в потоке сознания — пиши их как независимые модули. Если в файле есть хотя бы один косяк из списка исследователей, вероятность того, что агент его подцепит в новой задаче, стремится к нулю. Либо ты делаешь структурированные навыки, либо твой ИИ-агент навсегда останется склеротиком, который каждый раз изобретает велосипед с нуля.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с