3,583 papers
arXiv:2608.15188 71 15 авг. 2026 г. PRO

Rubric качества тестов: как проверить, что AI-тест реально ловит баги, а не просто проходит для вида

КЛЮЧЕВАЯ СУТЬ
Обнаружено: тест может оставаться зелёным даже если сломать код, который он должен проверять — это называется «слабый оракул», и это самая частая проблема тестов вообще, не только у AI. Чек-лист из 7 критериев заставляет любую LLM мысленно «поломать» код и проверить, заметит ли тест разницу — без этого модель проверяет только синтаксис, а не логику. Метод даёт возможность прогнать через LLM любой тест — свой или сгенерированный AI — и понять, ловит ли он реальные баги или просто существует для вида. Кстати, по ходу исследование выяснило: тесты Claude AI на Django и Pandas оказались не хуже человеческих — старые пессимистичные выводы касались старых моделей.
Адаптировать под запрос
📋 Дайджест исследования

Контент доступен только для PRO подписчиков

Чтобы получить доступ к дайджесту этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Контент доступен только для PRO подписчиков

Чтобы получить доступ к концептам этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO
📖 Простыми словами

Контент доступен только для PRO подписчиков

Чтобы получить доступ к упрощённому объяснению этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с