TL;DR
CapQuiz — метод проверки качества описания (текста, конспекта, пересказа) без эталонного текста для сравнения: вместо этого генерируются вопросы с вариантами ответов по оригинальному контенту, и проверяется, можно ли на них ответить, читая только текст-кандидат. Если ответ верный — текст передал деталь, если неверный — текст соврал, если "не знаю" — текст упустил деталь.
Главная находка: модели при описании контента ведут себя как перестраховщики. Они выдают точные, но неполные описания — боятся ошибиться и поэтому недосказывают. Например, GPT-4o в исследовании показал точность 78%, но покрытие всего 67% — почти треть важных деталей просто пропущена, хотя ни одна из указанных деталей не выдумана.
Суть метода: по оригиналу генерируются вопросы с 5 вариантами ответа (включая "правдоподобный, но неверный" вариант — hard negative) плюс дополнительная опция "нельзя определить". Модель отвечает на них, используя только текст-кандидат. Ответы делятся на три типа: верный (информация передана), неверный конкретный (галлюцинация), "нельзя определить" (пропуск). Из этого считаются две отдельные метрики — точность и полнота — и их гармоническое среднее.
Схема метода
ШАГ 1: Генерация вопросов по оригиналу → N вопросов, 5 вариантов + опция "нельзя определить"
(в каждом вопросе минимум один hard negative — правдоподобный неверный вариант)
[отдельный запрос, работает по оригинальному контенту]
ШАГ 2: Ответы на вопросы по тексту-кандидату → выбор варианта для каждого вопроса
(модель отвечает, видя ТОЛЬКО текст-кандидат, не оригинал)
[отдельный запрос]
ШАГ 3: Классификация ответов → верный / неверный конкретный / "нельзя определить"
(можно сделать вручную или третьим запросом-сверкой)
ШАГ 4: Расчёт метрик → Точность = верные / (верные + неверные конкретные)
Полнота = верные / всего вопросов
Пример применения
Задача: Вы записали созвон с клиентом на 40 минут, попросили ИИ сделать конспект. Хочется проверить: не потерялись ли важные договорённости и не придумал ли ИИ то, чего не было.
Промпт (шаг 1 — генерация вопросов по расшифровке):
Вот полная расшифровка созвона:
{расшифровка}
Сгенерируй 10 вопросов с множественным выбором по ключевым фактам:
договорённости, цифры, сроки, кто за что отвечает.
Для каждого вопроса:
- 4 варианта ответа, один из них правильный
- 1 вариант — правдоподобный, но неверный (например, похожая цифра или дата)
- 6-й вариант всегда: "Невозможно определить"
Помечай правильный вариант звёздочкой в конце строки.
Промпт (шаг 2 — проверка конспекта):
Вот конспект встречи, который сделал ИИ:
{конспект}
Ответь на вопросы выше, используя ТОЛЬКО текст этого конспекта.
Не подглядывай в расшифровку. Если в конспекте нет ответа — выбирай "Невозможно определить".
Результат: вы получите список ответов на каждый вопрос. Сравнив со звёздочками из шага 1, вы увидите три группы: сколько деталей конспект передал верно, сколько потерял (ответ "невозможно определить"), и — что важнее — не придумал ли конспект что-то, чего не было (неверный конкретный ответ). Это даёт числовую картину: не просто "конспект хороший", а "70% деталей на месте, 20% потеряно, 10% выдумано".
Почему это работает
Если попросить модель напрямую оценить качество текста "от 1 до 10", она даёт размытую, часто завышенную оценку — LLM склонна хвалить любой связный текст, не проверяя факты построчно.
Зато модель хорошо справляется с узкой, конкретной задачей: ответить на вопрос с вариантами, опираясь строго на данный текст. Это проверяемая, бинарная по сути задача — модели проще быть точной в малом, чем честной в общем.
Метод раскладывает одну размытую оценку на много маленьких точных тестов. А разделение ошибок на "выдумал" и "забыл" даёт то, что общая оценка скрывает: два разных типа проблем требуют разных исправлений.
Рычаги управления: - Число вопросов → для быстрой проверки короткого текста хватит 5-7, для важного документа — 15-20. - Hard negatives (правдоподобные неверные варианты) → без них тест слишком лёгкий, модель угадывает; добавляйте похожие цифры/даты/имена. - Опция "нельзя определить" → убирайте, если вам не важно различать вранье и пропуск, оставляйте — если важно. - Домен → метод одинаково работает для конспектов встреч, пересказов статей, кратких изложений договоров, описаний товаров.
Шаблон промпта
Шаг 1 — генерация вопросов:
Вот исходный текст:
{оригинал}
Сгенерируй {число} вопросов с множественным выбором по ключевым фактам этого текста
({что_проверяем — например, "цифры, сроки, договорённости, ответственные лица"}).
Для каждого вопроса:
- 4 варианта ответа, один правильный
- минимум 1 вариант — правдоподобный, но неверный
- дополнительный вариант: "Невозможно определить"
Помечай правильный ответ звёздочкой.
Шаг 2 — проверка кандидата:
Вот текст-кандидат, который нужно проверить:
{текст_кандидат}
Ответь на вопросы выше, используя ТОЛЬКО этот текст.
Если ответа нет — выбирай "Невозможно определить".
🚀 Быстрый старт — вставь в чат:
Вот шаблон проверки текста через вопросы с вариантами ответов (метод CapQuiz).
Адаптируй под мою задачу: {твоя задача — например, "проверить конспект встречи"
или "проверить краткое изложение договора"}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какой у вас оригинал и какой текст-кандидат нужно проверить, а также сколько деталей критично важно не упустить — потому что от этого зависит число и сложность вопросов.
Ограничения
⚠️ Трудоёмкость: метод требует двух отдельных запросов плюс сверку ответов — не подходит для мгновенной проверки на бегу, разумно применять для важных документов (договоры, протоколы встреч, медицинские выписки).
⚠️ Зависимость от качества вопросов: если модель на шаге 1 сгенерировала слабые или нечёткие вопросы — вся проверка теряет смысл. Для важных документов стоит бегло проверить вопросы глазами.
⚠️ Не для творческих текстов: метод создан для проверки фактов (кто, что, когда, сколько). Для оценки стиля, тона, убедительности текста он не подходит — там нет "правильного ответа".
Как исследовали
Исследователи собрали 1204 видео из 10 публичных датасетов, специально взяв только тестовые/отложенные части — чтобы модели не смогли "вспомнить" ответы из обучения. С помощью Gemini и GPT-4o сгенерировали почти 24 тысячи вопросов по 10 типам (от простого "кто это" до сложного "почему это произошло"), а затем живые люди проверили каждый вопрос на честность и сложность — согласие между разметчиками получилось очень высоким.
Дальше проверили десятки моделей (GPT-4o, GPT-5.2, Gemini, Qwen3-VL и другие): попросили описать видео, прогнали описания через QA-тест и сравнили итоговую оценку с оценками живых людей. Оказалось, что разложенная на вопросы оценка совпадает с человеческим мнением заметно точнее, чем когда модель-судья просто смотрит видео и текст и ставит балл напрямую.
Самое любопытное: почти у всех моделей точность выше полноты — они предпочитают недосказать, чем соврать. И разрыв между простыми и сложными вопросами (кто/что vs почему/как связано) у маленьких моделей втрое больше, чем у топовых — то есть распознавание объектов уже "решённая" задача, а вот причинно-следственные связи остаются слабым местом даже у сильных моделей.
