3,583 papers
arXiv:2609.09973 73 9 сент. 2026 г. FREE

CapQuiz: проверка качества текста через тест с вопросами вместо сравнения с эталоном

КЛЮЧЕВАЯ СУТЬ
Обнаружено: модели-конспекты — законченные перестраховщики. Почти не врут, но легко теряют треть важного. GPT-4o в тесте: точность 78%, покрытие всего 67% — треть деталей пропущена, хотя ни одна не выдумана. Метод CapQuiz позволяет проверить качество любого конспекта или пересказа без эталонного текста для сравнения — вместо этого по оригиналу генерируются вопросы с вариантами ответа. Модель отвечает на них, читая только текст-кандидат — так одна размытая оценка «хорошо/плохо» раскладывается на десяток точных мини-тестов, которые отдельно ловят выдумку и отдельно пропуск.
Адаптировать под запрос

TL;DR

CapQuiz — метод проверки качества описания (текста, конспекта, пересказа) без эталонного текста для сравнения: вместо этого генерируются вопросы с вариантами ответов по оригинальному контенту, и проверяется, можно ли на них ответить, читая только текст-кандидат. Если ответ верный — текст передал деталь, если неверный — текст соврал, если "не знаю" — текст упустил деталь.

Главная находка: модели при описании контента ведут себя как перестраховщики. Они выдают точные, но неполные описания — боятся ошибиться и поэтому недосказывают. Например, GPT-4o в исследовании показал точность 78%, но покрытие всего 67% — почти треть важных деталей просто пропущена, хотя ни одна из указанных деталей не выдумана.

Суть метода: по оригиналу генерируются вопросы с 5 вариантами ответа (включая "правдоподобный, но неверный" вариант — hard negative) плюс дополнительная опция "нельзя определить". Модель отвечает на них, используя только текст-кандидат. Ответы делятся на три типа: верный (информация передана), неверный конкретный (галлюцинация), "нельзя определить" (пропуск). Из этого считаются две отдельные метрики — точность и полнота — и их гармоническое среднее.

🔬

Схема метода

ШАГ 1: Генерация вопросов по оригиналу → N вопросов, 5 вариантов + опция "нельзя определить"
        (в каждом вопросе минимум один hard negative — правдоподобный неверный вариант)
        [отдельный запрос, работает по оригинальному контенту]

ШАГ 2: Ответы на вопросы по тексту-кандидату → выбор варианта для каждого вопроса
        (модель отвечает, видя ТОЛЬКО текст-кандидат, не оригинал)
        [отдельный запрос]

ШАГ 3: Классификация ответов → верный / неверный конкретный / "нельзя определить"
        (можно сделать вручную или третьим запросом-сверкой)

ШАГ 4: Расчёт метрик → Точность = верные / (верные + неверные конкретные)
                        Полнота = верные / всего вопросов

🚀

Пример применения

Задача: Вы записали созвон с клиентом на 40 минут, попросили ИИ сделать конспект. Хочется проверить: не потерялись ли важные договорённости и не придумал ли ИИ то, чего не было.

Промпт (шаг 1 — генерация вопросов по расшифровке):

Вот полная расшифровка созвона:
{расшифровка}

Сгенерируй 10 вопросов с множественным выбором по ключевым фактам:
договорённости, цифры, сроки, кто за что отвечает.

Для каждого вопроса:
- 4 варианта ответа, один из них правильный
- 1 вариант — правдоподобный, но неверный (например, похожая цифра или дата)
- 6-й вариант всегда: "Невозможно определить"

Помечай правильный вариант звёздочкой в конце строки.

Промпт (шаг 2 — проверка конспекта):

Вот конспект встречи, который сделал ИИ:
{конспект}

Ответь на вопросы выше, используя ТОЛЬКО текст этого конспекта.
Не подглядывай в расшифровку. Если в конспекте нет ответа — выбирай "Невозможно определить".

Результат: вы получите список ответов на каждый вопрос. Сравнив со звёздочками из шага 1, вы увидите три группы: сколько деталей конспект передал верно, сколько потерял (ответ "невозможно определить"), и — что важнее — не придумал ли конспект что-то, чего не было (неверный конкретный ответ). Это даёт числовую картину: не просто "конспект хороший", а "70% деталей на месте, 20% потеряно, 10% выдумано".


🧠

Почему это работает

Если попросить модель напрямую оценить качество текста "от 1 до 10", она даёт размытую, часто завышенную оценку — LLM склонна хвалить любой связный текст, не проверяя факты построчно.

Зато модель хорошо справляется с узкой, конкретной задачей: ответить на вопрос с вариантами, опираясь строго на данный текст. Это проверяемая, бинарная по сути задача — модели проще быть точной в малом, чем честной в общем.

Метод раскладывает одну размытую оценку на много маленьких точных тестов. А разделение ошибок на "выдумал" и "забыл" даёт то, что общая оценка скрывает: два разных типа проблем требуют разных исправлений.

Рычаги управления: - Число вопросов → для быстрой проверки короткого текста хватит 5-7, для важного документа — 15-20. - Hard negatives (правдоподобные неверные варианты) → без них тест слишком лёгкий, модель угадывает; добавляйте похожие цифры/даты/имена. - Опция "нельзя определить" → убирайте, если вам не важно различать вранье и пропуск, оставляйте — если важно. - Домен → метод одинаково работает для конспектов встреч, пересказов статей, кратких изложений договоров, описаний товаров.


📋

Шаблон промпта

Шаг 1 — генерация вопросов:

Вот исходный текст:
{оригинал}

Сгенерируй {число} вопросов с множественным выбором по ключевым фактам этого текста
({что_проверяем — например, "цифры, сроки, договорённости, ответственные лица"}).

Для каждого вопроса:
- 4 варианта ответа, один правильный
- минимум 1 вариант — правдоподобный, но неверный
- дополнительный вариант: "Невозможно определить"

Помечай правильный ответ звёздочкой.

Шаг 2 — проверка кандидата:

Вот текст-кандидат, который нужно проверить:
{текст_кандидат}

Ответь на вопросы выше, используя ТОЛЬКО этот текст.
Если ответа нет — выбирай "Невозможно определить".

🚀 Быстрый старт — вставь в чат:

Вот шаблон проверки текста через вопросы с вариантами ответов (метод CapQuiz).
Адаптируй под мою задачу: {твоя задача — например, "проверить конспект встречи" 
или "проверить краткое изложение договора"}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какой у вас оригинал и какой текст-кандидат нужно проверить, а также сколько деталей критично важно не упустить — потому что от этого зависит число и сложность вопросов.


⚠️

Ограничения

⚠️ Трудоёмкость: метод требует двух отдельных запросов плюс сверку ответов — не подходит для мгновенной проверки на бегу, разумно применять для важных документов (договоры, протоколы встреч, медицинские выписки).

⚠️ Зависимость от качества вопросов: если модель на шаге 1 сгенерировала слабые или нечёткие вопросы — вся проверка теряет смысл. Для важных документов стоит бегло проверить вопросы глазами.

⚠️ Не для творческих текстов: метод создан для проверки фактов (кто, что, когда, сколько). Для оценки стиля, тона, убедительности текста он не подходит — там нет "правильного ответа".


🔍

Как исследовали

Исследователи собрали 1204 видео из 10 публичных датасетов, специально взяв только тестовые/отложенные части — чтобы модели не смогли "вспомнить" ответы из обучения. С помощью Gemini и GPT-4o сгенерировали почти 24 тысячи вопросов по 10 типам (от простого "кто это" до сложного "почему это произошло"), а затем живые люди проверили каждый вопрос на честность и сложность — согласие между разметчиками получилось очень высоким.

Дальше проверили десятки моделей (GPT-4o, GPT-5.2, Gemini, Qwen3-VL и другие): попросили описать видео, прогнали описания через QA-тест и сравнили итоговую оценку с оценками живых людей. Оказалось, что разложенная на вопросы оценка совпадает с человеческим мнением заметно точнее, чем когда модель-судья просто смотрит видео и текст и ставит балл напрямую.

Самое любопытное: почти у всех моделей точность выше полноты — они предпочитают недосказать, чем соврать. И разрыв между простыми и сложными вопросами (кто/что vs почему/как связано) у маленьких моделей втрое больше, чем у топовых — то есть распознавание объектов уже "решённая" задача, а вот причинно-следственные связи остаются слабым местом даже у сильных моделей.


📋 Дайджест исследования

Ключевая суть

Обнаружено: модели-конспекты — законченные перестраховщики. Почти не врут, но легко теряют треть важного. GPT-4o в тесте: точность 78%, покрытие всего 67% — треть деталей пропущена, хотя ни одна не выдумана. Метод CapQuiz позволяет проверить качество любого конспекта или пересказа без эталонного текста для сравнения — вместо этого по оригиналу генерируются вопросы с вариантами ответа. Модель отвечает на них, читая только текст-кандидат — так одна размытая оценка «хорошо/плохо» раскладывается на десяток точных мини-тестов, которые отдельно ловят выдумку и отдельно пропуск.

Принцип работы

Работает как экзамен с закрытой книгой — только книга это не оригинал, а текст-кандидат. Сначала по оригиналу составляют вопросы с hard negative — правдоподобным, но неверным вариантом. Без него модель просто угадывает. Потом модель отвечает, видя только текст-кандидат. Если ответа там нет — есть честный вариант «нельзя определить». Три типа ответа вместо одной мутной оценки — верный, неверный, «не знаю» — дают две отдельные метрики.

Почему работает

Попроси модель оценить текст от 1 до 10 — получишь размытую, часто завышенную оценку. LLM обожает хвалить любой связный текст, не проверяя факты построчно. А вот ответить на конкретный вопрос с вариантами, опираясь только на этот текст — узкая задача. Тут врать сложнее. Бинарный вопрос с вариантами невозможно долить водой — либо знаешь ответ, либо нет. Отсюда разделение: точность 78% и покрытие 67% у GPT-4o — это две разные болячки, и лечить их надо по-разному.

Когда применять

Проверка текстовых конспектов и пересказов → конкретно для протоколов встреч, кратких изложений договоров, описаний товаров, особенно когда важно точно знать какие детали потерялись или выдуманы, а не просто «звучит хорошо». Не подходит для оценки стиля, тона или убедительности текста — там нет правильного варианта ответа.

Мини-рецепт

1. Собери оригинал: расшифровка звонка, полный текст договора, статья — всё, что нужно проверить на потери.
2. Сгенерируй вопросы: попроси модель составить 10-15 вопросов с вариантами по оригиналу. Обязательно с hard negative — похожей, но неверной цифрой или датой, иначе модель будет угадывать.
3. Добавь спасательный круг: вариант «нельзя определить» в каждом вопросе — без него не отличишь вранье от пропуска.
4. Прогони текст-кандидат: дай модели тот же список вопросов, но покажи только текст-кандидат, без оригинала.
5. Посчитай две метрики: точность = верные / (верные + неверные), полнота = верные / все вопросы. Высокая точность при низкой полноте значит текст скромничает — не врёт, но недосказывает.

Примеры

[ПЛОХО] : Оцени качество этого конспекта от 1 до 10
[ХОРОШО] : Сгенерируй 10 вопросов с вариантами ответа по расшифровке звонка. Добавь в каждый правдоподобный неверный вариант и опцию "нельзя определить". Затем проверь конспект, используя только его текст — не подглядывай в расшифровку
Источник: Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering
ArXiv ID: 2609.09973 | Сгенерировано: 2026-09-10 04:26

Проблемы LLM

ПроблемаСутьКак обойти
Прямая оценка качества текста моделью размыта и завышенаПросишь оценить текст "от 1 до 10" или "насколько хорошо передана суть" — получаешь высокую расплывчатую оценку. Модель хвалит любой связный текст, не проверяя факты построчно. Непонятно, что конкретно упущено или искаженоЗамени общую оценку на серию вопросов с вариантами ответа по исходному материалу. Проверяй, можно ли ответить на них, читая только текст-кандидат. Так вместо одной размытой цифры получишь конкретный список: что передано верно, что потеряно, что выдумано

Методы

МетодСуть
Проверка через вопросы с вариантами — вместо сравнения с эталономПо оригинальному тексту сгенерируй вопросы с несколькими вариантами ответа. В каждый вопрос добавь: 1) правдоподобный, но неверный вариант ("hard negative" — похожая цифра, дата, имя), 2) вариант "нельзя определить". Затем попроси модель ответить на эти вопросы, показав ей ТОЛЬКО текст-кандидат (не оригинал). Классифицируй каждый ответ: верный, неверный конкретный (значит текст соврал), "нельзя определить" (значит текст пропустил деталь). Считай отдельно: точность = верные / (верные + неверные), полнота = верные / все вопросы. Почему работает: модели проще быть точной в узкой конкретной задаче (выбор из вариантов), чем честной в общей оценке. Разбивая один размытый вопрос "хорош ли текст" на много маленьких проверяемых, получаешь численную и разложенную по типам ошибок картину. Когда применять: любой текст с проверяемыми фактами — конспекты встреч, пересказы статей, краткие изложения договоров, описания товаров. Когда не работает: оценка стиля, тона, убедительности — там нет "правильного варианта"

Тезисы

ТезисКомментарий
При описании контента модели жертвуют полнотой ради точностиМодель боится добавить деталь, если не уверена в ней — лучше промолчать, чем ошибиться. Это создаёт устойчивый паттерн: высокая точность (мало выдумок), но заметные пробелы в охвате деталей — треть важной информации может быть просто пропущена. Применяй: если нужна полная выжимка, явно проси модель "включи все детали, даже если не уверена" или отдельно запроси "что могло быть упущено"
📖 Простыми словами

Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering

arXiv: 2609.09973

Когда ты просишь нейросеть оценить текст по шкале от 1 до 10, она тупо льстит. Модели обожают хвалить любую гладкую фигню, даже если в ней половина фактов выдумана. Метод CapQuiz ломает эту лафу: вместо абстрактных оценок он устраивает конспекту жесткий экзамен с вариантами ответов по оригинальному контенту.

Это как проверять, прочитал ли школьник «Войну и мир». Спросишь «как тебе роман?» — он двадцать минут будет красиво лить воду про духовные поиски. Дай ему тест с конкретными деталями — и он моментально посыплется: если выбрал не тот вариант, его сразу поймали на вранье.

Механика CapQuiz отсекает субъективщину и делит результат всего на три исхода. Модель читает выжимку и сдает тест: правильный ответ — факт сохранен, ошиблась — генератор нагаллюцинировал отсебятину, ответила «не знаю» — важный кусок просто выкинули. Никаких споров, на выходе только сухая точность фактов.

Авторы тестировали метод на видео, но принцип универсален. Скормил ИИ запись 40-минутного созвона с клиентом или сложный договор? Прогони через тест: если по готовому саммари нельзя ответить на вопросы о дедлайне и бюджете, твой ассистент выдал красивую пустышку.

Короче: забудь про промпты в стиле «оцени качество выжимки» — это чистый самообман. Нужен жесткий аудит — тестируй текст вопросами на факты. Либо по конспекту можно сдать экзамен, либо перед тобой бесполезный мусор, в котором потеряли суть.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с