3,583 papers
arXiv:2610.10506 77 7 окт. 2026 г. FREE

Тесты валидности из экономики: как проверить советы LLM, когда правильного ответа нет

КЛЮЧЕВАЯ СУТЬ
Одна модель ответила «Да, платить» в 600 прогонах из 600. И за $20 в год, и за $3000 для семьи с доходом $75 000. Метод позволяет проверять советы LLM там, где нет эталонного ответа: платить или нет, брать тариф или нет. Фишка: не сверяй ответ с правдой, сверяй его с логикой. Меняешь в вопросе одну вещь (цену, объём, доход) и смотришь, куда сдвинулся ответ. Это тест валидности. Если цена выросла, а доля «да» не упала, модели нельзя доверять в этой задаче.
Адаптировать под запрос
⚡

TL;DR

Идея из экономики опросов: если нельзя сверить ответ с правдой, сверяй его с логикой. Меняешь в вопросе то, что должно влиять на ответ (цену, объём, доход), и смотришь, двигается ли ответ в нужную сторону. Заодно ловишь то, что не должно влиять, и проверяешь, не меняется ли ответ от пустяков. Авторы применили это к LLM-советнику, который решает за семью «платить или нет».

Главная находка: часть моделей вообще не реагирует на цену. Старые модели говорят «Да, платить» и при 20, и при 3000 долларов в год для семьи с доходом $75 000. Одна из них отвечала «Да» во всех 600 прогонах из 600. Ответ выглядит убедительно, рассуждение складное, но цена на решение не влияет. Другая беда: формат вопроса меняет ответ. Если просишь назвать максимальную сумму и разрешаешь модели сначала порассуждать, число вырастает в 2–3 раза по сравнению с ответом «голой цифрой».

Метод простой: напиши 3–4 предсказания вида «если X растёт, ответ не должен падать» и прогони вопрос серией, меняя по одному параметру. Если ответы не слушаются логики, модели нельзя доверять в этой задаче. Если слушаются, это ещё не значит, что ответы верны, только что они не бессмысленны.

🔬

Схема метода

ШАГ 1: Выбери решение без правильного ответа (платить/не платить, какой тариф)
ШАГ 2: Выпиши предсказания «что должно менять ответ»:
        · цена ↑ → доля «да» ↓
        · пакет содержит другой пакет + больше → оценка не ниже
        · доход ↑ → готовность платить не ниже
ШАГ 3: Каждый вариант вопроса — в 10 НОВЫХ чатах (отдельные запросы)
        → считаешь долю «да» по каждой цене
ШАГ 4: Сверяешь с предсказаниями → прошёл / не прошёл
ШАГ 5: Проверяешь устойчивость: тот же вопрос в другом формате,
        с другим порядком «Да/Нет», с рассуждением и без
🚀

Пример применения

Задача: Вы делаете ИИ-ассистента для малого бизнеса: он советует владельцу кофейни из Нижнего Новгорода, брать ли платный тариф CRM вроде Битрикс24. Прежде чем пускать его к клиентам, нужно понять, слушает ли он цену, объём тарифа и выручку, а не штампует «да».

Промпт (один прогон; запускать в новых чатах):

Ты советник владельца малого бизнеса. Он не может проверить твой совет
заранее, и ты отвечаешь за качество рекомендации.

Бизнес: кофейня, 4 сотрудника, Нижний Новгород.
Выручка: 1 200 000 ₽ в месяц.

Предложение: тариф «Профессиональный» — все функции тарифа «Стандарт»
плюс автоматизация воронки и аналитика.
Цена: 14 000 ₽ в месяц, оплата на год вперёд.

Можешь рассуждать свободно. В последней строке напиши только:
РЕШЕНИЕ: ДА или РЕШЕНИЕ: НЕТ

Дальше меняешь по одному параметру и каждый вариант гоняешь в 10 новых чатах: - Цена: 1 000 / 3 000 / 7 000 / 14 000 / 30 000 / 60 000 ₽. - Объём: тариф «Стандарт» по той же цене. Доля «да» на «Профессиональном» должна быть не ниже, ведь он содержит всё из «Стандарта» и больше. - Выручка: 400 000 / 1 200 000 / 5 000 000 ₽. Готовность платить не должна падать.

Результат: Получите таблицу «цена → доля ДА из 10». У хорошей модели доля плавно падает с ростом цены. У плохой почти не меняется: либо всегда «да», либо всегда «нет». Если «Стандарт» получает «да» чаще, чем «Профессиональный» за ту же цену, это логическая ошибка. Так видно, где именно модель разваливается, а не просто «хуже/лучше».

🧠

Почему это работает

Слабость. У вопросов «стоит ли?» нет ключа ответов. Сравнивать с мнением людей ненадёжно: люди тоже ошибаются, а модель может рассуждать хорошо, но по-другому. Поэтому обычная проверка «верно / неверно» здесь не работает.

Сильная сторона. Для таких вопросов не нужна истина, нужны предсказания о том, что должно двигать ответ. Больше цена — реже «да». Больше блага — не меньше готовность платить. Эти правила известны заранее, и модель легко прогнать десять раз на каждый вариант.

Как метод обходит слабость. Ты проверяешь направление ответа, а не его правильность. Это необходимое условие доверия. Рычаги: - Роль «советник», а не «респондент». Если человек нарушает правило, это может быть его предпочтение. Если советник рекомендует платить меньше за то, что даёт больше, это ошибка. - Число прогонов: при 10 прогонах погрешность доли около 0,15. Мелкие скачки на графике игнорируй, смотри на общий наклон. Для важных решений бери 20–30. - Параметры: расширь диапазон цен до заведомо абсурдных, иначе модель «пройдёт» тест просто потому, что до порога не дошла. - Форматы: меняй «да/нет» на «назови максимальную сумму», сравнивай ответы между собой.

📋

Шаблон промпта

Ты советник {кому}. Он не может проверить твой совет заранее,
и ты отвечаешь за качество рекомендации.

Контекст: {описание ситуации клиента, включая доход/выручку/размер}.

Предложение: {что именно предлагается, что входит}.
Цена: {цена и условия оплаты}.

Можешь рассуждать свободно. В последней строке напиши только:
РЕШЕНИЕ: ДА или РЕШЕНИЕ: НЕТ

Подставляй: {кому} (домохозяйство, владелец бизнеса, подписчик), {контекст} (параметр «доход»), {предложение} (набор опций, одна вложена в другую), {цена} (меняй по лестнице значений).

🚀 Быстрый старт — вставь в чат:

Вот шаблон проверки советов модели через тесты валидности. Адаптируй под мою
задачу: {твоя задача}. Задавай вопросы, чтобы заполнить поля, и составь
таблицу вариантов (цены, объёмы, доходы), которые мне надо прогнать,
и предсказания, которые должны выполняться.

[вставить шаблон выше]

LLM спросит, какое решение ты проверяешь, что в нём можно менять (цена, объём, размер клиента) и в какую сторону должен идти ответ, потому что без явных предсказаний тест не работает. Она соберёт таблицу вариантов и список правил «если X растёт, то Y не должно падать».

⚠️

Ограничения

⚠️ Согласованность ≠ правильность: Прошедшая тест модель показала только связность ответов. Она могла применить заученное правило, например «N% дохода со скидкой на расстояние», а не реально взвесить ситуацию.

⚠️ Один инструмент, один товар: Авторы проверили метод на одном опросе про качество воды. Применимость к другим задачам заявлена, но не показана.

⚠️ Высокие уровни у новых моделей: Даже модели, прошедшие тесты логики, называли суммы в несколько раз выше человеческих и слишком сильно росли с доходом. Знак реакции верный, величина нет. Не используй их числа как реальную оценку.

⚠️ Порядок ответов не проверяли: В промпте «Нет» стоял первым. Если у модели есть склонность к «Да» из-за порядка или формулировки, она могла сделать кривую плоской. Авторы только планируют проверить это перестановкой.

⚠️ Шум и «проход по умолчанию»: При 10 прогонах отдельные выводы шумные. Потолок цены был $3000, и многие сравнения прошли просто потому, что обе стороны не упёрлись в порог.

⚠️ Версии моделей: Две новейшие модели вызывали под безымянными названиями. Повторный запуск позже мог попасть в другую версию.

🔍

Как исследовали

Исследователи взяли готовый опрос, который уже проверен на людях: референдум о платных улучшениях качества воды. Респондент голосует «да/нет» при разных налогах. Четыре семьи параметров: девять сценариев (три вида улучшений × три региона), десять уровней налога от $20 до $3000, три уровня дохода и десять независимых прогонов на каждую комбинацию. Итого 16 200 голосов от шести моделей двух разработчиков. Название шкалы из опроса скрыли, чтобы модель не вспоминала исследование. Модель играла роль советника домохозяйства: так нарушение логики считается ошибкой, а не «личным вкусом».

Затем проверили предсказания из теории. Наклон спроса вниз: два старых «дешёвых» модели почти не реагируют на цену, а две новейшие рисуют нормальные кривые (падение до 0,00 и 0,08 «да» при $3000). Масштаб: «минимум уровень 2» содержит «минимум уровень 3», значит оценка не должна быть ниже. Нарушение почти не нашли. Доход: готовность платить не падала ни разу из 69 сравнений.

Удивительнее всего оказались форматы. При вопросе «назови максимум» Haiku отвечал суммами $575–$1650 в год, а в референдуме голосовал «да» даже при $3000 в каждом прогоне. Разрешение сначала порассуждать увеличило ответы в 2,8 и 2,3 раза. Инсайт для практики: формат вопроса — часть ответа, и один способ спросить ничего не гарантирует. Ещё важный момент: второй раунд авторы заранее зафиксировали предсказания в версионном контроле, чтобы не подгонять выводы.

💡

Адаптации и экстраполяции

🔧 Техника: добавь «ловушки на нерелевантное» → поймаешь подхалимство и шум

Кроме параметров, которые должны менять ответ, добавь те, что не должны: имя клиента, порядок опций, «да/нет» против «нет/да». Если ответ меняется, это сигнал, что модель реагирует на форму, а не на суть. В статье это только предложено (порядок «Да/Нет» не меняли), это моя адаптация логики рамки.

🔧 Техника: сравни «рассуждение» и «голый ответ» → увидишь влияние формата

Задай один и тот же вопрос дважды: «Сразу число, без объяснений» и «Сначала рассуждай, потом число». Если цифры расходятся в разы, как в статье, используй для решений тот формат, чьи ответы лучше проходят тесты логики.

Экстраполяция (моя идея, в статье не проверялась): тот же принцип для LLM-судьи, который оценивает тексты.

Проверка судьи: возьми один текст и оцени его трижды.
1) Как есть. 2) Тот же текст, но вдвое длиннее за счёт воды.
3) Тот же текст с другим именем автора.
Ожидание: оценка 2 не выше оценки 1, оценка 3 равна оценке 1.
Нарушение = судья реагирует не на качество.
🔗

Ресурсы

  • Статья: Validity Without Ground Truth: What Stated-Preference Economics Offers the Evaluation of Language Models
  • Авторы: Daniel Robert Kling Alexander (University of Michigan School of Information), Catherine Louise Kling (Cornell University, SC Johnson College of Business)
  • Код, промпты и результаты: github.com/drkalexander1/llm-valuation-evals
  • Исходный опрос: Vossler et al. (2023), PNAS
  • Связанные работы: Needham et al. 2025 (модели догадываются, что их оценивают), Sharma et al. 2024 (подхалимство)

📋 Дайджест исследования

Ключевая суть

Одна модель ответила «Да, платить» в 600 прогонах из 600. И за $20 в год, и за $3000 для семьи с доходом $75 000. Метод позволяет проверять советы LLM там, где нет эталонного ответа: платить или нет, брать тариф или нет. Фишка: не сверяй ответ с правдой, сверяй его с логикой. Меняешь в вопросе одну вещь (цену, объём, доход) и смотришь, куда сдвинулся ответ. Это тест валидности. Если цена выросла, а доля «да» не упала, модели нельзя доверять в этой задаче.

Принцип работы

Сначала выпиши правила «если X растёт, ответ не должен падать». Потом гоняй вопрос серией и меняй по одному параметру. Три типа предсказаний: - Цена выше — «да» реже. - Пакет содержит другой пакет и больше — оценка не ниже. - Доход выше — готовность платить не ниже. Проверяешь направление ответа, а не его правильность. Модель выступает советником, поэтому нарушение логики здесь считается ошибкой, а не «личным вкусом». Люди могут платить больше за меньшее, потому что им так нравится. Советнику это не прощается. Это как проверять весы гирями: не знаешь точный вес арбуза, но две гири по килограмму должны показать вдвое больше одной.

Почему работает

У вопросов «стоит ли?» нет ключа ответов. Мнение людей тоже не эталон: они ошибаются, а модель может рассуждать иначе, но разумно. Поэтому проверка «верно/неверно» тут не работает. Правила «больше цена — реже да» известны заранее, так что истина для теста не нужна. Жесть: старые модели не реагировали на цену вообще. Рассуждение выглядело складным, а цена на решение не влияла. Вторая находка: формат меняет ответ. Просишь назвать максимальную сумму и разрешаешь сначала порассуждать. Число вырастает в 2–3 раза по сравнению с ответом «голой цифрой». Про шум: при 10 прогонах погрешность доли около 0,15. Мелкие скачки игнорируй и смотри на общий наклон. Для важных решений бери 20–30 прогонов.

Когда применять

Проверка ИИ-советчиков → конкретно решения «платить или нет», выбор тарифа, оценка подписки, особенно когда проверить совет заранее нельзя, а ответ звучит убедительно. НЕ подходит как доказательство правильности. Прошедшая тест модель просто не бессмысленна. Даже «прошедшие» новые модели называли суммы в разы выше человеческих. Знак реакции верный, величина нет. Не бери их числа как реальную оценку.

Мини-рецепт

1. Выбери решение без ключа ответов: платить или нет, какой тариф брать.
2. Выпиши 3–4 правила: цена вверх — «да» реже; пакет больше — оценка не ниже; доход вверх — готовность платить не ниже.
3. Задай роль: <роль>советник, который отвечает за качество рекомендации, а владелец не может её проверить.
4. Заставь выбрать: в последней строке только «РЕШЕНИЕ: ДА» или «РЕШЕНИЕ: НЕТ». Разрешай рассуждать свободно.
5. Меняй один параметр за раз: остальное держи неизменным.
6. Каждый вариант гоняй в 10 новых чатах: не в одном диалоге, иначе модель подхватит прошлые ответы. Считай долю «да».
7. Растяни диапазон цен до абсурда: иначе модель «пройдёт» тест, просто не дойдя до порога.
8. Проверь устойчивость: другой порядок «Да/Нет», с рассуждением и без, «да/нет» против «назови максимальную сумму».
9. Сверь с правилами: прошёл или не прошёл по каждому. Видно, где именно модель разваливается.

Примеры

[ПЛОХО] : Стоит ли кофейне из Нижнего Новгорода брать тариф CRM (программа для учёта клиентов) за 14 000 ₽ в месяц? Один раз спросил, получил «да» с красивым обоснованием и поверил.
[ХОРОШО] : Ты советник владельца малого бизнеса. Он не может проверить твой совет заранее, и ты отвечаешь за качество рекомендации. Бизнес: кофейня, 4 сотрудника, Нижний Новгород. Выручка: 1 200 000 ₽ в месяц. Предложение: тариф «Профессиональный» — всё из тарифа «Стандарт» плюс автоматизация воронки продаж и аналитика. Цена: 14 000 ₽ в месяц, оплата на год вперёд. Можешь рассуждать свободно. В последней строке напиши только: РЕШЕНИЕ: ДА или РЕШЕНИЕ: НЕТ Дальше этот промпт идёт серией, по 10 новых чатов на вариант: - Цена: 1 000 / 3 000 / 7 000 / 14 000 / 30 000 / 60 000 ₽. Доля «да» должна плавно падать. - Тариф «Стандарт» по той же цене. У «Профессионального» доля «да» не должна быть ниже. - Выручка: 400 000 / 1 200 000 / 5 000 000 ₽. Готовность платить не должна падать. Итог: таблица «цена → доля ДА из 10». Если на 1 000 ₽ и на 60 000 ₽ ответ один и тот же, модель штампует.
Источник: Validity Without Ground Truth: What Stated-Preference Economics Offers the Evaluation of Language Models
ArXiv ID: 2610.10506 | Сгенерировано: 2026-10-08 06:00

Проблемы LLM

ПроблемаСутьКак обойти
Совет не зависит от ключевых условий, хотя звучит убедительноПросишь совет там, где нет правильного ответа: платить или нет, какой тариф брать. Модель пишет складное рассуждение и говорит «да». Меняешь цену в 100 раз, а ответ тот же. Иногда «да» в каждом из сотен прогонов. Рассуждение выглядит разумным, поэтому подвох не заметен. Решению нельзя доверятьНе читай рассуждение как доказательство. Прогони серию вопросов и меняй по одному параметру: цену, объём, доход. Посчитай долю «да» на каждом шаге. Если доля не меняется, модель не слушает условие. Не пускай её в эту задачу
Формат ответа сдвигает результатПросишь назвать максимальную сумму. Если разрешить модели сначала порассуждать, число выходит в 2–3 раза больше, чем при ответе голой цифрой. Вопрос тот же, числа разные. Один формат даёт один результат. Другой даёт другой. Какому верить, непонятноЗафиксируй формат и сравнивай ответы только внутри него. Прогони вопрос в двух форматах: с рассуждением и без. Смотри на разброс. Большой разброс — число ненадёжно. Меняй местами «Да» и «Нет» в инструкции. Порядок тоже мог влиять

Методы

МетодСуть
Проверка логики вместо проверки правды — когда эталонного ответа нетНе сверяй ответ с истиной. Сверяй с правилами, которые известны заранее. Шаги: 1. Выпиши 3–4 предсказания. Например: цена ↑ → доля «да» ↓. Или: вариант включает другой и больше → доля «да» не ниже. Или: доход ↑ → готовность платить не ниже. 2. Меняй за раз один параметр. 3. Каждый вариант гоняй в 10 новых чатах. Отдельные запросы, без общей истории. 4. Считай долю «да» по каждому варианту. 5. Сверь с предсказаниями: прошёл или нет. 6. Проверь устойчивость: другой формат, другой порядок «Да/Нет», с рассуждением и без. Почему работает: ты проверяешь направление ответа, а не его верность. Это необходимое условие доверия. Если цена растёт, а «да» не падает, модель ошибается. Спорить о вкусах тут не нужно. Важно: проси роль «советник», а не «опрашиваемый». Человек может иметь странные предпочтения. Советник, который рекомендует платить меньше за большее, просто ошибается. Детали: при 10 прогонах погрешность доли около 0,15. Мелкие скачки игнорируй, смотри на общий наклон. Для важных решений бери 20–30 прогонов. Делай диапазон шире разумного, вплоть до абсурдных значений. Иначе модель «пройдёт» тест, просто не дойдя до порога. Когда да: решения без ключа ответов, перед запуском советника к клиентам. Когда нет: есть проверяемый правильный ответ. Тогда сверяй с ним
📖 Простыми словами

Validity Without Ground Truth: What Stated-Preference Economics Offers the Evaluation ofLanguageModels

arXiv: 2610.10506

Большинство тестов для нейросетей тупо сверяют ответ с правильным ключом. Но в реальных вопросах вроде «стоит ли брать эту подписку?» никакого объективного эталона нет. Люди сами путаются и спорят, а модель просто гадает. Выход подсмотрели в экономике заявленных предпочтений: проверять не абстрактную правильность ответа, а логику поведения системы при изменении условий.

Это как проверять риелтора на адекватность. Спроси его, брать ли убитую однушку за 5 миллионов рублей, и он ответит: «конечно, бери». Подними цену в вопросе до 50 миллионов — и если он продолжит радостно кивать, то перед тобой не эксперт, а болванчик на скриптах. Ты ловишь его не на знании фактов, а на полном отсутствии логики.

Метод работает через контролируемый сдвиг параметров. Ты берёшь базовый сценарий и по очереди крутишь ключевые переменные: цену сервиса, выручку бизнеса, объём тарифа. Закон спроса непреклонен: если ценник взлетел в пять раз, рекомендация «покупай» обязана смениться на «откажись». Заодно проверяют шумовую устойчивость: если совет кардинально меняется от того, назвали владельца кофейни Олегом или Иваном, модель просто несёт чушь.

Авторы гоняли метод на семейных расходах, но принцип универсален. Делаешь ты ИИ-консультанта, который советует малому бизнесу CRM за 10 тысяч рублей, медицинского ассистента или кредитного робота — схема одна и та же. Любой автономный советник обязан проверяться не субъективными оценками людей, а жестким стресс-тестом на экономическую вменяемость.

Короче: хватит оценивать советы моделей по принципу «ну, вроде складно стелет». Если эталонной правды в задаче не существует, тестируй вектор реакции на стимулы. Загони систему в вилку противоположных условий и сразу увидишь, где у неё системный глюк. Иначе твой умный ассистент разорит клиентов быстрее, чем ты успеешь понять причину катастрофы.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с