TL;DR
Идея из экономики опросов: если нельзя сверить ответ с правдой, сверяй его с логикой. Меняешь в вопросе то, что должно влиять на ответ (цену, объём, доход), и смотришь, двигается ли ответ в нужную сторону. Заодно ловишь то, что не должно влиять, и проверяешь, не меняется ли ответ от пустяков. Авторы применили это к LLM-советнику, который решает за семью «платить или нет».
Главная находка: часть моделей вообще не реагирует на цену. Старые модели говорят «Да, платить» и при 20, и при 3000 долларов в год для семьи с доходом $75 000. Одна из них отвечала «Да» во всех 600 прогонах из 600. Ответ выглядит убедительно, рассуждение складное, но цена на решение не влияет. Другая беда: формат вопроса меняет ответ. Если просишь назвать максимальную сумму и разрешаешь модели сначала порассуждать, число вырастает в 2–3 раза по сравнению с ответом «голой цифрой».
Метод простой: напиши 3–4 предсказания вида «если X растёт, ответ не должен падать» и прогони вопрос серией, меняя по одному параметру. Если ответы не слушаются логики, модели нельзя доверять в этой задаче. Если слушаются, это ещё не значит, что ответы верны, только что они не бессмысленны.
Схема метода
ШАГ 1: Выбери решение без правильного ответа (платить/не платить, какой тариф)
ШАГ 2: Выпиши предсказания «что должно менять ответ»:
· цена ↑ → доля «да» ↓
· пакет содержит другой пакет + больше → оценка не ниже
· доход ↑ → готовность платить не ниже
ШАГ 3: Каждый вариант вопроса — в 10 НОВЫХ чатах (отдельные запросы)
→ считаешь долю «да» по каждой цене
ШАГ 4: Сверяешь с предсказаниями → прошёл / не прошёл
ШАГ 5: Проверяешь устойчивость: тот же вопрос в другом формате,
с другим порядком «Да/Нет», с рассуждением и без
Пример применения
Задача: Вы делаете ИИ-ассистента для малого бизнеса: он советует владельцу кофейни из Нижнего Новгорода, брать ли платный тариф CRM вроде Битрикс24. Прежде чем пускать его к клиентам, нужно понять, слушает ли он цену, объём тарифа и выручку, а не штампует «да».
Промпт (один прогон; запускать в новых чатах):
Ты советник владельца малого бизнеса. Он не может проверить твой совет
заранее, и ты отвечаешь за качество рекомендации.
Бизнес: кофейня, 4 сотрудника, Нижний Новгород.
Выручка: 1 200 000 ₽ в месяц.
Предложение: тариф «Профессиональный» — все функции тарифа «Стандарт»
плюс автоматизация воронки и аналитика.
Цена: 14 000 ₽ в месяц, оплата на год вперёд.
Можешь рассуждать свободно. В последней строке напиши только:
РЕШЕНИЕ: ДА или РЕШЕНИЕ: НЕТ
Дальше меняешь по одному параметру и каждый вариант гоняешь в 10 новых чатах: - Цена: 1 000 / 3 000 / 7 000 / 14 000 / 30 000 / 60 000 ₽. - Объём: тариф «Стандарт» по той же цене. Доля «да» на «Профессиональном» должна быть не ниже, ведь он содержит всё из «Стандарта» и больше. - Выручка: 400 000 / 1 200 000 / 5 000 000 ₽. Готовность платить не должна падать.
Результат: Получите таблицу «цена → доля ДА из 10». У хорошей модели доля плавно падает с ростом цены. У плохой почти не меняется: либо всегда «да», либо всегда «нет». Если «Стандарт» получает «да» чаще, чем «Профессиональный» за ту же цену, это логическая ошибка. Так видно, где именно модель разваливается, а не просто «хуже/лучше».
Почему это работает
Слабость. У вопросов «стоит ли?» нет ключа ответов. Сравнивать с мнением людей ненадёжно: люди тоже ошибаются, а модель может рассуждать хорошо, но по-другому. Поэтому обычная проверка «верно / неверно» здесь не работает.
Сильная сторона. Для таких вопросов не нужна истина, нужны предсказания о том, что должно двигать ответ. Больше цена — реже «да». Больше блага — не меньше готовность платить. Эти правила известны заранее, и модель легко прогнать десять раз на каждый вариант.
Как метод обходит слабость. Ты проверяешь направление ответа, а не его правильность. Это необходимое условие доверия. Рычаги: - Роль «советник», а не «респондент». Если человек нарушает правило, это может быть его предпочтение. Если советник рекомендует платить меньше за то, что даёт больше, это ошибка. - Число прогонов: при 10 прогонах погрешность доли около 0,15. Мелкие скачки на графике игнорируй, смотри на общий наклон. Для важных решений бери 20–30. - Параметры: расширь диапазон цен до заведомо абсурдных, иначе модель «пройдёт» тест просто потому, что до порога не дошла. - Форматы: меняй «да/нет» на «назови максимальную сумму», сравнивай ответы между собой.
Шаблон промпта
Ты советник {кому}. Он не может проверить твой совет заранее,
и ты отвечаешь за качество рекомендации.
Контекст: {описание ситуации клиента, включая доход/выручку/размер}.
Предложение: {что именно предлагается, что входит}.
Цена: {цена и условия оплаты}.
Можешь рассуждать свободно. В последней строке напиши только:
РЕШЕНИЕ: ДА или РЕШЕНИЕ: НЕТ
Подставляй: {кому} (домохозяйство, владелец бизнеса, подписчик), {контекст} (параметр «доход»), {предложение} (набор опций, одна вложена в другую), {цена} (меняй по лестнице значений).
🚀 Быстрый старт — вставь в чат:
Вот шаблон проверки советов модели через тесты валидности. Адаптируй под мою
задачу: {твоя задача}. Задавай вопросы, чтобы заполнить поля, и составь
таблицу вариантов (цены, объёмы, доходы), которые мне надо прогнать,
и предсказания, которые должны выполняться.
[вставить шаблон выше]
LLM спросит, какое решение ты проверяешь, что в нём можно менять (цена, объём, размер клиента) и в какую сторону должен идти ответ, потому что без явных предсказаний тест не работает. Она соберёт таблицу вариантов и список правил «если X растёт, то Y не должно падать».
Ограничения
⚠️ Согласованность ≠ правильность: Прошедшая тест модель показала только связность ответов. Она могла применить заученное правило, например «N% дохода со скидкой на расстояние», а не реально взвесить ситуацию.
⚠️ Один инструмент, один товар: Авторы проверили метод на одном опросе про качество воды. Применимость к другим задачам заявлена, но не показана.
⚠️ Высокие уровни у новых моделей: Даже модели, прошедшие тесты логики, называли суммы в несколько раз выше человеческих и слишком сильно росли с доходом. Знак реакции верный, величина нет. Не используй их числа как реальную оценку.
⚠️ Порядок ответов не проверяли: В промпте «Нет» стоял первым. Если у модели есть склонность к «Да» из-за порядка или формулировки, она могла сделать кривую плоской. Авторы только планируют проверить это перестановкой.
⚠️ Шум и «проход по умолчанию»: При 10 прогонах отдельные выводы шумные. Потолок цены был $3000, и многие сравнения прошли просто потому, что обе стороны не упёрлись в порог.
⚠️ Версии моделей: Две новейшие модели вызывали под безымянными названиями. Повторный запуск позже мог попасть в другую версию.
Как исследовали
Исследователи взяли готовый опрос, который уже проверен на людях: референдум о платных улучшениях качества воды. Респондент голосует «да/нет» при разных налогах. Четыре семьи параметров: девять сценариев (три вида улучшений × три региона), десять уровней налога от $20 до $3000, три уровня дохода и десять независимых прогонов на каждую комбинацию. Итого 16 200 голосов от шести моделей двух разработчиков. Название шкалы из опроса скрыли, чтобы модель не вспоминала исследование. Модель играла роль советника домохозяйства: так нарушение логики считается ошибкой, а не «личным вкусом».
Затем проверили предсказания из теории. Наклон спроса вниз: два старых «дешёвых» модели почти не реагируют на цену, а две новейшие рисуют нормальные кривые (падение до 0,00 и 0,08 «да» при $3000). Масштаб: «минимум уровень 2» содержит «минимум уровень 3», значит оценка не должна быть ниже. Нарушение почти не нашли. Доход: готовность платить не падала ни разу из 69 сравнений.
Удивительнее всего оказались форматы. При вопросе «назови максимум» Haiku отвечал суммами $575–$1650 в год, а в референдуме голосовал «да» даже при $3000 в каждом прогоне. Разрешение сначала порассуждать увеличило ответы в 2,8 и 2,3 раза. Инсайт для практики: формат вопроса — часть ответа, и один способ спросить ничего не гарантирует. Ещё важный момент: второй раунд авторы заранее зафиксировали предсказания в версионном контроле, чтобы не подгонять выводы.
Адаптации и экстраполяции
🔧 Техника: добавь «ловушки на нерелевантное» → поймаешь подхалимство и шум
Кроме параметров, которые должны менять ответ, добавь те, что не должны: имя клиента, порядок опций, «да/нет» против «нет/да». Если ответ меняется, это сигнал, что модель реагирует на форму, а не на суть. В статье это только предложено (порядок «Да/Нет» не меняли), это моя адаптация логики рамки.
🔧 Техника: сравни «рассуждение» и «голый ответ» → увидишь влияние формата
Задай один и тот же вопрос дважды: «Сразу число, без объяснений» и «Сначала рассуждай, потом число». Если цифры расходятся в разы, как в статье, используй для решений тот формат, чьи ответы лучше проходят тесты логики.
Экстраполяция (моя идея, в статье не проверялась): тот же принцип для LLM-судьи, который оценивает тексты.
Проверка судьи: возьми один текст и оцени его трижды.
1) Как есть. 2) Тот же текст, но вдвое длиннее за счёт воды.
3) Тот же текст с другим именем автора.
Ожидание: оценка 2 не выше оценки 1, оценка 3 равна оценке 1.
Нарушение = судья реагирует не на качество.
Ресурсы
- Статья: Validity Without Ground Truth: What Stated-Preference Economics Offers the Evaluation of Language Models
- Авторы: Daniel Robert Kling Alexander (University of Michigan School of Information), Catherine Louise Kling (Cornell University, SC Johnson College of Business)
- Код, промпты и результаты: github.com/drkalexander1/llm-valuation-evals
- Исходный опрос: Vossler et al. (2023), PNAS
- Связанные работы: Needham et al. 2025 (модели догадываются, что их оценивают), Sharma et al. 2024 (подхалимство)
