3,583 papers
arXiv:2607.27499 73 29 июля 2026 г. FREE

Многомерная рубрика оценки аргументов: суди не вывод, а конкретные оси критики

КЛЮЧЕВАЯ СУТЬ
Режим размышлений спасает модели на математике и коде. На спорных вопросах — этике, политике, философии сознания — он почти бесполезен, а иногда даже вредит. Причина: этот навык тренируют на задачах с проверяемым ответом, и он не переносится туда, где единственно верного решения просто нет. Метод даёт возможность оценивать критику или аргумент объективно — без расплывчатого вердикта «нравится/не нравится». Фишка — вместо одной общей оценки модель судит критику по 6 узким осям: бьёт ли она в центральную идею, насколько сильно её разрушает, есть ли фактические ошибки, насколько это понятно, сколько лишнего и держится ли критика одной темы.
Адаптировать под запрос

TL;DR

Вместо того чтобы просить LLM оценить спорный аргумент целиком ("хороший он или плохой"), разбей оценку на конкретные измерения: насколько критика бьёт в центральную идею позиции, насколько сильно она её разрушает, содержит ли она фактические ошибки, насколько она понятна, сколько в ней лишнего и держится ли она одной темы. Такую оценку легче делать объективно, чем выносить общий вердикт "аргумент хороший/плохой".

Главная находка исследования пугающая: даже топовые модели (Opus 4.1, GPT-5) на спорных, неоднозначных вопросах — этике, философии сознания, политике — часто выдают вывод без глубокого размышления, хватаясь за первое впечатление. И что особенно удивительно: включение режима "размышления" (thinking/reasoning), которое обычно спасает модели на математике и коде, почти не помогает на таких вопросах — иногда даже вредит. Авторы предполагают: reasoning тренируют на задачах с проверяемым ответом, и этот навык не переносится на вопросы без единственно верного решения.

Метод решает проблему через контекст + разбивку: критику показывают вместе с полным текстом позиции (не в вакууме), а оценку просят дать по шести отдельным осям вместо одной холистической цифры. Такая структура заставляет модель рассуждать по частям, а не выносить интуитивный вердикт.


🔬

Схема метода

ШАГ 1: Дай модели позицию (тезис/аргумент) целиком → контекст
ШАГ 2: Дай критику этой позиции → объект оценки
ШАГ 3: Попроси оценить критику по 6 осям (0-1) с рассуждением перед каждой цифрой:
   - Центральность
   - Сила
   - Корректность
   - Ясность
   - Лишний вес
   - Фокус на одной проблеме
ШАГ 4: Попроси итоговую оценку = центральность × сила (с поправкой на остальные оси)

Всё выполняется в одном промпте.


🚀

Пример применения

Задача: Основатель стартапа получил на созвоне с инвестором жёсткий фидбек: "Ваш unit-экономика не сходится, а рынок вы описали слишком оптимистично". Хочется понять — это фатальная критика, которую нужно решать первой, или частность, о которой можно не переживать пока.

Промпт:

Вот позиция (питч стартапа):
{текст питча}

Вот критика от инвестора:
{текст фидбека}

Оцени эту критику по шкале 0–1 по каждому пункту, сначала распиши рассуждение,
потом дай цифру:

1. Центральность — насколько критика бьёт в ключевую идею питча,
   а не в второстепенную деталь
2. Сила — насколько успешно критика разрушает атакуемую часть питча
3. Корректность — есть ли в критике фактические или логические ошибки
4. Ясность — насколько критика однозначна и понятна
5. Лишний вес — какая доля критики не относится к делу
6. Фокус — критика бьёт в одну проблему или сразу в несколько

В конце дай итоговую оценку веса критики = центральность × сила,
и одно предложение с рекомендацией: чинить это сейчас или можно подождать.

Результат: Модель распишет рассуждение по каждой из шести осей, поставит цифры 0-1 и в конце даст практический вывод — например, "критика центральная и сильная (0.8), исправлять первой" или "критика касается второстепенной детали (0.3), можно отложить".


🧠

Почему это работает

Когда модель просят оценить аргумент "в лоб" — просто "хороший или плохой" — она часто хватается за первое впечатление и выдаёт вывод без реального анализа. Особенно на спорных темах, где нет правильного ответа, модели сваливаются в интуитивный, поверхностный вердикт.

Зато модель хорошо умеет разбивать сложную задачу на более узкие, "измеримые" вопросы. Ей легче честно ответить "эта критика бьёт в центральную часть аргумента" или "эта критика содержит логическую ошибку", чем сразу вынести целостный вердикт "аргумент сильный".

Метод использует эту разбивку плюс контекст (полный текст позиции, а не критика в вакууме), чтобы заставить модель рассуждать по частям вместо выдачи интуитивного ответа.

Рычаги управления: - Оси оценки можно менять под свою задачу — вместо "ясность" добавь "релевантность аудитории", вместо "лишний вес" — "экономическая обоснованность" - Явная просьба "распиши рассуждение перед цифрой" работает лучше, чем включение режима "thinking" у модели — для спорных, неформализуемых вопросов reasoning-режим почти не даёт эффекта - Если критик — несколько человек (например, фидбек от разных инвесторов), можно сравнить их критику по одним осям и увидеть, кто указал на более центральную проблему


📋

Шаблон промпта

Вот позиция (тезис/аргумент), который нужно оценить в контексте критики:
{позиция}

Вот критика этой позиции:
{критика}

Оцени критику по каждому пункту от 0 до 1. Сначала распиши короткое рассуждение,
потом поставь цифру:

1. Центральность — критика бьёт в ключевую идею позиции или в второстепенную деталь?
2. Сила — насколько успешно критика разрушает атакуемую часть позиции?
3. Корректность — есть ли в критике фактические или логические ошибки?
4. Ясность — насколько критика однозначна после внимательного чтения?
5. Лишний вес — какая доля критики не относится напрямую к делу?
6. Фокус на одной проблеме — критика атакует одну проблему или сразу несколько?

В конце дай итоговую оценку = центральность × сила, с поправкой на остальные оси,
и одну рекомендацию: что делать с этой критикой.

Подставляй в {позиция} — исходный тезис или план, в {критика} — возражение, фидбек или контраргумент, который нужно оценить.

🚀 Быстрый старт — вставь в чат:

Вот шаблон рубрики для оценки аргументов и критики. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какая у тебя позиция и какая критика, а также — нужны ли дополнительные оси оценки под твою тему (например, для юридического спора или маркетингового брифа) — потому что метод работает через контекст конкретной позиции и её критики, а не абстрактно.


⚠️

Ограничения

⚠️ Субъективность остаётся: даже с разбивкой на оси, оценка спорных вопросов (этика, стратегия без данных) сохраняет элемент личного мнения оценщика — рубрика снижает субъективность, но не убирает её полностью.

⚠️ Режим "размышления" не спасает: если задача концептуальная (без проверяемого ответа), включение thinking-режима у модели почти не улучшает качество оценки. Лучше явно просить рассуждение по каждой оси в самом промпте, а не надеяться на встроенный reasoning.

⚠️ Нужен контекст: метод работает хуже, если критику показывать в изоляции, без полного текста позиции. Модель должна видеть, что именно критикуется.


🔍

Как исследовали

Исследователи собрали 951 оценённую критику на 442 философских и около-философских позициях — темы от этики и философии сознания до AI safety и теории голосования. Тексты позиций брали из книг, форумов, курсовых работ и частично писали сами (иногда с помощью LLM). Несколько экспертов вручную оценивали каждую критику по шести осям рубрики вслепую — не зная источника текста, чтобы не поддаваться предвзятости "это написала модель — значит слабое".

Затем прогнали топовые модели (GPT-5, Claude Opus 4.1, o3-pro, Gemini 2.5) с простым промптом без примеров и посчитали, насколько их оценки расходятся с оценками экспертов. Рейтинг моделей совпал с общим ощущением их силы — новые версии лучше старых, топовые тиры лучше младших. Но неожиданно: включение режима "thinking" почти не изменило результат — иногда даже немного ухудшило. Авторы объясняют это тем, что reasoning-тренировка заточена под задачи с проверяемым ответом (математика, код), и этот навык плохо переносится на вопросы без единственно верного решения.


📋 Дайджест исследования

Ключевая суть

Режим размышлений спасает модели на математике и коде. На спорных вопросах — этике, политике, философии сознания — он почти бесполезен, а иногда даже вредит. Причина: этот навык тренируют на задачах с проверяемым ответом, и он не переносится туда, где единственно верного решения просто нет. Метод даёт возможность оценивать критику или аргумент объективно — без расплывчатого вердикта «нравится/не нравится». Фишка — вместо одной общей оценки модель судит критику по 6 узким осям: бьёт ли она в центральную идею, насколько сильно её разрушает, есть ли фактические ошибки, насколько это понятно, сколько лишнего и держится ли критика одной темы.

Принцип работы

Правило простое: не спрашивай «аргумент хороший или плохой» — разбей вопрос на узкие части. Шаг 1: дай модели позицию целиком — это контекст. Шаг 2: дай критику этой позиции. Шаг 3: попроси оценить критику по каждой оси отдельно 0-1, с коротким рассуждением перед каждой цифрой. Финал: итоговый вес критики = центральность × сила, с поправкой на остальные четыре оси.

Почему работает

Модель, которую просят вынести вердикт «в лоб», хватается за первое впечатление — особенно там, где правильного ответа нет. На узкий вопрос типа «эта критика бьёт в ключевую идею?» она отвечает куда честнее. Дробление на измеримые куски заставляет модель рассуждать по частям вместо выдачи интуиции. Это как оценивать фильм не одной цифрой, а отдельно по сценарию, игре актёров и монтажу — честнее, чем просто «понравилось/не понравилось».

Когда применять

Оценка критики и фидбека → конкретно для разбора возражений после созвона с инвестором, ревью статьи, спора в комментариях, где нужно понять — критика фатальная или второстепенная. Особенно полезно когда критиков несколько и нужно сравнить, кто указал на более центральную проблему. Не подходит для вопросов с единственно верным ответом — там разбивка на оси просто лишняя трата токенов.

Мини-рецепт

1. Дай контекст: вставь позицию целиком — тезис, питч, статью. Без этого модель судит вслепую.
2. Дай критику: вставь возражение или фидбог, который нужно оценить.
3. Задай 6 осей: центральность, сила, корректность, ясность, лишний вес, фокус. Проси рассуждение перед каждой цифрой 0-1.
4. Попроси итог: вес критики = центральность × сила, плюс одна рекомендация — чинить сейчас или подождать.
5. Не надейся на встроенный режим размышлений: явно проси «распиши рассуждение» прямо в промпте — этот режим тут почти не помогает.

Примеры

[ПЛОХО] : Эта критика питча — она сильная или так себе?
[ХОРОШО] : Вот питч: {текст}. Вот критика инвестора: {текст}. Оцени по 6 осям (0-1): центральность, сила, корректность, ясность, лишний вес, фокус на одной проблеме. Распиши рассуждение перед каждой цифрой. В конце дай итог = центральность × сила и одну рекомендацию — чинить сейчас или подождать.
Источник: A dataset of rated conceptual arguments
ArXiv ID: 2607.27499 | Сгенерировано: 2026-07-31 04:29

Проблемы LLM

ПроблемаСутьКак обойти
Модель хватается за первое впечатление на спорных вопросахПросишь оценить аргумент целиком ("хороший или плохой"). На вопросах без единственно верного ответа — этика, стратегия, философия — модель часто выдаёт вывод без глубокого анализа. Цепляется за первое впечатление вместо реального разбора. Проблема касается любой холистической оценки: аргументов, критики, фидбека, споров, решенийНе проси общий вердикт. Разбей оценку на конкретные измерения (0-1 каждое) и попроси рассуждение перед каждой цифрой. Показывай критику вместе с полным контекстом того, что критикуется — не в вакууме

Методы

МетодСуть
Многомерная рубрика — оценка критики/аргумента по узким осям вместо общего вердиктаДай модели полный текст позиции как контекст. Дай критику этой позиции. Попроси оценить критику по нескольким конкретным осям (например: бьёт ли в центральную идею, насколько разрушает её, есть ли фактические ошибки, насколько понятна, сколько лишнего, держится ли одной темы) — каждую от 0 до 1, с рассуждением перед цифрой. В конце — итоговая оценка как произведение ключевых осей плюс поправка на остальные. Почему работает: модели легче честно ответить на узкий конкретный вопрос ("бьёт ли критика в центральную часть?"), чем сразу вынести целостный вердикт ("аргумент хороший?"). Разбивка заставляет рассуждать по частям вместо интуитивного ответа. Когда применять: оценка критики, фидбека, контраргументов, сравнение нескольких мнений по одним осям. Когда не работает: задачи с проверяемым единственным ответом — там разбивка не нужна, достаточно прямой проверки
📖 Простыми словами

A dataset of rated conceptual arguments

arXiv: 2607.27499

Суть в том, что когда ты просишь нейронку оценить чей-то аргумент целиком, она ведет себя как ленивый судья: смотрит на обложку и выносит вердикт «норм» или «фигня». Это фундаментальный баг современных LLM — они не умеют в глубокий анализ сложных концепций «в лоб». Вместо того чтобы реально вникнуть в суть спора, модель цепляется за первое впечатление или общие слова. Чтобы получить адекватную оценку, нужно заставить AI работать не с эмоцией, а с конкретными измерениями: бить по центральной идее, искать фактические косяки и отсекать лишний шум.

Это как если бы ты пришел к врачу и сказал: «Мне плохо, оцени мое здоровье по десятибалльной шкале». Врач посмотрит на твое бледное лицо и поставит тройку — формально он прав, но толку ноль. Чтобы реально помочь, ему нужно разложить тебя на конкретные показатели: давление, пульс, сахар в крови и рентген. Только когда есть цифры по каждому параметру, становится понятно, ты просто не выспался или у тебя реально отваливается печень. С аргументами та же история: нельзя судить «в целом», нужно препарировать структуру.

Что реально работает в этом методе: вместо одного вопроса мы задаем шесть. Мы заставляем модель проверить центральность (бьет ли критика в корень или цепляется к запятым), силу разрушения (насколько этот довод вообще обнуляет позицию оппонента) и фактическую точность. Сюда же добавляем фильтры на понятность, отсутствие воды и фокус на одной теме. Когда AI оценивает каждый пункт отдельно, итоговый рейтинг 4.5 из 5 становится не просто цифрой с потолка, а результатом жесткого аудита.

Тестировали это на сложных концептуальных спорах, но принцип универсален. Эту схему можно натравить на что угодно: от фидбека инвестора по твоему стартапу до разбора претензий жены по поводу немытой посуды. Если инвестор говорит, что твоя юнит-экономика — мусор, прогони это через систему измерений. Это фатальный удар в центр бизнес-модели или просто субъективное ворчание про слишком оптимистичный прогноз? Метод помогает отделить реальную угрозу от белого шума в любом тексте.

Короче: завязывай спрашивать у нейронки «хороший ли это текст». Это путь в никуда, где ты получишь порцию вежливых галлюцинаций. Хочешь объективности — используй декомпозицию на измерения. Разделяй оценку на понятность, точность и убойную силу, и тогда AI превратится из поверхностного критика в профессионального аналитика. Кто продолжает оценивать аргументы «в лоб», тот просто тратит токены на бесполезный мусор.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с