TL;DR
Когда LLM оценивает, важна ли новость для компании, модель чаще доверяет общему тону заголовка, чем реальным цифрам внутри текста. Например: заголовок говорит "прибыль выросла год к году" (позитив), а если сравнить с последним прогнозом компании — на самом деле это снижение относительно ожиданий. Все проверенные модели без исключения купились на позитивный фрейминг и не сделали это сравнение.
Вторая находка: модели плохо замечают тонкие правки формулировок. Компания меняла прогноз с "около 20%" на "до 20%" — смысл поменялся (было ориентир, стало потолок), но большинство моделей это пропустили, посчитав новость неновой или неважной. Модель не сверяет текст со старой версией слово в слово — она узнаёт "похожий смысл" и решает, что ничего нового нет.
Главный вывод для практики: если просишь LLM оценить новость, отчёт или изменение условий — не давай ей просто оценить "хорошо/плохо". Заставь её сначала явно найти точную предыдущую формулировку, потом сравнить цифры буквально (а не через смысл заголовка), и только потом делать вывод о значимости и направлении.
Схема метода (реконструкция принципа из находок статьи)
ШАГ 1: Найди точную предыдущую формулировку/цифру → процитируй её словами оригинала
ШАГ 2: Сравни новую формулировку с прежней буквально, а не по смыслу заголовка → отметь любое изменение слов, диапазонов, условий
ШАГ 3: Дай раздельные ответы на три вопроса:
— Это правда новая информация, или уже было известно?
— Насколько это важно для оценки компании: нет / низко / средне / высоко?
— В какую сторону это меняет картину: позитив / негатив / нейтрально / неясно?
ШАГ 4: Игнорируй заголовок и общий тон текста при ответе на шаг 3 — опирайся только на цифры и сравнение из шага 2
Все шаги можно выполнить в одном промпте.
Пример применения
Задача: Вы читаете пресс-релиз или новость про компанию (или про конкурента, или про изменение условий контракта с поставщиком) и просите LLM сказать, стоит ли на это реагировать.
Промпт:
Вот текст новости: {текст новости}
Вот предыдущая версия / прошлый прогноз / прошлое заявление на эту же тему: {текст предыдущей версии}
Сделай по шагам:
1. Процитируй точную формулировку из предыдущей версии, которая касается этой темы (слово в слово).
2. Процитируй точную формулировку из новой версии на ту же тему.
3. Сравни их буквально: что изменилось в словах, цифрах, диапазонах, условиях? Игнорируй заголовок и общий тон — смотри только на факты и цифры.
4. Ответь на три отдельных вопроса:
- Это новая информация или переформулировка уже известного?
- Насколько это важно: нет / низко / средне / высоко?
- Направление эффекта: позитив / негатив / нейтрально / неясно?
Обязательно объясни, если позитивный или негативный тон заголовка не совпадает с твоим выводом по цифрам.
Результат: Модель сначала выдаст две цитаты (старую и новую формулировку) — это заставит её физически найти разницу, а не полагаться на общее впечатление. Потом — три отдельных вердикта с объяснением, причём отдельным пунктом она укажет, если заголовок статьи вводит в заблуждение относительно реальных цифр.
Почему это работает
LLM хорошо умеет распознавать общий тон и смысл текста — это и есть слабость здесь: модель обобщает "новость выглядит позитивно" и на этом успокаивается, не доходя до арифметики.
Сильная сторона LLM — она отлично цитирует точный текст, если её попросить это сделать явно. Как только модель вынуждена процитировать старую и новую формулировку рядом, ей физически проще увидеть разницу в словах ("около" превратилось в "до"), чем когда она просто "помнит смысл" обоих текстов.
Метод разбивает одну смутную оценку ("хорошая новость или нет?") на три отдельных узких вопроса — новизна, важность, направление. Разделение мешает модели смешать "это новое" с "это важное": в исследовании модели гораздо лучше отличали новое от старого, чем правильно оценивали важность — значит, это разные навыки, и их стоит спрашивать раздельно.
Рычаги управления: - Убери требование "процитируй точно" → модель вернётся к смысловому пересказу, потеряется точность на тонких правках формулировок. - Добавь фразу "игнорируй заголовок" → явно отключает влияние фрейминга, полезно для скептического анализа любых PR-текстов, не только финансовых. - Раздели вопрос на подпункты (новизна/важность/направление) вместо одного "оцени эту новость" → снижает риск, что модель даст поверхностный общий вердикт.
Ограничения
⚠️ Точность в целом низкая: даже лучшая модель в исследовании правильно оценивала новость по всем трём параметрам только в половине случаев. Это значит, что даже с улучшенным промптом не стоит слепо доверять итоговому вердикту LLM в финансовых или похожих high-stakes решениях — используйте это как первый фильтр, не как окончательное решение.
⚠️ Дороже — не значит точнее: дорогие модели с долгими рассуждениями и множеством веб-поисков не показали значимого преимущества в точности. Больше токенов и поисковых запросов не гарантирует лучший результат — не стоит платить за самую "мощную" модель в надежде на автоматическое улучшение качества анализа.
⚠️ Разный аппетит к ложным тревогам: одна модель может ошибаться в разы чаще другой, даже показывая ту же итоговую точность — если для вас критично не поднимать лишний шум (ложные срабатывания), проверяйте не только точность, но и склонность модели "перебдить".
Как исследовали
Исследователи собрали команду профессиональных аналитиков хедж-фондов и попросили их придумать 82 реалистичных, но полностью синтетических новостных события про компании из полупроводникового сектора (ASML, NVIDIA, Ciena, Infineon и похожие) — это нужно, чтобы избежать "утечки ответа" через обычный веб-поиск, ведь событие никогда реально не происходило. Каждое событие эксперты снабдили тремя эталонными метками: новизна, важность (от "нет" до "высокая") и направление эффекта.
Каждое синтетическое событие поместили в реалистичный "пакет" из пяти настоящих статей и двух старых документов компании — агенту нужно было отфильтровать нужное среди шума, как в реальной работе аналитика. Проверили 14 разных агентов (от GPT-5.5 и Claude Opus до открытых моделей типа DeepSeek и Qwen), дав им доступ к веб-поиску.
Результат удивил даже авторов: точность по отдельным меткам (новое/не новое, и т.д.) была прилично высокой, но правильно угадать все три метки одновременно получилось лишь у половины лучших моделей. Причём модели, которые тратили в разы больше денег и делали в 10 раз больше поисковых запросов, не показывали пропорционально лучший результат — это говорит, что проблема не в нехватке информации, а в неумении модели правильно взвесить уже найденные факты.
