3,583 papers
arXiv:2607.20645 73 22 июля 2026 г. FREE

Финансовые новости и LLM: модели путают позитивный заголовок с реальной сутью цифр

КЛЮЧЕВАЯ СУТЬ
Заголовок кричит "прибыль выросла", а цифры внутри говорят другое — это провал относительно прогноза компании, но ни одна модель не заметила разницу. Метод учит LLM не доверять общему тону, а сверять текст с прошлой версией буквально. Модель сначала цитирует старую и новую формулировку рядом, потом сравнивает цифры — и только тогда решает, важна ли новость. Даже так лучшая модель угадывает все три критерия верно только в 50% случаев.
Адаптировать под запрос

TL;DR

Когда LLM оценивает, важна ли новость для компании, модель чаще доверяет общему тону заголовка, чем реальным цифрам внутри текста. Например: заголовок говорит "прибыль выросла год к году" (позитив), а если сравнить с последним прогнозом компании — на самом деле это снижение относительно ожиданий. Все проверенные модели без исключения купились на позитивный фрейминг и не сделали это сравнение.

Вторая находка: модели плохо замечают тонкие правки формулировок. Компания меняла прогноз с "около 20%" на "до 20%" — смысл поменялся (было ориентир, стало потолок), но большинство моделей это пропустили, посчитав новость неновой или неважной. Модель не сверяет текст со старой версией слово в слово — она узнаёт "похожий смысл" и решает, что ничего нового нет.

Главный вывод для практики: если просишь LLM оценить новость, отчёт или изменение условий — не давай ей просто оценить "хорошо/плохо". Заставь её сначала явно найти точную предыдущую формулировку, потом сравнить цифры буквально (а не через смысл заголовка), и только потом делать вывод о значимости и направлении.


🔬

Схема метода (реконструкция принципа из находок статьи)

ШАГ 1: Найди точную предыдущую формулировку/цифру → процитируй её словами оригинала
ШАГ 2: Сравни новую формулировку с прежней буквально, а не по смыслу заголовка → отметь любое изменение слов, диапазонов, условий
ШАГ 3: Дай раздельные ответы на три вопроса:
   — Это правда новая информация, или уже было известно?
   — Насколько это важно для оценки компании: нет / низко / средне / высоко?
   — В какую сторону это меняет картину: позитив / негатив / нейтрально / неясно?
ШАГ 4: Игнорируй заголовок и общий тон текста при ответе на шаг 3 — опирайся только на цифры и сравнение из шага 2

Все шаги можно выполнить в одном промпте.


🚀

Пример применения

Задача: Вы читаете пресс-релиз или новость про компанию (или про конкурента, или про изменение условий контракта с поставщиком) и просите LLM сказать, стоит ли на это реагировать.

Промпт:

Вот текст новости: {текст новости}

Вот предыдущая версия / прошлый прогноз / прошлое заявление на эту же тему: {текст предыдущей версии}

Сделай по шагам:

1. Процитируй точную формулировку из предыдущей версии, которая касается этой темы (слово в слово).
2. Процитируй точную формулировку из новой версии на ту же тему.
3. Сравни их буквально: что изменилось в словах, цифрах, диапазонах, условиях? Игнорируй заголовок и общий тон — смотри только на факты и цифры.
4. Ответь на три отдельных вопроса:
   - Это новая информация или переформулировка уже известного?
   - Насколько это важно: нет / низко / средне / высоко?
   - Направление эффекта: позитив / негатив / нейтрально / неясно?

Обязательно объясни, если позитивный или негативный тон заголовка не совпадает с твоим выводом по цифрам.

Результат: Модель сначала выдаст две цитаты (старую и новую формулировку) — это заставит её физически найти разницу, а не полагаться на общее впечатление. Потом — три отдельных вердикта с объяснением, причём отдельным пунктом она укажет, если заголовок статьи вводит в заблуждение относительно реальных цифр.


🧠

Почему это работает

LLM хорошо умеет распознавать общий тон и смысл текста — это и есть слабость здесь: модель обобщает "новость выглядит позитивно" и на этом успокаивается, не доходя до арифметики.

Сильная сторона LLM — она отлично цитирует точный текст, если её попросить это сделать явно. Как только модель вынуждена процитировать старую и новую формулировку рядом, ей физически проще увидеть разницу в словах ("около" превратилось в "до"), чем когда она просто "помнит смысл" обоих текстов.

Метод разбивает одну смутную оценку ("хорошая новость или нет?") на три отдельных узких вопроса — новизна, важность, направление. Разделение мешает модели смешать "это новое" с "это важное": в исследовании модели гораздо лучше отличали новое от старого, чем правильно оценивали важность — значит, это разные навыки, и их стоит спрашивать раздельно.

Рычаги управления: - Убери требование "процитируй точно" → модель вернётся к смысловому пересказу, потеряется точность на тонких правках формулировок. - Добавь фразу "игнорируй заголовок" → явно отключает влияние фрейминга, полезно для скептического анализа любых PR-текстов, не только финансовых. - Раздели вопрос на подпункты (новизна/важность/направление) вместо одного "оцени эту новость" → снижает риск, что модель даст поверхностный общий вердикт.


⚠️

Ограничения

⚠️ Точность в целом низкая: даже лучшая модель в исследовании правильно оценивала новость по всем трём параметрам только в половине случаев. Это значит, что даже с улучшенным промптом не стоит слепо доверять итоговому вердикту LLM в финансовых или похожих high-stakes решениях — используйте это как первый фильтр, не как окончательное решение.

⚠️ Дороже — не значит точнее: дорогие модели с долгими рассуждениями и множеством веб-поисков не показали значимого преимущества в точности. Больше токенов и поисковых запросов не гарантирует лучший результат — не стоит платить за самую "мощную" модель в надежде на автоматическое улучшение качества анализа.

⚠️ Разный аппетит к ложным тревогам: одна модель может ошибаться в разы чаще другой, даже показывая ту же итоговую точность — если для вас критично не поднимать лишний шум (ложные срабатывания), проверяйте не только точность, но и склонность модели "перебдить".


🔍

Как исследовали

Исследователи собрали команду профессиональных аналитиков хедж-фондов и попросили их придумать 82 реалистичных, но полностью синтетических новостных события про компании из полупроводникового сектора (ASML, NVIDIA, Ciena, Infineon и похожие) — это нужно, чтобы избежать "утечки ответа" через обычный веб-поиск, ведь событие никогда реально не происходило. Каждое событие эксперты снабдили тремя эталонными метками: новизна, важность (от "нет" до "высокая") и направление эффекта.

Каждое синтетическое событие поместили в реалистичный "пакет" из пяти настоящих статей и двух старых документов компании — агенту нужно было отфильтровать нужное среди шума, как в реальной работе аналитика. Проверили 14 разных агентов (от GPT-5.5 и Claude Opus до открытых моделей типа DeepSeek и Qwen), дав им доступ к веб-поиску.

Результат удивил даже авторов: точность по отдельным меткам (новое/не новое, и т.д.) была прилично высокой, но правильно угадать все три метки одновременно получилось лишь у половины лучших моделей. Причём модели, которые тратили в разы больше денег и делали в 10 раз больше поисковых запросов, не показывали пропорционально лучший результат — это говорит, что проблема не в нехватке информации, а в неумении модели правильно взвесить уже найденные факты.


📋 Дайджест исследования

Ключевая суть

Заголовок кричит "прибыль выросла", а цифры внутри говорят другое — это провал относительно прогноза компании, но ни одна модель не заметила разницу. Метод учит LLM не доверять общему тону, а сверять текст с прошлой версией буквально. Модель сначала цитирует старую и новую формулировку рядом, потом сравнивает цифры — и только тогда решает, важна ли новость. Даже так лучшая модель угадывает все три критерия верно только в 50% случаев.

Принцип работы

Правило простое: не спрашивай "хорошая новость или плохая?" — раздели вопрос на три отдельных: новизна, важность, направление. Это как три отдельных анализа крови вместо одного общего "самочувствие норм?" — каждый показатель меряется отдельно, ошибка одного не смешивается с другим. Модель гораздо лучше отличает новое от старого, чем правильно оценивает важность — это разные навыки, и путать их в одном вопросе вредно.

Почему работает

LLM отлично распознаёт общий тон текста — и именно в этом её слабость. Видит "прибыль выросла", помечает как позитив и останавливается, не доходя до арифметики. Зато если попросить процитировать текст буквально, модель делает это без проблем — сильная сторона превращается в инструмент проверки. Как только старая и новая формулировка стоят рядом, разница слов видна физически — "около" превратилось в "до", и прогноз из ориентира стал потолком.

Когда применять

Финансовый анализ → для чтения пресс-релизов, квартальных отчётов и заявлений о смене условий контракта, особенно когда заголовок звучит однозначно позитивно или негативно. Не подходит как единственный источник решения — точность даже у лучшей модели держится на уровне монетки, 50 на 50 по всем трём критериям сразу.

Мини-рецепт

1. Найди пару текстов: старую формулировку прогноза или новости и новую — без этого сравнивать нечем.
2. Заставь процитировать буквально: Процитируй точную формулировку из старой версии, слово в слово. Затем из новой.
3. Отключи заголовок: Игнорируй заголовок и общий тон, сравни только цифры и условия.
4. Раздели вопрос на три: новизна, важность, направление — отдельными пунктами, не одним общим вердиктом.
5. Проверь стыковку: если тон заголовка не совпадает с выводом по цифрам, заставь модель явно это указать.

Примеры

[ПЛОХО] : Оцени эту новость: важна ли она и это хорошо или плохо?
[ХОРОШО] : Процитируй старый прогноз "около 20%" и новый "до 20%" слово в слово. Сравни цифры, игнорируя заголовок. Ответь раздельно: это новая информация? Насколько важно: нет/низко/средне/высоко? В какую сторону меняет картину: позитив/негатив/нейтрально/неясно?
Источник: Frontier Financial Judgement: Can Agents Tell What Might Move a Stock?
ArXiv ID: 2607.20645 | Сгенерировано: 2026-07-24 04:29

Проблемы LLM

ПроблемаСутьКак обойти
Модель доверяет тону текста больше цифрОцениваешь новость по заголовку и цифрам внутри. Модель видит позитивный заголовок и делает вывод по нему. Не сравнивает цифры с прошлым прогнозом компании. Может назвать плохую новость хорошей — просто потому что заголовок звучит оптимистичноЯвно попроси модель игнорировать заголовок и общий тон. Вели сравнивать только цифры с последней известной версией прогноза
Модель не видит тонких изменений в формулировкахСравниваешь новую версию текста со старой (прогноз, условия контракта, политика). Модель узнаёт "похожий смысл" и решает, что ничего не изменилось. Пропускает важные правки типа "около 20%" "до 20%" — смысл поменялся, а модель считает новость неновойПопроси модель процитировать точную старую формулировку и точную новую. Сравнить слово в слово, а не по общему смыслу

Методы

МетодСуть
Явное цитирование до сравнения — ловит скрытые правкиПопроси модель сначала процитировать старую формулировку слово в слово, потом новую. Только после этого сравнивать. Процитируй старую версию. Процитируй новую версию. Сравни буквально, что изменилось в словах и цифрах. Почему работает: модель хорошо копирует точный текст, но плохо удерживает нюансы смысла "в голове". Когда две цитаты лежат рядом, разница в словах видна физически, а не через память о смысле. Работает для: сравнения версий контракта, прогноза, спецификации, условий сделки. Не работает: если старой версии для сравнения нет
Разделение оценки на новизну, важность и направлениеНе проси общий вердикт "хорошо это или плохо". Задай три отдельных узких вопроса: это новая информация или уже известная? насколько важно — нет/низко/средне/высоко? в какую сторону влияет — позитив/негатив/нейтрально? Почему работает: смешивание вопросов в одной общей оценке даёт смутный ответ. Модель путает "это новое" с "это важное" — это разные навыки, и раздельные узкие вопросы точнее каждого из них. Работает для: анализа новостей, отчётов, изменений условий, конкурентных сигналов. Не работает: когда нужен один быстрый общий вердикт без разбора
📖 Простыми словами

Frontier Financial Judgement: Canagentstell what might move a stock?

arXiv: 2607.20645

Современные нейросети в финансах работают не как расчетливые аналитики с Уолл-стрит, а как впечатлительные читатели газет. Корень проблемы в том, что LLM по своей природе заточены под поиск смысловых паттернов и общего тона, а не под жесткую верификацию цифр. Когда модель видит заголовок, она мгновенно считывает его эмоциональный заряд и выносит вердикт, пропуская этап критического сравнения данных. Для нее текст — это прежде всего контекст и настроение, а не сухая таблица в Excel, где важна каждая запятая.

Это как если бы ты выбирал ресторан по яркой вывеске "Скидка 50%!", не замечая мелкий шрифт о том, что цены перед этим подняли втрое. Формально тебя не обманули, но по факту ты в минусе. Модели ведут себя точно так же: они видят фразу "Прибыль выросла на 10%" и радостно ставят лайк, игнорируя тот факт, что по прогнозам аналитиков она должна была вырасти на 20%. Это когнитивная ловушка фрейминга, в которую AI влетает на полной скорости, потому что «позитивный вайб» для него весит больше, чем скрытая арифметика.

В ходе тестов выяснилось, что все проверенные модели без исключения лажают на элементарном сопоставлении. Если заголовок кричит о росте год к году, нейросеть игнорирует последний прогноз компании и реальные ожидания рынка. Она не лезет проверять, является ли этот рост на самом деле провалом относительно плана. Модель просто берет позитивный тон сообщения и выдает его за объективный финансовый прогноз, превращаясь из эксперта в обычного ретранслятора корпоративного пиара.

Этот принцип универсален и выходит далеко за рамки биржевых сводок. Тестировали на акциях, но та же фигня вылезет при анализе отчетов конкурентов, условий контрактов или пресс-релизов. Если твой бизнес-ассистент читает новость о том, что поставщик «стабилизировал цены», он может не заметить, что эта стабилизация произошла на пике инфляции и фактически означает убытки для тебя. Контекстный шум забивает логику везде, где нужно сопоставлять факты из разных источников, а не просто пересказывать один текст.

Короче: никогда не проси ChatGPT или Claude оценить важность новости фразой "Ну как оно?" — они выдадут тебе галлюцинацию, упакованную в оптимизм. Чтобы не прогореть, заставляй модель делать принудительное сравнение: давай ей цифру из новости и цифру из прошлого прогноза в одном промпте. Без прямого указания на числа AI будет верить буквам, а буквы в бизнесе часто врут. Кто продолжает доверять «мнению» модели без проверки фактов, тот скоро будет очень удивлен тем, куда делись деньги.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с