3,583 papers
arXiv:2607.19406 77 7 июля 2026 г. FREE

Evidence Table Search: как заставить LLM решать головоломку через таблицы улик и жёсткую проверку, а не угадывание

КЛЮЧЕВАЯ СУТЬ
Обнаружено: LLM, которую просят угадать ответ напрямую, выдаёт правдоподобный, но случайно неверный результат — она ищет похожий по стилю текст, а не проверяет логику. Метод позволяет превратить угадывание в пошаговую проверку гипотез: собрать факты в таблицу, предложить версии и отбросить те, что не бьются с проверяемыми правилами. Агент строит таблицу доказательств, потом таблицу фрагментов, предлагает кандидатов и гоняет каждого через жёсткие проверки — формула, баланс, число уникальных элементов. Фишка: без единого часа дообучения агент обошёл специализированные модели, натренированные на горах симулированных данных — просто получив пошаговый процесс мышления эксперта.
Адаптировать под запрос

TL;DR

Агент на базе LLM решает сложную задачу-головоломку (расшифровка структуры молекулы по спектру) не через прямое угадывание ответа, а через пошаговый поиск: собирает данные в промежуточные таблицы, классифицирует их, генерирует несколько версий-кандидатов и проверяет каждую по жёстким проверяемым правилам, прежде чем выдать финальный ответ. Если кандидат не проходит проверку — агент возвращается и переделывает таблицы.

Главная находка исследования жёстче, чем кажется: когда тому же самому мощному ИИ (Claude, GPT) дали ту же задачу и те же данные, но без структуры и чек-листа — просто "решай пошагово" — точность упала в разы, а разброс результатов (то правильно, то совсем мимо) резко вырос. То есть не модель слабая — слабая структура задачи. LLM без явных промежуточных артефактов быстро "залипает" на одной версии ответа и не пересматривает ранние предположения, даже если новые данные им противоречат.

Метод чинит это через четыре шага в одном агентском сеансе: (1) собрать сырые данные в таблицу «улик», (2) классифицировать их по категориям/паттернам, (3) сгенерировать несколько кандидатов-гипотез, (4) прогнать каждого через набор жёстких проверок на соответствие исходным данным (не сверяясь с "правильным ответом" — просто проверяя внутреннюю непротиворечивость) и повторить, если ни один не прошёл.

🔬

Схема метода

ШАГ 1: Собрать сырые данные → таблица «Улики» (список фактов, аномалий, сигналов)
ШАГ 2: Классифицировать улики по категориям/паттернам → таблица «Классификация»
ШАГ 3: Сгенерировать 3-5 кандидатов-гипотез на основе таблиц
ШАГ 4: Проверить каждого кандидата по чек-листу жёстких правил → 
        прошёл = финал / не прошёл = скорректировать таблицы и вернуться к ШАГУ 3

Все четыре шага происходят в одном непрерывном диалоге — модель сама решает, когда данных достаточно и когда пора вернуться назад.


🚀

Пример применения

Задача: Продажи интернет-магазина упали на 30% за месяц, и нужно понять причину, имея на руках разрозненные данные: трафик, конверсия, средний чек, расходы на рекламу, изменения цен, отзывы клиентов.

Промпт:

Вот данные по продажам за последние 3 месяца: [вставить таблицу/цифры].

Помоги разобраться, почему в октябре продажи упали на 30%. Работай так:

1. Выпиши в таблицу «Улики» все аномалии в данных — что изменилось, когда, 
   на сколько. Без выводов, только факты.

2. Сгруппируй улики по категориям возможных причин: реклама, цена, 
   сезонность, конкуренты, технические проблемы сайта, качество продукта.

3. Предложи 3 разные гипотезы, что могло вызвать падение.

4. Для каждой гипотезы проверь: подтверждается ли она ВСЕМИ данными 
   без противоречий? Если хоть один факт противоречит гипотезе — 
   явно скажи об этом и отбрось её.

5. Оставь только гипотезу, которая прошла проверку по всем пунктам, 
   и покажи, как именно ты её проверял.

Результат: Модель сначала выдаст таблицу фактов без интерпретаций, затем разложит их по категориям, предложит несколько версий причины падения, а после — явно пройдётся по каждой версии и отбросит те, что противоречат хотя бы одному факту. В финале — одна гипотеза с видимой цепочкой проверки, а не с одного взгляда угаданный ответ.


🧠

Почему это работает

LLM, когда её просят напрямую "объясни, почему упали продажи" или "поставь диагноз", склонна выдать первую правдоподобную историю и остановиться на ней — она не заглядывает назад и не сверяет вывод со всеми фактами одновременно. Это и показал эксперимент: тот же ИИ без структуры давал разброс результатов "то почти правильно, то полностью мимо".

Зато LLM хорошо умеет раскладывать информацию по таблицам и применять явные правила, если их сформулировать заранее. Метод берёт эту сильную сторону и заставляет модель сначала зафиксировать факты отдельно от выводов, а потом явно сверять каждую версию ответа с чек-листом — вместо того чтобы доверять модели держать всё "в голове" одновременно.

Рычаги управления: - Число проверочных правил в чек-листе — добавляй свои критерии под задачу (для финансов: баланс должен сойтись; для диагностики: симптом не должен противоречить факту) - Число кандидатов-гипотез — увеличь для сложных неоднозначных случаев, уменьши для простых - Отсутствие примеров решённых задач в промпте — исследователи специально не давали агенту образцов, чтобы он не копировал паттерн, а рассуждал сам; убери это правило, если хочешь быстрый ответ по аналогии - Условие повтора цикла ("если не прошло проверку — вернись к шагу 3") — можно ограничить количеством попыток, чтобы модель не зависала в бесконечном пересмотре


📋

Шаблон промпта

Вот данные по задаче: {данные}.

Нужно разобраться: {вопрос/задача}.

Работай по методу «Улики → Классификация → Гипотезы → Проверка»:

1. Выпиши в таблицу «Улики» все факты, аномалии, сигналы из данных. 
   Без выводов, только то, что явно видно.

2. Сгруппируй улики по категориям: {категории_причин}.

3. Предложи {N} разных гипотез/версий, которые объясняют ситуацию.

4. Для каждой гипотезы проверь по критериям: {критерии_проверки}. 
   Если данные противоречат гипотезе — отбрось её и объясни почему.

5. Оставь только гипотезу, прошедшую все проверки. Если ни одна не прошла — 
   вернись к шагу 1 и пересмотри таблицу улик.

Подставляй: {данные} — что у тебя есть на руках (цифры, симптомы, лог событий), {вопрос/задача} — что нужно выяснить, {категории_причин} — возможные направления поиска, {N} — сколько версий рассмотреть, {критерии_проверки} — твои жёсткие правила (что должно совпадать без противоречий).

🚀 Быстрый старт — вставь в чат:

Вот шаблон метода «Улики → Классификация → Гипотезы → Проверка». 
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какие у тебя данные, какие категории причин рассматривать и по каким критериям проверять гипотезы — потому что без этого чек-лист проверки не построить. Она возьмёт структуру шаблона и заполнит её под твою ситуацию.


⚠️

Ограничения

⚠️ Медленнее прямого ответа: метод требует нескольких проходов и явной проверки — на сложных задачах это может занять в разы больше времени и сообщений, чем просто спросить напрямую.

⚠️ Ломается на неоднозначных критериях: если проверочные правила нельзя сформулировать жёстко (субъективные оценки, "на глаз"), модель может застрять в цикле пересмотра гипотез без сходимости к финалу.

⚠️ Чем сложнее данные, тем хуже результат: точность метода заметно падает при увеличении числа переменных и "шума" в данных — метод не решает проблему сложности, только упорядочивает подход к ней.

⚠️ Качество чек-листа определяет всё: без явных, конкретных проверочных критериев метод превращается в обычное "рассуждай пошагово" и теряет своё преимущество.


🔗

Ресурсы

NMR Elucidation as an Agentic Search Problem, Not a Modeling Problem — Irina Espejo Morales, Damon Hinz, Marvin Alberts, Geraud Krawezik, Haewon Jeong, Shirley Ho. PolymathicAI, New York University, Flatiron Institute. Принято на ICML 2026 AI for Science Workshop.


📋 Дайджест исследования

Ключевая суть

Обнаружено: LLM, которую просят угадать ответ напрямую, выдаёт правдоподобный, но случайно неверный результат — она ищет похожий по стилю текст, а не проверяет логику. Метод позволяет превратить угадывание в пошаговую проверку гипотез: собрать факты в таблицу, предложить версии и отбросить те, что не бьются с проверяемыми правилами. Агент строит таблицу доказательств, потом таблицу фрагментов, предлагает кандидатов и гоняет каждого через жёсткие проверки — формула, баланс, число уникальных элементов. Фишка: без единого часа дообучения агент обошёл специализированные модели, натренированные на горах симулированных данных — просто получив пошаговый процесс мышления эксперта.

Принцип работы

Правило простое: сначала факты, потом версии, потом жёсткая проверка — никакого готового ответа с первого шага. Агент сверяет: совпадает ли итоговая формула, сходится ли баланс, совпадает ли число уникальных элементов структуры. Модель сверяет цифры по правилам — это механическая работа, не творческое угадывание, и тут она сильна. Творчество оставляем на шаг выдвижения версий, а не на финальный ответ.

Почему работает

LLM выбирает наиболее вероятный по стилю ответ, а не логически верный — отсюда случайные, непредсказуемые ошибки при прямом угадывании. Но проверка «формула должна совпадать» или «число должно быть в этом диапазоне» — это не творчество, это чистая сверка факта, и здесь модель не путается. Разбивка на этапы с жёсткими правилами превращает угадывание в проверяемый процесс — и без единого часа обучения агент обошёл модели, натренированные на горах симулированных спектров. Правда, точность резко падает с 80% на простых учебных примерах до 20% на разнородных реальных случаях — метод честный, но не волшебный.

Когда применять

Диагностика и аналитика → конкретно для анализа причин (падение продаж, ошибка в отчёте, спорный пункт в договоре), особенно когда нужно отбросить версию, которая звучит логично, но не подтверждается цифрами. НЕ подходит для творческих задач без проверяемых фактов — там правила проверки просто неоткуда взять.

Мини-рецепт

1. Собери факты: попроси модель выписать все данные без интерпретации — в таблицу, без выводов.
2. Раздели на категории: сгруппируй факты по зонам, например трафик / конверсия / технические проблемы.
3. Выдвини версии: 2-4 гипотезы, не больше — иначе модель начнёт путаться.
4. Проверь жёстко: для каждой версии — какие ещё цифры должны подтверждаться, если версия верна. Сверь с фактами из шага 1. Отбрось то, что не бьётся.

Примеры

[ПЛОХО] : Почему упали продажи в этом месяце?
[ХОРОШО] : Вот данные за месяц: [цифры]. Собери таблицу аномалий, сгруппируй по зонам, предложи 3 версии причины падения продаж и для каждой распиши, какие ещё цифры должны подтверждаться. Сверь с данными и отбрось версии без подтверждения.
Источник: NMR Elucidation as an Agentic Search Problem, Not a Modeling Problem
ArXiv ID: 2607.19406 | Сгенерировано: 2026-07-23 07:27

Проблемы LLM

ПроблемаСутьКак обойти
Прямой запрос на ответ даёт правдоподобную, но неверную версиюПросишь модель сразу назвать причину или решение. Модель выбирает не то, что логически верно, а то, что похоже на типичный ответ из обучения. Звучит убедительно, но часто мимо. Проблема для любой диагностической задачи: анализ ошибки, разбор причины, юридическая оценкаНе спрашивай "какой ответ". Разбей на этапы: сначала собрать факты в таблицу, потом выдвинуть версии, потом явно проверить каждую по конкретным числовым или логическим критериям
Модель застревает на первой гипотезе и игнорирует противоречащие фактыВ многошаговой проверке модель выбирает версию на раннем шаге и держится за неё. Даже когда новые факты её не подтверждают — не отказывается, а подгоняет объяснение. Замедляет процесс и портит итоговый ответ. Проявляется в любых многошаговых цепочках рассуждений, не только в диагностикеНа каждом шаге проверки прямо спрашивай: "Есть факты, которые противоречат этой версии?" Требуй явно написать "отбрасываю версию X, потому что..." перед тем как двигаться дальше. Можно вести 2-3 гипотезы параллельно, а не одну, чтобы не привязываться к первой

Методы

МетодСуть
Таблица фактов классификация гипотезы жёсткая проверкаРазбей задачу на 4 шага. Шаг 1: выпиши все конкретные наблюдения из данных без интерпретации — это таблица фактов. Шаг 2: сгруппируй факты по категориям, которые могут указывать на причину. Шаг 3: предложи 2-4 версии объяснения. Шаг 4: для каждой версии распиши, какие ещё факты ДОЛЖНЫ подтверждаться, если версия верна — и сверь с таблицей из шага 1. Отбрось версии, которые не подтвердились. Почему работает: модель хорошо справляется с механической сверкой (совпадает число или нет), но плохо угадывает ответ напрямую. Метод заставляет её сначала честно собрать факты, а потом отбрасывать неподтверждённое, а не сразу выдавать один "уверенный" ответ. Когда работает: любая задача с проверяемыми данными — разбор причины падения продаж, поиск ошибки в отчёте, диагностика проблемы. Когда не работает: без заранее продуманных жёстких критериев проверки (не "звучит логично", а "число должно быть в диапазоне X") — превращается в обычное угадывание. На сложных и разнородных исходных данных надёжность метода падает

Тезисы

ТезисКомментарий
Механическая проверка по правилам точнее творческой генерации ответаМодель плохо угадывает правильный ответ с первого раза — она выбирает похожий по стилю вариант, а не логически верный. Но она хорошо сверяет конкретные факты: совпадает число, входит ли значение в диапазон, соблюдён ли баланс. Это не творческая, а механическая задача — и модель с ней справляется надёжно. Применяй: не проси модель "оценить, похоже ли на правду". Формулируй проверку как конкретный измеримый критерий — "должно совпадать", "должно быть в диапазоне X-Y"
📖 Простыми словами

NMR Elucidation as anAgenticSearch Problem, Not aModelingProblem

arXiv: 2607.19406

Суть в том, что нейронки лажают в сложных задачах не потому, что они «глупые», а потому, что пытаются угадать ответ сразу целиком. В расшифровке молекул по спектру NMR это фатально: один неверный атом — и вся структура летит в мусор. Исследование доказывает, что ключ к успеху не в «умной» модели, а в превращении процесса в агентский поиск. Вместо того чтобы выплевывать готовый результат, ИИ работает как дотошный следователь: сначала собирает улики в таблицы, классифицирует их и только потом строит версии, которые обязан проверить на вшивость.

Это как собирать сложный пазл на тысячу деталей с закрытыми глазами, надеясь на интуицию. Шанс на успех около нуля. Но если ты начнешь сначала сортировать детали по цветам, отдельно откладывать рамку и проверять, стыкуется ли каждый конкретный пазл с соседом, задача превращается из лотереи в алгоритмический процесс. Агент делает именно это: он не «гадает» структуру молекулы, он строит её по кирпичикам, и если очередной кирпич не лезет в паз — он безжалостно сносит постройку и начинает с того места, где накосячил.

В основе метода лежат проверяемые правила и промежуточные артефакты. Сначала агент заполняет таблицы связей, потом генерирует кандидатов-молекул, а затем прогоняет их через жесткий фильтр соответствия исходным данным. Если кандидат не проходит проверку — это сигнал к откату. Система не просто «думает», она ведет пошаговый поиск в пространстве решений, где каждый шаг подтвержден фактами. Это превращает галлюцинирующую нейронку в надежный инструмент, который не успокоится, пока цифры не сойдутся.

Этот подход — спасение для любого бизнеса, где цена ошибки высока. Тестировали на химии, но принцип универсален: диагностика поломок, аудит падения продаж или юридический анализ работают по той же логике. Нельзя спрашивать у ChatGPT «почему упала выручка» и верить первому ответу — это будет просто красивая сказка. Нужно заставить агента составить таблицу трафика, проверить конверсию по каналам и сопоставить это с изменениями цен. Агентский поиск превращает хаос разрозненных данных в четкую цепочку доказательств.

Главный вывод: хватит ждать «идеальную модель», которая решит всё одним промптом. Будущее за системами, которые умеют проверять сами себя и возвращаться назад при ошибке. Если задача сложнее, чем написание поста в соцсети, прямой ответ от ИИ — это почти всегда херня и галлюцинация. Только через жесткую структуру, промежуточные таблицы и циклы проверки можно получить результат, которому реально можно доверять. Кто не внедрит такой «поиск» в свои процессы, так и будет получать от нейронок правдоподобный бред вместо решений.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с