TL;DR
Агент на базе LLM решает сложную задачу-головоломку (расшифровка структуры молекулы по спектру) не через прямое угадывание ответа, а через пошаговый поиск: собирает данные в промежуточные таблицы, классифицирует их, генерирует несколько версий-кандидатов и проверяет каждую по жёстким проверяемым правилам, прежде чем выдать финальный ответ. Если кандидат не проходит проверку — агент возвращается и переделывает таблицы.
Главная находка исследования жёстче, чем кажется: когда тому же самому мощному ИИ (Claude, GPT) дали ту же задачу и те же данные, но без структуры и чек-листа — просто "решай пошагово" — точность упала в разы, а разброс результатов (то правильно, то совсем мимо) резко вырос. То есть не модель слабая — слабая структура задачи. LLM без явных промежуточных артефактов быстро "залипает" на одной версии ответа и не пересматривает ранние предположения, даже если новые данные им противоречат.
Метод чинит это через четыре шага в одном агентском сеансе: (1) собрать сырые данные в таблицу «улик», (2) классифицировать их по категориям/паттернам, (3) сгенерировать несколько кандидатов-гипотез, (4) прогнать каждого через набор жёстких проверок на соответствие исходным данным (не сверяясь с "правильным ответом" — просто проверяя внутреннюю непротиворечивость) и повторить, если ни один не прошёл.
Схема метода
ШАГ 1: Собрать сырые данные → таблица «Улики» (список фактов, аномалий, сигналов)
ШАГ 2: Классифицировать улики по категориям/паттернам → таблица «Классификация»
ШАГ 3: Сгенерировать 3-5 кандидатов-гипотез на основе таблиц
ШАГ 4: Проверить каждого кандидата по чек-листу жёстких правил →
прошёл = финал / не прошёл = скорректировать таблицы и вернуться к ШАГУ 3
Все четыре шага происходят в одном непрерывном диалоге — модель сама решает, когда данных достаточно и когда пора вернуться назад.
Пример применения
Задача: Продажи интернет-магазина упали на 30% за месяц, и нужно понять причину, имея на руках разрозненные данные: трафик, конверсия, средний чек, расходы на рекламу, изменения цен, отзывы клиентов.
Промпт:
Вот данные по продажам за последние 3 месяца: [вставить таблицу/цифры].
Помоги разобраться, почему в октябре продажи упали на 30%. Работай так:
1. Выпиши в таблицу «Улики» все аномалии в данных — что изменилось, когда,
на сколько. Без выводов, только факты.
2. Сгруппируй улики по категориям возможных причин: реклама, цена,
сезонность, конкуренты, технические проблемы сайта, качество продукта.
3. Предложи 3 разные гипотезы, что могло вызвать падение.
4. Для каждой гипотезы проверь: подтверждается ли она ВСЕМИ данными
без противоречий? Если хоть один факт противоречит гипотезе —
явно скажи об этом и отбрось её.
5. Оставь только гипотезу, которая прошла проверку по всем пунктам,
и покажи, как именно ты её проверял.
Результат: Модель сначала выдаст таблицу фактов без интерпретаций, затем разложит их по категориям, предложит несколько версий причины падения, а после — явно пройдётся по каждой версии и отбросит те, что противоречат хотя бы одному факту. В финале — одна гипотеза с видимой цепочкой проверки, а не с одного взгляда угаданный ответ.
Почему это работает
LLM, когда её просят напрямую "объясни, почему упали продажи" или "поставь диагноз", склонна выдать первую правдоподобную историю и остановиться на ней — она не заглядывает назад и не сверяет вывод со всеми фактами одновременно. Это и показал эксперимент: тот же ИИ без структуры давал разброс результатов "то почти правильно, то полностью мимо".
Зато LLM хорошо умеет раскладывать информацию по таблицам и применять явные правила, если их сформулировать заранее. Метод берёт эту сильную сторону и заставляет модель сначала зафиксировать факты отдельно от выводов, а потом явно сверять каждую версию ответа с чек-листом — вместо того чтобы доверять модели держать всё "в голове" одновременно.
Рычаги управления: - Число проверочных правил в чек-листе — добавляй свои критерии под задачу (для финансов: баланс должен сойтись; для диагностики: симптом не должен противоречить факту) - Число кандидатов-гипотез — увеличь для сложных неоднозначных случаев, уменьши для простых - Отсутствие примеров решённых задач в промпте — исследователи специально не давали агенту образцов, чтобы он не копировал паттерн, а рассуждал сам; убери это правило, если хочешь быстрый ответ по аналогии - Условие повтора цикла ("если не прошло проверку — вернись к шагу 3") — можно ограничить количеством попыток, чтобы модель не зависала в бесконечном пересмотре
Шаблон промпта
Вот данные по задаче: {данные}.
Нужно разобраться: {вопрос/задача}.
Работай по методу «Улики → Классификация → Гипотезы → Проверка»:
1. Выпиши в таблицу «Улики» все факты, аномалии, сигналы из данных.
Без выводов, только то, что явно видно.
2. Сгруппируй улики по категориям: {категории_причин}.
3. Предложи {N} разных гипотез/версий, которые объясняют ситуацию.
4. Для каждой гипотезы проверь по критериям: {критерии_проверки}.
Если данные противоречат гипотезе — отбрось её и объясни почему.
5. Оставь только гипотезу, прошедшую все проверки. Если ни одна не прошла —
вернись к шагу 1 и пересмотри таблицу улик.
Подставляй: {данные} — что у тебя есть на руках (цифры, симптомы, лог событий), {вопрос/задача} — что нужно выяснить, {категории_причин} — возможные направления поиска, {N} — сколько версий рассмотреть, {критерии_проверки} — твои жёсткие правила (что должно совпадать без противоречий).
🚀 Быстрый старт — вставь в чат:
Вот шаблон метода «Улики → Классификация → Гипотезы → Проверка».
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какие у тебя данные, какие категории причин рассматривать и по каким критериям проверять гипотезы — потому что без этого чек-лист проверки не построить. Она возьмёт структуру шаблона и заполнит её под твою ситуацию.
Ограничения
⚠️ Медленнее прямого ответа: метод требует нескольких проходов и явной проверки — на сложных задачах это может занять в разы больше времени и сообщений, чем просто спросить напрямую.
⚠️ Ломается на неоднозначных критериях: если проверочные правила нельзя сформулировать жёстко (субъективные оценки, "на глаз"), модель может застрять в цикле пересмотра гипотез без сходимости к финалу.
⚠️ Чем сложнее данные, тем хуже результат: точность метода заметно падает при увеличении числа переменных и "шума" в данных — метод не решает проблему сложности, только упорядочивает подход к ней.
⚠️ Качество чек-листа определяет всё: без явных, конкретных проверочных критериев метод превращается в обычное "рассуждай пошагово" и теряет своё преимущество.
Ресурсы
NMR Elucidation as an Agentic Search Problem, Not a Modeling Problem — Irina Espejo Morales, Damon Hinz, Marvin Alberts, Geraud Krawezik, Haewon Jeong, Shirley Ho. PolymathicAI, New York University, Flatiron Institute. Принято на ICML 2026 AI for Science Workshop.
