3,583 papers
arXiv:2608.21504 70 21 авг. 2026 г. FREE

Промпт-чувствительность в химических LLM: одна и та же молекула, разные ответы в зависимости от формулировки вопроса

КЛЮЧЕВАЯ СУТЬ
90% точности → 45% на той же самой задаче. Просто переформулировали вопрос, смысл не менялся. ChemDIRT позволяет проверить, действительно ли химическая модель понимает факт о молекуле, или подгоняет ответ под привычную фразу из обучения. Метод берёт одну молекулу и прогоняет её через 4-10 разных формулировок вопроса и три формата данных — текстовый код SMILES, официальное название по системе IUPAC, картинку. Если ответы расходятся — модель угадывает, а не знает. Проверили на 23 моделях — от GPT и Claude до узких химических моделей.
Адаптировать под запрос

TL;DR

Модель может дать точность 90% или 45% на одной и той же задаче — просто потому что вопрос переформулировали, не меняя смысла. Исследователи проверили это на 23 моделях (от общих типа GPT и Claude до узкоспециализированных химических) и увидели: ответ зависит не только от того, ЧТО вы спрашиваете, но и КАК вы формулируете вопрос, и в каком виде подаёте данные — текстом, специальным кодом или картинкой.

Главная боль: модель не «понимает» факт один раз и навсегда — она реагирует на поверхностный паттерн фразировки. Спросите «определи токсичность молекулы X» и «есть ли у молекулы X риск токсичности» — казалось бы, одно и то же, но модель может ответить по-разному, потому что в её обучающих данных эти формулировки встречались в разных контекстах. То же самое с представлением данных: если одну и ту же молекулу описать текстовым кодом (SMILES) или официальным названием (IUPAC), точность ответа модели может измениться — хотя информация идентична.

Метод исследования — ChemDIRT: для каждой задачи составили несколько семантически одинаковых формулировок вопроса и несколько форматов представления одних и тех же данных, прогнали через модели и сравнили не только точность, но и согласованность ответов между вариантами.


🔬

Схема метода

ШАГ 1: Берём задачу → создаём 4–10 разных формулировок вопроса с одинаковым смыслом
ШАГ 2: Берём один и тот же объект (молекулу) → представляем в разных форматах (текстовый код, официальное название, картинка)
ШАГ 3: Прогоняем модель на всех комбинациях → сравниваем не только правильность, но и одинаковость ответов между вариантами

Все шаги выполняются как отдельная серия запросов — не в одном промпте.


🚀

Пример применения

Задача: Вы спросили ChatGPT про дозировку лекарства для ребёнка или про юридическую тонкость (например, нужно ли платить налог с продажи квартиры, которая в собственности меньше 3 лет) — и хотите проверить, насколько ответу можно доверять, а не гадает ли модель.

Промпт:

Ответь на один и тот же вопрос по теме "{тема}", но я задам его четырьмя разными способами. 
Дай короткий ответ на каждый вариант, не меняя суть вопроса между формулировками.

1. {вопрос, вариант 1}
2. {вопрос, вариант 2, другими словами}
3. {вопрос, вариант 3, с другой структурой предложения}
4. {вопрос, вариант 4, максимально формально/официально}

После всех четырёх ответов — сравни их. Если ответы совпадают по смыслу — отметь высокую уверенность. Если различаются — покажи в чём разница.

Результат: Модель даст четыре ответа подряд, а затем краткое резюме — совпадают они или нет. Если ответы разошлись, это сигнал: модель не «знает» факт железно, а угадывает по формулировке. В этом случае стоит проверить ответ в другом источнике, а не доверять первому попавшемуся варианту.


🧠

Почему это работает

Слабость LLM в том, что у неё нет внутреннего счётчика уверенности, видимого пользователю. Модель выдаёт правдоподобный текст, а не «знание» в чистом виде — и правдоподобность сильно зависит от того, насколько формулировка похожа на типичные примеры из обучения.

Сильная сторона LLM — она неплохо справляется с задачей, если вопрос звучит привычно. Проблема в том, что пользователь не знает, какая формулировка «привычная» для конкретной модели в конкретной теме.

Метод обходит это простым трюком: если несколько по-разному сформулированных вопросов дают одинаковый ответ — это сильный сигнал, что модель действительно «понимает» суть, а не угадывает по словам. Разброс ответов — сигнал, что нужна дополнительная проверка.

Рычаг управления: число вариантов формулировки. Для быстрой проверки хватит 2-3 переформулировки. Для критичных решений (медицина, юридические вопросы, финансы) — 4-5 плюс смена формата данных (текст → таблица → список).


📋

Шаблон промпта

Мне важно проверить надёжность ответа на вопрос по теме "{тема}".
Ответь на один и тот же вопрос, заданный четырьмя способами с одинаковым смыслом:

1. {формулировка_1}
2. {формулировка_2}
3. {формулировка_3}
4. {формулировка_4}

Дай короткий ответ на каждый пункт отдельно.
Затем сравни все четыре ответа: совпадают ли они по существу?
Если да — укажи "ответ устойчив".
Если нет — покажи разницу и предположи, почему формулировка повлияла на ответ.

Что подставлять: {тема} — область вопроса (лекарство, налоги, техническая спецификация), {формулировка_N} — сам вопрос, переформулированный разными словами, но с тем же смыслом.

🚀 Быстрый старт — вставь в чат:

Вот шаблон проверки надёжности ответа LLM через переформулировку вопроса. 
Адаптируй под мой вопрос: {твой вопрос}.
Задавай уточняющие вопросы, чтобы составить 4 разные формулировки.

[вставить шаблон выше]

LLM спросит, в чём именно суть вопроса и какие аспекты нельзя менять при переформулировке — потому что от этого зависит, останутся ли варианты семантически одинаковыми.


⚠️

Ограничения

⚠️ Метод только выявляет проблему, не решает её: если ответы модели расходятся — вы узнаёте, что доверять нельзя, но правильного ответа так и не получаете. Нужна проверка во внешнем источнике.

⚠️ В узких специализированных темах разброс больше: там, где данных мало (редкие лекарства, нишевые юридические случаи, специфичные химические соединения), даже переформулировка не спасает — модель может стабильно ошибаться во всех вариантах одинаково.

⚠️ Стоит времени и токенов: проверка требует нескольких запросов вместо одного — не имеет смысла для рутинных несложных вопросов.


🔍

Как исследовали

Команда из Notre Dame собрала 4484 примера в 33 настройках — 8 категорий химических задач: от подсчёта атомов в молекуле до предсказания продукта реакции. Для каждой задачи сделали несколько формулировок вопроса и несколько способов представить одну и ту же молекулу — текстовым кодом, официальным названием, картинкой структуры. Прогнали через 23 модели, от специализированных химических (ChemLLM, ChemDFM) до общих (GPT, Claude, Gemini, Llama).

Результат подтвердил опасение: даже у сильных моделей точность на одной и той же задаче «гуляла» в зависимости от формулировки — иногда разброс достигал десятков процентных пунктов. Любопытная деталь: специализированные химические модели заметно устойчивее общих — это логично, ведь они «видели» больше разных формулировок химических задач в обучении. Но полностью устойчивых моделей не нашли — разброс есть у всех.

Главный практический вывод: точность на одном бенчмарке с фиксированной формулировкой — это не показатель надёжности модели в реальной работе, где пользователи задают вопросы по-разному.


🔗

Ресурсы

ChemDIRT: A Diversified Instruction, Representation, and Task Benchmark for Robust Chemistry-LLM Evaluation — Eric Inae, Tim Gunn, Chris Bond, Meng Jiang, University of Notre Dame. Код и данные: GitHub, Hugging Face


📋 Дайджест исследования

Ключевая суть

90% точности → 45% на той же самой задаче. Просто переформулировали вопрос, смысл не менялся. ChemDIRT позволяет проверить, действительно ли химическая модель понимает факт о молекуле, или подгоняет ответ под привычную фразу из обучения. Метод берёт одну молекулу и прогоняет её через 4-10 разных формулировок вопроса и три формата данных — текстовый код SMILES, официальное название по системе IUPAC, картинку. Если ответы расходятся — модель угадывает, а не знает. Проверили на 23 моделях — от GPT и Claude до узких химических моделей.

Принцип работы

Модель не хранит факт о молекуле как запись в таблице — она реагирует на похожесть фразы с тем, что видела при обучении. Одна и та же молекула в коде SMILES и в официальном названии IUPAC — для модели два разных объекта, хотя химик видит одно и то же вещество. Прикол в том, что смена формата данных бьёт по точности так же сильно, как смена слов в вопросе.

Почему работает

LLM устроена так — предсказывает следующее слово по похожести на тренировочные тексты, а не достаёт факт из базы. Фраза «определи токсичность» и «есть ли риск токсичности» значат одно, но встречались в обучении по-разному — вот и разные ответы на одинаковый вопрос. Совпадение ответов на разные формулировки — единственный сигнал снаружи, что модель отвечает не наугад. Разброс в узких темах (редкие соединения) даже больше — там модель может стабильно ошибаться во всех вариантах сразу.

Когда применять

Химические и научные LLM → для проверки надёжности перед реальным использованием (расчёт токсичности, предсказание реакции, свойства вещества), особенно когда молекула редкая или малоизученная. Не подходит для рутинных простых вопросов — тратит токены и время впустую там, где риск ошибки низкий.

Мини-рецепт

1. Собери формулировки: 4-10 вариантов одного вопроса, разные слова — смысл тот же
2. Смени формат данных: текстовый код SMILES, официальное название IUPAC, картинка молекулы
3. Прогони всё через модель: каждую формулировку с каждым форматом
4. Сравни не только правильность, но совпадение: одинаковы ли ответы между вариантами
5. Если разошлись — не верь: проверь ответ в справочнике или у химика

Примеры

[ПЛОХО] : Определи токсичность молекулы CCO
[ХОРОШО] : Определи токсичность молекулы, заданной кодом CCO. Затем ответь на тот же вопрос про молекулу с названием "этанол" (то же вещество, другой формат). Сравни оба ответа — совпадают по смыслу?
Источник: ChemDIRT: A Diversified Instruction, Representation, and Task Benchmark for Robust Chemistry-LLM Evaluation
ArXiv ID: 2608.21504 | Сгенерировано: 2026-08-25 08:12

Проблемы LLM

ПроблемаСутьКак обойти
Модель зависит от формы вопроса, а не только от смыслаМеняешь формулировку вопроса или формат данных — смысл тот же, ответ другой. Точность может отличаться в разы на одной задаче. Модель ловит привычный паттерн фразы, а не сам фактЗадай вопрос 3-4 разными формулировками с одинаковым смыслом. Для важных данных проверь разные форматы: обычный текст, код, таблицу, официальное название. Сравни ответы между собой

Методы

МетодСуть
Проверка через переформулировку — тест на устойчивость ответаЗадай один вопрос 3-5 способами с одинаковым смыслом. Попроси модель ответить на каждый отдельно, потом сравнить. Ответь на вопрос по теме "X" четырьмя разными способами. Дай короткий ответ на каждый. Затем сравни — совпадают ли по смыслу? Работает потому что: у модели нет счётчика уверенности, но совпадение ответов при разной фразировке — косвенный признак настоящего знания, а не угадывания. Годится для проверки фактов в медицине, праве, финансах. Не подходит как способ найти правильный ответ — только как индикатор доверия к тому что уже есть

Тезисы

ТезисКомментарий
Согласованность ответов при переформулировке — индикатор надёжности, а не правильностиМодель не умеет сказать "я не уверен" числом. Единственный доступный сигнал — сравнить ответы на разные формулировки одного смысла. Совпадение говорит: ответ основан на устойчивом знании. Расхождение говорит: модель угадывает по словам вопроса. Применяй: для важных решений задай вопрос 3-4 способами перед тем как доверять ответу
📖 Простыми словами

ChemDIRT: A Diversified Instruction, Representation, and Task Benchmark for Robust Chemistry-LLMEvaluation

arXiv: 2608.21504

Нейросети не понимают суть твоих задач — они просто угадывают продолжение текста. Если переформулировать вопрос, вообще не меняя его смысла, точность ответов модели может мгновенно рухнуть с 90% до 45%. Исследователи прогнали 23 модели через бенчмарк ChemDIRT и доказали: AI реагирует не на факты, а на формулировку вопроса и формат подачи данных, будь то обычный текст, картинка или специализированный код.

Это как школьник-зубрила, который выучил билет слово в слово, но сыпется на первом же простом вопросе не по учебнику. Формально он всё знает, но стоит переставить слова местами, и в ответе начинается полная каша. Модель не решает задачу осознанно — она ищет знакомый паттерн, и если визуальная обёртка чуть изменилась, она начинает уверенно выдавать чушь с невозмутимым видом.

Что конкретно вскрыло проблему: авторы протестировали всё подряд — от топовых GPT-4 и Claude до узких химических нейросетей. Оказалось, что смена репрезентации данных вроде перехода от текста к коду молекулы или картинке начисто ломает логику большинства сеток. У моделей напрочь отсутствует внутренний контроль уверенности: они не понимают, где знают ответ точно, а где просто тыкают пальцем в небо.

Тестировали на сложной химии, но принцип универсален абсолютно для всего. Спрашиваешь ты ChatGPT про дозировку лекарства для ребёнка, расчет налогов при продаже квартиры или кусок сложного кода — один удачный запрос выдаст идеальное решение, а его синоним подсунет опасную галлюцинацию. Слепо доверять первому попавшемуся ответу — это чистая лотерея.

Короче: один промпт ничего не доказывает. Если цена ошибки высока, всегда переформулируй вопрос два-три раза, меняй форматы и смотри, не поплыл ли результат. Кто проверяет стабильность ответов, тот получает рабочий результат, а остальные рискуют внедрить в жизнь или бизнес галлюцинаторный бред.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с