TL;DR
Модель может дать точность 90% или 45% на одной и той же задаче — просто потому что вопрос переформулировали, не меняя смысла. Исследователи проверили это на 23 моделях (от общих типа GPT и Claude до узкоспециализированных химических) и увидели: ответ зависит не только от того, ЧТО вы спрашиваете, но и КАК вы формулируете вопрос, и в каком виде подаёте данные — текстом, специальным кодом или картинкой.
Главная боль: модель не «понимает» факт один раз и навсегда — она реагирует на поверхностный паттерн фразировки. Спросите «определи токсичность молекулы X» и «есть ли у молекулы X риск токсичности» — казалось бы, одно и то же, но модель может ответить по-разному, потому что в её обучающих данных эти формулировки встречались в разных контекстах. То же самое с представлением данных: если одну и ту же молекулу описать текстовым кодом (SMILES) или официальным названием (IUPAC), точность ответа модели может измениться — хотя информация идентична.
Метод исследования — ChemDIRT: для каждой задачи составили несколько семантически одинаковых формулировок вопроса и несколько форматов представления одних и тех же данных, прогнали через модели и сравнили не только точность, но и согласованность ответов между вариантами.
Схема метода
ШАГ 1: Берём задачу → создаём 4–10 разных формулировок вопроса с одинаковым смыслом
ШАГ 2: Берём один и тот же объект (молекулу) → представляем в разных форматах (текстовый код, официальное название, картинка)
ШАГ 3: Прогоняем модель на всех комбинациях → сравниваем не только правильность, но и одинаковость ответов между вариантами
Все шаги выполняются как отдельная серия запросов — не в одном промпте.
Пример применения
Задача: Вы спросили ChatGPT про дозировку лекарства для ребёнка или про юридическую тонкость (например, нужно ли платить налог с продажи квартиры, которая в собственности меньше 3 лет) — и хотите проверить, насколько ответу можно доверять, а не гадает ли модель.
Промпт:
Ответь на один и тот же вопрос по теме "{тема}", но я задам его четырьмя разными способами.
Дай короткий ответ на каждый вариант, не меняя суть вопроса между формулировками.
1. {вопрос, вариант 1}
2. {вопрос, вариант 2, другими словами}
3. {вопрос, вариант 3, с другой структурой предложения}
4. {вопрос, вариант 4, максимально формально/официально}
После всех четырёх ответов — сравни их. Если ответы совпадают по смыслу — отметь высокую уверенность. Если различаются — покажи в чём разница.
Результат: Модель даст четыре ответа подряд, а затем краткое резюме — совпадают они или нет. Если ответы разошлись, это сигнал: модель не «знает» факт железно, а угадывает по формулировке. В этом случае стоит проверить ответ в другом источнике, а не доверять первому попавшемуся варианту.
Почему это работает
Слабость LLM в том, что у неё нет внутреннего счётчика уверенности, видимого пользователю. Модель выдаёт правдоподобный текст, а не «знание» в чистом виде — и правдоподобность сильно зависит от того, насколько формулировка похожа на типичные примеры из обучения.
Сильная сторона LLM — она неплохо справляется с задачей, если вопрос звучит привычно. Проблема в том, что пользователь не знает, какая формулировка «привычная» для конкретной модели в конкретной теме.
Метод обходит это простым трюком: если несколько по-разному сформулированных вопросов дают одинаковый ответ — это сильный сигнал, что модель действительно «понимает» суть, а не угадывает по словам. Разброс ответов — сигнал, что нужна дополнительная проверка.
Рычаг управления: число вариантов формулировки. Для быстрой проверки хватит 2-3 переформулировки. Для критичных решений (медицина, юридические вопросы, финансы) — 4-5 плюс смена формата данных (текст → таблица → список).
Шаблон промпта
Мне важно проверить надёжность ответа на вопрос по теме "{тема}".
Ответь на один и тот же вопрос, заданный четырьмя способами с одинаковым смыслом:
1. {формулировка_1}
2. {формулировка_2}
3. {формулировка_3}
4. {формулировка_4}
Дай короткий ответ на каждый пункт отдельно.
Затем сравни все четыре ответа: совпадают ли они по существу?
Если да — укажи "ответ устойчив".
Если нет — покажи разницу и предположи, почему формулировка повлияла на ответ.
Что подставлять: {тема} — область вопроса (лекарство, налоги, техническая спецификация), {формулировка_N} — сам вопрос, переформулированный разными словами, но с тем же смыслом.
🚀 Быстрый старт — вставь в чат:
Вот шаблон проверки надёжности ответа LLM через переформулировку вопроса.
Адаптируй под мой вопрос: {твой вопрос}.
Задавай уточняющие вопросы, чтобы составить 4 разные формулировки.
[вставить шаблон выше]
LLM спросит, в чём именно суть вопроса и какие аспекты нельзя менять при переформулировке — потому что от этого зависит, останутся ли варианты семантически одинаковыми.
Ограничения
⚠️ Метод только выявляет проблему, не решает её: если ответы модели расходятся — вы узнаёте, что доверять нельзя, но правильного ответа так и не получаете. Нужна проверка во внешнем источнике.
⚠️ В узких специализированных темах разброс больше: там, где данных мало (редкие лекарства, нишевые юридические случаи, специфичные химические соединения), даже переформулировка не спасает — модель может стабильно ошибаться во всех вариантах одинаково.
⚠️ Стоит времени и токенов: проверка требует нескольких запросов вместо одного — не имеет смысла для рутинных несложных вопросов.
Как исследовали
Команда из Notre Dame собрала 4484 примера в 33 настройках — 8 категорий химических задач: от подсчёта атомов в молекуле до предсказания продукта реакции. Для каждой задачи сделали несколько формулировок вопроса и несколько способов представить одну и ту же молекулу — текстовым кодом, официальным названием, картинкой структуры. Прогнали через 23 модели, от специализированных химических (ChemLLM, ChemDFM) до общих (GPT, Claude, Gemini, Llama).
Результат подтвердил опасение: даже у сильных моделей точность на одной и той же задаче «гуляла» в зависимости от формулировки — иногда разброс достигал десятков процентных пунктов. Любопытная деталь: специализированные химические модели заметно устойчивее общих — это логично, ведь они «видели» больше разных формулировок химических задач в обучении. Но полностью устойчивых моделей не нашли — разброс есть у всех.
Главный практический вывод: точность на одном бенчмарке с фиксированной формулировкой — это не показатель надёжности модели в реальной работе, где пользователи задают вопросы по-разному.
Ресурсы
ChemDIRT: A Diversified Instruction, Representation, and Task Benchmark for Robust Chemistry-LLM Evaluation — Eric Inae, Tim Gunn, Chris Bond, Meng Jiang, University of Notre Dame. Код и данные: GitHub, Hugging Face
