TL;DR
Один и тот же вопрос, заданный одной и той же модели GPT-5.3, даёт разные ответы в зависимости от того, спрашиваешь ты через обычный чат ChatGPT или через программный API — и от того, включён ли веб-поиск. Разница не в самой модели, а в надстройках: системные промпты, модерация и поиск работают по-разному в браузерной версии и в API, хотя "мозг" внутри один.
Главная боль: если задать один вопрос три раза подряд, ответы совпадут не всегда — расхождение доходит до 21% случаев. Включение веб-поиска не спасает — точность иногда падает на 8 процентных пунктов, а иногда даже разворачивает тренд: с поиском чат-версия внезапно становится точнее API, хотя без поиска было наоборот. Модель может отказаться отвечать в одном режиме и спокойно ответить в другом — на тот же самый вопрос.
Это не техника, а предупреждение: доверять единственному ответу ChatGPT на важный вопрос — рискованно. Чтобы получить надёжный факт, нужно спросить несколько раз, в разных режимах (с поиском / без) и сравнить.
Что обнаружили (схема исследования)
ПРОВЕРКА 1: Точность → чат UI и API дают разную точность на одинаковых вопросах,
веб-поиск иногда СНИЖАЕТ точность вместо повышения
ПРОВЕРКА 2: Повторяемость → тот же вопрос 3 раза → до 21% ответов не совпадают
ПРОВЕРКА 3: Источники → чат и API цитируют РАЗНЫЕ сайты даже давая одинаковый ответ
ПРОВЕРКА 4: Отказ отвечать → непоследователен — отказ в одном режиме, ответ в другом
Пример применения
Задача: Вы готовите текст для клиента — например, разбираете вопрос о налоговом вычете за квартиру или трактовку статьи закона, и хотите опереться на ответ ChatGPT как на факт.
Промпт:
Проверь для меня факт: {ваш вопрос, например "Какой лимит налогового вычета
при покупке квартиры в 2025 году в России?"}
Ответь сначала без использования поиска в интернете.
Затем включи поиск и ответь снова, указав источники.
Сравни оба ответа — совпадают ли они?
Результат: Вы увидите два ответа — "по памяти" модели и "с поиском", возможно с разными цифрами или формулировками. Если они не совпадают — это сигнал, что факт нестабилен и нужно проверить вручную, а не полагаться на первый попавшийся ответ.
Почему это работает
Модель — не база данных с одним верным ответом, а генератор текста, который каждый раз собирает ответ немного по-разному (в исследовании стояла температура генерации 1.0 — то есть модель специально не детерминирована). Плюс браузерная версия ChatGPT и API — это разные "обёртки" вокруг одной модели: у них разные системные инструкции, фильтры и логика подключения поиска.
Сильная сторона модели — она отлично выполняет прямые инструкции, если попросить явно сравнить свои же ответы или показать источники.
Метод "триангуляции" использует эту сильную сторону: вместо того чтобы доверять одному ответу, вы заставляете модель дать несколько версий (с поиском / без, в новом чате) и сверяете их между собой — расхождение само подскажет, где факт нестабилен.
Рычаги управления: - Тумблер поиска в интерфейсе ChatGPT → включай/выключай для сравнения на важных фактах - Новый чат для повторного вопроса → проверка на случайность ответа - Явный запрос источников → видно, откуда модель взяла цифры
Ограничения
⚠️ Это не готовая техника, а сигнал тревоги. Исследование показывает проблему, но не даёт формулы "как гарантированно получить правильный ответ" — только способ обнаружить, что ответу нельзя доверять слепо.
⚠️ Не критично для творческих задач. Разброс ответов важен для фактов (цифры, законы, медицина), но не имеет значения для текстов, идей, черновиков.
⚠️ Требует лишних действий. Чтобы проверить факт триангуляцией, нужно 2-3 запроса вместо одного — не всегда удобно для рутинных вопросов.
Как исследовали
Команда взяла два известных бенчмарка про предрассудки и безопасность ответов (BBQ и SafetyBench), выбрала 401 вопрос и прогнала каждый три раза в четырёх режимах: обычный чат / API, с поиском / без поиска. Получилось почти 4812 ответов на одни и те же вопросы.
Дальше сравнили не только точность, но и согласованность повторов, схожесть текста ответов, какие сайты модель цитирует и как часто она отказывается отвечать. Удивительный результат: обычно думают, что API — это "эталонное" поведение модели, а чат — просто удобная обёртка сверху. Но оказалось, что чат-версия ведёт себя настолько иначе, что при включении поиска тренд точности разворачивается на противоположный — с поиском чат вдруг обгоняет API, хотя без поиска было наоборот. Вывод для практики: нельзя судить о надёжности модели по одному запуску через один канал — поведение "той же" модели сильно зависит от того, как к ней обращаешься.
Ресурсы
What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations) — Ro Encarnación, Tina Behzad, Emma Lurie, Danaë Metaxa (University of Pennsylvania, Stony Brook University). Датасет: github.com/seerocode/aies-llm-modality-audit
