3,583 papers
arXiv:2608.06202 75 6 авг. 2026 г. FREE

Модальность и поиск в ChatGPT: почему один и тот же вопрос даёт разные ответы в браузере и через API

КЛЮЧЕВАЯ СУТЬ
До 21% ответов не совпадают, если задать один и тот же вопрос трижды подряд одной модели GPT-5.3. Обнаружено: браузерная версия ChatGPT и API — это разные обёртки вокруг одного мозга, и они по-разному подключают веб-поиск и системные промпты. Метод триангуляции позволяет проверить любой важный факт перед тем как вставлять ответ ChatGPT в документ клиенту. Задай вопрос с поиском и без, сравни ответы — расхождение сразу покажет, где модель путается. До 21% ответов расходятся при обычном повторе того же вопроса.
Адаптировать под запрос

TL;DR

Один и тот же вопрос, заданный одной и той же модели GPT-5.3, даёт разные ответы в зависимости от того, спрашиваешь ты через обычный чат ChatGPT или через программный API — и от того, включён ли веб-поиск. Разница не в самой модели, а в надстройках: системные промпты, модерация и поиск работают по-разному в браузерной версии и в API, хотя "мозг" внутри один.

Главная боль: если задать один вопрос три раза подряд, ответы совпадут не всегда — расхождение доходит до 21% случаев. Включение веб-поиска не спасает — точность иногда падает на 8 процентных пунктов, а иногда даже разворачивает тренд: с поиском чат-версия внезапно становится точнее API, хотя без поиска было наоборот. Модель может отказаться отвечать в одном режиме и спокойно ответить в другом — на тот же самый вопрос.

Это не техника, а предупреждение: доверять единственному ответу ChatGPT на важный вопрос — рискованно. Чтобы получить надёжный факт, нужно спросить несколько раз, в разных режимах (с поиском / без) и сравнить.


📌

Что обнаружили (схема исследования)

ПРОВЕРКА 1: Точность → чат UI и API дают разную точность на одинаковых вопросах, 
            веб-поиск иногда СНИЖАЕТ точность вместо повышения
ПРОВЕРКА 2: Повторяемость → тот же вопрос 3 раза → до 21% ответов не совпадают
ПРОВЕРКА 3: Источники → чат и API цитируют РАЗНЫЕ сайты даже давая одинаковый ответ
ПРОВЕРКА 4: Отказ отвечать → непоследователен — отказ в одном режиме, ответ в другом

🚀

Пример применения

Задача: Вы готовите текст для клиента — например, разбираете вопрос о налоговом вычете за квартиру или трактовку статьи закона, и хотите опереться на ответ ChatGPT как на факт.

Промпт:

Проверь для меня факт: {ваш вопрос, например "Какой лимит налогового вычета 
при покупке квартиры в 2025 году в России?"}

Ответь сначала без использования поиска в интернете.
Затем включи поиск и ответь снова, указав источники.
Сравни оба ответа — совпадают ли они?

Результат: Вы увидите два ответа — "по памяти" модели и "с поиском", возможно с разными цифрами или формулировками. Если они не совпадают — это сигнал, что факт нестабилен и нужно проверить вручную, а не полагаться на первый попавшийся ответ.


🧠

Почему это работает

Модель — не база данных с одним верным ответом, а генератор текста, который каждый раз собирает ответ немного по-разному (в исследовании стояла температура генерации 1.0 — то есть модель специально не детерминирована). Плюс браузерная версия ChatGPT и API — это разные "обёртки" вокруг одной модели: у них разные системные инструкции, фильтры и логика подключения поиска.

Сильная сторона модели — она отлично выполняет прямые инструкции, если попросить явно сравнить свои же ответы или показать источники.

Метод "триангуляции" использует эту сильную сторону: вместо того чтобы доверять одному ответу, вы заставляете модель дать несколько версий (с поиском / без, в новом чате) и сверяете их между собой — расхождение само подскажет, где факт нестабилен.

Рычаги управления: - Тумблер поиска в интерфейсе ChatGPT → включай/выключай для сравнения на важных фактах - Новый чат для повторного вопроса → проверка на случайность ответа - Явный запрос источников → видно, откуда модель взяла цифры


⚠️

Ограничения

⚠️ Это не готовая техника, а сигнал тревоги. Исследование показывает проблему, но не даёт формулы "как гарантированно получить правильный ответ" — только способ обнаружить, что ответу нельзя доверять слепо.

⚠️ Не критично для творческих задач. Разброс ответов важен для фактов (цифры, законы, медицина), но не имеет значения для текстов, идей, черновиков.

⚠️ Требует лишних действий. Чтобы проверить факт триангуляцией, нужно 2-3 запроса вместо одного — не всегда удобно для рутинных вопросов.


🔍

Как исследовали

Команда взяла два известных бенчмарка про предрассудки и безопасность ответов (BBQ и SafetyBench), выбрала 401 вопрос и прогнала каждый три раза в четырёх режимах: обычный чат / API, с поиском / без поиска. Получилось почти 4812 ответов на одни и те же вопросы.

Дальше сравнили не только точность, но и согласованность повторов, схожесть текста ответов, какие сайты модель цитирует и как часто она отказывается отвечать. Удивительный результат: обычно думают, что API — это "эталонное" поведение модели, а чат — просто удобная обёртка сверху. Но оказалось, что чат-версия ведёт себя настолько иначе, что при включении поиска тренд точности разворачивается на противоположный — с поиском чат вдруг обгоняет API, хотя без поиска было наоборот. Вывод для практики: нельзя судить о надёжности модели по одному запуску через один канал — поведение "той же" модели сильно зависит от того, как к ней обращаешься.


🔗

Ресурсы

What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations) — Ro Encarnación, Tina Behzad, Emma Lurie, Danaë Metaxa (University of Pennsylvania, Stony Brook University). Датасет: github.com/seerocode/aies-llm-modality-audit


📋 Дайджест исследования

Ключевая суть

До 21% ответов не совпадают, если задать один и тот же вопрос трижды подряд одной модели GPT-5.3. Обнаружено: браузерная версия ChatGPT и API — это разные обёртки вокруг одного мозга, и они по-разному подключают веб-поиск и системные промпты. Метод триангуляции позволяет проверить любой важный факт перед тем как вставлять ответ ChatGPT в документ клиенту. Задай вопрос с поиском и без, сравни ответы — расхождение сразу покажет, где модель путается. До 21% ответов расходятся при обычном повторе того же вопроса.

Принцип работы

Не спрашивай один раз — спрашивай минимум дважды и сравнивай. Триангуляция — старый журналистский приём: если два независимых источника говорят разное, факт под вопросом. Здесь источники — это чат-версия и API, ответ с поиском и без. Расхождение ответов — это сам сигнал, а не шум который надо игнорировать.

Почему работает

Причина простая: чат-интерфейс и API — разные надстройки над одной моделью. У них разные системные инструкции, фильтры модерации и логика подключения поиска. Плюс температура генерации стоит на 1.0 — модель специально недетерминирована, поэтому ответы гуляют даже без всяких надстроек. Веб-поиск иногда снижает точность на 8 процентных пунктов вместо ожидаемого роста. Разные обёртки дают разные факты, хотя мозг внутри один и тот же.

Когда применять

Проверка фактов → конкретно для цифр, законов, налоговых вычетов и медицинских рекомендаций, особенно когда ответ пойдёт в документ клиенту или в публичный текст. Не подходит для творческих задач — там разброс формулировок не имеет значения.

Мини-рецепт

1. Задай вопрос без поиска: получи первый ответ по памяти модели.
2. Включи веб-поиск и задай тот же вопрос: сравни цифры и формулировки с первым ответом.
3. Открой новый чат и повтори вопрос: проверь, совпадёт ли ответ со старым.
4. Попроси указать источники: явно спроси, с каких сайтов взяты цифры.

Примеры

[ПЛОХО] : Какой лимит налогового вычета за квартиру в 2025 году? — и сразу вставляешь ответ в документ для клиента.
[ХОРОШО] : Ответь на вопрос про лимит налогового вычета за квартиру в 2025 году сначала без поиска, затем включи поиск и укажи источники. Сравни оба ответа — совпадают ли цифры?
Источник: What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications for Safety Evaluations
ArXiv ID: 2608.06202 | Сгенерировано: 2026-08-07 04:22

Проблемы LLM

ПроблемаСутьКак обойти
Один и тот же вопрос даёт разные ответы при повтореСпрашиваешь модель дважды-трижды один и тот же фактический вопрос. Ответы могут не совпасть — до пятой части повторов расходится. Модель генерирует текст заново каждый раз, а не достаёт готовый факт из базыЗадай важный вопрос 2-3 раза в новых чатах. Если ответы разные — не доверяй ни одному, проверяй вручную
Способ доступа к модели меняет ответ и точностьОдин и тот же вопрос через обычный чат и через программный доступ (API) может дать разный ответ и разную точность. Включение веб-поиска не всегда помогает — иногда точность падает, иногда меняется даже то, какой из двух способов точнее. Модель может отказаться отвечать в одном режиме и спокойно ответить в другом на тот же вопрос. Причина — разные надстройки (системные инструкции, фильтры, логика подключения поиска) вокруг одной и той же моделиДля важных фактов проверяй ответ и с включённым, и с выключенным поиском. Если доступны разные способы обращения к модели (чат, API) — сравни ответы из обоих

Методы

МетодСуть
Триангуляция ответов — проверка факта через сравнение вариантовЗадай один вопрос несколько раз: без поиска и с поиском, в новом чате, попроси явно указать источники. Затем попроси модель сравнить свои же ответы. Ответь без поиска. Затем включи поиск и ответь снова с источниками. Сравни оба ответа. Работает, потому что модель хорошо выполняет прямые инструкции на сравнение, а расхождение между вариантами само указывает, где факт нестабилен. Применяй для цифр, законов, дат, медицинских фактов. Не нужно для творческих текстов, идей, черновиков — там разброс не важен

Тезисы

ТезисКомментарий
Расхождение между повторными ответами — сигнал ненадёжности факта, а не признак ошибкиМодель генерирует ответ заново при каждом запросе, а не подставляет фиксированный факт. Если несколько попыток дают разные версии — это значит модель "не уверена" в факте, хотя формулирует его уверенным тоном. Применяй: не оценивай надёжность ответа по одной попытке. Задай вопрос повторно и смотри, стабилен ли результат
📖 Простыми словами

What CurrentAIBenchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)

arXiv: 2608.06202

Суть в том, что GPT-5.3 — это не монолитный оракул, а пластилин, форму которого определяет «коробка». Исследование показало, что одна и только же модель выдает принципиально разные результаты в зависимости от того, как ты к ней обращаешься: через интерфейс ChatGPT в браузере или через программный API. Проблема не в «мозгах» нейронки, а в обвязке — системных промптах, скрытых фильтрах и механизмах поиска, которые работают по-разному. В итоге получается, что идентичность модели — это миф, и на один и тот же вопрос ты получишь два разных мнения от одного и того же «эксперта».

Это как если бы ты пришел к врачу в государственную клинику, а вечером — к нему же в частную. В первом случае он уставший и ограничен протоколами ОМС, а во втором — у него есть время, доступ к платной лаборатории и другое настроение. Врач один и тот же, знания те же, но диагноз и метод лечения могут отличаться просто из-за контекста приема. В мире AI этот контекст создают невидимые настройки, которые превращают одну модель в двух разных персонажей.

Что реально ломает логику: веб-поиск и системные инструкции. В браузерной версии ChatGPT вшит огромный невидимый текст, который заставляет модель быть вежливой, осторожной и использовать поиск определенным образом. В API этого текста либо нет, либо он другой. Исследователи выставили температуру 1.0 — это режим «творческого хаоса», когда модель не обязана повторяться. В итоге разница в ответах между чатом и кодом становится критической: там, где чат найдет свежую ссылку и перескажет ее, API может просто выдать галлюцинацию или сухую справку из старой базы.

Этот принцип универсален для любого серьезного внедрения AI. Если ты тестируешь промпты в удобном чатике ChatGPT, а потом переносишь их в свой сервис через API — ты идешь по граблям. Результаты не совпадут. Это касается всего: от юридических консультаций до написания кода. Ты не можешь просто скопировать удачный ответ из браузера и ждать, что программа повторит его один в один. Среда определяет результат так же сильно, как и сама нейронка.

Короче: хватит верить, что название модели гарантирует стабильность. Если хочешь предсказуемости, тестируй всё именно в той среде, где продукт будет работать. Разрыв между чатом и API — это не баг, а фундаментальная особенность того, как корпорации упаковывают свои технологии. Кто не учитывает эту разницу, тот рано или поздно подставит клиента, выдав галлюцинацию за факт просто потому, что в API забыли включить нужную «галочку» поиска.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с