TL;DR
Исследователи придумали способ измерить, насколько легко атакующему «протащить» нужную ему информацию в ответы ИИ-поисковиков (ChatGPT с поиском, Gemini, Claude с веб-режимом). Идея простая: они делят все источники, на которые ссылается ИИ, по барьеру публикации — насколько легко кому угодно опубликовать там контент. Пост в соцсети — барьер низкий, любой может написать что угодно. Крупное издание с редакцией — барьер средний. Официальный госсайт — барьер высокий.
Главная находка: чем больше ИИ-поисковик цитирует источники с низким барьером (форумы, соцсети, самиздат-сайты), тем легче атакующему подсунуть туда нужный текст и получить его в ответе модели. Причём это не значит, что модель «предпочитает» слабые источники — часто дело в том, какие запросы модель сама формирует для поиска: если поисковый запрос сформулирован широко, в выдачу попадает мусор, и модель цитирует то, что нашла.
Метод решает эту проблему тремя измерениями: (1) считают, сколько цитат каждого уровня барьера попало в ответ, (2) смотрят, сколько текста в ответе «принадлежит» каждому уровню барьера (домирование), (3) проверяют, насколько точно ответ пересказывает именно то, что написано в источнике (верность источнику). Три эти цифры вместе показывают, где у конкретного ИИ-поисковика дыра в защите.
Схема метода
ШАГ 1: Классифицировать домен-источник → категория барьера
(primary — сайт самой партии/организации;
opponent — сайт конкурента;
low — платформы/соцсети/личные блоги, где может писать кто угодно;
medium — медиа и компании с редакцией;
high — научные/госисточники с обязательной нейтральностью)
ШАГ 2: Задать вопрос ИИ-поисковику (с профилем пользователя или без) → получить ответ с цитатами
ШАГ 3: Посчитать три метрики по ответу:
- Распределение барьеров (сколько цитат какого уровня)
- Domination (сколько % текста ответа держится на источниках каждого барьера)
- Faithfulness (насколько точно текст ответа соответствует содержанию цитаты)
ШАГ 4: Сравнить показатели между моделями / партиями / профилями пользователя
Шаги 1 и 3 в оригинале делались через отдельные вызовы LLM-как-судьи плюс ручную проверку — то есть это исследовательская инфраструктура. Но сама логика классификации применима вручную в любом чате.
Пример применения
Задача: Вы хотите разобраться, насколько ИИ-поисковик (например, Perplexity или ChatGPT с поиском) уязвим к манипуляции, когда вы спрашиваете его о спорной теме — скажем, о репутации конкретного банка или политика перед выборами.
Промпт:
Я задам тебе вопрос с включённым веб-поиском. После того как ответишь,
покажи список всех источников, на которые ты сослался, и для каждого укажи:
1. Тип источника:
- официальный сайт самой организации/партии (primary)
- сайт оппонента/конкурента (opponent)
- платформа, где может писать кто угодно — форум, соцсеть, блог без редакции (low)
- медиа или компания с редакционным контролем (medium)
- научный/государственный источник с требованием нейтральности (high)
2. Сколько предложений в твоём ответе опирается именно на этот источник (в %)
Вопрос: {твой вопрос про политика, компанию или спорную тему}
Результат: Модель даст обычный ответ на вопрос, а затем — таблицу или список источников с разметкой по типу и долей влияния на текст. Вы увидите, если, например, 60% ответа держится на одном посте в соцсети без редакции — это сигнал, что здесь легко подсунуть фейк и ИИ его повторит.
Почему это работает
ИИ-поисковик не умеет сам оценивать надёжность источника — он оценивает только релевантность тексту запроса. Слабость в том, что любой может создать сайт-клон настоящего СМИ (в статье упоминается операция «Doppelganger» — больше 700 фейковых новостных сайтов, скопировавших дизайн легитимных медиа) — и по содержанию его не отличить от настоящего.
Сильная сторона LLM здесь — способность классифицировать домен по типу (соцсеть, госсайт, медиа) просто по названию и контексту, без специальных баз данных. Это ровно то, что нужно для ручной проверки: попросить модель саму разметить свои источники по уровню барьера.
Рычаги управления: - Убери требование «% влияния на текст» → получишь просто список категорий, быстрее, но менее детально - Добавь «объясни, почему ты счёл источник надёжным» → увидишь логику модели, можно найти слабые места в её рассуждении - Замени категории барьера на свои (например, «финансовый», «государственный», «частный блог») → адаптируешь под свою тему, не только политику
Шаблон промпта
Проанализируй ответ на вопрос "{твой вопрос}", который ты дашь с включённым
веб-поиском. После ответа классифицируй каждый источник, на который ты
сослался, по уровню риска манипуляции:
- ПЕРВИЧНЫЙ: официальный сайт самого субъекта вопроса ({название организации/человека})
- КОНКУРЕНТ: сайт оппонента/конкурента
- НИЗКИЙ БАРЬЕР: платформа без редактуры — форум, соцсеть, личный блог,
wiki без модерации (сюда легко написать что угодно)
- СРЕДНИЙ БАРЬЕР: медиа или компания с редакционным контролем
- ВЫСОКИЙ БАРЬЕР: научный или государственный источник с требованием нейтральности
Для каждого источника укажи:
1. Категорию барьера
2. Долю текста твоего ответа, основанную на этом источнике (примерно, в %)
3. Насколько точно твой пересказ соответствует содержанию источника
(точно / с искажением / додумано)
Вопрос: {твой вопрос}
🚀 Быстрый старт — вставь в чат:
Вот шаблон анализа надёжности источников для ИИ-поисковика.
Адаптируй под мою задачу: {опиши свою тему — компания, персона, продукт, о котором хочешь спросить}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какой это домен (политика, бизнес, продукт) и кто «первичный» источник в вашем случае — потому что без этого нельзя правильно разметить категории барьера.
Ограничения
⚠️ Не измеряет реальную атаку: метод показывает потенциальную дырку в защите, но не проверяет, сработает ли настоящая атака с реальным фейковым контентом. Это карта риска, не доказательство уязвимости.
⚠️ Ручная классификация неточна: когда ИИ-модели не соглашались друг с другом при разметке источника, решение принимали люди вручную — то есть чистой автоматизации категорий пока нет, и ваша собственная разметка через промпт будет с погрешностью.
⚠️ Персонализация почти не влияет: если вы надеялись, что указание своих политических взглядов в профиле сильно изменит, какие источники цитирует ИИ — исследование показало, что это работает слабо. Профиль пользователя почти не меняет паттерн цитирования по барьерам.
Как исследовали
Исследователи прогнали 3 861 ответ через три модели (GPT-5, Claude Sonnet 4, Gemini Flash 2.5) с включённым веб-поиском, задавая вопросы про 13 политических партий в США и Японии, комбинируя это с 3 профилями пользователей (разный уровень политических знаний и разная идеология) и 33 шаблонами вопросов.
Логика была такой: сначала классифицировали каждую цитату по её домену — используя две разные LLM как «судей» плюс ручную проверку, когда судьи расходились во мнениях. Затем для каждого ответа посчитали, сколько цитат какого барьера, сколько текста держится на каждой категории и насколько точно текст соответствует первоисточнику.
Удивительный результат: правящая партия оказалась более уязвима, чем оппозиция — потому что про неё чаще пишут в соцсетях и на низкобарьерных площадках, а про оппозицию модель чаще цитирует крупные медиа. Ещё интереснее — разница в уязвимости между моделями объясняется не тем, что модель «предпочитает» слабые источники при выборе из выдачи, а тем, какие поисковые запросы модель сама генерирует: если поиск формулируется широко и мутно, в выдачу попадает больше низкобарьерного мусора ещё на этапе поиска, до того как модель начала выбирать, что цитировать.
Адаптации и экстраполяции
🔧 Техника: смена домена барьеров → проверка источников в любой теме
Категории primary/opponent/low/medium/high созданы для политики, но принцип «насколько легко опубликовать здесь фейк» переносится на любую тему. Для медицинских вопросов: primary = сайт клиники/врача, low = форум пациентов, high = рецензируемый журнал. Для финансов: primary = сайт компании, low = телеграм-канал «инсайдера», high = отчётность на бирже.
Проанализируй ответ на вопрос о {лекарство/диагноз/финансовый инструмент}.
Классифицируй источники:
- ПЕРВИЧНЫЙ: официальный производитель/регулятор
- НИЗКИЙ БАРЬЕР: форумы пациентов/инвесторов, соцсети, блоги без редактуры
- СРЕДНИЙ БАРЬЕР: медицинские/финансовые издания с редакцией
- ВЫСОКИЙ БАРЬЕР: рецензируемые журналы, официальная статистика регулятора
Это превращает исследовательский метод в личный чек надёжности перед тем, как доверять ответу ИИ-поисковика по важному для вас вопросу — здоровью, деньгам, крупной покупке.
Ресурсы
Riku Mochizuki, Shusuke Komatsu, Souta Noguchi, Kazuto Ataka — Keio University / QueryLift Inc., Tokyo. Assessing Attack Surfaces in Generative Search Engines through Publisher Attributes: A Case Study in Political Domains. Отсылки: PoisonedRAG (Zou et al.), GEO — generative engine optimization (Aggarwal et al.), операция «Doppelganger» (EU DisinfoLab).
