3,583 papers
arXiv:2608.15814 78 16 авг. 2026 г. FREE

Content-Injection Barrier: карта уязвимости ИИ-поисковиков к фейкам

КЛЮЧЕВАЯ СУТЬ
Обнаружено: ИИ-поисковик не отличает настоящий сайт издания от его точной копии — он проверяет только совпадение с запросом, а не надёжность источника. Метод барьер публикации позволяет посчитать, сколько текста в ответе ИИ держится на источниках, куда может написать кто угодно — форум, соцсеть, блог без редакции. Чем выше эта доля, тем легче атакующему подсунуть туда фейк и получить его в ответе модели. Операция Doppelgangerбольше 700 фейковых сайтов-клонов настоящих СМИ — доказывает: по содержанию клон не отличить от оригинала.
Адаптировать под запрос

TL;DR

Исследователи придумали способ измерить, насколько легко атакующему «протащить» нужную ему информацию в ответы ИИ-поисковиков (ChatGPT с поиском, Gemini, Claude с веб-режимом). Идея простая: они делят все источники, на которые ссылается ИИ, по барьеру публикации — насколько легко кому угодно опубликовать там контент. Пост в соцсети — барьер низкий, любой может написать что угодно. Крупное издание с редакцией — барьер средний. Официальный госсайт — барьер высокий.

Главная находка: чем больше ИИ-поисковик цитирует источники с низким барьером (форумы, соцсети, самиздат-сайты), тем легче атакующему подсунуть туда нужный текст и получить его в ответе модели. Причём это не значит, что модель «предпочитает» слабые источники — часто дело в том, какие запросы модель сама формирует для поиска: если поисковый запрос сформулирован широко, в выдачу попадает мусор, и модель цитирует то, что нашла.

Метод решает эту проблему тремя измерениями: (1) считают, сколько цитат каждого уровня барьера попало в ответ, (2) смотрят, сколько текста в ответе «принадлежит» каждому уровню барьера (домирование), (3) проверяют, насколько точно ответ пересказывает именно то, что написано в источнике (верность источнику). Три эти цифры вместе показывают, где у конкретного ИИ-поисковика дыра в защите.

🔬

Схема метода

ШАГ 1: Классифицировать домен-источник → категория барьера
  (primary — сайт самой партии/организации;
   opponent — сайт конкурента;
   low — платформы/соцсети/личные блоги, где может писать кто угодно;
   medium — медиа и компании с редакцией;
   high — научные/госисточники с обязательной нейтральностью)

ШАГ 2: Задать вопрос ИИ-поисковику (с профилем пользователя или без) → получить ответ с цитатами

ШАГ 3: Посчитать три метрики по ответу:
  - Распределение барьеров (сколько цитат какого уровня)
  - Domination (сколько % текста ответа держится на источниках каждого барьера)
  - Faithfulness (насколько точно текст ответа соответствует содержанию цитаты)

ШАГ 4: Сравнить показатели между моделями / партиями / профилями пользователя

Шаги 1 и 3 в оригинале делались через отдельные вызовы LLM-как-судьи плюс ручную проверку — то есть это исследовательская инфраструктура. Но сама логика классификации применима вручную в любом чате.


🚀

Пример применения

Задача: Вы хотите разобраться, насколько ИИ-поисковик (например, Perplexity или ChatGPT с поиском) уязвим к манипуляции, когда вы спрашиваете его о спорной теме — скажем, о репутации конкретного банка или политика перед выборами.

Промпт:

Я задам тебе вопрос с включённым веб-поиском. После того как ответишь, 
покажи список всех источников, на которые ты сослался, и для каждого укажи:

1. Тип источника: 
   - официальный сайт самой организации/партии (primary)
   - сайт оппонента/конкурента (opponent)  
   - платформа, где может писать кто угодно — форум, соцсеть, блог без редакции (low)
   - медиа или компания с редакционным контролем (medium)
   - научный/государственный источник с требованием нейтральности (high)

2. Сколько предложений в твоём ответе опирается именно на этот источник (в %)

Вопрос: {твой вопрос про политика, компанию или спорную тему}

Результат: Модель даст обычный ответ на вопрос, а затем — таблицу или список источников с разметкой по типу и долей влияния на текст. Вы увидите, если, например, 60% ответа держится на одном посте в соцсети без редакции — это сигнал, что здесь легко подсунуть фейк и ИИ его повторит.


🧠

Почему это работает

ИИ-поисковик не умеет сам оценивать надёжность источника — он оценивает только релевантность тексту запроса. Слабость в том, что любой может создать сайт-клон настоящего СМИ (в статье упоминается операция «Doppelganger» — больше 700 фейковых новостных сайтов, скопировавших дизайн легитимных медиа) — и по содержанию его не отличить от настоящего.

Сильная сторона LLM здесь — способность классифицировать домен по типу (соцсеть, госсайт, медиа) просто по названию и контексту, без специальных баз данных. Это ровно то, что нужно для ручной проверки: попросить модель саму разметить свои источники по уровню барьера.

Рычаги управления: - Убери требование «% влияния на текст» → получишь просто список категорий, быстрее, но менее детально - Добавь «объясни, почему ты счёл источник надёжным» → увидишь логику модели, можно найти слабые места в её рассуждении - Замени категории барьера на свои (например, «финансовый», «государственный», «частный блог») → адаптируешь под свою тему, не только политику


📋

Шаблон промпта

Проанализируй ответ на вопрос "{твой вопрос}", который ты дашь с включённым 
веб-поиском. После ответа классифицируй каждый источник, на который ты 
сослался, по уровню риска манипуляции:

- ПЕРВИЧНЫЙ: официальный сайт самого субъекта вопроса ({название организации/человека})
- КОНКУРЕНТ: сайт оппонента/конкурента
- НИЗКИЙ БАРЬЕР: платформа без редактуры — форум, соцсеть, личный блог, 
  wiki без модерации (сюда легко написать что угодно)
- СРЕДНИЙ БАРЬЕР: медиа или компания с редакционным контролем
- ВЫСОКИЙ БАРЬЕР: научный или государственный источник с требованием нейтральности

Для каждого источника укажи:
1. Категорию барьера
2. Долю текста твоего ответа, основанную на этом источнике (примерно, в %)
3. Насколько точно твой пересказ соответствует содержанию источника 
   (точно / с искажением / додумано)

Вопрос: {твой вопрос}

🚀 Быстрый старт — вставь в чат:

Вот шаблон анализа надёжности источников для ИИ-поисковика. 
Адаптируй под мою задачу: {опиши свою тему — компания, персона, продукт, о котором хочешь спросить}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какой это домен (политика, бизнес, продукт) и кто «первичный» источник в вашем случае — потому что без этого нельзя правильно разметить категории барьера.


⚠️

Ограничения

⚠️ Не измеряет реальную атаку: метод показывает потенциальную дырку в защите, но не проверяет, сработает ли настоящая атака с реальным фейковым контентом. Это карта риска, не доказательство уязвимости.

⚠️ Ручная классификация неточна: когда ИИ-модели не соглашались друг с другом при разметке источника, решение принимали люди вручную — то есть чистой автоматизации категорий пока нет, и ваша собственная разметка через промпт будет с погрешностью.

⚠️ Персонализация почти не влияет: если вы надеялись, что указание своих политических взглядов в профиле сильно изменит, какие источники цитирует ИИ — исследование показало, что это работает слабо. Профиль пользователя почти не меняет паттерн цитирования по барьерам.


🔍

Как исследовали

Исследователи прогнали 3 861 ответ через три модели (GPT-5, Claude Sonnet 4, Gemini Flash 2.5) с включённым веб-поиском, задавая вопросы про 13 политических партий в США и Японии, комбинируя это с 3 профилями пользователей (разный уровень политических знаний и разная идеология) и 33 шаблонами вопросов.

Логика была такой: сначала классифицировали каждую цитату по её домену — используя две разные LLM как «судей» плюс ручную проверку, когда судьи расходились во мнениях. Затем для каждого ответа посчитали, сколько цитат какого барьера, сколько текста держится на каждой категории и насколько точно текст соответствует первоисточнику.

Удивительный результат: правящая партия оказалась более уязвима, чем оппозиция — потому что про неё чаще пишут в соцсетях и на низкобарьерных площадках, а про оппозицию модель чаще цитирует крупные медиа. Ещё интереснее — разница в уязвимости между моделями объясняется не тем, что модель «предпочитает» слабые источники при выборе из выдачи, а тем, какие поисковые запросы модель сама генерирует: если поиск формулируется широко и мутно, в выдачу попадает больше низкобарьерного мусора ещё на этапе поиска, до того как модель начала выбирать, что цитировать.


💡

Адаптации и экстраполяции

🔧 Техника: смена домена барьеров → проверка источников в любой теме

Категории primary/opponent/low/medium/high созданы для политики, но принцип «насколько легко опубликовать здесь фейк» переносится на любую тему. Для медицинских вопросов: primary = сайт клиники/врача, low = форум пациентов, high = рецензируемый журнал. Для финансов: primary = сайт компании, low = телеграм-канал «инсайдера», high = отчётность на бирже.

Проанализируй ответ на вопрос о {лекарство/диагноз/финансовый инструмент}.
Классифицируй источники:
- ПЕРВИЧНЫЙ: официальный производитель/регулятор
- НИЗКИЙ БАРЬЕР: форумы пациентов/инвесторов, соцсети, блоги без редактуры
- СРЕДНИЙ БАРЬЕР: медицинские/финансовые издания с редакцией
- ВЫСОКИЙ БАРЬЕР: рецензируемые журналы, официальная статистика регулятора

Это превращает исследовательский метод в личный чек надёжности перед тем, как доверять ответу ИИ-поисковика по важному для вас вопросу — здоровью, деньгам, крупной покупке.


🔗

Ресурсы

Riku Mochizuki, Shusuke Komatsu, Souta Noguchi, Kazuto Ataka — Keio University / QueryLift Inc., Tokyo. Assessing Attack Surfaces in Generative Search Engines through Publisher Attributes: A Case Study in Political Domains. Отсылки: PoisonedRAG (Zou et al.), GEO — generative engine optimization (Aggarwal et al.), операция «Doppelganger» (EU DisinfoLab).


📋 Дайджест исследования

Ключевая суть

Обнаружено: ИИ-поисковик не отличает настоящий сайт издания от его точной копии — он проверяет только совпадение с запросом, а не надёжность источника. Метод барьер публикации позволяет посчитать, сколько текста в ответе ИИ держится на источниках, куда может написать кто угодно — форум, соцсеть, блог без редакции. Чем выше эта доля, тем легче атакующему подсунуть туда фейк и получить его в ответе модели. Операция Doppelgangerбольше 700 фейковых сайтов-клонов настоящих СМИ — доказывает: по содержанию клон не отличить от оригинала.

Принцип работы

Правило простое: барьер публикации — это то, насколько сложно кому угодно опубликовать контент на конкретном домене. Официальный госсайт — барьер высокий, туда просто так не напишешь. Личный блог или форум — барьер почти нулевой, пишет кто хочет. Чем ниже барьер источника, тем легче протащить в ответ ИИ нужный текст.

Почему работает

ИИ-поисковик ищет по совпадению с темой, а не по надёжности автора — вот его слабое место. Запрос для поиска модель формирует сама: если он широкий, в выдачу лезет мусор с форумов и соцсетей. Модель не проверяет, кто написал текст — только совпадает ли он с вопросом. Отсюда и больше 700 сайтов-клонов из операции Doppelganger — они просто скопировали дизайн настоящих СМИ и обманули систему поиска.

Когда применять

Проверка ответов ИИ-поисковика → конкретно для спорных тем: репутация компании, политика перед выборами, скандалы вокруг персон — особенно когда решение принимается на основе одного запроса к Perplexity или ChatGPT с поиском. Не подходит для нейтральных бытовых вопросов типа рецептов — там разметка источников бессмысленна.

Мини-рецепт

1. Задай вопрос с поиском: спроси ИИ про спорную тему с включённым веб-режимом.
2. Попроси разметку источников: после ответа пусть модель распишет каждый источник по категории — первичный, конкурент, низкий/средний/высокий барьер публикации.
3. Спроси долю текста: для каждого источника — сколько процентов ответа держится именно на нём.
4. Ищи красный флаг: если 50%+ ответа висит на одном источнике с низким барьером — вот она, дырка, которую легко продавить фейком.

Примеры

[ПЛОХО] : Расскажи про скандал вокруг компании X — и веришь первому ответу без проверки, откуда модель это взяла.
[ХОРОШО] : Ответь на вопрос про скандал вокруг компании X с веб-поиском. После ответа разметь каждый источник по барьеру публикации (первичный/конкурент/низкий/средний/высокий) и укажи % текста ответа, основанный на каждом из них.
Источник: Assessing Attack Surfaces in Generative Search Engines through Publisher Attributes: A Case Study in Political Domains
ArXiv ID: 2608.15814 | Сгенерировано: 2026-08-18 05:30

Проблемы LLM

ПроблемаСутьКак обойти
Поисковик проверяет релевантность, а не надёжность источникаИИ-поисковик ищет текст, похожий на запрос. Надёжность источника он не проверяет. Сайт-клон настоящего СМИ по содержанию не отличить от оригинала. Модель процитирует фейк с той же уверенностью, что и настоящую новостьПосле ответа попроси модель классифицировать каждый источник: кто угодно может там написать (форум, соцсеть) или есть редакционный контроль (медиа, госсайт). Проверяй долю текста ответа, которая держится на источниках без контроля
Широкий поисковый запрос тащит мусорные источники в ответМодель сама формулирует запрос для веб-поиска перед тем как искать. Если запрос сформулирован широко и неточно, в выдачу попадают слабые источники — форумы, блоги, самиздат. Модель цитирует их не потому что "предпочла", а потому что это всё что нашлаПопроси модель показать, какой именно поисковый запрос она использовала. Если он слишком общий — попроси переформулировать точнее, с указанием "только официальные источники" или конкретного домена

Методы

МетодСуть
Разметка источников по барьеру публикацииПосле ответа с веб-поиском попроси модель классифицировать каждый источник по категории: официальный сайт субъекта, сайт конкурента, платформа без контроля (соцсеть, форум), медиа с редакцией, госсайт с требованием нейтральности. Дополнительно попроси указать % текста ответа, который держится на каждом источнике. Почему работает: LLM способна распознать тип домена по названию и контексту без специальных баз данных — это встроенное знание модели о структуре интернета. Когда применять: спорные темы, репутационные вопросы, где важна проверка достоверности. Когда не работает: узкие фактические вопросы без риска манипуляции (там разметка избыточна)
📖 Простыми словами

Assessing Attack Surfaces in Generative SearchEnginesthrough Publisher Attributes: A Case Study in Political Domains

arXiv: 2608.15814

ИИ-поисковики вроде ChatGPT или Perplexity выбирают источники не по их честности, а по тому, насколько текст «попадает» в запрос пользователя. Проблема в том, что у нейросетей напрочь отсутствует встроенный детектор лжи: они работают как сверхмощные агрегаторы смыслов, для которых пост сумасшедшего в соцсетях и статья в Nature — это просто наборы токенов. Исследователи копнули в корень и поняли: главная уязвимость здесь — это барьер публикации, то есть то, насколько легко любому проходимцу вбросить информацию в интернет так, чтобы ИИ её подхватил.

Это как если бы ты пришёл в библиотеку, где книги стоят вперемешку с рекламными листовками, записками на салфетках и надписями на стенах туалета. Библиотекарь-робот не смотрит на обложку и печать издательства — он просто ищет, где написано про «выгодные кредиты». Если мошенник наклеил на стеллаж бумажку с нужным текстом, робот радостно процитирует её тебе как истину в последней инстанции. Формально он выполнил задачу, но по факту — скормил тебе мусор, потому что наклеить бумажку может каждый.

В исследовании ввели четкую шкалу: низкий, средний и высокий барьеры. Соцсети — это проходной двор, где атакующему ничего не стоит создать тысячи ботов. СМИ с редакцией — это уже фильтр, но и его обходят через операции типа «Doppelganger», создавая сотни сайтов-клонов, которые выглядят как настоящие медиа. Самый высокий барьер у госсайтов, но даже там ИИ может споткнуться, если злоумышленник взломает заброшенную страницу ведомства. Суть метода в том, чтобы посчитать, какой процент ответов ИИ тянет из «мусорных» зон с низким барьером — чем он выше, тем сильнее поверхность атаки.

Хотя тестировали это на политических темах, где манипуляции — обычное дело, принцип универсален. Это касается отзывов о технике, медицинских советов или финансовых прогнозов. Если ИИ-ассистент при ответе на вопрос о здоровье ссылается на форум, где каждый второй — «эксперт» без диплома, значит, система дырявая. GEO (Generative Engine Optimization) теперь — это не только про охваты, но и про информационную безопасность: мы входим в эру, где доверие к ответу зависит от того, насколько сложно было «пропихнуть» этот текст в индекс.

Короче: ИИ-поисковики сейчас — это рай для манипуляторов, потому что они релевантность путают с авторитетностью. Если ты строишь бизнес или личный бренд, забудь про простое SEO — теперь важно не просто «быть в поиске», а находиться на площадках с высоким барьером входа. Кто не научится фильтровать источники по сложности публикации, тот неизбежно станет жертвой массовых вбросов, которые ИИ услужливо упакует в красивый и убедительный ответ.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с