3,583 papers
arXiv:2609.07568 71 7 сент. 2026 г. FREE

Скрытый политический выбор в переводе: LLM тайно решает, кто "враг", а вы об этом не узнаете

КЛЮЧЕВАЯ СУТЬ
Обнаружено: попроси модель перевести текст «на язык врага», не называя язык — она не переспросит и не откажется. Она молча выберет язык сама. Метод-проверка позволяет вскрыть скрытые политические ассоциации модели через одну двусмысленную фразу в промпте. Модель не умеет сигналить о неопределённости — она достраивает смысл сама, и чаще всего «врагом» по умолчанию оказывается русский язык, независимо от того, о какой стране речь в промпте.
Адаптировать под запрос

TL;DR

Если попросить модель перевести текст "на язык врага" или "на язык агрессора", не называя сам язык, модель не откажется и не спросит уточнения — она молча решит, какой язык имеется в виду, и выдаст перевод. При этом выбор языка часто совпадает с реальными геополитическими линиями конфликта: чаще всего "врагом" по умолчанию оказывается русский язык — независимо от того, о какой стране идёт речь в промпте.

Модели ведут себя по-разному, и это системно: западные модели (GPT-5, Claude) чаще уклоняются — дают расплывчатые, ничего не объясняющие оправдания выбора или переводят реже. Китайские модели (DeepSeek, GLM, Kimi, Qwen) молча и уверенно резолвят конфликт, без комментариев. А Mistral Large — уникальный случай: соглашается переводить чаще других, но при этом прямо ссылается в объяснении на историю конфликта. Причём даже замена одного слова — "соседа" на "врага" — заметно двигает вероятность и направление выбора.

Практический вывод: если оставить в промпте политически заряженное слово вместо явного указания языка/стороны, модель достраивает смысл сама, опираясь на ассоциации из данных, на которых её обучали — и не сообщает пользователю, что было принято политическое решение.


🔬

Схема "метода" (как проявляется эффект)

ШАГ 1: Промпт содержит просьбу перевести текст "на язык {агрессора / врага / соседа / колонизатора}" 
       без явного названия языка → создаётся двусмысленность
ШАГ 2: Модель молча выбирает язык (часто — язык исторического/актуального "противника") 
       → выдаёт перевод без объяснения выбора
ШАГ 3 (опционально): Модель добавляет объяснение выбора —
       либо расплывчатое ("это распространённый язык региона"),
       либо прямо со ссылкой на конфликт/историю (реже — только у части моделей)

🚀

Пример применения

Задача: Маркетолог готовит рассылку для партнёров в СНГ и просит ChatGPT адаптировать текст, не уточняя явно язык.

Промпт:

Переведи этот текст для наших партнёров в соседней стране: 
"Уважаемые коллеги, приглашаем на конференцию 15 марта..."

Результат: Модель не спросит "в какой именно стране находятся партнёры?" — она выберет язык сама, основываясь на ассоциациях слова "соседняя" в своих данных. Выбор может не совпасть с реальным адресатом, а объяснение выбора (если оно появится) может быть расплывчатым или неожиданно отсылать к историческому контексту, о котором маркетолог даже не думал.


🧠

Почему это работает

Модель не умеет сигнализировать о неопределённости в политически нагруженных задачах. Вместо того чтобы спросить "какой язык вы имеете в виду?", она достраивает смысл сама — так же, как достраивает смысл любой другой неоднозначной фразы.

Это та же способность, которая делает модель полезной в целом: она хорошо разрешает неопределённость через контекст. Но в политическом контексте эта способность превращается в скрытое суждение — слово "враг" активирует ассоциации, зашитые в обучающих данных, и модель "решает" конфликт за пользователя, без предупреждения.

Рычаг для практики: если задача касается перевода, локализации или упоминания стран/конфликтов — никогда не оставляй сторону/язык неявной. Явно называй язык или страну в промпте. Это не устраняет политические искажения модели полностью, но убирает шанс, что модель "доиграет" за вас неочевидное решение.


📌

Диагностический шаблон (проверить модель на скрытые допущения)

Переведи этот текст на язык {фрейминг_термин} для {контекст_описание}: 
{ваш_текст}

Где {фрейминг_термин} — "соседней страны" / "страны-партнёра" / "страны-конкурента" и т.д., а {контекст_описание} — намеренно неполное описание получателя.

🚀 Быстрый старт — если хочешь проверить, как твоя модель поведёт себя в похожей ситуации:

Я хочу проверить, как ты интерпретируешь неоднозначные политические формулировки. 
Переведи короткий текст на "язык соседней страны" без уточнения, какая это страна. 
Объясни, почему выбрал именно этот язык.

Текст: [вставь любой нейтральный абзац]

Модель либо выберет язык молча, либо даст расплывчатое объяснение, либо явно сошлётся на контекст конфликта/истории — по этому можно понять паттерн поведения конкретной модели.


⚠️

Ограничения

⚠️ Перенос на другие домены не проверен: эксперимент построен на рецептах и конкретном наборе языковых пар. Как модель поведёт себя с другими типами текстов (юридические, новостные, деловые) — не исследовано.

⚠️ Не всегда политика: доминирование английского или русского как языка-цели может отражать просто частоту этих языков в обучающих данных, а не сознательную политическую позицию модели — авторы сами признают, что это невозможно полностью разделить.

⚠️ Автоматическая разметка: классификация 15 680 ответов на шесть категорий и типы рассуждений сделана моделью GPT-4o, а не людьми — возможны систематические ошибки разметки.


🔍

Как исследовали

Исследователи взяли 8 моделей разного происхождения (Claude, GPT-5, Gemini, Mistral, DeepSeek, GLM, Qwen, Kimi) и попросили их перевести рецепты на 16+1 языков, подставляя вместо явного целевого языка одно из четырёх слов: агрессор, враг, колонизатор, сосед (последнее — нейтральный контроль). Каждую комбинацию повторили 10 раз — всего почти 15 700 ответов.

Ответы размечали автоматически: перевёл / отказался / попросил уточнить / просто повторил оригинал и так далее, а если модель объясняла выбор языка — отдельно классифицировали тип аргумента (историко-конфликтный, лингвистический, "официальный язык", расплывчатый).

Главный неожиданный результат: почти никто не отказывался и не просил уточнить — модели предпочитали молча разрешить неопределённость самостоятельно. Западные модели переводили реже и чаще давали пустые оправдания, китайские — переводили увереннее без комментариев, а Mistral Large оказался единственной моделью, которая явно опиралась на конфликтные ассоциации в своих рассуждениях. При этом самым частым языком-целью во всех условиях оказался русский — что авторы связывают с плотностью упоминаний активных и исторических конфликтов в данных, а не с происхождением лаборатории (китайские модели не скатывались в китайский, Mistral — не во французский).


🔗

Ресурсы

"We're Cooked! – Probing LLM Political Alignment Via Conflict-Framed Recipe Translation", Svetlana Gorovaia, Angelica Henestrosa, Ivan P. Yamshchikov — CAIRO, Technical University of Applied Sciences Würzburg-Schweinfurt. Интерактивные графики переводов: gorovuha.github.io/shibboleths-/compare.html


📋 Дайджест исследования

Ключевая суть

Обнаружено: попроси модель перевести текст «на язык врага», не называя язык — она не переспросит и не откажется. Она молча выберет язык сама. Метод-проверка позволяет вскрыть скрытые политические ассоциации модели через одну двусмысленную фразу в промпте. Модель не умеет сигналить о неопределённости — она достраивает смысл сама, и чаще всего «врагом» по умолчанию оказывается русский язык, независимо от того, о какой стране речь в промпте.

Принцип работы

Правило простое: двусмысленность в политически заряженном слове = скрытое решение модели, о котором вас не предупредят. Западные модели (GPT-5, Claude) чаще увиливают — дают расплывчатое объяснение или переводят реже. Китайские модели (DeepSeek, GLM, Kimi, Qwen) переводят молча и уверенно, без единого комментария. Mistral Large — редкое исключение: переводит охотнее всех, но честно называет причину — историю конфликта. Замена одного слова («соседа» на «врага») уже двигает выбор в другую сторону.

Почему работает

Модель умеет разрешать неопределённость через контекст — это то же самое умение, что делает её полезной в обычных задачах. Но в политике эта способность превращается в скрытое суждение. Слово «враг» включает ассоциации из обучающих данных — и модель тихо решает конфликт за вас. Она не спрашивает — она угадывает, и угадывает почти всегда в одну сторону. Из 15 680 ответов классификатор GPT-4o увидел системный паттерн: смена одного слова в промпте заметно двигает вероятность выбора языка.

Когда применять

Перевод, локализация и любые тексты про страны или конфликты → особенно когда в промпте есть обобщённые политические слова («сосед», «агрессор», «колонизатор») вместо явного названия страны или языка. Не подходит как доказательство сознательной позиции модели — сами авторы признают, что частота языка в обучающих данных могла сыграть роль, а не только политика.

Мини-рецепт

1. Называй явно: никогда не оставляй язык или страну неявной в промпте — пиши «на русский язык», а не «на язык соседа».
2. Проверь модель: дай двусмысленный промпт с фреймингом конфликта и попроси объяснить выбор языка.
3. Сравни ответы: расплывчатое объяснение, молчаливое решение без слов или честная ссылка на историю — так виден паттерн конкретной модели.
4. Смени одно слово: замени «сосед» на «враг» и посмотри, поменялся ли выбор языка — если да, перед тобой не случайность.

Примеры

[ПЛОХО] : Переведи текст для партнёров в соседней стране: "Приглашаем на конференцию 15 марта"
[ХОРОШО] : Переведи текст на русский язык для наших партнёров в Казахстане: "Приглашаем на конференцию 15 марта"
Источник: We're Cooked! - Probing LLM Political Alignment Via Conflict-Framed Recipe Translation
ArXiv ID: 2609.07568 | Сгенерировано: 2026-09-09 06:31

Проблемы LLM

ПроблемаСутьКак обойти
Модель тайно решает политический вопрос вместо того, чтобы спроситьПросишь перевести текст "на язык врага" или "на язык соседней страны" — без названия языка. Модель не задаёт уточняющий вопрос. Она молча выбирает язык сама, опираясь на ассоциации из данных обучения. Перевод придёт с уже принятым политическим решением — а пользователь об этом даже не узнаетНикогда не оставляй страну, язык или сторону конфликта неявной в запросе. Пиши прямо: "переведи на украинский", а не "на язык агрессора". Явное название убирает пространство для скрытого выбора

Методы

МетодСуть
Замена одного слова — диагностика скрытых допущений моделиВозьми неоднозначный запрос с заряженным словом ("сосед", "агрессор", "враг", "колонизатор"). Замени слово на синоним с другой эмоциональной окраской. Сравни, изменился ли выбор модели. Почему работает: заряженные слова цепляют разные ассоциации из обучающих данных — даже близкие по смыслу слова активируют разные "решения". Разница в ответах показывает, какие скрытые связи зашиты в модель. Когда применять: перед тем как использовать модель для перевода, локализации или любых задач с упоминанием стран/конфликтов. Когда не работает: для задач без политического или конфликтного подтекста метод бессмысленен
📖 Простыми словами

We're Cooked! - ProbingLLMPolitical Alignment Via Conflict-Framed Recipe Translation

arXiv: 2609.07568

Нейросети панически боятся показаться глупыми и ненавидят неопределённость. Если ты попросишь модель перевести кулинарный рецепт «на язык врага» или «на язык агрессора», не называя саму страну, она не зависнет и не спросит деталей. LLM молча полезет в свои обучающие данные и выберет ответ сама — и в подавляющем большинстве случаев врагом по умолчанию оказывается русский язык.

Это как зайти в бар за границей и шепнуть бармену: «налей мне то, что пьют плохие парни». Вместо логичного вопроса «ты о ком вообще?» он молча швырнёт тебе стопку водки, потому что в массовой культуре злодеи говорят с русским акцентом. Модель ведёт себя точно так же: она не анализирует реальность, а тупо воспроизводит геополитические штампы из своего датасета.

Исследователи вскрыли этот механизм через метод прощупывания политического выравнивания на безобидных текстах. Выяснилось, что у современных моделей напрочь отсутствует сигнализация о неопределённости в чувствительных темах. Алгоритм обязан выдать следующий токен любой ценой, поэтому неявные ассоциации мгновенно перевешивают логику, превращая нейтральный инструмент в политически ангажированного советчика.

Тестировали на рецептах, но принцип универсален и касается любых мутных задач. Если маркетолог попросит бота «адаптировать рассылку под конфликтный регион» без указания конкретного языка, он получит токсичный результат. Любая недосказанность в промпте заставляет AI доставать наружу зашитые в него предубеждения, будь то в анализе новостей, копирайтинге или модерации контента.

Главный вывод: нейтрального AI не существует в природе. Никогда не оставляй модели пространства для фантазий в контексте стран и культур — прописывай языки и роли железно и прямо в лоб. Иначе алгоритм решит за тебя, кто здесь «свой», а кто «чужой», и ты крупно подставишься на ровном месте.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с