3,583 papers
arXiv:2608.25832 74 26 авг. 2026 г. FREE

Скрытая языковая надбавка: LLM решают одну и ту же логическую задачу по-разному в зависимости от языка

КЛЮЧЕВАЯ СУТЬ
Одна модель играет в крестики-нолики против самой себя — доска и правила одинаковы, разница только в языке команд. Версия на английском систематически обыгрывает саму себя на иврите и арабском. Приём разделяет язык мышления и язык ответа: модель рассуждает на английском, а финальный ответ выдаёт на нужном языке — так возвращается потерянная логика без смены языка общения с пользователем. Причина потерь простая: модель не переводит мысль буквально, а переформулирует её на новом языке и теряет часть расчёта — путает координаты, забывает выигрышную стратегию, смещает риск-профиль решений.
Адаптировать под запрос

TL;DR

Модель может хуже решать логическую задачу просто потому, что вы обратились к ней на русском, а не на английском — даже если задача вообще не про язык, а про цифры и координаты. Исследователи заставили одну и ту же модель играть саму против себя в игры типа крестики-нолики и распределение бюджета, только один "игрок" получал правила на английском, а другой — на иврите или арабском. Доска, цифры, правила — всё одинаковое. Разница была только в языке.

Оказалось: модель систематически проигрывает себе самой, когда думает не на английском. В крестики-нолики она путает диагонали с колонками, в игре на распределение ресурсов делает более рискованные или более слабые ходы, а иногда просто забывает оптимальную стратегию, которую отлично знает и применяет на английском. То есть язык влияет не только на то, что модель знает, но и на то, как она соображает и принимает решения — это две разные вещи, и вторая ломается сильнее.

Хорошая новость: в части задач помогает простой трюк — оставить язык общения прежним, но попросить модель рассуждать внутри себя на английском, а финальный ответ дать на нужном языке. Это возвращает значительную часть потерянного качества — но не везде и не полностью.


🔬

Схема метода

ШАГ 1 (один промпт): Дать задачу на нужном языке, но явно попросить модель вести рассуждения/расчёты на английском
ШАГ 2 (тот же промпт): Попросить финальный ответ на языке пользователя

Это не многошаговая процедура — всё делается одной инструкцией в промпте.


🚀

Пример применения

Задача: Вы распределяете рекламный бюджет на 5 каналов (соцсети, контекст, блогеры, офлайн, email) в условиях, когда конкурент делает то же самое и неизвестно, куда он вложится больше. Нужна стратегия распределения ресурсов под неопределённость — это ровно тот тип задачи (Colonel Blotto), где разница между языками в исследовании была самой большой.

Промпт:

Мне нужно распределить бюджет 1 000 000 рублей на 5 маркетинговых 
каналов так, чтобы обойти конкурента, который распределяет похожий 
бюджет непредсказуемо между теми же каналами. Победа засчитывается 
по каналам отдельно — где вложил больше, тот канал "выиграл".

Веди все внутренние расчёты и логические рассуждения на английском 
языке — это точнее для такого типа задач. Финальный ответ и 
распределение бюджета дай на русском, с пояснением логики.

Результат: Модель покажет блок рассуждений (если не просить его скрыть) на английском — там будет матрица вероятных ходов конкурента, логика распределения ставок по каналам. Финальный ответ придёт на русском в виде таблицы: канал → сумма → почему. Само распределение будет отражать более просчитанную стратегию, чем если бы модель весь процесс вела на русском.


🧠

Почему это работает

Модель хуже "соображает" на некоторых языках не потому, что не знает фактов — знания у неё есть на всех языках, просто доступ к ним разный. В исследовании модель, играющая в игру "Ним" (где есть точная выигрышная формула), на английском стабильно называла правильную стратегию, а на иврите и арабском — почти никогда, хотя формула математически одна и та же.

Сильная сторона модели — английский язык накопил больше текста при обучении, и рассуждения на нём получаются точнее и надёжнее. Слабость — при переключении на другой язык интерфейса модель не просто переводит мысль, а по-другому её формулирует, и в процессе теряет часть логики: путает пространственные отношения, забывает алгоритм, смещает риск-профиль решений.

Разделение "язык интерфейса" и "язык мышления" работает, потому что заставляет модель делать тяжёлую логическую работу там, где она надёжнее всего — а перевод на нужный язык (простая операция) она делает хорошо почти всегда.

Рычаги управления: - Если задача требует точной логики, пространственного мышления или расчётов — переключайте язык рассуждений на английский. - Если задача творческая или про стиль текста — этот приём не нужен, там язык рассуждений не так критичен. - Можно явно попросить показать рассуждения ("покажи ход мыслей на английском"), чтобы проверить, не потерялась ли логика при переводе финального ответа.


📋

Шаблон промпта

{задача на русском}

Веди внутренние рассуждения и расчёты на английском языке — 
это снижает вероятность логических ошибок. Финальный ответ 
дай на русском.

Подставьте вашу задачу в {задача на русском}. Приём особенно полезен для задач с чёткой логикой: распределение ресурсов, планирование, расчёты, игровые/конкурентные сценарии, пространственные задачи (схемы, маршруты, раскладки).

🚀 Быстрый старт — вставь в чат:

Вот приём для повышения точности логических задач. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, если нужно уточнить формат ответа.

[вставить шаблон выше]

LLM спросит, нужен ли видимый блок рассуждений или только финальный ответ — потому что показ рассуждений помогает проверить, не потерялась ли логика при переводе.


⚠️

Ограничения

⚠️ Не универсально: в задачах с неопределённостью и риском (например, покер, переговоры с элементом обмана) переключение языка рассуждений помогает слабо и непредсказуемо — эффект то есть, то нет.

⚠️ Частичное восстановление: даже там, где приём работает, он возвращает не всё потерянное качество, а часть — от трети до примерно 90% в лучших случаях.

⚠️ Проверено на компактных моделях: эффект замерен на моделях среднего размера (открытые модели вокруг 3-4 млрд параметров). У топовых моделей (GPT-5, Claude) разрыв между языками может быть меньше — прямых данных по ним в исследовании нет.

⚠️ Иврит и арабский — самые уязвимые языки в тесте, английский почти всегда самый сильный. Для русского языка величина эффекта не измерялась напрямую, но раз русский не является высокоресурсным языком уровня английского — вероятность выигрыша от приёма выше среднего.


🔍

Как исследовали

Исследователи взяли три открытые модели среднего размера и заставили каждую играть саму против себя в шесть настольных игр (крестики-нолики, распределение ресурсов, покер на картах и другие), при этом один "игрок" получал правила на одном языке, а второй — на другом, из восьми языков разной типологии. Игровое поле, цифры и правила оставались идентичными — переводился только текст интерфейса.

Если бы язык не влиял на "умение" модели, а только на знания, две копии одной модели побеждали бы друг друга случайно, как при игре с собой на одном языке. Но нет: английский почти всегда выигрывал, иврит почти всегда проигрывал, а Colonel Blotto (распределение ресурсов) показал самый большой разрыв между языками из всех игр.

Дополнительный тест — что будет, если оставить язык интерфейса слабым, но заставить модель думать на сильном языке. Оказалось, в играх с чёткой пространственной логикой (крестики-нолики) это возвращало до 89% потерянного качества, а в игре с элементом неопределённости (покер) — почти ничего. Это и есть главный практический вывод: язык мышления и язык общения — не одна и та же переменная, и их можно разделять.


🔗

Ресурсы

Skill Issue: Are Skills Language-Invariant in LLMs? — Bobby Cheng, Adam Gaber, Zhengyuan Liu, Catherine Arnett, Omer Goldman, Cheston Tan, Leshem Choshen (A*STAR, Weizmann Institute of Science, MIT-IBM Watson AI Lab, University of Cambridge, EleutherAI). Код и данные: github.com/TextArena/TextArena


📋 Дайджест исследования

Ключевая суть

Одна модель играет в крестики-нолики против самой себя — доска и правила одинаковы, разница только в языке команд. Версия на английском систематически обыгрывает саму себя на иврите и арабском. Приём разделяет язык мышления и язык ответа: модель рассуждает на английском, а финальный ответ выдаёт на нужном языке — так возвращается потерянная логика без смены языка общения с пользователем. Причина потерь простая: модель не переводит мысль буквально, а переформулирует её на новом языке и теряет часть расчёта — путает координаты, забывает выигрышную стратегию, смещает риск-профиль решений.

Принцип работы

Правило простое: меняй не язык общения, а язык мышления. Задача и ответ остаются на русском, а между ними модель считает и рассуждает на английском. Это как синхронный переводчик — он решает задачу в голове на родном языке, а вслух выдаёт готовый перевод, вместо того чтобы соображать на чужом языке в реальном времени.

Почему работает

Причина не в знаниях — они у модели есть на всех языках. В игре Ним с точной выигрышной формулой модель называла её верно на английском почти всегда, а на иврите и арабском — почти никогда, хотя формула одна и та же. Английского текста при обучении в разы больше, и рассуждения на нём получаются надёжнее. Модель не переводит мысль — она пересобирает её на новом языке и теряет часть логики: путает диагонали с колонками, смещает риск-профиль решений. Переключение языка мышления возвращает от трети до 90% потерянной точности.

Когда применять

Логические и пространственные задачи на не-английском языке → распределение бюджета, планирование, конкурентные сценарии, схемы и маршруты — особенно когда нужна точная стратегия, а не красивый текст. НЕ подходит для задач с обманом и неопределённостью — покер, переговоры с элементом хитрости, там эффект нестабилен.

Мини-рецепт

1. Сформулируй задачу как обычно: на русском, без изменений в содержании.
2. Добавь одну инструкцию: "веди все рассуждения и расчёты на английском, финальный ответ дай на русском".
3. Попроси показать ход мыслей: это опционально, но помогает проверить, не потерялась ли логика при переводе ответа.
4. Сравни с обычным запросом: если задача про расчёты, координаты или риск — разница в качестве должна быть заметна.

Примеры

[ПЛОХО] : Распредели бюджет 1 000 000 рублей на 5 каналов, чтобы обойти конкурента
[ХОРОШО] : Распредели бюджет 1 000 000 рублей на 5 маркетинговых каналов, чтобы обойти конкурента, который действует непредсказуемо. Веди все расчёты и логические рассуждения на английском языке — это точнее для такого типа задач. Финальный ответ и распределение бюджета дай на русском, с пояснением логики.
Источник: Skill Issue: Are Skills Language-Invariant in LLMs?
ArXiv ID: 2608.25832 | Сгенерировано: 2026-08-27 04:32

Проблемы LLM

ПроблемаСутьКак обойти
Скрытая языковая надбавка в рассужденияхМодель хуже решает логическую задачу, если общаться с ней не на английском — даже когда задача вообще не про язык, а про цифры, координаты или стратегию. Путает диагонали с колонками, делает более рискованные ходы, забывает оптимальную стратегию, которую отлично знает на английском. Проблема касается любых задач с чёткой логикой: игры, распределение ресурсов, планирование, пространственные схемыПопроси модель вести внутренние рассуждения и расчёты на английском, а финальный ответ дать на нужном тебе языке. Одна инструкция в том же промпте

Методы

МетодСуть
Разделение языка мышления и языка ответаПиши: "Веди рассуждения и расчёты на английском. Финальный ответ дай на [нужный язык]". Одна инструкция, один промпт. Почему работает: перевод готового ответа — простая операция, модель делает её хорошо почти всегда. А сложная многошаговая логика надёжнее на языке, где модель училась на большем объёме текста. Когда да: задачи с чёткой логикой — распределение ресурсов, расчёты, планирование, пространственные схемы, конкурентные стратегии. Когда нет: задачи с неопределённостью и элементом обмана (переговоры, покер) — эффект непредсказуем. Творческие задачи и вопросы стиля — приём не нужен, там язык мышления не критичен
📖 Простыми словами

Skill Issue: Are SkillsLanguage-Invariant inLLMs?

arXiv: 2608.25832

LLM тупеет не от сложности задачи, а от языка промпта. Казалось бы, чистая логика и математика не зависят от слов, но нейросети устроены иначе: языковая инвариантность навыков — это миф. Модель хранит знания в общем пространстве, но доступ к логическим цепочкам пробит криво. На английском она видит решение сразу, а на русском, арабском или иврите её логический модуль просто клинит, хотя правила задачи и входные цифры абсолютно те же.

Это как программист, который учился по англоязычным учебникам, а на собеседовании его заставляют писать код на 1С и рассуждать терминами вроде «перечисление» и «обработка проведения». Вроде слова понятны, но абстрактное мышление моментально вязнет в каше перевода. В итоге вместо красивого алгоритма получается полный облом и детские ошибки на ровном месте.

В исследовании модель стравливали саму с собой в играх на чистую теорию игр: крестики-нолики, математическая игра Ним и распределение ресурсов в Colonel Blotto. Результат показателен: получая вводные на английском, сетка уверенно доставала из памяти строгие формулы и побеждала. Но стоило перевести те же правила на иврит или арабский — модель начисто забывала выигрышную стратегию и сливала партию.

Тестировали на играх, но принцип универсален. Считаешь юнит-экономику, распределяешь рекламный бюджет по 5 каналам в условиях жесткой конкуренции или пишешь сложную архитектуру кода — язык запроса решает качество результата. Скормишь сложную задачу оптимизации на русском — получишь посредственную отписку, а на английском модель выдаст жёсткую математическую стратегию.

Короче: для тяжелой логики забудь про «удобный язык» в промптах. Думай и формулируй на английском, а результат при необходимости переводи на русский. Иначе ты собственноручно срезаешь модели половину интеллекта. Английский для LLM — это язык мышления, а остальные языки годятся разве что для базового смолл-тока.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с