TL;DR
Модель может хуже решать логическую задачу просто потому, что вы обратились к ней на русском, а не на английском — даже если задача вообще не про язык, а про цифры и координаты. Исследователи заставили одну и ту же модель играть саму против себя в игры типа крестики-нолики и распределение бюджета, только один "игрок" получал правила на английском, а другой — на иврите или арабском. Доска, цифры, правила — всё одинаковое. Разница была только в языке.
Оказалось: модель систематически проигрывает себе самой, когда думает не на английском. В крестики-нолики она путает диагонали с колонками, в игре на распределение ресурсов делает более рискованные или более слабые ходы, а иногда просто забывает оптимальную стратегию, которую отлично знает и применяет на английском. То есть язык влияет не только на то, что модель знает, но и на то, как она соображает и принимает решения — это две разные вещи, и вторая ломается сильнее.
Хорошая новость: в части задач помогает простой трюк — оставить язык общения прежним, но попросить модель рассуждать внутри себя на английском, а финальный ответ дать на нужном языке. Это возвращает значительную часть потерянного качества — но не везде и не полностью.
Схема метода
ШАГ 1 (один промпт): Дать задачу на нужном языке, но явно попросить модель вести рассуждения/расчёты на английском
ШАГ 2 (тот же промпт): Попросить финальный ответ на языке пользователя
Это не многошаговая процедура — всё делается одной инструкцией в промпте.
Пример применения
Задача: Вы распределяете рекламный бюджет на 5 каналов (соцсети, контекст, блогеры, офлайн, email) в условиях, когда конкурент делает то же самое и неизвестно, куда он вложится больше. Нужна стратегия распределения ресурсов под неопределённость — это ровно тот тип задачи (Colonel Blotto), где разница между языками в исследовании была самой большой.
Промпт:
Мне нужно распределить бюджет 1 000 000 рублей на 5 маркетинговых
каналов так, чтобы обойти конкурента, который распределяет похожий
бюджет непредсказуемо между теми же каналами. Победа засчитывается
по каналам отдельно — где вложил больше, тот канал "выиграл".
Веди все внутренние расчёты и логические рассуждения на английском
языке — это точнее для такого типа задач. Финальный ответ и
распределение бюджета дай на русском, с пояснением логики.
Результат: Модель покажет блок рассуждений (если не просить его скрыть) на английском — там будет матрица вероятных ходов конкурента, логика распределения ставок по каналам. Финальный ответ придёт на русском в виде таблицы: канал → сумма → почему. Само распределение будет отражать более просчитанную стратегию, чем если бы модель весь процесс вела на русском.
Почему это работает
Модель хуже "соображает" на некоторых языках не потому, что не знает фактов — знания у неё есть на всех языках, просто доступ к ним разный. В исследовании модель, играющая в игру "Ним" (где есть точная выигрышная формула), на английском стабильно называла правильную стратегию, а на иврите и арабском — почти никогда, хотя формула математически одна и та же.
Сильная сторона модели — английский язык накопил больше текста при обучении, и рассуждения на нём получаются точнее и надёжнее. Слабость — при переключении на другой язык интерфейса модель не просто переводит мысль, а по-другому её формулирует, и в процессе теряет часть логики: путает пространственные отношения, забывает алгоритм, смещает риск-профиль решений.
Разделение "язык интерфейса" и "язык мышления" работает, потому что заставляет модель делать тяжёлую логическую работу там, где она надёжнее всего — а перевод на нужный язык (простая операция) она делает хорошо почти всегда.
Рычаги управления: - Если задача требует точной логики, пространственного мышления или расчётов — переключайте язык рассуждений на английский. - Если задача творческая или про стиль текста — этот приём не нужен, там язык рассуждений не так критичен. - Можно явно попросить показать рассуждения ("покажи ход мыслей на английском"), чтобы проверить, не потерялась ли логика при переводе финального ответа.
Шаблон промпта
{задача на русском}
Веди внутренние рассуждения и расчёты на английском языке —
это снижает вероятность логических ошибок. Финальный ответ
дай на русском.
Подставьте вашу задачу в {задача на русском}. Приём особенно полезен для задач с чёткой логикой: распределение ресурсов, планирование, расчёты, игровые/конкурентные сценарии, пространственные задачи (схемы, маршруты, раскладки).
🚀 Быстрый старт — вставь в чат:
Вот приём для повышения точности логических задач. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, если нужно уточнить формат ответа.
[вставить шаблон выше]
LLM спросит, нужен ли видимый блок рассуждений или только финальный ответ — потому что показ рассуждений помогает проверить, не потерялась ли логика при переводе.
Ограничения
⚠️ Не универсально: в задачах с неопределённостью и риском (например, покер, переговоры с элементом обмана) переключение языка рассуждений помогает слабо и непредсказуемо — эффект то есть, то нет.
⚠️ Частичное восстановление: даже там, где приём работает, он возвращает не всё потерянное качество, а часть — от трети до примерно 90% в лучших случаях.
⚠️ Проверено на компактных моделях: эффект замерен на моделях среднего размера (открытые модели вокруг 3-4 млрд параметров). У топовых моделей (GPT-5, Claude) разрыв между языками может быть меньше — прямых данных по ним в исследовании нет.
⚠️ Иврит и арабский — самые уязвимые языки в тесте, английский почти всегда самый сильный. Для русского языка величина эффекта не измерялась напрямую, но раз русский не является высокоресурсным языком уровня английского — вероятность выигрыша от приёма выше среднего.
Как исследовали
Исследователи взяли три открытые модели среднего размера и заставили каждую играть саму против себя в шесть настольных игр (крестики-нолики, распределение ресурсов, покер на картах и другие), при этом один "игрок" получал правила на одном языке, а второй — на другом, из восьми языков разной типологии. Игровое поле, цифры и правила оставались идентичными — переводился только текст интерфейса.
Если бы язык не влиял на "умение" модели, а только на знания, две копии одной модели побеждали бы друг друга случайно, как при игре с собой на одном языке. Но нет: английский почти всегда выигрывал, иврит почти всегда проигрывал, а Colonel Blotto (распределение ресурсов) показал самый большой разрыв между языками из всех игр.
Дополнительный тест — что будет, если оставить язык интерфейса слабым, но заставить модель думать на сильном языке. Оказалось, в играх с чёткой пространственной логикой (крестики-нолики) это возвращало до 89% потерянного качества, а в игре с элементом неопределённости (покер) — почти ничего. Это и есть главный практический вывод: язык мышления и язык общения — не одна и та же переменная, и их можно разделять.
Ресурсы
Skill Issue: Are Skills Language-Invariant in LLMs? — Bobby Cheng, Adam Gaber, Zhengyuan Liu, Catherine Arnett, Omer Goldman, Cheston Tan, Leshem Choshen (A*STAR, Weizmann Institute of Science, MIT-IBM Watson AI Lab, University of Cambridge, EleutherAI). Код и данные: github.com/TextArena/TextArena
