3,583 papers
arXiv:2609.04653 74 4 сент. 2026 г. FREE

Sequential Bilingual Reasoning: почему смешивать два языка в одном промпте — плохая идея, а разделять по шагам — хорошая

КЛЮЧЕВАЯ СУТЬ
Обнаружено: если перевести только половину текста — вопрос на английский, а варианты ответов оставить на казахском — модель путается сильнее, чем вообще без перевода. Это интерференция двух языков в одном промпте. Метод позволяет получать надёжные ответы на редких языках (казахский, урду, суахили) без этой путаницы. Фишка — разносить языки не по месту, а по времени: сначала думай на исходном языке, потом на английском, сравнивай в конце. Три отдельные фазы вместо одной смеси из двух языков.
Адаптировать под запрос

TL;DR

Метод заставляет модель рассуждать в три отдельных шага подряд: сначала думать на языке вопроса, потом перевести всё на английский и подумать ещё раз, потом сравнить два ответа и выбрать финальный. Это разбивает перевод на фазы вместо того, чтобы сразу кидать модели вопрос на двух языках одновременно.

Главная находка исследования: когда в промпте одновременно лежит текст на редком языке и его перевод на английский, модель путается — это называется интерференция. Особенно плохо, если перевести только часть текста: например, перевести вопрос на английский, а варианты ответов оставить на исходном языке. Тогда переведённый вопрос "не совпадает" с непереведённым контекстом, и модель хуже понимает, о чём вообще речь. При этом чистый перевод на английский тоже не панацея — для самых редких языков (урду, йоруба) эффект непредсказуем: то помогает, то роняет точность.

Вместо смешивания языков в одном заходе метод разносит рассуждение по фазам: думай на исходном языке → переведи и подумай на английском → сверь два ответа и выбери финальный. Так модель получает пользу от "английского мышления" (модели обучены в основном на английских текстах, поэтому там они рассуждают увереннее), но без путаницы от параллельных языков в одном промпте.

🔬

Схема метода

ШАГ 1: Рассуждение на исходном языке → ответ-кандидат №1
ШАГ 2: Перевод контента на английский + рассуждение → ответ-кандидат №2
ШАГ 3: Сравнение двух кандидатов, выбор финального ответа → финальный ответ

Все три шага — в одном промпте, последовательными инструкциями.

🚀

Пример применения

Задача: Вы делаете AI-консультанта для клиентов из Казахстана, который отвечает на вопросы по условиям кредитного договора. Договор — на казахском языке, вопросы клиентов тоже на казахском. Казахский — язык со средним/низким ресурсом для большинства LLM, поэтому модель может путать пункты договора.

Промпт:

Вот фрагмент кредитного договора на казахском языке:
«{текст_договора_на_казахском}»

Вопрос клиента: «{вопрос_на_казахском}»

Выполни три шага по порядку:

ШАГ 1. Прочитай договор и вопрос на казахском языке. 
Дай предварительный ответ, рассуждая только на казахском.

ШАГ 2. Переведи договор и вопрос на английский язык. 
Дай второй предварительный ответ, рассуждая полностью на английском языке.

ШАГ 3. Сравни ответы из шага 1 и шага 2. 
Если они совпадают — дай этот ответ как финальный. 
Если различаются — объясни, в чём разница, и выбери более обоснованный. 
Финальный ответ дай на казахском языке.

Результат: Модель покажет рассуждение на казахском, затем переведённую версию с рассуждением на английском, а в конце — сверку и финальный ответ на казахском. Если пункты договора сложные (проценты, штрафы, сроки), два независимых прохода снижают риск, что модель "не поняла" формулировку на казахском и выдала неверный вывод.

🧠

Почему это работает

Модели рассуждают увереннее и точнее на английском — это следствие того, что большая часть обучающих данных на английском. Для редких языков внутреннее "понимание" модели слабее, поэтому ошибки в понимании текста — частая причина неверных ответов.

Но если просто кинуть модели вопрос на двух языках одновременно, ей приходится держать в голове два параллельных смысловых потока — и это создаёт шум, а не помощь. Особенно если переведена только часть текста: рассинхрон между переведённым и непереведённым кусками ломает связку "вопрос ↔ контекст".

Метод решает это, разнося языки по времени, а не по месту. Модель сначала полностью проходит рассуждение на одном языке, потом — полностью на другом, и только в конце сравнивает результаты. Это как решить задачу двумя разными способами и свериться, а не пытаться решать её сразу двумя способами одновременно.

Рычаги управления: - Добавь третий язык-посредник (например, если аудитория говорит на языке с латиницей, а модель лучше "думает" на близкородственном языке) — просто вставь дополнительный шаг перевода. - Замени критерий сверки на Шаге 3: вместо "выбери более обоснованный" — попроси "укажи оба варианта и вероятность каждого", если хочешь видеть неуверенность модели явно. - Убери требование финального ответа на исходном языке, если тебе нужен ответ на английском для дальнейшей работы.

📋

Шаблон промпта

Вот текст на {язык}:
«{исходный_текст}»

Вопрос: «{вопрос}»

Выполни три шага по порядку:

ШАГ 1. Дай ответ, рассуждая только на {язык}, без перевода.

ШАГ 2. Переведи текст и вопрос на английский язык. 
Дай второй ответ, рассуждая полностью на английском.

ШАГ 3. Сравни ответы из шага 1 и шага 2. 
Если совпадают — дай финальный ответ. 
Если отличаются — объясни разницу и выбери более обоснованный вариант. 
Ответ дай на {язык}.

Подставь: {язык} — язык, на котором работаешь (казахский, узбекский, вьетнамский и т.д.); {исходный_текст} — документ/контекст; {вопрос} — что нужно узнать.

🚀 Быстрый старт — вставь в чат:

Вот шаблон последовательного двуязычного рассуждения. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какой язык и какой текст использовать — потому что от этого зависит, какой перевод делать на шаге 2 и на каком языке давать финальный ответ.

⚠️

Ограничения

⚠️ Не для языков с большим ресурсом: для английского, испанского, французского, хинди техника не даёт прироста точности и может даже слегка мешать — модель и без доп. шагов справляется хорошо, а лишняя фаза рассуждения добавляет шума.

⚠️ Не переводи по частям: если решил переводить контекст — переводи весь текст целиком, а не только вопрос или только часть документа. Рассинхрон между переведённым и непереведённым фрагментами ухудшает понимание сильнее, чем вообще без перевода.

⚠️ Автоматическое решение "когда включать" в чате недоступно: в исследовании решение о том, нужен ли доп. шаг перевода, принималось на основе внутренних сигналов уверенности модели (доступ к разным слоям нейросети через API). В обычном чате такого сигнала нет — включай технику вручную, когда работаешь с редким языком или чувствуешь, что модель путается.

🔍

Как исследовали

Исследователи взяли две модели (LLaMA и Qwen) и прогнали вопросы с вариантами ответов на девяти языках трёх уровней "ресурсности" — от богатых данными (английский, французский) до совсем редких (урду, йоруба). Тестировали все комбинации: что переводить (только вопрос, только текст, всё целиком) и как подавать перевод (только на языке оригинала, только на английском, оба вместе). Мерили не только точность ответов, но и то, насколько уверенность модели совпадает с реальной правильностью (это называется калибровка).

Оказалось, что чем больше переводишь — не значит точнее: билингвальный промпт (оригинал + перевод одновременно) иногда путает модель сильнее, чем просто монолингвальный вариант. На основе этого собрали систему из двух механизмов: один переключается между режимами перевода на основе внутренних технических сигналов (не применим в обычном чате), второй — структурированный трёхфазный промпт для сложных случаев, который и есть applicable часть этого исследования.


📋 Дайджест исследования

Ключевая суть

Обнаружено: если перевести только половину текста — вопрос на английский, а варианты ответов оставить на казахском — модель путается сильнее, чем вообще без перевода. Это интерференция двух языков в одном промпте. Метод позволяет получать надёжные ответы на редких языках (казахский, урду, суахили) без этой путаницы. Фишка — разносить языки не по месту, а по времени: сначала думай на исходном языке, потом на английском, сравнивай в конце. Три отдельные фазы вместо одной смеси из двух языков.

Принцип работы

Работает как три независимых попытки решить задачу, а не одна с двумя языками сразу. Шаг 1 — рассуждение только на исходном языке. Шаг 2 — полный перевод плюс рассуждение только на английском. Шаг 3 — сверка двух ответов, выбор финального. Ключевое правило: переводить текст целиком, а не по частям. Половинчатый перевод — вопрос переведён, контекст нет — роняет точность сильнее, чем вообще без перевода.

Почему работает

Модели обучены в основном на английских текстах. Поэтому на английском они рассуждают увереннее, чем на казахском или йоруба. Но если кинуть вопрос на двух языках сразу в одном промпте, модель держит в голове два смысловых потока параллельно — и это шум, а не подсказка. Разница в том, что языки разнесены по времени, а не смешаны в одном месте промпта — модель полностью проходит рассуждение на одном языке, потом полностью на другом, и только потом сравнивает. Как решить задачу двумя разными способами и свериться, а не мешать два способа в один.

Когда применять

Многоязычные приложения → работа с документами на редких или средне-ресурсных языках (казахский, узбекский, вьетнамский, суахили), особенно когда важна точность — юридические тексты, финансовые договоры, медицинские инструкции. НЕ подходит для языков с большим ресурсом — английский, испанский, французский, хинди: там модель справляется сама, а лишняя фаза только добавляет шума.

Мини-рецепт

1. Определи язык: на каком языке вопрос и контекст — казахский, узбекский, вьетнамский?
2. Шаг 1 в промпте: попроси модель рассуждать только на исходном языке, без перевода.
3. Шаг 2 в промпте: попроси перевести весь текст целиком на английский и рассуждать заново.
4. Шаг 3 в промпте: попроси сравнить два ответа, выбрать более обоснованный, финальный ответ — на исходном языке.

Примеры

[ПЛОХО] : Переведи этот вопрос на английский: {вопрос}. Ответь используя контекст: {контекст на казахском}
[ХОРОШО] : Вот договор на казахском: {текст}. Вопрос: {вопрос}. ШАГ 1: Ответь, рассуждая только на казахском. ШАГ 2: Переведи весь текст и вопрос на английский, ответь, рассуждая на английском. ШАГ 3: Сравни оба ответа, выбери обоснованный, дай финальный ответ на казахском.
Источник: Choosing the Right Language Mode at Inference Time for Multilingual Reliability
ArXiv ID: 2609.04653 | Сгенерировано: 2026-09-07 04:34

Проблемы LLM

ПроблемаСутьКак обойти
Смешивание двух языков в одном промпте путает модельЕсли в тексте одновременно лежит оригинал на редком языке и его перевод на английский, модель держит в голове два смысловых потока сразу. Особенно плохо, если перевели только часть текста — например, вопрос перевели, а контекст оставили как есть. Переведённый кусок "не совпадает" с непереведённым, и модель теряет связку между вопросом и контекстомНе смешивай языки внутри одного рассуждения. Разнеси по фазам: сначала полное рассуждение на исходном языке, потом полное рассуждение на английском (с полным переводом текста), потом сравнение двух ответов

Методы

МетодСуть
Последовательное двуязычное рассуждение — три шага вместо смешивания языковПопроси модель пройти рассуждение трижды подряд в одном промпте: 1) думай на исходном языке, дай ответ; 2) переведи весь текст на английский, думай на английском, дай второй ответ; 3) сравни оба ответа и выбери финальный (или объясни разницу). ШАГ 1 ШАГ 2 ШАГ 3 — всё в одном промпте, последовательно. Почему работает: модели рассуждают увереннее на английском (там больше обучающих данных), но одновременное присутствие двух языков в одном месте создаёт шум. Разнесение языков по времени, а не по месту, даёт пользу от "английского мышления" без путаницы. Когда да: работаешь с языком среднего/низкого ресурса (казахский, узбекский, вьетнамский), текст сложный (договоры, инструкции). Когда нет: язык с большим ресурсом (английский, испанский, французский, хинди) — модель справляется и без доп. шагов, лишняя фаза только добавляет шума

Тезисы

ТезисКомментарий
Модель рассуждает увереннее на языке с большим объёмом обучающих данныхОбычно это английский — просто потому что на нём больше текстов при обучении. Для редких языков внутреннее понимание слабее, и это частая причина неверных ответов, даже если сам вопрос простой. Применяй: для задач на редком языке добавляй параллельный проход рассуждения на английском как проверку, но не заменяй им проход на исходном языке — финальный ответ всё равно нужно сверять с оригиналом
📖 Простыми словами

Choosing the RightLanguageMode at Inference Time for Multilingual Reliability

arXiv: 2609.04653

Модели думают на английском — это факт архитектуры. Когда ты задаёшь сложный логический вопрос на казахском или любом другом не топовом языке, нейросеть начинает плыть в логике, потому что подавляющая часть её обучающей базы — англоязычная. Метод RightLanguageMode решает проблему в лоб: он заставляет LLM думать в три раздельных шага, а не пытаться родить гениальный ответ на редком языке с первой попытки.

Это как просить иностранного инженера рассчитать сложный сопромат, заставляя его мыслить исключительно на чужом для него языке. Он неизбежно накосячит в формулах. А вот если он сначала вникнет в задачу, потом спокойно решит её на родном английском и сопоставит оба черновика — шанс поймать лажу падает практически до нуля.

Что конкретно делает метод: сначала запускается рассуждение на исходном языке вопроса, затем модель переводит контекст на английский для чистоты логики и решает заново, а на третьем шаге выступает судьёй и сравнивает выводы. Вместо того чтобы путаться в длинных формулировках, модель проводит двухэтапную перепроверку и выдаёт выверенный результат.

Исследовали механику на запутанных кредитных договорах, но принцип универсален. Схема жизненно необходима для любого юридического софта, медтеха или клиентской поддержки на языках со средним и низким ресурсом — везде, где цена ошибки означает потерянные деньги или суды. Полагаться на слепой прямой промпт в таких задачах — чистый саботаж.

Короче: хватит требовать от модели идеального мышления на языках, где у неё мало данных. Внедряй трёхфазный инференс в пайплайн: потратишь чуть больше токенов, но навсегда забудешь про галлюцинации и провалы. Кто настроит языковую валидацию — получит железобетонную надёжность бота, остальные продолжат разгребать факапы за кривым переводом.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с