TL;DR
Метод заставляет модель рассуждать в три отдельных шага подряд: сначала думать на языке вопроса, потом перевести всё на английский и подумать ещё раз, потом сравнить два ответа и выбрать финальный. Это разбивает перевод на фазы вместо того, чтобы сразу кидать модели вопрос на двух языках одновременно.
Главная находка исследования: когда в промпте одновременно лежит текст на редком языке и его перевод на английский, модель путается — это называется интерференция. Особенно плохо, если перевести только часть текста: например, перевести вопрос на английский, а варианты ответов оставить на исходном языке. Тогда переведённый вопрос "не совпадает" с непереведённым контекстом, и модель хуже понимает, о чём вообще речь. При этом чистый перевод на английский тоже не панацея — для самых редких языков (урду, йоруба) эффект непредсказуем: то помогает, то роняет точность.
Вместо смешивания языков в одном заходе метод разносит рассуждение по фазам: думай на исходном языке → переведи и подумай на английском → сверь два ответа и выбери финальный. Так модель получает пользу от "английского мышления" (модели обучены в основном на английских текстах, поэтому там они рассуждают увереннее), но без путаницы от параллельных языков в одном промпте.
Схема метода
ШАГ 1: Рассуждение на исходном языке → ответ-кандидат №1
ШАГ 2: Перевод контента на английский + рассуждение → ответ-кандидат №2
ШАГ 3: Сравнение двух кандидатов, выбор финального ответа → финальный ответ
Все три шага — в одном промпте, последовательными инструкциями.
Пример применения
Задача: Вы делаете AI-консультанта для клиентов из Казахстана, который отвечает на вопросы по условиям кредитного договора. Договор — на казахском языке, вопросы клиентов тоже на казахском. Казахский — язык со средним/низким ресурсом для большинства LLM, поэтому модель может путать пункты договора.
Промпт:
Вот фрагмент кредитного договора на казахском языке:
«{текст_договора_на_казахском}»
Вопрос клиента: «{вопрос_на_казахском}»
Выполни три шага по порядку:
ШАГ 1. Прочитай договор и вопрос на казахском языке.
Дай предварительный ответ, рассуждая только на казахском.
ШАГ 2. Переведи договор и вопрос на английский язык.
Дай второй предварительный ответ, рассуждая полностью на английском языке.
ШАГ 3. Сравни ответы из шага 1 и шага 2.
Если они совпадают — дай этот ответ как финальный.
Если различаются — объясни, в чём разница, и выбери более обоснованный.
Финальный ответ дай на казахском языке.
Результат: Модель покажет рассуждение на казахском, затем переведённую версию с рассуждением на английском, а в конце — сверку и финальный ответ на казахском. Если пункты договора сложные (проценты, штрафы, сроки), два независимых прохода снижают риск, что модель "не поняла" формулировку на казахском и выдала неверный вывод.
Почему это работает
Модели рассуждают увереннее и точнее на английском — это следствие того, что большая часть обучающих данных на английском. Для редких языков внутреннее "понимание" модели слабее, поэтому ошибки в понимании текста — частая причина неверных ответов.
Но если просто кинуть модели вопрос на двух языках одновременно, ей приходится держать в голове два параллельных смысловых потока — и это создаёт шум, а не помощь. Особенно если переведена только часть текста: рассинхрон между переведённым и непереведённым кусками ломает связку "вопрос ↔ контекст".
Метод решает это, разнося языки по времени, а не по месту. Модель сначала полностью проходит рассуждение на одном языке, потом — полностью на другом, и только в конце сравнивает результаты. Это как решить задачу двумя разными способами и свериться, а не пытаться решать её сразу двумя способами одновременно.
Рычаги управления: - Добавь третий язык-посредник (например, если аудитория говорит на языке с латиницей, а модель лучше "думает" на близкородственном языке) — просто вставь дополнительный шаг перевода. - Замени критерий сверки на Шаге 3: вместо "выбери более обоснованный" — попроси "укажи оба варианта и вероятность каждого", если хочешь видеть неуверенность модели явно. - Убери требование финального ответа на исходном языке, если тебе нужен ответ на английском для дальнейшей работы.
Шаблон промпта
Вот текст на {язык}:
«{исходный_текст}»
Вопрос: «{вопрос}»
Выполни три шага по порядку:
ШАГ 1. Дай ответ, рассуждая только на {язык}, без перевода.
ШАГ 2. Переведи текст и вопрос на английский язык.
Дай второй ответ, рассуждая полностью на английском.
ШАГ 3. Сравни ответы из шага 1 и шага 2.
Если совпадают — дай финальный ответ.
Если отличаются — объясни разницу и выбери более обоснованный вариант.
Ответ дай на {язык}.
Подставь: {язык} — язык, на котором работаешь (казахский, узбекский, вьетнамский и т.д.); {исходный_текст} — документ/контекст; {вопрос} — что нужно узнать.
🚀 Быстрый старт — вставь в чат:
Вот шаблон последовательного двуязычного рассуждения. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какой язык и какой текст использовать — потому что от этого зависит, какой перевод делать на шаге 2 и на каком языке давать финальный ответ.
Ограничения
⚠️ Не для языков с большим ресурсом: для английского, испанского, французского, хинди техника не даёт прироста точности и может даже слегка мешать — модель и без доп. шагов справляется хорошо, а лишняя фаза рассуждения добавляет шума.
⚠️ Не переводи по частям: если решил переводить контекст — переводи весь текст целиком, а не только вопрос или только часть документа. Рассинхрон между переведённым и непереведённым фрагментами ухудшает понимание сильнее, чем вообще без перевода.
⚠️ Автоматическое решение "когда включать" в чате недоступно: в исследовании решение о том, нужен ли доп. шаг перевода, принималось на основе внутренних сигналов уверенности модели (доступ к разным слоям нейросети через API). В обычном чате такого сигнала нет — включай технику вручную, когда работаешь с редким языком или чувствуешь, что модель путается.
Как исследовали
Исследователи взяли две модели (LLaMA и Qwen) и прогнали вопросы с вариантами ответов на девяти языках трёх уровней "ресурсности" — от богатых данными (английский, французский) до совсем редких (урду, йоруба). Тестировали все комбинации: что переводить (только вопрос, только текст, всё целиком) и как подавать перевод (только на языке оригинала, только на английском, оба вместе). Мерили не только точность ответов, но и то, насколько уверенность модели совпадает с реальной правильностью (это называется калибровка).
Оказалось, что чем больше переводишь — не значит точнее: билингвальный промпт (оригинал + перевод одновременно) иногда путает модель сильнее, чем просто монолингвальный вариант. На основе этого собрали систему из двух механизмов: один переключается между режимами перевода на основе внутренних технических сигналов (не применим в обычном чате), второй — структурированный трёхфазный промпт для сложных случаев, который и есть applicable часть этого исследования.
