3,583 papers
arXiv:2608.03550 78 4 авг. 2026 г. FREE

Zero-shot без примеров: почему few-shot CoT-примеры вредят сильным моделям на математике

КЛЮЧЕВАЯ СУТЬ
Чем больше примеров решений вы даёте модели — тем хуже она считает. Для reasoning-моделей типа Mathstral few-shot примеры съедают до 10 процентных пунктов точности — модель тратит ресурс на копирование чужого стиля вместо решения задачи. Метод zero-shot без примеров позволяет получить точный ответ на математических задачах — просто задайте вопрос напрямую, без образцов. Модель решает в своём естественном стиле — пошаговый reasoning это её врождённый способ вывода, а не то, что нужно вызывать примером.
Адаптировать под запрос

TL;DR

Если модель уже умеет решать задачи пошагово — она делает это сама, без подсказок. Хуже: если вы даёте ей примеры решений перед своей задачей (классический few-shot Chain-of-Thought), модель начинает копировать стиль и формат этих примеров вместо того, чтобы сосредоточиться на самой задаче. Точность падает.

Боль в том, что все привыкли думать: "чем больше примеров дам модели — тем лучше она поймёт, что делать". Для слабых моделей это правда. Но для моделей, специально обученных на рассуждениях (типа Mathstral), примеры из датасета — это чужой стиль, который приходится "натягивать" на себя, тратя ресурс на подстройку формата, а не на решение задачи. В одном из тестов такая подстройка "съедала" до 10 процентных пунктов точности.

Решение оказалось до смешного простым: уберите примеры вообще. Просто задайте вопрос напрямую (zero-shot) — модель выдаст своё естественное пошаговое рассуждение и решит задачу точнее, чем с "обучающими" примерами. Опционально можно добавить фразу "давай думать шаг за шагом" — для слабых моделей это даёт заметный бонус, для сильных — почти незаметный.


🔬

Схема метода

ШАГ 1: Задать вопрос напрямую, без примеров решений → модель генерирует свой пошаговый ответ
ШАГ 2 (опционально, усиливает эффект для слабых моделей): 
        Добавить фразу "давай решать шаг за шагом" → лёгкий буст точности

Оба шага — это один промпт, без отдельных запросов.


🚀

Пример применения

Задача: Вы продаёте товар на Wildberries и считаете юнит-экономику, чтобы не уйти в минус.

❌ Так делают многие (few-shot с примерами):

Вот пример расчёта: себестоимость 200 руб, комиссия 12%, логистика 40 руб, 
минимальная цена — 320 руб (расчёт: ...).

Теперь посчитай для меня: себестоимость товара 350 руб, комиссия маркетплейса 
15%, логистика 60 руб за единицу, хочу маржу минимум 25%. Какая минимальная 
цена продажи?

✅ Так надёжнее (zero-shot, без примеров):

У меня магазин на Wildberries. Себестоимость товара 350 руб, комиссия 
маркетплейса 15%, логистика 60 руб за единицу, хочу маржу минимум 25%. 
Посчитай минимальную цену продажи.

Результат: во втором случае модель выдаст полное пошаговое рассуждение в своём естественном стиле и с большей вероятностью придёт к верному числу. В первом случае модель может начать имитировать формат примера ("расчёт: ...") вместо того, чтобы честно посчитать вашу цифру — и на этом сбиться.


🧠

Почему это работает

Современные LLM, особенно "заточенные" под рассуждения, уже обучены на огромном количестве примеров пошаговых решений. Пошаговое рассуждение — это их естественный стиль вывода, а не что-то, что нужно вызывать специальной подсказкой.

Когда вы даёте модели чужие примеры решений (особенно человеческие, из датасета), она тратит часть "внимания" не на задачу, а на подстройку под формат этих примеров — стиль изложения, структуру, требования к оформлению ответа. Это как заставить хорошего математика решать задачу, глядя на чужой почерк и пытаясь писать так же — вместо того, чтобы просто решить.

Убирая примеры, вы даёте модели рассуждать так, как ей естественно. Это освобождает "мыслительный ресурс" для самой задачи, а не для копирования формата.

Рычаги управления: - Наличие примеров — для слабых, не заточенных на рассуждения моделей, примеры всё ещё могут помогать. Для сильных reasoning-моделей — убирайте. - Фраза "думай шаг за шагом" — для слабых моделей заметный бонус, для сильных — минимальный, иногда почти нулевой эффект. - Формат ответа ("выведи только число" vs свободный текст) — влияет не на качество рассуждения, а на то, насколько легко потом достать финальный ответ из текста. - Свои примеры модели (если вы всё же хотите дать few-shot) — генерируйте их той же моделью, а не берите готовые чужие тексты. Это менее вредно, чем человеческие примеры, но всё равно не гарантированно лучше чистого zero-shot.


📋

Шаблон промпта

{Ваша задача, сформулированная напрямую, без примеров решений}

{Опционально, для менее продвинутых моделей: Давай решать шаг за шагом.}

Никаких плейсхолдеров сложнее не нужно — суть метода именно в минимализме: не давайте модели образцы для подражания, дайте ей просто задачу.


⚠️

Ограничения

⚠️ Проверено только на математике: исследование использует один бенчмарк школьных задач (GSM8K). Для логических задач, кода или творческих текстов выводы не проверены напрямую — принцип "не мешай модели её естественным стилем" вероятно применим шире, но это не доказано в этой работе.

⚠️ Тестировали модели среднего размера (7–8 млрд параметров): для флагманских моделей уровня GPT-4 или Claude Opus эффект может отличаться — они ещё сильнее в естественном рассуждении, и разрыв может быть даже больше.

⚠️ Работает по-разному для разных моделей: для моделей, специально обученных на рассуждениях (как Mathstral), эффект огромный. Для универсальных моделей без такой специализации (как Llama) убирание примеров иногда даже немного вредит — они всё ещё выигрывают от небольшой подсказки в виде примера.

⚠️ "Думай шаг за шагом" — угасающий эффект: чем сильнее модель, тем меньше пользы от этой фразы. Для самых продвинутых моделей она может быть почти бесполезна или даже слегка мешать.


🔍

Как исследовали

Исследователи взяли три модели среднего размера: Mathstral (специально обучена на математике), Qwen2.5 (универсальная, но с упором на рассуждения) и Llama-3.1 (обычная универсальная модель без акцента на рассуждения). Все три прогнали через 7,5 тысячи учебных и 1,3 тысячи тестовых задач из GSM8K — стандартного бенчмарка школьной математики.

Ключевая деталь дизайна: примеры для few-shot выбирались случайно, а не по специальным алгоритмам подбора похожих задач. Это сделано специально — чтобы измерить чистый эффект самого формата CoT, не смешивая его с эффектом "умного" подбора примеров.

Сравнивали шесть вариантов: примеры из датасета (с инструкциями по формату и без), примеры, сгенерированные самой моделью (с добавлением "думай шаг за шагом" и без), а также baseline — просто задать вопрос напрямую.

Результат удивил даже авторов: для Mathstral точность выросла с ≤74% (лучший результат с человеческими примерами) до 84% при простом zero-shot — и это без единого дополнительного примера в промпте, то есть буквально бесплатно. Причина, которую нашли исследователи — экстракция ответа: модели с датасетными примерами часто путались в требуемом формате ответа (например, паттерн #### число), и это маскировало настоящую точность рассуждений.


🔗

Ресурсы

Denys Pushkin, Albert Q. Jiang, Aryo Lotfi, Colin Sandon, Emmanuel Abbé — EPFL, Apple, Mistral AI. Статья ссылается на оригинальные работы по CoT: Wei et al. (2022) — классический few-shot CoT, Kojima et al. (2022) — zero-shot CoT ("Let's think step by step"). Датасет — GSM8K (Cobbe et al., 2021).


📋 Дайджест исследования

Ключевая суть

Чем больше примеров решений вы даёте модели — тем хуже она считает. Для reasoning-моделей типа Mathstral few-shot примеры съедают до 10 процентных пунктов точности — модель тратит ресурс на копирование чужого стиля вместо решения задачи. Метод zero-shot без примеров позволяет получить точный ответ на математических задачах — просто задайте вопрос напрямую, без образцов. Модель решает в своём естественном стиле — пошаговый reasoning это её врождённый способ вывода, а не то, что нужно вызывать примером.

Принцип работы

Правило простое, но ломает привычку: не показывай модели как решать — просто спроси. Классический few-shot Chain-of-Thought работал для слабых моделей, потому что им нужен был образец формата. Сильные reasoning-модели такого образца не просят — они уже умеют рассуждать пошагово сами, а чужой пример только сбивает их с курса, заставляя подгонять вывод под чужую структуру.

Почему работает

Причина проста: современные reasoning-модели обучены на миллионах примеров пошаговых решений — рассуждение шаг за шагом это их родной язык, а не трюк, который нужно вызывать подсказкой. Когда вы подсовываете чужой пример, модель тратит часть внимания на подгонку формата — стиль, структуру, обороты — вместо решения самой задачи. Вот почему на GSM8K убирание примеров возвращало до 10 процентных пунктов точности — модель просто перестаёт тратить силы на чужой почерк.

Когда применять

Математика и логические задачи → конкретно для reasoning-моделей (Mathstral и подобные, специально обученные на рассуждениях), особенно когда вы уже используете длинные few-shot примеры из датасетов. НЕ подходит для слабых универсальных моделей без специализации на рассуждениях (тип Llama-base) — там пример ещё немного помогает.

Мини-рецепт

1. Убери примеры: задай задачу прямым текстом, без "вот пример решения..."
2. Добавь по желанию: для слабых моделей вставь фразу "давай решать шаг за шагом" — для сильных моделей эффект почти нулевой, можно пропустить.
3. Проверь формат вывода: если нужен только финальный ответ — попроси явно "выведи только число", это не влияет на качество рассуждения, но упрощает извлечение ответа.
4. Если всё же хочешь few-shot: генерируй примеры той же моделью, а не бери готовые из датасета — так меньше вреда, хотя всё равно не гарантированно лучше чистого zero-shot.

Примеры

[ПЛОХО] : Вот пример расчёта: себестоимость 200 руб, комиссия 12%, логистика 40 руб, минимальная цена — 320 руб (расчёт: ...). Теперь посчитай для меня: себестоимость 350 руб, комиссия 15%, логистика 60 руб, маржа 25%. Какая минимальная цена?
[ХОРОШО] : У меня магазин на Wildberries. Себестоимость товара 350 руб, комиссия маркетплейса 15%, логистика 60 руб за единицу, хочу маржу минимум 25%. Посчитай минимальную цену продажи.
Источник: Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve
ArXiv ID: 2608.03550 | Сгенерировано: 2026-08-05 04:22

Проблемы LLM

ПроблемаСутьКак обойти
Примеры решений сбивают сильную модель с решения задачиДаёшь модели примеры решений перед своим вопросом (классический few-shot). Модель начинает копировать стиль и формат примеров вместо того, чтобы решать твою задачу. Точность падает — иногда на 10 процентных пунктовУбери примеры вообще. Задай вопрос напрямую, без образцов решений. Модель выдаст своё естественное пошаговое рассуждение и решит точнее

Методы

МетодСуть
Zero-shot напрямую — без примеров решенийЗадай задачу текстом, без единого примера решения перед ней. Опционально добавь фразу "думай шаг за шагом". Почему работает: современная модель уже умеет рассуждать пошагово сама — это её естественный формат вывода. Примеры чужих решений заставляют её тратить ресурс на подстройку под чужой стиль, а не на саму задачу. Когда да: модель специально обучена на рассуждениях (математика, логика, код). Когда нет: слабая универсальная модель без специализации на рассуждениях — ей примеры всё ещё помогают. Если хочешь дать пример — сгенерируй его той же моделью, а не бери готовый чужой текст

Тезисы

ТезисКомментарий
Чужой формат примера отвлекает ресурс модели от решения задачиСильная модель уже умеет рассуждать пошагово без подсказок — это её встроенный стиль. Когда ей показывают чужой пример (особенно написанный человеком), она частично переключается на подражание этому стилю: структуре, оформлению, манере изложения. Внимание уходит не на вычисления, а на копирование формы. Чем сильнее модель в рассуждениях — тем больше она теряет от такого навязанного шаблона. Применяй: для задач, где модель должна рассуждать (математика, логика, многошаговые расчёты) — убирай примеры-образцы и задавай вопрос прямо
📖 Простыми словами

Soft Guidance Starts to Outperform CoTPromptingasLLMsImprove

arXiv: 2608.03550

Суть в том, что современные нейронки стали слишком умными для старых костылей. Раньше мы пихали в промпт примеры решения задач, чтобы модель поняла логику — это называлось Chain-of-Thought (цепочка мыслей). Но теперь топовые модели уже «прошиты» рассуждать по шагам на уровне инстинктов. Когда ты даешь им готовые примеры, они перестают думать над твоим вопросом и начинают тупо мимикрировать под твой стиль и формат. Это когнитивный перекос: модель тратит ресурсы на то, чтобы казаться похожей на твой пример, вместо того чтобы реально решать задачу.

Это как если бы ты нанял опытного шеф-повара, но перед готовкой заставил его посмотреть три ролика из TikTok, где студенты варят пельмени. Формально он сделает всё по инструкции, но вместо высокой кухни ты получишь те самые пельмени, потому что повар решил, что именно такого примитива ты от него и ждешь. Ты буквально отупляешь эксперта, навязывая ему чужой, часто более слабый паттерн поведения.

Исследователи выяснили, что Soft Guidance (мягкое направление) теперь бьет жесткие примеры. Вместо того чтобы разжевывать «сначала сделай А, потом Б», лучше просто дать модели контекст и позволить ей использовать свои внутренние алгоритмы рассуждения. В тестах 10 из 15 методов с примерами провалились там, где модель без подсказок справилась бы лучше. Модель просто копирует ошибки или ограничения из твоих примеров, даже если сама знает, как сделать правильнее и точнее.

Этот принцип универсален: он работает и в сложных математических расчетах, и в написании кода, и даже в банальной юнит-экономике для маркетплейсов. Если ты просишь ChatGPT посчитать прибыль и даешь кривой пример из интернета, она подстроится под него и выдаст лажу. SEO для промптов умирает, потому что модели стали чувствительны к «шуму» в примерах. Чем сложнее задача, тем больше вреда от попыток навязать модели конкретный путь решения через few-shot CoT.

Короче: хватит кормить умные модели детскими примерами — это только сбивает их с толку. Если модель уровня GPT-4o или Claude 3.5 уже умеет рассуждать, просто ставь задачу четко и не мешай ей работать своим «авторским стилем». Избыточное инструктирование — это яд, который убивает точность. Либо давай идеальные, эталонные примеры, либо вообще не давай никаких, иначе получишь результат, который выглядит правильно, но по факту является полной херней.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с