3,583 papers
arXiv:2609.03177 71 2 сент. 2026 г. FREE

LLM как батч-оптимизаторы: сильны в смысловых задачах, хрупки в чисто числовых

КЛЮЧЕВАЯ СУТЬ
Сдвинь шкалу чисел на пару делений или поменяй оси местами — и LLM, которая секунду назад уверенно подбирала лучшие варианты, разваливается в хлам. Хотя суть задачи не поменялась ни на грамм. Метод батч-оптимизации через LLM позволяет находить сильные варианты заголовков, формулировок и названий за несколько раундов тестов — иногда за в разы меньшее число попыток, чем специализированные алгоритмы. Фишка в том, что весь цикл держится в одном непрерывном диалоге: модель видит всю историю попыток и оценок, а не гадает с чистого листа каждый раз.
Адаптировать под запрос

TL;DR:

Если просить LLM подбирать варианты решения итеративно — с фидбеком после каждой попытки — модель ведёт себя как самообучающийся перебор: смотрит на историю попыток и результатов, и на основе неё предлагает следующую партию вариантов. По сути это цикл "предложи — оцени — учти результат — предложи снова", без всякого дообучения, чисто через диалог.

Модель неплохо справляется даже с абстрактными числовыми задачами (например, найти оптимальную точку в многомерном пространстве), но результат нестабилен. Если задачу "переодеть" — сменить оси, инвертировать шкалу, замаскировать диапазон — качество резко падает, особенно с ростом числа переменных и объёма партии предложений за раз. Причина: модель отчасти узнаёт знакомую форму задачи из обучения, как будто вспоминает ответ, а не считает его — и когда узнавание не срабатывает, начинает путаться.

Зато в задачах, которые можно описать смыслом — словами, а не голыми числами (в исследовании это подбор молекул через текстовую запись их структуры) — модель работает значительно лучше и экономичнее по числу попыток, чем в числовой оптимизации. И ещё один важный момент: если вести весь перебор в одном непрерывном диалоге, а не начинать заново каждый раз, качество заметно растёт — модель реально использует память о прошлых попытках для рассуждений.

🔬

Схема метода

ШАГ 1 (в одном диалоге): Дать модели контекст задачи + историю всех уже опробованных вариантов с их результатами
→ модель предлагает следующую партию новых вариантов

ШАГ 2 (вне диалога): Оценить каждый предложенный вариант реальным способом (тест, метрика, экспертная оценка)
→ добавить результат в историю

ШАГ 3: Повторить шаг 1 в том же диалоге, не открывая новый чат
→ до достижения лимита попыток или нужного результата

🚀

Пример применения

Задача: Маркетолог тестирует заголовки email-рассылки для интернет-магазина косметики. Бюджет — 5 раундов тестов по 5 заголовков, цель — максимизировать открываемость (open rate).

Промпт (первый раунд, дальше — в том же диалоге):

Помогаешь подобрать заголовок email-рассылки для интернет-магазина косметики, 
чтобы максимизировать open rate.

Вот 5 заголовков и их open rate после теста на 1000 подписчиков:
1. "Скидка 20% только сегодня" — 18%
2. "Новинки для вашей кожи" — 12%
3. "Ваш подарок ждёт внутри 🎁" — 24%
4. "Обновление ассортимента" — 9%
5. "Последний день акции!" — 21%

На основе этих результатов предложи 5 новых заголовков, 
которые могут дать более высокий open rate. 
Кратко объясни, какие паттерны из удачных заголовков ты использовал.

Результат: Модель предложит новую партию заголовков с объяснением закономерностей (эмоджи, срочность, вопрос-подарок и т.п.). Дальше в этом же диалоге отправляешь результаты нового теста — и так по кругу. Важно: не открывать новый чат на каждой итерации, а продолжать один и тот же разговор.


🧠

Почему это работает

У LLM нет внутреннего калькулятора — она не «вычисляет» оптимум, а угадывает его по паттернам. В чисто числовых абстрактных задачах модель часто опирается на узнавание знакомой формы задачи из обучения, а не на реальный расчёт — и когда задачу маскируют, узнавание ломается, а с ним и качество.

Зато сильная сторона LLM — работа со смыслом. Вся её подготовка — это язык, поэтому когда объект оптимизации описан словами (текст письма, структура молекулы, дизайн-концепция), модель может рассуждать: «этот вариант сработал, потому что...», а не просто перебирать числа наугад.

Оптимизационный цикл через диалог использует именно эту сильную сторону: заставляет модель рассуждать над историей попыток в естественно-языковой форме — среде, которая ей ближе, чем голые числа. А ведение одного непрерывного диалога даёт модели возможность держать в голове всю историю рассуждений, а не терять контекст на каждом шаге.

Рычаги управления: - Размер партии вариантов за раз → чем больше вариантов просишь сразу, тем чуть хуже качество каждого. Для точности проси 1-2 варианта за итерацию, для скорости — можно больше. - Один диалог против новых чатов → всегда веди историю в одном непрерывном диалоге, не начинай заново. - Смысловая обёртка задачи → если можешь описать задачу через контекст и смысл, а не абстрактные числа — модель рассуждает заметно лучше. - Число итераций → больше раундов с фидбеком даёт лучший результат, но с падающей отдачей после 3-4 раундов.


📋

Шаблон промпта

Мы подбираем {что оптимизируем}, чтобы максимизировать {метрика успеха}.

Вот варианты, которые мы уже попробовали, и их результат:
{вариант 1} — {результат 1}
{вариант 2} — {результат 2}
...

На основе этой истории предложи {число} новых вариантов, 
которые могут показать лучший результат по {метрика}.
Кратко объясни, какую закономерность из прошлых результатов ты использовал.

Подставляй: что оптимизируешь (заголовок, цену, описание товара, скрипт продаж), метрику успеха (клики, конверсия, отклик), историю попыток с результатами, сколько новых вариантов нужно.

🚀 Быстрый старт — вставь в чат:

Вот шаблон итеративного подбора вариантов с фидбеком. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какую метрику ты оптимизируешь и как формулировать результаты тестов — потому что без чёткой метрики модель не сможет находить закономерности в истории попыток.


⚠️

Ограничения

⚠️ Чисто числовые задачи без смысла: если оптимизируемый параметр — просто число без описания (курс, доза, координата), результат нестабилен, особенно когда переменных становится больше 3-4.

⚠️ Большие партии вариантов: чем больше вариантов просишь за раз, тем ниже качество каждого отдельного варианта.

⚠️ Эффект «узнавания»: если задача похожа на известную головоломку, модель может подставить готовый ответ из памяти вместо реального решения — тестируя LLM на своих задачах, избегай классических примеров.

⚠️ Против специализированных инструментов: в сравнении с узкоспециализированными системами, обученными конкретно под задачу, LLM в среднем расходует больше попыток на тот же результат — для критичных по бюджету задач специализированный инструмент выигрывает.


🔗

Ресурсы

Frank Hu, Shriram Chennakesavalu, David Graff — Prescient Design, Genentech. Тестировали модели Anthropic (Sonnet 4.6, Opus 4.8, Opus 5) на классических функциях оптимизации (Branin, Hartmann, Ackley, Rastrigin) и на молекулярном бенчмарке PMO (Practical Molecular Optimization).


📋 Дайджест исследования

Ключевая суть

Сдвинь шкалу чисел на пару делений или поменяй оси местами — и LLM, которая секунду назад уверенно подбирала лучшие варианты, разваливается в хлам. Хотя суть задачи не поменялась ни на грамм. Метод батч-оптимизации через LLM позволяет находить сильные варианты заголовков, формулировок и названий за несколько раундов тестов — иногда за в разы меньшее число попыток, чем специализированные алгоритмы. Фишка в том, что весь цикл держится в одном непрерывном диалоге: модель видит всю историю попыток и оценок, а не гадает с чистого листа каждый раз.

Принцип работы

Один диалог — это как черновик, который дорабатывают, а не выбрасывают. Каждый новый раунд модель видит всю историю: что пробовали, что сработало, что нет. Отдельные новые чаты без памяти работают заметно хуже — модель каждый раз начинает с нуля, как будто видит задачу в первый раз.

Почему работает

Числа для LLM — не математика, а узнавание знакомой картинки. Модель не строит внутри карту «рельефа» задачи, как классические алгоритмы оптимизации. Она вспоминает, на что это похоже по обучению. Сдвинь шкалу — узнавание пропадает, качество летит вниз. С текстом всё иначе: тут модель реально рассуждает над смыслом — почему один заголовок лучше другого — и это рассуждение переносится на новые варианты.

Когда применять

Подбор вариантов с измеримым результатом → тестирование заголовков, названий, формулировок, промптов, особенно когда есть несколько раундов A/B-тестов с реальными цифрами. НЕ подходит для голой числовой оптимизации без текстового смысла — там модель нестабильна и легко сбивается от смены представления данных.

Мини-рецепт

1. Собери историю: дай модели список вариантов с результатами прошлых тестов.
2. Задай бюджет: скажи прямо «осталось N раундов по Q вариантов в каждом» — иначе модель не соизмеряет риск.
3. Попроси логику сначала: пусть объяснит паттерн лучших вариантов в 2-3 предложениях, потом даст список.
4. Держи один диалог: результаты нового раунда возвращай в тот же чат, не открывай новый.
5. Повторяй: цикл «предложи — проверь — верни результат» до конца бюджета попыток.

Примеры

[ПЛОХО] : Придумай 10 заголовков для рекламы скидки
[ХОРОШО] : Вот 5 заголовков и их CTR: 1) Скидка 50% только сегодня — 2.1%, 2) Успей забрать скидку до полуночи — 2.6%... Осталось 4 раунда по 5 штук. Сначала объясни, что общего у лучших заголовков, потом дай следующие 5, которые должны побить текущий максимум CTR
Источник: Frontier LLMs are effective batch optimizers: Assessing reasoning models in continuous and discrete settings
ArXiv ID: 2609.03177 | Сгенерировано: 2026-09-04 04:33

Проблемы LLM

ПроблемаСутьКак обойти
Числовая оптимизация ломается от косметических измененийМодель подбирает варианты по числам без смысла — например, оптимизирует функцию. Если поменять оси местами, зеркально отразить шкалу или сдвинуть диапазон, суть задачи не меняется. Но качество ответов резко падает. Модель не строит внутреннюю карту задачи, а узнаёт знакомую формуПереформулируй числовую задачу в текстовую или смысловую, если это возможно. Например, вместо "подбери координаты x, y" опиши вариант словами: "заголовок с дедлайном и цифрой". Для чисто абстрактных чисел не жди устойчивого результата от LLM

Методы

МетодСуть
Итеративный подбор вариантов в одном диалогеДержи весь цикл "предложи — проверь — сообщи результат — предложи снова" в одном непрерывном чате, а не в отдельных запросах. Каждый раз давай модели полную историю вариантов с их оценками, проси объяснить логику лучших вариантов в 2-3 предложениях, потом список новых, и указывай сколько раундов осталось. Почему работает: модель видит свои прошлые рассуждения и уточняет стратегию шаг за шагом, как человек проговаривает вслух "это не сработало, значит попробуем в другую сторону". Когда применять: есть измеримая метрика (CTR, оценка, конверсия) и несколько раундов проверки. Когда не работает: варианты — голые числа без смысла, или нет реального способа оценить результат

Тезисы

ТезисКомментарий
LLM узнаёт знакомую форму задачи, а не строит модель "рельефа"Модель не считает математически, где выше и где ниже значение функции. Она сопоставляет задачу с похожими примерами из обучения и подстраивается под знакомый паттерн. Если задачу закамуфлировать — сместить шкалу, поменять переменные местами — узнавание пропадает и качество падает, хотя суть не изменилась. Работает противоположный эффект для текстовых задач: там модель реально рассуждает над смыслом, почему один вариант лучше другого, и это рассуждение переносится на новые варианты. Применяй: если задача похожа на что-то стандартное — не путай хороший результат с реальным пониманием модели. Для нестандартных чисел проверяй устойчивость к переформулировке
Один непрерывный диалог даёт лучший результат, чем серия изолированных запросовКогда весь процесс подбора вариантов идёт в одном чате, модель видит всю историю своих прошлых рассуждений и постепенно уточняет стратегию. Отдельные новые чаты без этой памяти теряют качество итерации, даже если ты вручную передаёшь те же данные. Применяй: никогда не открывай новый чат на каждом шаге итеративной задачи — веди диалог до конца бюджета попыток
📖 Простыми словами

FrontierLLMsare effective batch optimizers: Assessing reasoningmodelsin continuous and discrete settings

arXiv: 2609.03177

Современным сеткам не нужно сложное дообучение, чтобы работать как мощные пакетные оптимизаторы. Механика проста: ты запускаешь модель в закрытый цикл, где она генерирует пачку гипотез, получает обратно сухие цифры метрик и сразу выдаёт новую партию решений. Модель на лету считывает паттерны успехов и лаж, работая как самообучающийся алгоритм прямо внутри одного диалога.

Это как играть в морской бой с опытным наводчиком, который помнит каждый сделанный залп. Ты не читаешь ему лекции по баллистике, а просто командуешь: «перелёт на два метра». Модель моментально сопоставляет историю промахов, отсекает тупиковые ветки и бьёт точно в яблочко, экономя тебе кучу времени и попыток.

В основе подхода лежит итеративный пакетный поиск. Модель выдаёт, скажем, партию из 5 вариантов за раунд, забирает метрики эффективности и через анализ контекстной истории вычисляет скрытые закономерности. Главное — не прятать от неё контекст задачи: нейросеть побеждает не с помощью внутреннего калькулятора, а за счёт чутья на знакомые паттерны в реальных данных.

Тестировали механику на рассылках и тестах сходимости, но принцип универсален. Загоняй туда оптимизацию кликабельности заголовков, подбор промптов, калибровку параметров или игровой баланс. Везде, где есть внятная цифра отклика (вроде open rate или конверсии), связка из LLM и быстрого фидбека заменяет недели ручных тестов.

Хватит перебирать варианты вручную или городить громоздкие скрипты оптимизации. Зацикли LLM на метрику через обратную связь — и пусть она сама крутит гипотезы раунд за раундом. Кто автоматизирует этот цикл, получит быстрый рост показателей, а остальные продолжат гадать на кофейной гуще и сливать бюджеты впустую.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с