3,583 papers
arXiv:2608.16707 78 17 авг. 2026 г. FREE

Семантические бандиты: LLM выбирает по звучанию названия, а не по реальным цифрам

КЛЮЧЕВАЯ СУТЬ
Назови худший вариант «восхитительным» — модель будет упорно выбирать именно его, несмотря на провальные цифры. Назови так лучший — тот же алгоритм находит его быстрее классических методов. Метод дебиасинга меняет эмоциональные названия вариантов на нейтральные номера и добавляет прямое предупреждение «слова могут врать, смотри на цифры» — это позволяет получить от модели выбор, основанный на реальной истории результатов, а не на созвучии слова «премиум» с успехом. Разница между провалом и обгоном классических алгоритмов зависит только от одного — совпадает ли название с реальностью.
Адаптировать под запрос

TL;DR

Когда языковую модель просят раз за разом выбирать между несколькими вариантами и подстраиваться под фидбек (классическая задача "многорукого бандита" — пробуй разные варианты, учись на награде), модель ориентируется не только на цифры. Она цепляется за слова, которыми названы варианты, и это может полностью переписать логику выбора.

Если назвать лучший вариант "восхитительным" — модель быстро найдёт его и покажет отличный результат, даже лучше классических алгоритмов. Но если "восхитительным" назвать худший вариант — модель упорно держится за него несмотря на плохие цифры, почти не пробует альтернативы, и результат резко проваливается. Модель путает ярлык с реальностью — потому что слова "восхитительный", "лучший", "элитный" статистически связаны с хорошим исходом ещё с обучения, и эта связь перебивает то, что показывают фактические данные. Отдельная находка: негативная награда заставляет модель менять стратегию гораздо сильнее, чем такая же по силе позитивная — она воспринимает минус не как число, а как сигнал "что-то не так, надо всё поменять".

Чтобы получить от модели решение, основанное на данных, а не на звучании слов — называй варианты нейтрально (буквы, номера) и явно предупреждай, что названия могут не отражать реальную эффективность, а также прямо проси исследовать все варианты, а не держаться за один.


📌

Схема исследования

ШАГ 1: Модели описывают задачу выбора (например "3 поля для урожая", "3 товара для рекомендации")
ШАГ 2: Каждому варианту присваивают название — нейтральное (случайный код) или окрашенное (эмоциональное слово, "лучший/худший", отраслевой термин)
ШАГ 3: Модель выбирает вариант → получает число-награду → на следующем шаге выбирает снова, видя историю
ШАГ 4 (повторяется N раз): если название совпадает с реальностью — модель находит лучший вариант быстро.
        Если название противоречит реальности — модель застревает на плохом варианте.

🚀

Пример применения

Задача: Маркетолог тестирует три рекламных креатива и просит ChatGPT каждый день решать, куда перераспределить бюджет, основываясь на вчерашних показателях CTR и конверсии.

Промпт (плохой вариант, с ловушкой):

У тебя есть 3 рекламных креатива: "Хайповый", "Стандартный", "Скучный".
Вот данные за последние 5 дней:
Хайповый: CTR 1.2%, конверсия 0.3%
Стандартный: CTR 2.8%, конверсия 1.1%
Скучный: CTR 3.5%, конверсия 1.6%

Куда направить бюджет завтра?

Результат: Есть риск, что модель продолжит отдавать предпочтение "Хайповому" креативу или будет колебаться между ним и лучшим вариантом, даже когда цифры однозначно показывают, что "Скучный" работает лучше — потому что слово "хайповый" статистически ассоциируется с успехом.

Промпт (исправленный, с нейтральными именами и предупреждением):

У тебя есть 3 рекламных креатива: Вариант 1, Вариант 2, Вариант 3.
Названия вариантов случайны и не отражают их реальную эффективность — учитывай только цифры.

Вот данные за последние 5 дней:
Вариант 1: CTR 1.2%, конверсия 0.3%
Вариант 2: CTR 2.8%, конверсия 1.1%
Вариант 3: CTR 3.5%, конверсия 1.6%

Куда направить бюджет завтра? Обязательно учитывай возможность, что лидер может измениться — не зацикливайся на одном варианте.

Результат: Модель с большей вероятностью примет решение строго по цифрам (Вариант 3) и будет спокойнее пересматривать выбор при изменении данных в будущих раундах.


🧠

Почему это работает

Модель не воспринимает числа как чистый абстрактный сигнал. Она обучалась на текстах, где слова типа "лучший", "премиум", "отличный" почти всегда стоят рядом с положительным исходом. Эта статистическая привычка живёт в модели независимо от того, что происходит в конкретной задаче — модель предчувствует результат по слову, а не вычисляет его по данным.

Сильная сторона языковой модели — использовать контекст и смысл для быстрых выводов. Это работает отлично, когда название и реальность совпадают: модель находит правильный ответ быстрее классических алгоритмов, потому что дополнительно опирается на смысл. Но та же сила превращается в слабость, если название вводит в заблуждение — модель верит слову больше, чем фактам.

Рычаги управления: - Название вариантов (нейтральные буквы/номера ↔ эмоциональные слова, ранги, отраслевые термины) → определяет, насколько модель доверяет словам вместо цифр - Явное предупреждение о том, что названия могут быть обманчивыми → снижает влияние слов - Прямая инструкция "исследуй все варианты" → увеличивает готовность пробовать непопулярные варианты, но если название и так совпадает с реальностью — эта же инструкция может ЗАСТАВИТЬ модель зря тратить попытки на заведомо плохие варианты - Знак результата (позитивный/негативный фидбек) → негативный сигнал куда сильнее заставляет модель менять стратегию, чем позитивный такой же силы


📋

Шаблон промпта

Ты принимаешь решение на основе истории результатов, а не по названиям вариантов.

Варианты: {список вариантов с нейтральными именами — "Вариант 1", "Вариант 2" и т.д.}

Задача: {что нужно оптимизировать — бюджет, стратегию, выбор товара}

История результатов:
{вариант} → {результат}
{вариант} → {результат}
...

Важно: названия вариантов могут быть случайными и не отражать реальную эффективность. 
Учитывай только фактические результаты из истории. 
Обязательно пробуй разные варианты в течение серии решений — не зацикливайся на одном, даже если он кажется явно лучшим.

Какой вариант выбрать дальше? Объясни рассуждение по цифрам.

Подставь свою задачу (бюджет, ассортимент, стратегию), реальные варианты — но замени их эмоциональные названия на нейтральные, и вставь историю результатов по раундам.

🚀 Быстрый старт — вставь в чат:

Вот шаблон для принятия решений на основе данных без влияния названий вариантов. 
Адаптируй под мою задачу: {твоя задача}. 
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, сколько у тебя вариантов и какие данные по ним есть за прошлые периоды — потому что без истории результатов и чёткого списка вариантов дебиасинг не сработает: модели нужна конкретная цифровая история, чтобы перестать полагаться на слова.


⚠️

Ограничения

⚠️ Дебиасинг не бесплатен: явная инструкция "обязательно исследуй все варианты" помогает, когда название вводит в заблуждение, но вредит, когда название и так совпадает с реальностью — модель зря тратит попытки на заведомо слабые варианты.

⚠️ Эффект зависит от модели: одни модели (в исследовании — Gemini) в целом более устойчивы к словесным ловушкам, другие почти не исследуют варианты без прямой подсказки, что это задача выбора с накоплением опыта.

⚠️ Проверено на простых задачах: тестировали выбор из 3 вариантов с понятной числовой наградой. В сложных многошаговых агентных сценариях (с длинной цепочкой решений и памятью) эффект может усиливаться или ослабевать — прямых данных по этому нет.


🔍

Как исследовали

Команда взяла классическую задачу "многорукого бандита" (выбираешь один из нескольких вариантов, получаешь случайную награду, со временем учишься выбирать лучший) и добавила туда единственную новую переменную — текстовое название каждого варианта. Они протестировали три модели (OLMo, Qwen3, Gemini) на трёх сценариях — абстрактный бандит, ферма с полями и рекомендация одежды — и на четырёх типах названий: случайные буквы, эмоциональные слова, явные ранги ("лучший/худший") и термины, знание о которых уже заложено в модель ("плодородный луг" vs "каменистые холмы").

Каждую комбинацию прогнали 10 раз, сравнивая с классическим алгоритмом UCB1 (математически оптимальная стратегия без учёта слов). Оказалось, что при случайных названиях модели ведут себя почти как классический алгоритм — это подтверждает, что именно смысл слов, а не сама задача, ломает логику. Дополнительный сдвиг переменной награды (позитивная/негативная при одинаковой величине) показал, что знак числа сам по себе — тоже смысловой сигнал: минус воспринимается моделью как повод резко поменять стратегию, а не просто как меньшее число.


🔗

Ресурсы

Semantic Bandits: In-Context Exploration-Exploitation is Biased by Semantic Priors — David Eric Austin, Kaheer Suleman, Jackie Chi Kit Cheung. McGill University, Mila – Quebec AI Institute, Skyfall AI. Published as a conference paper at COLM 2026.


📋 Дайджест исследования

Ключевая суть

Назови худший вариант «восхитительным» — модель будет упорно выбирать именно его, несмотря на провальные цифры. Назови так лучший — тот же алгоритм находит его быстрее классических методов. Метод дебиасинга меняет эмоциональные названия вариантов на нейтральные номера и добавляет прямое предупреждение «слова могут врать, смотри на цифры» — это позволяет получить от модели выбор, основанный на реальной истории результатов, а не на созвучии слова «премиум» с успехом. Разница между провалом и обгоном классических алгоритмов зависит только от одного — совпадает ли название с реальностью.

Принцип работы

Модель не считает — она угадывает по слову. Слова «лучший», «элитный», «хайповый» тянут за собой шлейф успеха ещё из обучающих текстов, и эта привычка спорит с цифрами из истории раундов. Чем ярче название — тем сильнее модель верит слову, а не таблице с результатами. Отдельная деталь: минус в награде трясёт стратегию сильнее, чем такой же плюс — модель читает минус как «срочно всё меняй», а не как обычное число.

Почему работает

Причина не в глупости модели, а в том, как она обучалась. В текстах слова «премиум» и «топ» почти всегда стоят рядом с хорошим исходом — модель выучила эту связь на миллионах примеров. Модель предчувствует результат по слову раньше, чем вычисляет его по цифрам — и если предчувствие спорит с фактами, обычно побеждает предчувствие. Та же особенность работает в плюс, если название совпадает с реальностью: модель находит правильный ответ быстрее классических алгоритмов бандитов, потому что дополнительно ловит смысл слова как подсказку.

Когда применять

Применяй в любых сценариях с повторяющимся выбором и обратной связью → распределение рекламного бюджета, выбор поставщика, A/B-тест вариантов товара, особенно когда варианты названы броско («премиум», «топ», «флагман»). Не подходит как единственная защита в сложных многошаговых агентных сценариях с долгой памятью — там эффект не проверен и может оказаться сильнее.

Мини-рецепт

1. Убери эмоции из названий: замени «Хайповый крео» на «Вариант 1», «Вариант 2»
2. Добавь предупреждение прямо в промпт: «названия случайны и не отражают реальную эффективность, учитывай только цифры»
3. Попроси исследовать: «не зацикливайся на одном варианте, даже если он кажется явно лучшим»
4. Дай историю результатов по раундам явно — без конкретных цифр за прошлые периоды дебиасинг не сработает

Примеры

[ПЛОХО] : У тебя 3 креатива: Хайповый, Стандартный, Скучный. Хайповый: CTR 1.2%, конверсия 0.3%. Скучный: CTR 3.5%, конверсия 1.6%. Куда направить бюджет завтра?
[ХОРОШО] : У тебя 3 варианта: Вариант 1, Вариант 2, Вариант 3. Названия случайны и не отражают реальную эффективность — учитывай только цифры. Вариант 1: CTR 1.2%, конверсия 0.3%. Вариант 3: CTR 3.5%, конверсия 1.6%. Не зацикливайся на одном варианте, даже если он выглядит лучшим. Куда направить бюджет завтра?
Источник: Semantic Bandits: In-Context Exploration-Exploitation is Biased by Semantic Priors
ArXiv ID: 2608.16707 | Сгенерировано: 2026-08-18 05:22

Проблемы LLM

ПроблемаСутьКак обойти
Название варианта важнее цифр при выбореМодель выбирает между несколькими вариантами по накопленным данным. Если вариант назван "лучший", "премиум", "восхитительный" — модель тянется к нему даже когда цифры показывают обратное. Слово перебивает факты. Модель почти не пробует другие варианты, застревает на одном. Это ломает любую задачу где нужно выбирать на основе истории результатов: подбор товара, распределение бюджета, выбор стратегии, A/B-тесты через диалог с модельюНазывай варианты нейтрально: "Вариант 1", "Вариант 2", буквы или коды. Прямо напиши в запросе: "названия случайны и не отражают реальную эффективность, учитывай только цифры". Добавь просьбу пробовать разные варианты, а не держаться одного

Методы

МетодСуть
Нейтральные имена + предупреждение — снимает влияние слов на выборЗамени эмоциональные или оценочные названия вариантов на нейтральные коды. Добавь явную фразу: "названия не отражают реальную эффективность, решай по цифрам". Добавь инструкцию "пробуй все варианты, не зацикливайся на одном". Почему работает: модель связывает слова типа "лучший" с хорошим исходом ещё со времён обучения на текстах. Эта связь включается автоматически, даже если противоречит текущим данным. Нейтральное имя не создаёт такой связи — модель вынуждена смотреть на цифры. Когда работает: любая задача выбора из нескольких вариантов с историей результатов — распределение бюджета, подбор ассортимента, выбор стратегии. Когда не работает и даже вредит: если название и так совпадает с реальностью — инструкция "пробуй все варианты" заставит модель тратить попытки на заведомо слабые варианты без выгоды
📖 Простыми словами

Semantic Bandits: In-Context Exploration-Exploitation is Biased by Semantic Priors

arXiv: 2608.16707

Суть в том, что современные нейронки — это не калькуляторы, а жертвы стереотипов. Когда ты просишь модель решить классическую задачу многорукого бандита (выбирать лучший вариант, опираясь на прошлый опыт), она ломается об обычные слова. Вместо того чтобы честно анализировать цифры и сухую статистику, LLM цепляется за названия вариантов. Если один вариант называется «Премиум», а другой — «Бюджетный», модель подсознательно тянется к первому, даже если цифры кричат, что он приносит одни убытки. Это фундаментальный баг семантического смещения, который сидит глубоко в архитектуре.

Это как если бы ты нанял профессионального трейдера, но он отказывался бы покупать акции прибыльной компании только потому, что её название звучит «неудачливо», и вливал бы все деньги в фирму с названием «Золотой успех», которая на деле банкрот. Формально он анализирует рынок, но на деле просто ведется на красивую обертку. Модель ведет себя так же: её внутренние предубеждения оказываются сильнее реальных фактов, которые ты ей скармливаешь в промпте.

Исследователи копнули в механику In-Context Exploration-Exploitation и выяснили, что названия вариантов (те самые семантические ключи) работают как мощный магнит. Если в названии есть позитивный окрас, модель будет «долбиться» в этот вариант, игнорируя плохие результаты, — это называется положительным смещением. И наоборот: если вариант назван чем-то нейтральным или негативным, нейронка может вообще его не попробовать, даже если там скрыта золотая жила. Статистическая привычка из обучающей выборки перевешивает логику «здесь и сейчас».

Этот принцип универсален для любых задач, где AI должен принимать решения на основе данных в реальном времени. Будь то оптимизация рекламных кампаний, выбор заголовков для рассылки или распределение ресурсов в облаке — если у вариантов есть человеческие названия, модель будет предвзята. SEO для алгоритмов превращается в психологическую манипуляцию: достаточно назвать кнопку «Мгновенный результат», и AI-ассистент с большей вероятностью подсунет её пользователю, проигнорировав скучные, но эффективные альтернативы.

Короче: модель не беспристрастна, она мыслит ассоциациями, а не чистой математикой. Если хочешь, чтобы AI принимал объективные решения на основе цифр, обезличивай варианты — называй их «Вариант А» и «Вариант Б», иначе семантический мусор в голове нейронки исказит все результаты. 10 из 10 моделей лажают, когда названия начинают конфликтовать с реальностью. Кто не учитывает этот баг восприятия, тот сливает бюджет на «красивые» слова, которые не работают.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с