3,583 papers
arXiv:2609.06842 80 6 сент. 2026 г. FREE

XY Problem: почему ИИ отвечает на ваш буквальный вопрос, а не на настоящую проблему

КЛЮЧЕВАЯ СУТЬ
Без подсказки модель озвучивает правильный совет только в 33-71% случаев — хотя внутри неё это знание есть. Приём из исследования XYBench позволяет разблокировать это скрытое знание одним движением: заставить модель сравнить твой метод с альтернативой в том же промпте, где ты формулируешь реальную цель. Секрет прост: если дать модели выбор из двух готовых ответов, она берёт правильный в 84% случаев — свободная генерация слабая, сравнение вариантов сильное. Задача пользователя — создать этот выбор искусственно, внутри одного запроса.
Адаптировать под запрос

TL;DR

Когда вы спрашиваете ИИ "как сделать X", а на самом деле X — это неправильный метод для решения задачи Y, модель почти всегда просто помогает с X. Она не останавливает вас и не говорит "стоп, это не тот путь" — даже если внутри неё есть понимание, что путь неверный.

Представьте: вы спрашиваете "как распарсить XML через регулярные выражения". Модель с вероятностью 75-92% просто даст вам регулярку. Хотя правильный ответ — "используй XML-парсер, регулярки для этого не годятся" — модель озвучивает такой ответ только в 33-71% случаев. Самое неожиданное: если дать модели те же два варианта ответа и спросить "какой лучше?", она в 84% случаев выберет правильный, прагматичный вариант. Но сама, без подсказки, она его не сгенерирует.

Разница видна на цифрах: люди-эксперты замечают ошибку в подходе пользователя в 79-90% случаев, у моделей — максимум 60-63%. Причина не в незнании — модель "знает" лучший ответ (это доказывает тест с выбором), но не активирует это знание, если её не попросить явно сравнить подходы. Значит, если вы явно попросите модель сопоставить ваш метод с альтернативами — вероятность получить полезный совет резко растёт.


🔬

Схема метода

Это не техника из статьи, а вывод, который можно превратить в приём для чата:

ШАГ 1 (в одном промпте): Опиши реальную цель, а не только выбранный метод → явная формулировка "чего я хочу добиться"
ШАГ 2 (в том же промпте): Попроси модель явно сравнить твой метод с альтернативами → выбор между вариантами вместо свободного ответа

Механика по данным исследования: когда модели дают выбор между "ответить в лоб" и "ответить по существу проблемы" — она выбирает по существу в 84% случаев. Значит, задача пользователя — самому создать этот "выбор" внутри промпта.


🚀

Пример применения

Ограничение метода: работает лучше для процедурных ошибок (человек выбрал неправильный инструмент/способ), хуже для чисто фактических вопросов.

Задача: Владелец интернет-магазина на Wildberries хочет протестировать 5 разных заголовков на карточке товара и вручную создаёт 5 копий карточки, чтобы вручную менять и сравнивать конверсию.

Промпт:

Мне нужно протестировать 5 разных заголовков карточки товара на Wildberries. 
Сейчас я планирую создать 5 отдельных копий карточки и вручную менять заголовки, 
а потом сравнивать продажи за неделю на каждой.

Прежде чем помогать мне с этим планом, ответь на два вопроса:
1. Какая моя настоящая цель — не как я планирую это делать, а что я хочу получить в итоге?
2. Есть ли более эффективный способ достичь этой цели, чем создание 5 копий карточки вручную? 
Если да — прямо скажи, в чём слабость моего текущего плана, и предложи лучшую альтернативу.

После этого дай мне пошаговый план — либо по моему исходному способу, либо по альтернативе.

Результат: Модель сначала сформулирует настоящую цель ("найти заголовок с максимальной конверсией без потери позиции карточки в поиске"), затем укажет слабость ручного A/B-теста (искажение из-за сезонности, потеря позиций из-за дублей, долгий срок теста) и предложит альтернативу — встроенные инструменты аналитики WB Advertising или сервисы сплит-тестирования карточек. В конце — конкретный план действий по лучшему варианту.


🧠

Почему это работает

Модели обучены буквально выполнять инструкции — это тренированное поведение, а не баг. Когда вы просите "как сделать X", модель по умолчанию отвечает про X, а не проверяет, была ли выбрана правильная цель.

Но у модели есть скрытая сила: она хорошо сравнивает готовые варианты, если их явно предъявить. Исследование показало — стоит дать модели выбор "ответ А или ответ Б", и она в 84% случаев выбирает более полезный. Проблема не в знаниях модели, а в том, что при свободной генерации это знание не включается автоматически.

Приём выше искусственно создаёт этот "выбор" внутри одного запроса — вы просите модель сначала явно сформулировать цель и сравнить подходы, а потом уже отвечать. Это переносит задачу из режима "свободная генерация" (где модель слабая) в режим "сравнение вариантов" (где модель сильная).

Рычаги управления: - Уберите вопрос "какая моя настоящая цель" → модель вернётся к буквальному ответу на ваш вопрос, минуя проверку. - Добавьте "оцени риски моего текущего подхода в цифрах/времени" → модель конкретнее объяснит цену ошибки. - Для технических задач добавьте "представь, что ты сеньор-разработчик, которого попросили сделать код-ревью моего плана" → роль экспертов усиливает готовность указывать на ошибки (люди-эксперты в исследовании справлялись значительно лучше моделей).


📋

Шаблон промпта

Мне нужно {конкретная задача}. Сейчас я планирую делать это через {ваш метод/инструмент}.

Прежде чем помогать с этим планом, ответь на два вопроса:
1. Какая моя настоящая цель — не способ, а результат, который я хочу получить?
2. Есть ли более эффективный способ достичь этой цели, чем {ваш метод}? 
Если да — прямо укажи слабость текущего плана и предложи лучшую альтернативу.

После этого дай план действий — по исходному способу или по альтернативе, в зависимости от твоего ответа.

Подставляйте: {конкретная задача} — то, чего вы хотите добиться в итоге; {ваш метод/инструмент} — конкретный способ, который вы уже выбрали и который может быть не оптимальным.

🚀 Быстрый старт — вставь в чат:

Вот приём для проверки, не выбрал ли я неправильный способ решения задачи. 
Адаптируй его под мою ситуацию: {опишите вашу задачу и метод, который собираетесь использовать}.

[вставить шаблон выше]

LLM спросит детали вашей задачи и метода — потому что без конкретики она не сможет сформулировать вашу реальную цель и сравнить альтернативы.


⚠️

Ограничения

⚠️ Не панацея даже с явной подсказкой: в экспериментах исследователей даже когда модели явно давали и стated-запрос, и intended-запрос (то есть почти всю подсказку решения), разрыв с человеческим уровнем не закрывался полностью. Приём снижает проблему, но не убирает её.

⚠️ Модель может неверно угадать "реальную цель": если в вашем запросе мало контекста, шаг 1 промпта может сформулировать неправильную цель, и весь дальнейший совет будет мимо.

⚠️ Слабее работает на фактических вопросах: приём заточен под ситуации "неправильный метод/инструмент", а не под вопросы типа "правда ли, что...". Для проверки фактов это не тот инструмент.


🔍

Как исследовали

Команда собрала 8 115 запросов с "скрытой ошибкой в подходе" (тот самый XY problem — когда человек зацикливается на неправильном методе) из трёх источников: реальные вопросы со Stack Overflow и Stack Exchange, размеченные сообществом как "XY problem" (1741 штука), синтетические бытовые запросы, сгенерированные из статей WikiHow (6272 штуки), и вручную собранные случаи из Reddit и рабочих переписок (102 штуки).

Для каждого запроса выделили три параметра ответа: решает ли ответ буквальный запрос, называет ли модель саму ошибку в подходе, и предлагает ли решение настоящей проблемы. Дальше протестировали 5 топовых моделей (3 закрытых, 2 открытых) и сравнили их с ответами живых людей-экспертов на тех же вопросах.

Самое интересное — тест с множественным выбором. Когда моделям дали и буквальный, и "правильный" вариант ответа и попросили выбрать лучший, они выбирали правильный в 84% случаев. Но когда тех же моделей просто просили ответить на вопрос свободно — правильный, прагматичный ответ появлялся значительно реже. Это разошлось с ожиданием исследователей: получилось, что дело не в отсутствии знаний у модели, а в том, что свободная генерация "не достаёт" это знание без явной подсказки сравнить варианты.


🔗

Ресурсы

XYBench (Akhila Yerukola, Jena D. Hwang, Mingqian Zheng и др., Carnegie Mellon University, Allen Institute for AI, NVIDIA, Johns Hopkins University). Код и датасет: github.com/Akhila-Yerukola/XYBench


📋 Дайджест исследования

Ключевая суть

Без подсказки модель озвучивает правильный совет только в 33-71% случаев — хотя внутри неё это знание есть. Приём из исследования XYBench позволяет разблокировать это скрытое знание одним движением: заставить модель сравнить твой метод с альтернативой в том же промпте, где ты формулируешь реальную цель. Секрет прост: если дать модели выбор из двух готовых ответов, она берёт правильный в 84% случаев — свободная генерация слабая, сравнение вариантов сильное. Задача пользователя — создать этот выбор искусственно, внутри одного запроса.

Принцип работы

Модель ведёт себя как отличник, который знает верный ответ, но не поднимает руку — пока учитель сам не даст ему выбрать между А и Б. Дай ей этот выбор сам — внутри промпта, а не жди, что она создаст его сама. Формула простая: сначала попроси сформулировать реальную цель, потом — сравнить твой метод с альтернативой.

Почему работает

Модели тренируют отвечать буквально на вопрос — это их базовая настройка, не баг. Спросишь про регулярки для XML — получишь регулярку, хотя внутри модель 'знает', что нужен парсер. Знание не пропадает — оно просто не включается в режиме свободного ответа, только в режиме сравнения готовых вариантов. Люди-эксперты ловят такие ошибки в 79-90% случаев, модели — максимум в 60-63%.

Когда применять

Разработка, аналитика, тестирование гипотез → конкретно когда ты уже выбрал метод или инструмент и просишь помощь с ним, а не спрашиваешь совета с нуля. Особенно полезно, когда задача звучит как 'как сделать X', а не 'что мне делать с Y'. Не подходит для фактических вопросов типа 'правда ли, что...' — там механика другая.

Мини-рецепт

1. Опиши цель, не метод: в промпте явно спроси модель — 'какая моя настоящая цель, а не то, как я планирую её достичь?'
2. Создай искусственный выбор: попроси сравнить твой способ с альтернативой в том же запросе — не давай модели просто ответить 'как сделать'.
3. Спроси цену ошибки в цифрах: добавь 'укажи слабость текущего плана в цифрах или времени' — получишь не абстрактный совет, а измеримый.
4. Забери план в конце: только после сравнения проси финальный пошаговый план — по исходному способу или по альтернативе.

Примеры

[ПЛОХО] : Как распарсить XML через регулярные выражения?
[ХОРОШО] : Мне нужно вытащить данные из XML. Планирую делать это через регулярные выражения. Прежде чем помогать — скажи, какая моя реальная цель, и есть ли способ лучше регулярок. Если да — укажи слабость моего подхода и предложи альтернативу.
Источник: XYBench: Can LLMs Respond Pragmatically to Queries with Misconceptions?
ArXiv ID: 2609.06842 | Сгенерировано: 2026-09-09 06:28

Проблемы LLM

ПроблемаСутьКак обойти
Модель решает буквальный вопрос, а не настоящую проблемуСпрашиваешь "как сделать X" — а X сам неправильный метод для задачи Y. Модель просто помогает с X. Не останавливает и не говорит "это не тот путь". Даже если внутри неё есть правильный ответ, она его не озвучивает без просьбы. Работает для любых технических и процедурных вопросов, где выбран неверный инструмент или подходОпиши в промпте не только метод, а настоящую цель. Прямо попроси модель сравнить твой метод с альтернативами перед тем как давать план. Заставь её сначала ответить на вопрос "есть ли способ лучше", а потом уже помогать

Методы

МетодСуть
Явное сравнение вариантов внутри одного промптаОпиши задачу и свой метод. Добавь два вопроса перед просьбой о помощи: "какая моя настоящая цель" и "есть ли способ лучше моего". Прежде чем помогать, ответь: 1) какая моя реальная цель; 2) есть ли более эффективный способ её достичь. Почему работает: модель плохо генерирует критику сама, но хорошо сравнивает готовые варианты, если их явно предъявить. Формулировка вопроса создаёт этот выбор внутри промпта. Работает лучше: процедурные задачи, где выбран неверный инструмент/способ. Работает хуже: фактические вопросы вида "правда ли что...", где нет альтернативного метода для сравнения

Тезисы

ТезисКомментарий
Модель сильна в сравнении готовых вариантов, слаба в свободной генерации критикиКогда модель придумывает ответ с нуля, она редко сама указывает на ошибку в подходе пользователя — по умолчанию просто выполняет буквальную просьбу. Но если дать ей два готовых варианта ответа и спросить "какой лучше", она почти всегда выбирает более правильный. Знание у модели есть, но при свободной генерации оно не активируется само. Применяй: не проси "помоги с X", а проси "сравни X и альтернативный подход, выбери лучший" — это переводит задачу в режим, где модель работает надёжнее
📖 Простыми словами

XYBench: CanLLMsRespond Pragmatically to Queries with Misconceptions?

arXiv: 2609.06842

Нейросети страдают классической проблемой XY: когда ты просишь помочь с кривым решением X, модель послушно помогает тебе его реализовать, вместо того чтобы спросить про реальную цель Y. Это фундаментальное ограничение instruction tuning — модели намертво выдрессированы буквально исполнять команды. Алгоритм может понимать, что ты творишь дичь, но всё равно услужливо поможет закопать себя глубже.

Это как прийти в магазин и спросить: "Каким молотком удобнее выбивать пробку из бутылки вина?". Нормальный консультант даст тебе штопор, а нейросеть с умным видом подберёт кувалду на два килограмма и распишет инструкцию, как не порезать руки осколками. Формально ответила на вопрос, но задача провалена.

Бенчмарк XYBench показал: модели массово лажают именно в процедурных ошибках, когда человек выбирает не тот инструмент. Чтобы заставить ИИ думать прагматично, нужен контекстный фрейминг. Перестань спрашивать только про действие — всегда задавай связку: исходная цель Y плюс вопрос "адекватен ли способ X или я делаю фигню?". Без явного разрешения на критику модель будет слепо поддакивать.

Тестировали на синтетических тестах, но принцип универсален. Это работает в написании кода, настройке серверов, маркетинге и менеджменте. Если ты спросишь, как парсить HTML регулярными выражениями, модель послушно родит чудовищный костыль, вместо того чтобы в одну строчку предложить нормальный парсер.

Короче: хватит скармливать сетке готовые костыли — описывай проблему целиком. Требуй валидации своего подхода до того, как начнёшь писать код или внедрять стратегию. Иначе ты просто потратишь часы на идеальную реализацию решения, которое изначально не должно было существовать.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с