3,583 papers
arXiv:2608.18158 75 13 авг. 2026 г. FREE

Когда LLM не нужен: маленькая тестовая выборка обманывает, а простое правило иногда выигрывает

КЛЮЧЕВАЯ СУТЬ
Промпт «подправили» на 117 отобранных примерах — точность подскочила, всё выглядело отлично. Прогнали правку на всех 2194 парах товаров — точность упала: модель начала слишком доверять коду товара и пропускать реальные дубли без него. Исследование сравнило GPT-4o-mini с обычными алгоритмами и нашло правило: LLM не даёт прибавки там, где задача — это чистое сравнение текста, зато выигрывает там, где нужны знания о мире (какой бренд кому принадлежит). Фишка: разделяй задачи на «текстовое совпадение» и «нужны знания» — от этого зависит, платить за LLM или обойтись правилом.
Адаптировать под запрос

TL;DR

Промпт, который исправил ошибки на маленькой проверочной выборке, может неожиданно испортить результат при полном прогоне на всех данных — это главная находка исследования о том, когда LLM реально выгоднее обычных правил для проверки качества данных. Исследователи сравнили GPT-4o-mini с классическими алгоритмами на двух задачах: поиск задвоенных товаров в каталоге и определение перепутанного бренда в карточке товара.

Когда задача сводится к сравнению текста «слово в слово» (совпадают названия товаров или нет), LLM не даёт прибавки — простое правило (пересечение слов) справляется так же хорошо. Но стоило исследователям «улучшить» промпт, добавив инструкцию про приоритет кода товара, и проверить это на 117 отобранных примерах — результат выглядел отлично. При запуске на всех 2194 парах точность упала: модель стала слишком сильно цепляться за код товара и начала пропускать реальные совпадения без него.

Зато там, где нужны фоновые знания о мире — например, понять, что «Zone Labs» и есть производитель бренда «ZoneAlarm» — LLM ощутимо выигрывает у простого правила, потому что правило ищет буквальное совпадение текста, а модель знает связи между брендами. И ещё вывод: на простых да/нет-вопросах модель почти не путается в своих ответах сама с собой (согласие 99,7% случаев), так что гонять запрос пять раз и голосовать по большинству — трата денег без реальной выгоды.


🔬

Схема метода (принципы, не пошаговая техника)

ШАГ 1: Определи тип задачи → текстовое совпадение или нужны знания о мире?
ШАГ 2: Если текстовое совпадение (дубли по названию, точные строки) → простое правило не хуже LLM и дешевле
ШАГ 3: Если нужны знания о связях (бренд-производитель, сокращения, синонимы) → тут LLM выигрывает заметно
ШАГ 4: Если меняешь промпт под конкретные ошибки → проверяй правку на БОЛЬШОЙ выборке, а не на 20-100 примерах
ШАГ 5: Для простых бинарных задач → одного запроса достаточно, голосование по нескольким прогонам не окупается

🚀

Пример применения

Задача: Ты ведёшь каталог товаров на Ozon или Wildberries и хочешь проверить карточки на ошибки в поле «бренд» — например, вместо «Samsung» стоит «Samsung Electronics», или вместо полного названия — сокращение типа тикера на бирже.

Промпт:

Вот список товаров с указанным производителем в карточке:

{список товаров с полями "название" и "производитель"}

Для каждого товара определи, правильно ли указан производитель. 
Используй свои знания о брендах, дочерних компаниях, сокращениях 
и альтернативных названиях — не проверяй буквальное совпадение текста 
в названии и поле производителя.

Ответь для каждой строки: "верно" или "ошибка", без объяснений.

Результат: Модель пройдёт по списку и для каждого товара выдаст короткий вердикт. Она поймает случаи, где название бренда в карточке — это сокращение, старое название или дочерняя компания реального производителя, даже если простой поиск по тексту не нашёл бы совпадения. Не ожидай 100% точности — модель может принять непонятные нишевые названия за правдоподобные без проверки.


🧠

Почему это работает

LLM плохо справляется, когда задача — это чистое текстовое сопоставление: у неё нет преимущества перед алгоритмом, который просто считает совпадающие слова, а иногда модель даже хуже, потому что не так строго держится за точные коды и артикулы.

Сильная сторона модели — она несёт в себе общие знания о мире: какие компании кому принадлежат, как называются бренды в разных вариантах. Там, где нужно это знание, а не сравнение строк, LLM выигрывает ощутимо.

Из этого следует практический рычаг: не берись улучшать промпт по 20-50 примерам и не считай результат окончательным. Модель может «переобучиться» на паттерне из маленькой выборки (в исследовании — начала слишком доверять коду товара) и хуже работать в целом. Проверяй правки на бóльшем количестве случаев, прежде чем доверять им.


📋

Шаблон промпта (принцип валидации правок)

Я хочу проверить, помогает ли изменение в промпте {описание изменения, 
например "добавить приоритет кода товара как признак совпадения"}.

Вот {N} примеров, где старый промпт ошибался, и {M} примеров, 
где старый промпт был прав (контрольная группа):

{примеры}

Прогони новый промпт на этих примерах и сравни с результатом старого.
Но перед тем как я буду считать это улучшением, напомни мне:
результат на маленькой выборке может не подтвердиться на всех данных — 
нужно перепроверить хотя бы на 5-10 раз большем количестве случаев.

🚀 Быстрый старт — вставь в чат:

Я дорабатываю промпт для задачи: {твоя задача классификации/разметки}. 
Помоги мне спроектировать честную проверку правки промпта — 
на скольких примерах нужно тестировать, чтобы не обмануться результатом 
на маленькой выборке, и как разделить примеры на "проблемные" и "контрольные".

[вставить шаблон выше]

LLM спросит про размер твоей исходной выборки данных и характер ошибок, которые ты пытаешься исправить — потому что от этого зависит, сколько примеров нужно для надёжной проверки.


⚠️

Ограничения

⚠️ Узкая задача: Выводы про стабильность ответов (99,7% согласия) получены на простой бинарной задаче. На более сложных или субъективных вопросах модель может путаться в своих ответах гораздо сильнее.

⚠️ Один тип ошибок: Синтетические ошибки в бренде были грубыми (явная подмена производителя на случайный другой). Реальные ошибки в данных обычно тоньше, и там разрыв между LLM и простым правилом может быть другим.

⚠️ Один язык модели: Проверяли только GPT-4o-mini. Другие модели могут вести себя иначе — как по точности, так и по стабильности повторных ответов.

⚠️ Ловушка маленькой выборки касается тебя тоже: если ты дорабатываешь промпт и тестируешь на 10-20 примерах, у тебя может быть та же проблема, что в исследовании — правка выглядит отлично локально и портит результат в целом.


🔍

Как исследовали

Исследователь взял два открытых датасета: Abt-Buy (2194 пары товаров из двух каталогов, где вручную размечено, какие пары — это один и тот же товар) и подмножество товаров Amazon (500 карточек, где половине искусственно подменили производителя). На первом сравнивали простой алгоритм пересечения слов с GPT-4o-mini в zero-shot и few-shot режимах, на втором — простую проверку «есть ли имя производителя в тексте названия» против той же модели.

Самое интересное — попытка «улучшить» промпт для entity matching: добавили правило приоритета кода товара, проверили на 117 отобранных примерах (67 ошибок + 50 контроль), увидели явное улучшение — и тут же получили просадку на всём датасете из 2194 пар. Это конкретно показывает, почему маленькая проверка обманывает: локальный паттерн не масштабируется.

Для проверки стабильности модель гоняли 5 раз на 200 парах при температуре 0.7 (не нулевой, чтобы был реальный разброс) — и она совпала сама с собой в 99% случаев. Отсюда вывод: голосование по нескольким прогонам почти не улучшает результат, а стоит в 5 раз дороже.


📋 Дайджест исследования

Ключевая суть

Промпт «подправили» на 117 отобранных примерах — точность подскочила, всё выглядело отлично. Прогнали правку на всех 2194 парах товаров — точность упала: модель начала слишком доверять коду товара и пропускать реальные дубли без него. Исследование сравнило GPT-4o-mini с обычными алгоритмами и нашло правило: LLM не даёт прибавки там, где задача — это чистое сравнение текста, зато выигрывает там, где нужны знания о мире (какой бренд кому принадлежит). Фишка: разделяй задачи на «текстовое совпадение» и «нужны знания» — от этого зависит, платить за LLM или обойтись правилом.

Принцип работы

Сначала спроси: это сравнение строк или нужны знания о мире? Если задача — найти текстовое совпадение (одинаковые названия товаров, дубли в каталоге) — простое правило считает пересечение слов и справляется так же, как модель, только бесплатно. Если задача требует фоновых знаний — понять, что «Zone Labs» это и есть производитель бренда «ZoneAlarm» — правило слепо ищет буквальный текст и проваливается, а модель просто знает эту связь.

Почему работает

LLM не имеет преимущества на чистом сопоставлении текста — иногда даже хуже, потому что не так жёстко держится за точные коды и артикулы, как алгоритм. Сильная сторона модели — она несёт в себе знания о мире: связи между брендами, сокращения, дочерние компании — там, где нужно именно это, а не сравнение строк, разрыв в пользу LLM ощутимый. А вот провал с промптом — классическое переобучение на маленькой выборке: правку проверили на 117 случаях, она «подогналась» под эти примеры и сломалась на оставшихся 2077. Ещё цифра: на простых да/нет-вопросах модель согласна с собой в 99,7% случаев — гонять запрос пять раз и голосовать по большинству тут просто трата денег.

Когда применять

Проверка качества данных в каталогах товаров → дедупликация карточек, проверка правильности бренда/производителя, особенно когда нужны фоновые знания (сокращения, дочерние компании, альтернативные названия). Не подходит для чистого текстового сравнения строк — там простое правило (пересечение слов) не хуже и в разы дешевле.

Мини-рецепт

1. Определи тип задачи: сравнение текста или знания о мире? Если сомневаешься — прогони простое правило и сравни с LLM на небольшой части.
2. Для текстовых дублей: используй пересечение слов или похожие простые алгоритмы — не плати за LLM.
3. Для задач со знаниями: дай модели явную инструкцию не проверять буквальное совпадение, а использовать знания о брендах и связях.
4. Если меняешь промпт: не считай правку окончательной по 20-100 примерам — прогони минимум на 5-10 раз большей выборке.
5. Для простых да/нет вопросов: не голосуй по нескольким прогонам — модель и так согласна с собой в 99,7% случаев, это лишние расходы.

Примеры

[ПЛОХО] : Улучшил промпт, проверил на 30 примерах — точность выросла с 70% до 95%, отправляю в прод
[ХОРОШО] : Вот 117 примеров где старый промпт ошибался и 200 контрольных где был прав. Прогони новый промпт на ВСЕХ 2194 парах, не только на отобранных — сравни точность до и после правки на полном наборе
Источник: When Do LLMs Actually Help? Evaluating LLMs as Data Quality Annotators
ArXiv ID: 2608.18158 | Сгенерировано: 2026-08-20 05:27

Проблемы LLM

ПроблемаСутьКак обойти
Промпт «переобучается» на маленькой проверочной выборкеПравишь промпт, чтобы исправить ошибки на 20-100 примерах. Результат на этой выборке становится идеальным. Но на полном наборе данных точность падает — модель зацепилась за паттерн, который в маленькой выборке выглядел общим правилом, а на самом деле был случайностьюПроверяй любую правку промпта на выборке в 5-10 раз больше исходной. Раздели примеры на две группы: где старый промпт ошибался и где был прав. Новый промпт должен улучшать первую группу без ухудшения второй

Методы

МетодСуть
Двойная контрольная группа для проверки правки промптаПеред тем как менять промпт, собери две группы примеров: где старая версия ошибалась ("проблемные") и где работала правильно ("контрольные"). Прогони новый промпт на обеих группах. Если улучшение видно только на "проблемных", но контрольная группа стала хуже — правка не годится. Работает потому что маленькая выборка ошибок часто содержит побочный паттерн (например, один конкретный признак), который модель начинает переоценивать. Контрольная группа ловит этот побочный эффект. Применяй: для любой доработки промпта под классификацию или разметку. Не работает: если у тебя вообще нет данных для контрольной группы

Тезисы

ТезисКомментарий
LLM выигрывает там, где нужны знания о связях между сущностями, а не текстовое сравнениеПростое правило (пересечение слов, поиск подстроки) отлично работает, когда правильный ответ виден прямо в тексте: совпадают слова — значит совпадают товары. Но если правильный ответ требует знания, что одна компания владеет другим брендом, или что сокращение означает то же самое — правило слепо, а у LLM это знание встроено при обучении. Применяй: перед тем как звать LLM для проверки данных, спроси себя — нужна ли тут внешняя информация о мире, или достаточно сравнить текст. Если достаточно сравнить текст — не трать деньги на LLM
📖 Простыми словами

When DoLLMsActually Help? EvaluatingLLMsas Data Quality Annotators

arXiv: 2608.18158

Запихивать нейронку в очистку таблиц только потому, что это модно — верный способ слить бюджет. Большие языковые модели мыслят семантикой и вероятностями, а не строгой логикой. Когда задача сводится к тупому сопоставлению строк, артикулов или кодов, LLM регулярно лажает там, где копеечный алгоритм по совпадению символов отрабатывает идеально.

Это как нанять профессора философии сверять штрихкоды на складе. Вроде специалист умный, но вместо того чтобы просто пикнуть сканером, он начинает додумывать контекст и пропускает элементарные ошибки. Классический код не пытается фантазировать: он тупо сравнивает буквы, пока модель увлечённо рассуждает, похожи ли «Samsung» и «Samsung Electronics».

Исследователи проверили GPT-4o-mini против обычных правил на поиске дублей и кривых брендов в каталоге. Главный облом: промпт, вылизанный на тестовой выборке, ломает всё на полных данных. Ты подгоняешь инструкцию под десяток примеров, радуешься стопроцентной точности, а на масштабе в тысячи строк модель внезапно начинает галлюцинировать и пороть чушь.

Тестировали на маркетплейсах, но грабли везде одинаковые. Очистка CRM, дедупликация баз клиентов, проверка справочников — везде, где требуются строгие правила и точные совпадения, нейросети проигрывают обычному коду. LLM полезна лишь там, где нужен языковой контекст: понять, что биржевой тикер вместо названия компании в карточке — это лажа контентщика.

Короче: хватит забивать гвозди микроскопом. Для сверки артикулов и поиска дублей используй простые детерминированные алгоритмы, а нейросеть держи как редкий инструмент для сложных текстовых кейсов. И никогда не верь успеху промпта на маленькой пачке данных — иначе полный прогон утопит тебя в мусоре.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с