3,583 papers
arXiv:2608.17188 78 17 авг. 2026 г. FREE

Relevance-contrast context: почему немного «мусора» в контексте делает LLM точнее

КЛЮЧЕВАЯ СУТЬ
Добавь в список 60% откровенно неважных пунктов того же типа — и LLM найдёт критичное точнее, чем если дать только избранное. Метод relevance-contrast context позволяет выделять реально важные письма, задачи и сообщения без ручной предфильтрации заранее. Модель сравнивает пункты между собой внутри одного промпта — без образца «неважного» она задирает оценку всему подряд, а с ним точно видит, где проходит граница.
Адаптировать под запрос

TL;DR

Если просишь LLM найти важное среди списка задач, писем или сообщений — не давай ей только важное. Исследование показало: когда в промпт кроме нужных пунктов подмешаны неважные пункты того же типа, модель точнее оценивает, что действительно важно. Механика простая: модель без примеров «неважного» не знает, где проходит граница, и начинает завышать оценку важности всему подряд.

Боль знакома всем, кто просил LLM разобрать переписку или список задач: модель то помечает важным всё, то путается, что действительно требует внимания. Причина — у модели нет внутреннего эталона, что считать «неважным», если ей показали только избранное. Она как человек, которому дали только пятёрки на проверку и попросили сказать, какая из них самая сильная — сравнивать не с чем.

Метод — relevance-contrast context: держи фиксированный размер контекста (например, 10 пунктов), но замени часть высокорелевантных пунктов на низкорелевантные пункты того же домена (те же письма, но неважные, а не случайный текст откуда угодно). Модель получает контраст — и её оценка релевантности целевых пунктов становится точнее.


🔬

Схема метода

ШАГ 1: Собери пункты для анализа (письма, задачи, сообщения) → список
ШАГ 2: Не фильтруй жёстко только на «важное» → оставь 30-50% явно неважных пунктов того же типа
ШАГ 3: Подай весь смешанный список в один промпт с просьбой оценить важность каждого → модель точнее калибрует шкалу

Все шаги — в одном запросе к LLM, без API и кода.


🚀

Пример применения

Задача: Ты фаундер небольшого стартапа, у тебя за день накопилось 40 сообщений в общем чате команды (Telegram/Slack), и ты просишь LLM выделить, что требует твоего решения сегодня.

Промпт:

Вот 40 сообщений из рабочего чата команды за сегодня.
Некоторые из них важные (решения, блокеры, дедлайны), 
некоторые — обычная рабочая болтовня без действий.

Не удаляй и не игнорируй "неважные" сообщения — 
покажи их в списке тоже, отметив как неважные.
Это поможет тебе точнее откалибровать, что действительно критично.

Оцени каждое сообщение по шкале:
0 — не относится к работе
1 — упомянуто, но без решения/действия
2 — важный статус, стоит знать
3 — требует решения/действия сегодня

Сообщения:
{вставить все 40 сообщений подряд, включая рутинные}

Выведи только пункты с оценкой 2-3, отсортированные по важности.

Результат: Модель выдаст список приоритетных сообщений с оценками. Если сравнить с промптом, куда заранее вручную отобрать только «похожие на важные» сообщения — точность распознавания реально критичных пунктов будет ниже. Смешанный список с «шумом» того же домена даёт модели ориентир, где проходит граница важности.


🧠

Почему это работает

LLM не имеет фиксированной шкалы важности «в голове» — она оценивает относительно того, что видит в этом самом промпте. Если показать ей только избранное, она теряет точку отсчёта и начинает раздувать оценки — «всё кажется важным, если вокруг нет ничего неважного».

Модель хорошо умеет улавливать относительные контрасты: сравнивать один пункт с другим внутри одного контекста. Метод использует эту способность — специально подсовывает «эталон неважности», чтобы модель откалибровала шкалу, а не гадала на глазах у пустоты.

Рычаг управления: соотношение сигнал/шум. Исследование показало, что оптимум — широкое плато от 30% до 50% действительно важных пунктов в списке (то есть 50-70% «мусора» того же типа). Если у тебя мало неважных примеров — добавь искусственно (старые задачи, закрытые вопросы) просто чтобы дать модели контраст.


📋

Шаблон промпта

Вот список {тип_контента} за {период}.
Среди них есть важные пункты ({критерий_важности}) 
и неважные — обычная рутина без действий.

НЕ фильтруй список заранее. Покажи мне все пункты, включая неважные — 
это поможет тебе точнее понять, где граница важности.

Оцени каждый пункт по шкале:
0 — не относится к делу
1 — упомянуто, но без решения
2 — стоит знать, но не критично
3 — требует действия/решения

Список:
{вставить все пункты подряд без предварительной чистки}

Выведи финально только пункты с оценкой 2-3.

Подставь: {тип_контента} — письма/задачи/сообщения/отзывы, {период} — день/неделя, {критерий_важности} — что для тебя считается важным.

🚀 Быстрый старт — вставь в чат:

Вот шаблон relevance-contrast context. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какой тип контента ты анализируешь и по какому критерию считать пункт важным — потому что без этого не сможет подобрать правильную шкалу оценки.


⚠️

Ограничения

⚠️ Эффект неравномерен по типам контента: в исследовании выигрыш был заметен для писем (где важного мало и легко потеряться), но почти нулевой для встреч и чатов, где доля важного изначально высокая. Проверяй эффект на своём типе данных перед тем как полагаться на него.

⚠️ Позиция важнее только на длинных контекстах: на коротких списках (до ~10-15 пунктов) порядок пунктов почти не влияет на точность. На больших объёмах (30+ пунктов) важное может «затеряться» в середине — тогда выноси критичное в начало или конец.

⚠️ Эффект слабеет у моделей с расширенным рассуждением: для одной из моделей (Claude с включённым глубоким рассуждением) эффект контраста практически исчезал — модель сама выводила границу важности без подсказок. Для моделей без reasoning-режима метод работает надёжнее.

⚠️ Не любой шум работает: метод требует шума того же домена (неважные письма среди писем), а не случайного нерелевантного текста — иначе эффект может не проявиться или навредить.


🔍

Как исследовали

Исследователи взяли 661 реальное рабочее сообщение (письма, чаты, транскрипты встреч) одного специалиста за неделю, вручную разметили каждое по шкале важности 0-3, и прогнали 2420 тестов через 11 разных настроек моделей (включая GPT и Claude с разными уровнями рассуждения). Сравнивали, как точно модель оценивает важность целевых пунктов, когда в промпте только важное — против промптов, где часть важного заменена на неважное того же типа.

Результат оказался противоречащим интуиции: логика подсказывает, что «чем чище контекст — тем лучше», но на практике смешанный список с 50% неважных пунктов дал заметно более точную оценку важности, чем список из одних важных пунктов. Эффект подтвердился почти во всех моделях и устоял после проверки на дублирующихся данных и разных статистических срезах.

Отдельно проверили гипотезу про «умное объединение» — когда модель пять раз извлекает данные из одного текста, а потом LLM пытается слить пять версий в одну. Оказалось, что простое механическое объединение уникальных найденных пунктов работает не хуже (а часто лучше), чем попытка LLM «умно» синтезировать результат — умный синтез иногда терял редкие находки, которые попались только в одном из пяти прогонов.


📋 Дайджест исследования

Ключевая суть

Добавь в список 60% откровенно неважных пунктов того же типа — и LLM найдёт критичное точнее, чем если дать только избранное. Метод relevance-contrast context позволяет выделять реально важные письма, задачи и сообщения без ручной предфильтрации заранее. Модель сравнивает пункты между собой внутри одного промпта — без образца «неважного» она задирает оценку всему подряд, а с ним точно видит, где проходит граница.

Принцип работы

Правило простое: не давай модели только избранное — держи баланс. Оптимальная зона — 30-50% действительно важных пунктов, остальное — рутина того же домена. У модели нет фиксированной шкалы важности в голове — она откалибровывается на глазах, по тому что видит именно в этом промпте, здесь и сейчас.

Почему работает

LLM оценивает важность не абсолютно, а относительно окружения в промпте. Покажи только пятёрки — она не поймёт, какая сильнее, сравнивать не с чем. Модель хорошо ловит контраст между соседними пунктами, а не держит в голове абстрактную шкалу — метод специально подсовывает неважные образцы того же типа, чтобы дать точку отсчёта.

Когда применять

Разбор переписки, списков задач, отзывов и писем → конкретно там, где важного мало и легко потерять его среди рутины. Особенно полезно для писем — доля критичного там низкая. НЕ подходит для встреч и чатов с высокой изначальной долей важного, а также слабее работает у моделей с включённым глубоким рассуждением — они сами выводят границу без подсказок.

Мини-рецепт

1. Собери всё подряд: письма, задачи или сообщения за период — без ручной фильтрации.
2. Оставь мусор: 50-70% явно неважных пунктов того же домена, не случайный текст откуда угодно.
3. Дай шкалу: от 0 (не по делу) до 3 (требует решения сегодня).
4. Запрети чистку: явно напиши в промпте — «покажи всё, включая рутину, не фильтруй заранее».
5. Отфильтруй на выходе: попроси вывести только пункты с оценкой 2-3.

Примеры

[ПЛОХО] : Вот 10 самых важных писем за день, оцени какое критичнее — модель размывает оценки, всё кажется важным, границы нет.
[ХОРОШО] : Вот все 40 писем за день, включая рутинные без действий. Оцени каждое по шкале 0-3, где 3 — требует решения сегодня. Не удаляй неважные — покажи их тоже с отметкой. Выведи финально только оценки 2-3
Источник: Token Optimization and Context Window Management in Multi-Agent AI Workflows
ArXiv ID: 2608.17188 | Сгенерировано: 2026-08-19 05:25

Проблемы LLM

ПроблемаСутьКак обойти
Модель завышает важность, если видит только избранноеПросишь LLM оценить важность списка (письма, задачи, сообщения). Если заранее оставил только похожие на важные пункты — модель теряет ориентир и начинает считать критичным почти всё. У неё нет фиксированного эталона "неважного", она сравнивает пункты только между собой внутри запросаДобавь в список 50–70% явно неважных пунктов того же типа (те же письма, но рутинные — не случайный текст из другой темы). Контраст даёт модели точку отсчёта, и оценка важности становится точнее

Методы

МетодСуть
Relevance-contrast context — контраст для калибровки важностиНе фильтруй список заранее только на "важное". Оставь долю явно неважных пунктов того же домена (письма среди писем, задачи среди задач). Подай весь смешанный список одним запросом с просьбой оценить важность по шкале. Модель сравнивает пункты друг с другом внутри контекста, а не с абстрактным эталоном в голове — контраст с неважным сужает диапазон "важного" и убирает завышение оценок. Работает: списки где важного изначально мало (почта, большие бэклоги задач), 30+ пунктов. Слабее или не работает: списки где важного изначально много (встречи, активные чаты); модели с глубоким режимом рассуждений; шум из другого домена вместо того же типа контента

Тезисы

ТезисКомментарий
Модель оценивает важность относительно контекста, а не по внутренней шкалеLLM не хранит абсолютный эталон "важное/неважное". Она сравнивает пункты друг с другом внутри одного запроса. Если вокруг только важное — оценки смещаются вверх, всё кажется критичным. Применяй: в любой задаче ранжирования всегда включай в список часть заведомо неважных пунктов того же типа, а не только кандидатов на важность
📖 Простыми словами

Token Optimization and Context Window Management in Multi-AgentAIWorkflows

arXiv: 2608.17188

LLM не понимает абсолютную важность вещей — у неё нет встроенного жизненного опыта. Модель калибрует приоритеты исключительно относительно того, что ты скормил ей в текущем контексте. Если отфильтровать мусор заранее и дать нейронке только предварительно отобранные пункты, она теряет ориентиры: для неё каждая мелочь покажется катастрофой. Чтобы модель нашла реально критичные задачи, ей жизненно необходим фоновый шум для сравнения.

Это как зайти в элитный бутик, где абсолютно всё стоит от миллиона рублей: без привычных ценников из супермаркета мозг теряет берега и начинает считать куртку за 300 тысяч «выгодной сделкой». Полный самообман. Нейросеть мыслит точно так же: без примеров откровенно проходных сообщений она не видит границу нормы и вешает ярлык «срочно в номер» на любой рядовой вопрос от стажёра.

Рабочий метод прост — контрастная калибровка контекста: скармливай модели не рафинированную выжимку, а срез данных с мусором. Если нужно отсортировать 40 сообщений из рабочего чата, не пытайся вырезать шутки и флуд вроде "кто заказал пиццу". Оставь несколько заведомо неважных пунктов того же типа прямо в промпте, чтобы задать нижнюю планку шкалы. Модель сравнит задачи лоб в лоб и выдаст точные приоритеты, а не список из сорока «критических» проблем.

Фишку тестировали на оптимизации контекста в multi-agent системах, но принцип универсален. Он работает для сортировки входящей почты, разбора баг-репортов, фильтрации клиентских тикетов и любых персональных AI-ассистентов. Вместо попыток сэкономить пару токенов и скормить агенту «только суть», покажи ему типичную рутину — иначе вся твоя автоматизация превратится в бесконечный генератор ложных тревог.

Короче: перестанешь пичкать AI стерильными списками — начнёшь получать адекватную аналитику. Хватит вычищать промпты до идеального блеска, ведь стерильность напрочь сбивает модель с толку. Подмешивай бытовой контекст, давай алгоритму точку отсчёта и перестань тратить нервы на задачи, которые не стоят выеденного яйца.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с