3,583 papers

Все концепты

Концепты из исследований января 2026

30 исследований, 87 концептов — отсортировано по рейтингу

2

LLM как редактор эмпатии: добавь тепла без искажения фактов

3 концепта
88
Проблемы (1)
Генерация с нуля добавляет непрошеные детали

Просишь модель написать ответ клиенту или пациенту. Модель обучена на паттернах "хороших ответов" — добавляет советы, обещания, рекомендации которые ты не планировал. В медицине: "запишитесь на консультацию" (врач этого не говорил). В деловой переписке: "мы учтём замечания" (ты этого не обещал). Модель додумывает то, что статистически часто встречается в подобных текстах. Это галлюцинация в контексте точности

Как обойти

Не проси модель писать с нуля. Напиши короткий черновик сам — точный, но сухой. Дай модель задачу: "отредактируй мой текст, измени тон, НЕ добавляй новых фактов". Твой черновик станет якорем — модель улучшит формулировки, но не придумает лишнего

Методы (1)
Редактирование черновика вместо генерации

Напиши черновик сам. Дай модели задачу редактуры: "улучши тон", "добавь тепла", "сделай формальнее". Добавь явные запреты: "НЕ меняй факты, числа, обязательства", "НЕ добавляй новые советы". Синтаксис: Отредактируй мой текст: [задача]. Сохрани все факты из оригинала. Не добавляй новую информацию. Исходный текст: [черновик]. Почему работает: Твой черновик задаёт границы. Модель видит что ЕСТЬ (твой текст), что НУЖНО (изменить тон), что НЕЛЬЗЯ (менять смысл). Без исходного текста модель летит в свободном полёте — додумывает детали по статистике обучающих данных. С черновиком движется по рельсам. Когда применять: Коммуникация где критична точность фактов + нужен правильный тон. Переписка с клиентами, пациентами, партнёрами, инвесторами. Любая ситуация где ошибка дорого стоит. Когда не работает: Креатив и маркетинг где додумывание полезно (посты в соцсетях, реклама). Очень короткие тексты (1-2 предложения) — модель может переписать всё целиком

Тезисы (1)
Исходный текст в промпте работает как якорь против галлюцинаций

Когда модель редактирует готовый текст, у неё есть образец — что именно ты хотел сказать. Она улучшает формулировки, но не придумывает новые факты. При генерации с нуля модель стремится "помочь" — добавляет детали которые кажутся уместными по статистике текстов. Это не злой умысел, а особенность обучения: модель видела много "полных" ответов и тянется к этому паттерну. Механика: Исходный текст задаёт границы допустимого. Модель знает ЧТО ты уже сказал — остаётся только изменить КАК это звучит. Применяй: Для точной коммуникации (деловая, медицинская, юридическая, клиентская) пиши черновик сам. Даже сухой, даже корявый. Модель улучшит. Но не давай ей писать с нуля — риск додумывания слишком высок

6

CAPEL: динамический счётчик длины текста для точного контроля

1 концепт
87
Методы (1)
Динамический счётчик длины (CAPEL) — точный контроль output

Что делать: Прерывай генерацию после каждого 1-3 предложений. Вставляй строку <использовано_слов=N> с текущим счётом. Продолжай генерацию. Модель видит "87 из 150 слов" → понимает остаток → корректирует темп и объём следующей части. Почему работает: Модель фокусируется на смысле токенов, а не на подсчёте. Внешний счётчик даёт явный сигнал о прогрессе. Модель интерпретирует разрыв между текущим и целевым значением как "сколько осталось" → подстраивает подробность. Когда применять: Нужна точная длина (описания товаров, посты с лимитом слов, саммари для email). Готов делать 3-5 ручных прерываний или использовать API. Когда не работает: Задача без чёткого критерия длины. Нужна скорость без итераций. На слабых моделях (<8B параметров) эффект меньше

7

Архитектура длинного контекста: где модели теряют информацию и почему "Don't Make It Up" убивает точность

2 концепта
87
Проблемы (2)
Провал внимания в середине длинного контекста

В длинных текстах модель хуже видит информацию из середины. ChatGPT-5-mini проваливается на 50% глубины: точность падает с 100% до 80%. Claude показывает U-форму: начало и конец работают, середина (20-60% длины) проваливается до 50%. Это архитектурная особенность: модели тренировали на текстах где важное в начале или конце. Середина — детали и переходы. Паттерн внимания смещён к краям. Gemini и Deepseek не страдают от этого

Как обойти

Размещай критическую информацию в начале или конце промпта. Не клади важное в середину. Для ChatGPT и Claude: делай sandwich-структуру — инструкция ДО текста + повтор ключевого ПОСЛЕ. Или используй Gemini/Deepseek для длинных текстов

"Не выдумывай" блокирует правильные ответы

Промпт "Don't Make It Up" снижает галлюцинации. Но одновременно роняет точность. ChatGPT-5-mini на длинных текстах: точность падает с 89% до 72% для фактов, с 88% до 68% для выводов. Модель начинает отказываться отвечать даже когда информация есть. Это цена за безопасность (safety tax). Причина: порог уверенности растёт слишком сильно. Модель требует от себя большей уверенности. Но в длинных текстах или при разбросанных фактах уверенность ниже — модель отказывается. Deepseek и Gemini теряют только 1-2% точности

Как обойти

Для ChatGPT и Claude: добавляй "не выдумывай" только если критична верность. Готовься потерять 15-20% правильных ответов. Для Deepseek и Gemini: можно использовать без опаски, потери минимальны. Альтернатива: не пиши "не выдумывай", а проси "если не уверен — скажи прямо, не уверен на X%"

11

Formula-One Prompting: сначала уравнения, потом стратегия решения

1 концепт
87
Методы (1)
Два шага: формулы, потом стратегия

Шаг 1 — формализация: модель выписывает дано, найти, уравнения (как в школе). Шаг 2 — адаптивное решение: смотрит на структуру формул и выбирает стратегию — прямое вычисление (простая подстановка), цепочка рассуждений (многошаговый вывод) или код (итеративные расчёты). Оба шага в одном запросе. Почему работает: Явные уравнения = каркас задачи. Модель видит что подставлять, что выводить, в каком формате считать. Без этого прыгает в решение и путается. Когда применять: задачи с формулами и числами — финансовые расчёты, физика, метрики эффективности, бизнес-показатели. Когда НЕ работает: чистая математика (абстрактные доказательства), текстовые рассуждения без формул, простые одношаговые подстановки (избыточно)

13

Парадокс ограничений: почему избыток требований ломает LLM

2 концепта
86
Проблемы (1)
Избыток требований к формату ломает решение задачи

Добавляешь в промпт явные требования. Длина текста. Стиль изложения. Ключевые слова. Структура ответа. Модель выполняет требования на 94%+. Но проваливает саму задачу. Точность падает на 15-40% при добавлении 5 ограничений. Модель фокусируется на форме. Теряет фокус на содержании. Проверяет "соблюдаю ли требование" вместо "правильно ли решаю". Особенно опасно для кода и математики

Как обойти

Оставь только критичные ограничения. Критичное = без него результат технически бесполезен. Примеры: формат для парсинга (JSON), технический стек (библиотека для совместимости), жёсткий лимит среды (280 символов). Всё остальное убери. Стиль, длину, структуру — модель выберет сама и лучше

Тезисы (1)
Ограничения конкурируют с задачей за фокус модели

Модель при генерации "распределяет внимание" между частями контекста. Технически: attention-механизм. Чем больше токенов-требований в промпте, тем больше модель думает про них. Думает "вписалась ли в 200 слов" вместо "правильно ли решила". В провальных случаях доля фокуса на ограничения резко растёт. Особенно к концу генерации. Применяй: Каждое требование = конкурент за фокус. Держи их ≤3

18

Reflect: пост-генерационная проверка соблюдения принципов

2 концепта
84
Проблемы (1)
Модель теряет принципы при генерации длинного текста

Даёшь модели 4-5 правил в начале промпта. Она начинает писать — и забывает про одно правило. Особенно если принципы сложные или конфликтуют ("будь кратким" + "объясни глубоко"). При генерации модель видит принципы только в начале контекста. Пока пишет — не может вернуться и "перечитать" их все разом. Проблема усиливается с каждым новым предложением

Как обойти

Разбей на два этапа. Сначала модель пишет текст как умеет. Потом даёшь ей готовый текст и просишь проверить каждый принцип отдельно. При проверке модель видит и принцип, и весь текст одновременно — находит нарушения точно

Методы (1)
Пост-генерация + самооценка по принципам

Шаг 1: Модель пишет текст с учётом принципов (обычный промпт). Шаг 2: Просишь оценить каждый принцип от 1 до 5 в готовом тексте. Шаг 3: Если оценка ниже 3 — модель критикует себя и переписывает проблемные части. Всё в одной сессии чата. Почему работает: Модель сильнее в анализе готового текста, чем в соблюдении правил на лету. Разделение на генерацию и проверку использует эту силу. Когда применять: много принципов (4+), сложные правила, высокие требования к соблюдению (юридические тексты, бренд-гайды, compliance). Когда не работает: простые задачи с 1-2 правилами (избыточно), массовая генерация где важна скорость (2-3 запроса вместо одного)

19

Evaluative Fingerprints: каждая LLM-судья оценивает по своей теории качества

3 концепта
84
Проблемы (3)
LLM-судьи дают противоречивые оценки одного контента — каждая модель применяет свои критерии качества

Одинаковый промпт оценки → Claude ставит 3, Gemini 4.5, GPT 4; согласие между моделями 0.04 из 1.0; каждая модель усваивает свои приоритеты из обучающих данных (RLHF, датасеты); различия стабильны и воспроизводимы

Как обойти

Запускай оценку в 2-3 моделях, сравнивай ОБОСНОВАНИЯ (не цифры); учитывай характер судьи: Claude строже всех (−0.43 от среднего), Gemini мягче (+0.26); не усредняй оценки — это синтетика

Mistral/Llama не замечают выдуманные факты — оценивают фейк выше правды

Текст с подсаженными галлюцинациями → Mistral +0.01, Llama +0.27 ВЫШЕ оригинала; Gemini −1.46, GPT-5.2 −1.12; эти модели не обучены обнаружению фейков

Как обойти

Для проверки фактов используй Gemini/GPT-5.2/Claude; в промпте: Процитируй каждое сомнительное утверждение и объясни проблему

Llama-405B выдумывает цитаты в обосновании оценки — 20% цитат из несуществующего контента

Запрос обоснуй оценку цитатами → Llama генерирует правдоподобные но выдуманные цитаты; валидность 80% (худшая среди моделей); GPT-4.1: 44% точных цитат (лучшая), Claude-Sonnet: 31%

Как обойти

С Llama: не полагайся на цитаты, проверяй обоснования вручную; для надёжных цитат используй GPT-4.1 или Claude-Sonnet

21

Откалиброванная уверенность без стратегии: почему LLM не воздерживаются даже когда должны

3 концепта
83
Проблемы (1)
Модель не воздерживается от ответов даже когда риск высок

Задаёшь вопрос где цена ошибки критична. Например: "стоит ли покупать этот стартап за 5М". Модель отвечает почти всегда. Даже когда уверенность 60-70%. Не говорит "не знаю". Не предлагает собрать больше данных. Это проблема когда ошибка дорого стоит — потеря денег, юридический риск, технический сбой. Модель обучена "быть полезной всегда", не обучена взвешивать риски

Как обойти

Используй двухэтапную схему. Шаг 1: Попроси ответ + оценку уверенности (0-100%). Шаг 2: Оцени "цену ошибки" — во сколько раз потеря хуже выгоды (λ). Шаг 3: Посчитай порог τ = λ/(1+λ). Если уверенность ниже порога → попроси не ответ, а план сбора данных

Методы (1)
Двухэтапная схема для воздержания от рискованных ответов

Что делать: Первый запрос: "Дай ответ и оцени уверенность 0-100%". Получил ответ и число. Второй шаг: посчитай порог по формуле τ = λ/(1+λ), где λ — "цена ошибки". Если уверенность < τ → попроси альтернативу: "Твоя уверенность {число}% ниже порога {τ}%. Вместо ответа дай: какие данные нужны, какие есть альтернативные гипотезы, как проверить малой кровью". Почему работает: Разделяет два процесса. Оценку уверенности (модель делает хорошо) и принятие решения "ответить или воздержаться" (модель делает плохо). Ты берёшь уверенность от модели, но решение принимаешь сам. Когда да: Задачи с проверяемым ответом (факты, прогнозы, технические решения). Понятна "цена ошибки". Когда нет: Субъективные оценки ("красивый ли дизайн"). Цена ошибки неясна

Тезисы (1)
Модель оценивает уверенность но не действует на основе этой оценки

Два разных навыка. Первый: "оцени вероятность что ты прав" — модель делает хорошо. Второй: "если вероятность низкая, откажись отвечать" — модель НЕ делает. Причина: обучение (RLHF) наградило поведение "отвечай всегда". Не вшило механизм оценки риска. Модель может сказать "уверен на 60%", но всё равно выдаст категоричный совет. Применяй: Не полагайся на модель в выборе "ответить или воздержаться". Запроси уверенность явно, прими решение сам

Разблокируйте все концепты с PRO

Получите полный доступ ко всем все концепты и методам из научных исследований

Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO