3,583 papers
arXiv:2608.12743 74 13 авг. 2026 г. FREE

Spatial Memory Agent (SMA): накопление проверенных уроков вместо дообучения модели

КЛЮЧЕВАЯ СУТЬ
Модель нашла в памяти карточку «про то же самое» — и это оказалось почти хуже, чем не найти ничего. Метод SMA даёт возможность модели копить уроки из своих же ошибок и успехов без дообучения, а потом подключать к новой задаче не просто похожие, а доказанно полезные подсказки. После каждой решённой задачи модель пишет короткую карточку: тип задачи, ловушка, что проверить — а не тащит в память весь лог рассуждений. К каждой карточке прикручен счётчик доверия (Transfer Reliability Score, TRS), который растёт, если урок реально помог, и падает, если увёл в сторону.
Адаптировать под запрос

TL;DR

SMA — это система, где ИИ-агент после каждой решённой задачи сам формулирует компактный переносимый урок (что сработало, в какую ловушку не попасть, что проверить в следующий раз) и складывает его в базу. При новой похожей задаче агент достаёт из базы не просто похожие по смыслу советы, а те, что доказанно помогали в прошлом — на основе реальной статистики использования.

Главный инсайт: похожесть задачи не гарантирует, что совет полезен. Можно найти в памяти «похожий» пример и получить от него вред — если раньше этот совет уже вводил в заблуждение. Модели, которые выбирают подсказки только по смысловой близости, путают релевантность с надёжностью — это разные вещи.

SMA решает это через «балл надёжности» для каждого урока: стартует одинаковым для всех уроков, а потом растёт или падает в зависимости от того, помогал ли урок при реальных попытках его применить. При выборе совета для новой задачи система смешивает похожесть и балл надёжности, а не смотрит только на похожесть — и это работает лучше.


🔬

Схема метода

ШАГ 1: Модель решает задачу → получает ответ + оценку правильности (верно/неверно)
ШАГ 2: Модель формулирует компактный урок из этой попытки (паттерн + ловушка + проверка), 
       без утечки самого ответа → сохраняется в базу уроков
ШАГ 3: При новой похожей задаче — сначала фильтр по смысловой похожести,
       затем среди похожих отбираются те, что доказанно чаще помогали → топ-3 вставляются в промпт
ШАГ 4: После использования урока — балл его надёжности обновляется:
       помог → балл растёт, не помог → падает

Шаги 1-2 выполняются один раз (при «обучении» на своих задачах), шаги 3-4 — при каждой новой задаче.


🚀

Пример применения

Задача: Фрилансер пишет холодные письма (email outreach) для B2B продаж разным клиентам и хочет, чтобы Claude не повторял одни и те же провальные ходы, а учился на прошлых кампаниях.

Промпт (шаг «после задачи», сразу после отправки письма и получения результата):

Я составил холодное письмо для клиента из ниши {ниша}. 
Результат: {ответил/не ответил, купил/не купил}.

Сформулируй компактный урок на будущее в такой структуре:
— Паттерн: какой тип ситуации это был
— Ловушка: какую ошибку легко допустить в похожей ситуации
— Проверка: что проверить перед отправкой в следующий раз

Не переписывай сам текст письма — дай только общий принцип, применимый к похожим клиентам.

Промпт (шаг «перед новой задачей»):

Вот база уроков из прошлых кампаний (в скобках — сколько раз урок реально помог / не помог):
{список уроков с пометками}

Новая задача: письмо для клиента из ниши {новая_ниша}.

Возьми из базы только уроки, которые ДОКАЗАННО чаще помогали (а не просто похожи по теме), 
и используй их как ограничения при написании письма.

Результат: После нескольких десятков писем накопится компактная база из 10-20 принципов вместо десятков конкретных примеров. Claude при новой задаче будет опираться не на «похожую по теме» подсказку, а на ту, что реально работала — письма станут точнее с каждой итерацией без переобучения и без копирования старых текстов.


🧠

Почему это работает

Модель не помнит прошлые чаты и не учится на своих ошибках между сессиями — каждый раз начинает «с нуля» и рискует повторить те же провалы. Это слабость: нет накопленного опыта без явного механизма.

Сильная сторона модели — она отлично резюмирует опыт в компактные правила, если попросить явно, и хорошо использует вставленный в промпт контекст как руководство к действию.

SMA использует эту сильную сторону, но добавляет важный нюанс: вместо того чтобы доверять «похожести» примера, система отслеживает, какие правила реально помогали, и приоритизирует именно их. База уроков со временем самоочищается от бесполезных советов — вредные правила теряют вес, полезные — усиливаются.

Рычаги управления: - Количество уроков в промпте (в исследовании — 3) → увеличь для сложных задач с множеством нюансов, уменьши для простых (экономия токенов) - Баланс похожести vs надёжности (оптимум в исследовании — 50/50) → смещай в сторону надёжности, если у тебя уже накоплена большая проверенная база; в сторону похожести — если задач и данных пока мало - Формат урока (паттерн-ловушка-проверка) → можно адаптировать под свою область, но сохрани принцип «не финальный ответ, а общий принцип»


📋

Шаблон промпта

Шаблон 1 — извлечение урока после задачи:

Я решал задачу: {описание задачи}.
Результат: {что получилось / оценка успеха или провала}.

Сформулируй компактный переносимый урок для похожих задач в будущем, 
в такой структуре:
— Паттерн: тип ситуации, к которой это применимо
— Ловушка: какую ошибку легко допустить
— Проверка: что проверить перед тем как дать ответ

Не повторяй сам ответ — дай только общий принцип.

Шаблон 2 — применение накопленных уроков к новой задаче:

Вот база уроков из прошлых похожих задач:
{список уроков, для каждого — сколько раз он реально помог / не помог}

Новая задача: {описание задачи}.

Выбери из уроков выше только те, что доказанно чаще помогали 
(а не просто похожи по теме), и используй их как руководство при решении новой задачи.

Плейсхолдеры: {описание задачи} — конкретная ситуация; {результат} — успех или провал попытки; {список уроков} — твоя накопленная заметка с уроками.

🚀 Быстрый старт — вставь в чат:

Вот принцип накопления уроков из своего опыта (метод SMA). Помоги мне применить его к моей задаче: {твоя задача}.
Задавай вопросы, чтобы понять, как мне вести базу уроков и когда её обновлять.

[вставить оба шаблона выше]

LLM спросит, как часто ты решаешь похожие задачи и как оцениваешь успех попытки — потому что без этого нельзя понять, когда урок «доказал» надёжность, а когда ещё нет.


⚠️

Ограничения

⚠️ Нужна ручная дисциплина: в оригинале балл надёжности считается автоматически по статистике десятков попыток. В чате без автоматизации придётся вручную отслеживать, помог урок или нет — это работает только если ты действительно решаешь много похожих задач.

⚠️ Годится для задач с чёткой оценкой успеха: метод тестировали на задачах, где есть однозначно правильный/неправильный ответ (верификатор). Для творческих и субъективных задач (тексты, дизайн) сложно объективно решить, «помог» ли урок.

⚠️ На старте эффекта нет: пока уроков накоплено мало, метод не даёт преимущества над обычным «похожим примером». Выгода проявляется только после накопления достаточного объёма проверенного опыта.


🔗

Ресурсы

Spatial Memory Agent (SMA), Zhang et al. (2026), Zhejiang University, Shanghai Jiao Tong University. Project page: aim-uofa.github.io/SMA


📋 Дайджест исследования

Ключевая суть

Модель нашла в памяти карточку «про то же самое» — и это оказалось почти хуже, чем не найти ничего. Метод SMA даёт возможность модели копить уроки из своих же ошибок и успехов без дообучения, а потом подключать к новой задаче не просто похожие, а доказанно полезные подсказки. После каждой решённой задачи модель пишет короткую карточку: тип задачи, ловушка, что проверить — а не тащит в память весь лог рассуждений. К каждой карточке прикручен счётчик доверия (Transfer Reliability Score, TRS), который растёт, если урок реально помог, и падает, если увёл в сторону.

Принцип работы

Обычный подход к памяти агентов путает две разные вещи: похоже по смыслу и реально работает на практике. SMA разводит их жёстко. Сначала — семантический поиск: находим карточки на ту же тему. Потом — сортировка по смеси «похожесть + TRS»: карточка с высоким доверием обгоняет карточку, которая просто ближе по формулировке, но раньше подводила. Похожесть даёт кандидатов, доказанная польза расставляет их по местам. Урок стартует с нейтрального доверия — ни плюс, ни минус, — и заслуживает место в топе только использованием.

Почему работает

Модель отлично умеет вытащить общий принцип из одного конкретного случая — это её сильная сторона. Слабая сторона — нулевая память между разговорами: каждый новый чат начинается с чистого листа, прошлый опыт не переносится сам. Если просто хранить историю решений и подсовывать похожие по теме — модель принимает похожесть за пользу, а это разные вещи. Авторы проверили именно это: убрали расчёт доказанной пользы, оставили только поиск по смыслу — точность упала. Урок без проверки на практике может быть красивым, но бесполезным или даже вредным советом.

Когда применять

Повторяющиеся текстовые задачи с проверяемым результатом → разбор заявок поддержки, комплаенс-проверки, модерация по регламенту, ревью документов по чек-листу, особенно когда решений накопились десятки однотипных случаев. Не подходит для творческих и субъективных задач — если нет способа сказать «правильно/неправильно», нет базы для доверия к урокам, и вся конструкция рассыпается.

Мини-рецепт

1. Проверь, есть ли эталон: у тебя должен быть способ сказать, правильный ответ получился или нет — регламент, чек-лист, реальный вердикт.
2. После каждого решения пиши карточку: итог задачи + компактный урок (паттерн, ловушка, что проверить), без упоминания конкретного правильного ответа.
3. Копи карточки в файл: 10-20 штук — уже рабочий банк, для ручного ведения больше не тяни.
4. На новой задаче подставляй топ-3 карточки: сначала похожие по теме, потом смотри, какие из них реально сработали в прошлых разборах.
5. Обновляй доверие вручную: если урок помог — отметь плюсом, если увёл не туда — минусом. Через десяток проверок увидишь, какие карточки реально рабочие.

Примеры

[ПЛОХО] : Вот прошлые 15 решений по заявкам на возврат, разбери новую заявку с их учётом
[ХОРОШО] : Вот новая заявка: {текст}. Вот проверенные уроки из похожих разборов, которые раньше реально помогали (не просто похожие по теме): 1) если клиент пишет 'не подошёл размер' спустя 20+ дней — по регламенту возврат не положен, даже если товар не был в использовании; 2) {урок 2}; 3) {урок 3}. Разбери заявку, укажи какие уроки применил
Источник: Spatial MemoryAgent: Experience-Grounded Procedure Memory for Spatial Intelligence
ArXiv ID: 2608.12743 | Сгенерировано: 2026-08-14 06:28

Проблемы LLM

ПроблемаСутьКак обойти
Похожая подсказка полезная подсказкаИщешь в банке памяти пример "про то же самое". Находишь похожий по смыслу текст. Но эта подсказка может быть бесполезной или даже вредной — её раньше никто не проверял на практике. Модель путает "похоже по теме" с "реально помогает"Не сортируй подсказки только по похожести. Добавь счётчик доверия к каждой подсказке. Считай, помогала ли она раньше в реальных ответах. Сортируй по смеси "похоже + доказанно помогает"

Методы

МетодСуть
Счётчик доказанной пользы для ранжирования подсказокКаждой подсказке в банке памяти присвой стартовое нейтральное значение доверия. Каждый раз когда подсказку использовали и ответ оказался верным — доверие растёт. Ответ неверный — доверие падает. При поиске новой подсказки сначала находи похожие по смыслу, потом сортируй их по смеси "похожесть + текущее доверие". Почему работает: похожесть — это про смысл, доверие — это про реальный результат. Это разные вещи, и смешивать их без разделения теряет точность. Когда применять: есть поток однотипных задач, есть способ проверить ответ, подсказок накопилось много. Когда не работает: разовая задача, нет проверки правильности
Урок-выжимка вместо сырого лога решенияПосле решения задачи с известным правильным ответом попроси модель не сохранить весь диалог, а сформулировать компактное правило: тип задачи, в какую ловушку легко попасть, что проверить перед ответом. Не сам правильный ответ — а принцип. Почему работает: модель лучше извлекает общий принцип из одного случая, чем удерживает в контексте десятки сырых примеров. Выжимка занимает меньше места и меньше шумит. Когда применять: повторяющиеся задачи одного типа. Когда не работает: уникальная разовая задача без повторов
📖 Простыми словами

Spatial MemoryAgent: Experience-Grounded Procedure Memory for Spatial Intelligence

arXiv: 2608.12743

ИИ-агенты в пространственных задачах обычно ведут себя как люди с амнезией: каждый раз заходя в новую комнату, они заново изобретают велосипед и наступают на те же грабли. Система Spatial MemoryAgent (SMA) меняет саму механику работы с опытом. Вместо того чтобы просто хранить логи прошлых действий, агент после каждой задачи выжимает из неё процедурную память — короткий, жесткий урок о том, что сработало, а где был провал. Это превращает нейронку из глупого исполнителя в опытного мастера, который не просто «знает теорию», а помнит, что в этой конкретной ситуации лучше не соваться в левый угол.

Это как если бы ты каждый раз, обжегшись о горячую сковородку, не просто орал от боли, а записывал в блокнот: «черная штука с ручкой кусается, хватай через тряпку». В следующий раз, когда ты видишь похожий предмет, ты не ждешь команды, а сразу лезешь в блокнот за проверенным рецептом выживания. Без такой памяти ИИ — это вечный стажер, который формально всё знает, но на практике тупит на ровном месте, потому что не умеет связывать прошлые ошибки с текущим моментом.

В основе метода лежат переносимые уроки и жесткая статистика. Когда агент сталкивается с новой целью, он не просто ищет в базе что-то похожее по словам, а достает советы, которые доказанно помогали в прошлом. Если совет из базы помог решить задачу быстрее — его рейтинг растет, если завел в тупик — он летит в корзину. Это не просто склад информации, а самообучающийся фильтр, где выживают только самые эффективные стратегии вроде «сначала проверь за дверью» или «не трать время на пустые шкафы».

Принцип SMA легко переносится с роботов-пылесосов на любой бизнес-процесс, например, на холодные продажи. Если твой ИИ-помощник раз за разом пишет письма, которые улетают в спам, обычный Claude будет продолжать в том же духе, пока ты его не пнешь. Агент с такой архитектурой сам поймет: «ага, на письма с темой "Привет" никто не отвечает, попробую "Вопрос по проекту"». Он накапливает базу успешных ходов, превращая каждый провал в инструкцию, которая реально работает в полевых условиях.

Главный вывод: хватит надеяться, что модель «сама всё поймет» из контекста — ей нужна структурированная память о процедурах. Без механизма извлечения уроков и их оценки ИИ обречен на бесконечный день сурка. Внедрение Spatial MemoryAgent — это переход от одноразовых промптов к системе, которая умнеет с каждым кликом. Кто первым научит свои модели запоминать, что работает, тот перестанет сливать бюджет на бесконечные исправления одних и тех же косяков.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с