3,583 papers
arXiv:2608.23172 78 24 авг. 2026 г. FREE

CaRGo-T: объясняет смысл картинки через явную карту причин и следствий

КЛЮЧЕВАЯ СУТЬ
Спрашиваешь модель 'почему это смешно?' — получаешь пересказ того, что видно на картинке, без единой связи между элементами. Метод CaRGo-T позволяет получить объяснение мемов, сатиры и метафор через конкретные причинно-следственные связи, а не общие фразы типа 'потому что тут ирония'. Модель сначала строит псевдокод-граф — сущности, их свойства, пары причина → следствие — и только потом отвечает на вопрос. Объяснение перестаёт быть пустым и опирается на конкретные связи из графа.
Адаптировать под запрос

TL;DR

CaRGo-T — техника, которая заставляет модель сначала построить причинно-следственный граф (в виде псевдокода) для картинки, и только потом отвечать на вопрос. Модель перечисляет все сущности на изображении — людей, объекты, абстрактные понятия — их свойства, а затем явно прописывает: что из чего следует. Финальный ответ она строит уже на основе этой карты, а не "с потолка".

Модели плохо объясняют сложные картинки — мемы, сатиру, метафоры. Просят "почему это смешно?" — и получают поверхностное описание того, что видно на картинке, без понимания связей между элементами. Обычный Chain-of-Thought тут не спасает: модель начинает рассуждать общими фразами, а не разбирает конкретные причины и следствия — что из-за чего произошло, кто на что реагирует.

CaRGo-T решает это, разбивая задачу на два явных шага в одном запросе: сначала модель строит структурированную карту — кто/что есть на картинке → какие у них свойства → что вызывает что, потом опираясь на эту карту отвечает на вопрос. Явная структура не даёт модели соскользнуть в общие рассуждения.

🔬

Схема метода

ШАГ 1: Построй причинно-следственный граф → код/псевдокод:
  - Сущности (люди, объекты, абстрактные понятия, события)
  - Свойства каждой сущности
  - Пары "причина → следствие" между сущностями

ШАГ 2: На основе графа дай финальный ответ на вопрос → текст

(Оба шага — в одном запросе, один ответ модели)

🚀

Пример применения

Задача: Ты ведёшь маркетинговый канал и хочешь разобрать, почему рекламный креатив конкурента "заходит" — например, реклама с мемом или ироничный билборд, который все репостят.

Промпт:

Посмотри на это изображение [прикрепи картинку].

Сначала построй причинно-следственный граф в виде псевдокода:
- Entities: перечисли всех людей, объекты, абстрактные понятия и события на изображении
- Properties: для каждой сущности укажи ключевые свойства
- CauseEffect: список пар "причина → следствие" между сущностями

Затем, основываясь на этом графе, объясни: почему это изображение вызывает такую реакцию у аудитории? Что именно делает его смешным/цепляющим?

Результат: Модель сначала выдаст структурированный список — сущности с их свойствами, потом цепочку причин и следствий (например: "высокие каблуки → неудобство → контраст с модным образом → комический эффект"), и только после этого — развёрнутое объяснение, почему это работает. Объяснение будет опираться на конкретные связи из графа, а не на общие фразы вроде "потому что тут ирония".


🧠

Почему это работает

Модель хорошо генерирует структурированный текст по чёткому шаблону — код, списки, таблицы. Но когда её просят просто "порассуждай", она часто выдаёт правдоподобно звучащие, но пустые рассуждения — потому что свободная форма не заставляет её зафиксировать конкретные связи.

CaRGo-T использует эту сильную сторону: структура графа принуждает модель явно проговорить, что из чего следует, прежде чем формулировать вывод. Это похоже на то, как проще спорить с человеком, который сначала расписал аргумент по пунктам, чем с тем, кто говорит общими словами.

Рычаги управления: - Убери "в виде псевдокода" → граф будет более человекочитаемым текстом, но чуть менее строгим - Добавь "начни с 3-5 ключевых сущностей" → ограничит граф, ускорит ответ на простых задачах - Приложи 2-3 примера с готовыми графами (few-shot) → модель точнее держит структуру, но по данным исследования выигрыш от увеличения числа примеров быстро выходит на плато — 2 примера почти так же хороши, как 5


📋

Шаблон промпта

Посмотри на это изображение (и текст, если он есть): {контент}

{вопрос_по_задаче}

Сначала построй причинно-следственный граф в виде псевдокода:
- Entities: перечисли людей, объекты, абстрактные понятия и события, изображённые на входе
- Properties: для каждой сущности — её ключевые свойства
- CauseEffect: список пар "причина → следствие", построенных из сущностей и их свойств

Затем, опираясь на этот граф, дай финальный ответ на вопрос выше.

{контент} — картинка/мем/скрин, который нужно разобрать. {вопрос_по_задаче} — конкретный вопрос: "почему это смешно", "в чём ирония", "почему эта реклама сработала", "что здесь не так с логикой".

🚀 Быстрый старт — вставь в чат:

Вот шаблон CaRGo-T для разбора сложного визуального контента через причинно-следственный граф. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какой конкретно контент разбираем и какой вопрос задаём — потому что без этого граф строить не из чего. Она возьмёт структуру (Entities → Properties → CauseEffect → Ответ) и подгонит под твою картинку.


⚠️

Ограничения

⚠️ Зависимость от размера модели: метод работает заметно лучше на крупных моделях (GPT-4o), которые хорошо генерируют структурированный текст. На более слабых моделях выигрыш почти пропадает.

⚠️ Маленький эффект на простых да/нет вопросах: если нужно просто определить "смешно это или нет" (бинарный ответ), улучшение минимальное — метод раскрывается там, где нужно объяснить, а не классифицировать.

⚠️ Отдача от примеров быстро падает: добавление большого числа примеров-образцов в контекст не даёт пропорционального роста качества — 2 примера почти так же хороши, как 5.


🔍

Как исследовали

Исследователи проверили CaRGo-T на трёх наборах данных — сатирические картинки, мемы и саркастичные посты с текстом — и на трёх моделях: GPT-4o, GPT-4o-mini и открытая MiniCPM. Сравнивали с обычным промптом без рассуждений, с Chain-of-Thought, Chain-of-Draft и ещё одной техникой на основе графов сцены (CCoT).

Результат: CaRGo-T выигрывает у всех конкурентов в задаче "объясни, почему смешно" — прирост от 1% до 20% в зависимости от модели и датасета, а в задаче "смешно или нет" — скромнее, 1-3%. Интересный момент: чем крупнее модель, тем лучше работает граф — потому что построение точного псевдокода требует хорошего понимания структуры, а маленькие модели путаются. Ещё исследователи через анализ информации показали, что граф CaRGo-T содержит больше данных, релевантных правильному ответу, чем рассуждения в свободной форме — то есть модель не просто пишет длиннее, а пишет по делу.


📋 Дайджест исследования

Ключевая суть

Спрашиваешь модель 'почему это смешно?' — получаешь пересказ того, что видно на картинке, без единой связи между элементами. Метод CaRGo-T позволяет получить объяснение мемов, сатиры и метафор через конкретные причинно-следственные связи, а не общие фразы типа 'потому что тут ирония'. Модель сначала строит псевдокод-граф — сущности, их свойства, пары причина → следствие — и только потом отвечает на вопрос. Объяснение перестаёт быть пустым и опирается на конкретные связи из графа.

Принцип работы

Один запрос — два шага, без права проскочить сразу к выводу. Сначала: кто и что на картинке, какие у них свойства. Потом: явные пары причина → следствие между ними. И только в конце — сам ответ. Модель не может ответить 'с потолка' — граф уже зафиксировал связи, на которые придётся ссылаться.

Почему работает

LLM отлично генерирует текст по жёсткому шаблону — код, списки, таблицы. Но когда просишь просто 'порассуждай', она выдаёт красиво звучащую пустоту — свободная форма не заставляет зафиксировать конкретную связь. Структура графа принуждает модель проговорить, что из чего следует, прежде чем сделать вывод. Это как спорить с человеком, который расписал аргумент по пунктам, а не льёт общие слова.

Когда применять

Разбор сложного визуального контента → мемы, реклама, сатирические картинки, метафоры, особенно когда нужно объяснить ПОЧЕМУ это работает, а не просто сказать да или нет. НЕ подходит для простых бинарных вопросов 'смешно или нет' — выигрыш там почти нулевой. Также слабо работает на моделях меньше GPT-4o.

Мини-рецепт

1. Дай картинку и вопрос: прикрепи изображение, задай конкретный вопрос — 'почему это смешно', 'в чём ирония', 'почему реклама сработала'
2. Заставь построить граф первым: попроси Entities (сущности) → Properties (свойства) → CauseEffect (причина → следствие) в виде псевдокода
3. Свяжи ответ с графом: явно попроси 'основываясь на графе, объясни...' — иначе модель может проигнорировать свою же структуру
4. Не перегружай примерами: 2 готовых графа в промпте почти так же хороши, как 5 — не трать токены зря

Примеры

[ПЛОХО] : Почему этот мем смешной?
[ХОРОШО] : Посмотри на картинку. Сначала построй причинно-следственный граф в псевдокоде: Entities (кто/что есть), Properties (свойства каждого), CauseEffect (пары причина → следствие). Затем на основе графа объясни, почему это смешно.
Источник: CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension
ArXiv ID: 2608.23172 | Сгенерировано: 2026-08-25 05:23

Проблемы LLM

ПроблемаСутьКак обойти
Модель поверхностно объясняет сложные изображенияСпрашиваешь "почему это смешно" или "в чём ирония" — получаешь описание того что видно, без объяснения связей между элементами. Обычная цепочка рассуждений не спасает: модель начинает рассуждать общими фразами вместо разбора конкретных причин и следствийЗаставь модель сначала построить явный причинно-следственный граф: перечислить сущности на картинке, их свойства, и пары "причина следствие". Только потом — ответ на вопрос, опираясь на граф

Методы

МетодСуть
Причинно-следственный граф перед ответом — объяснение через явные связиПопроси модель в одном запросе: (1) построить псевдокод-граф — сущности на картинке, их свойства, пары "причина следствие" между ними, (2) на основе этого графа дать финальный ответ. Entities Properties CauseEffect Ответ. Почему работает: модель хорошо генерирует текст по чёткому шаблону (код, списки), но при свободном рассуждении часто выдаёт правдоподобные, но пустые фразы. Жёсткая структура графа принуждает явно зафиксировать конкретные связи, прежде чем делать вывод. Когда применять: нужно объяснить сложный визуальный контент — мем, сатиру, метафору, рекламу, "что здесь не так с логикой". Когда не работает: простой да/нет вопрос без нужды объяснять (эффект минимальный); на слабых моделях, которые плохо держат структурированный формат, выигрыш почти пропадает
📖 Простыми словами

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

arXiv: 2608.23172

Нейросети феноменально тупят, когда пытаются понять юмор или сложные мемы на картинках. Если попросить модель просто «объяснить прикол», она выдаст правдоподобный, но абсолютно пустой булшит. Метод CaRGo-T решает эту проблему через причинно-следственное моделирование: он заставляет нейронку сначала разобрать картинку на базовые элементы и зафиксировать их зависимости в виде кода, а не гадать на кофейной гуще.

Это как если бы следователь вместо поиска улик попытался раскрыть дело по гороскопу. Формально версия звучит складно, но преступник на свободе. CaRGo-T заставляет модель собрать классическую доску расследования с красными нитями: найти персонажей, вытащить скрытый контекст и соединить их стрелками. Когда логическая цепочка выстроена наглядно, смысл шутки становится очевидным.

Вся магия строится на трёх шагах: модель сканирует визуал, выписывает сущности с их свойствами и собирает причинно-следственный граф в формате псевдокода. Никакой вольной поэзии — только строгие правила вроде «объект А порождает абсурдный эффект Б». И только после компиляции этой схемы генерируется финальный ответ, что начисто убивает галлюцинации и шаблонные отмазки.

Технологию тестировали на распознавании мемов, но этот принцип универсален. Точно так же можно вскрывать вирусный маркетинг конкурентов, сложные визуальные метафоры и креативы в рекламе. Структурированный псевдокод принуждает мультимодальные модели сопоставлять скрытые смыслы там, где обычный промпт выдаёт банальную кашу.

Короче: хватит просить AI «порассуждать в свободной форме» о сложном визуале. Граф связей вместо текстовой простыни — вот что превращает слепое угадывание в честный анализ. Внедряй структурный формат CaRGo-T в свои промпты, если хочешь, чтобы модель реально понимала подтекст, а не притворялась умной.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с