3,583 papers
arXiv:2607.23513 71 26 июля 2026 г. FREE

Диаграммы не спасают логику LLM — текстовая запись работает лучше

КЛЮЧЕВАЯ СУТЬ
Кажется логичным: нарисуй круги Эйлера для силлогизма — модель увидит отношения множеств, как человек. Но нет. Точность не растёт, иногда даже падает. Способ проверять логическую валидность вывода без картинок — записать условия текстом через отношения множеств (S⊆P, S∩P=∅). Модель отвечает точнее не потому что «видит» структуру, а потому что текстовая символика — привычный паттерн из учебников логики. Картинка для неё — просто шум.
Адаптировать под запрос

TL;DR

Когда просишь ChatGPT или Claude проверить, следует ли вывод из условий (классический силлогизм типа "Все банкиры — консерваторы, некоторые консерваторы не любят риск, значит..."), рисунок или схема с кругами Эйлера не помогает модели рассуждать точнее. Зато если условия записать в явном виде через отношения множеств (текстом, без картинки), модель решает задачу заметно точнее.

Главная проблема глубже, чем "диаграммы не работают". Модели плохо отличают ситуацию "вывод не следует ни туда, ни сюда" (нейтральный случай) от "вывод точно следует" (entailment). На нейтральных задачах точность падает до 20-30% — модель почти угадывает. Причина — классическая логическая ошибка конверсии: модель путает "Все А — Б" с "Все Б — А", то есть переворачивает утверждение местами, будто это одно и то же.

Диаграммы не лечат эту болезнь. У человека линии и круги делают разницу между "А входит в Б" и "Б входит в А" наглядной — и человек реже путается. LLM же, судя по результатам, тянет ответ из статистических паттернов текста, а не из пространственной структуры картинки, поэтому картинка тут просто лишняя информация, а иногда даже мешает.

🔬

Схема метода

Здесь метода в привычном смысле нет — это сравнительное исследование четырёх способов подать модели одну и ту же логическую задачу:

ФОРМАТ 1: Просто текст на естественном языке → модель выбирает: следует / противоречит / нейтрально
ФОРМАТ 2: Текст + логическая запись (S⊆P, S∩P=∅ и т.п.) → та же классификация
ФОРМАТ 3: Текст + линейная диаграмма (текстовые отрезки) → та же классификация
ФОРМАТ 4: Текст + диаграмма Эйлера (картинка с кругами) → та же классификация

Все четыре запроса выполняются как отдельные обращения к модели — сравнивается точность между ними.

🚀

Пример применения

Задача: Вы спорите в комментариях под постом с оппонентом, который выстроил логическую цепочку: "Все успешные фаундеры работают по 80 часов в неделю. Некоторые из тех, кто работает по 80 часов в неделю, не построили успешный бизнес. Значит, работа по 80 часов не гарантирует успех, но и без неё успеха не бывает." Вы хотите быстро проверить у ChatGPT, действительно ли вывод логически железный, или это подмена.

Промпт:

Проверь логическую валидность этого рассуждения. 
Запиши каждое утверждение как отношение множеств (используй ⊆, ∩, =∅ или ≠∅), 
затем проверь, следует ли заключение строго логически, 
или это ошибка вида "переворачивание условия" (например, путают "все А есть Б" с "все Б есть А").

Условие 1: Все успешные фаундеры работают по 80 часов в неделю.
Условие 2: Некоторые из тех, кто работает по 80 часов в неделю, не построили успешный бизнес.
Заключение: Работа по 80 часов не гарантирует успех.

Ответь: следует / противоречит / не следует (нейтрально) — и объясни через отношения множеств.

Результат: Модель распишет условия в виде множеств, явно проверит, не перепутала ли она направление включения, и выдаст один из трёх вердиктов с обоснованием через отношения множеств, а не "на глаз".

🧠

Почему это работает

LLM генерирует ответ по паттернам из текста, на которых её обучали. Если формат задачи похож на десятки тысяч учебников логики с записью через множества, модель "включает" более строгий режим рассуждения. Картинка с кругами не даёт модели такого текстового якоря — она просто описывает то, что видит, и это добавляет шум, а не структуру.

Модель хорошо умеет писать формальные символьные конструкции — это частый паттерн в её обучающих данных (учебники, доказательства, код). Слабое место — визуально-пространственное рассуждение поверх картинки в применении к логике: модель не "видит" отношения фигур так, как это делает человек, глядя на диаграмму Эйлера.

Отсюда практический рычаг: если задача требует строгой логики (валидность вывода, юридическая формулировка, проверка контракта на противоречия) — просите явную символьную/текстовую запись условий, а не просите модель "посмотреть на схему". Если задача творческая или про интуитивное понимание пространства — картинка может быть уместна, но не для формальной логики.

⚠️

Ограничения

⚠️ Модельная зависимость: более раннее исследование (Ando et al., 2024) на других моделях нашло, что диаграммы Эйлера, наоборот, помогают. В этой работе с другими моделями эффект пропал или стал отрицательным. Значит, поведение сильно зависит от конкретной модели — нет универсального правила "диаграммы всегда бесполезны".

⚠️ Узкая область: исследование касается только классических силлогизмов — двух условий и одного вывода с тремя терминами (Все/Некоторые/Никто). На более сложные многошаговые аргументы выводы не проверялись напрямую.

⚠️ Нейтральные случаи — слепая зона: если ваша задача предполагает возможный ответ "из этого ничего не следует", учитывайте, что модель систематически склонна путать это с "следует". Стоит явно попросить модель отдельно проверить вариант "переворачивания" условий, как в примере выше.

⚠️ Эффект правдоподобия: если содержание задачи звучит правдоподобно жизненно (например, реальные факты о бизнесе), модель чаще ошибается, ориентируясь на "похоже на правду", а не на строгую структуру. Абстрактные символы (А, Б, В) модель обрабатывает точнее, чем конкретные утверждения про реальный мир.

🔍

Как исследовали

Исследователи взяли 285 задач-силлогизмов из готового датасета (два условия + вывод про три термина, как "Все банкиры — консерваторы") и прогнали их через Claude 3.5 Sonnet и GPT-4o-mini четырьмя способами: просто текст, текст с формальной логической записью, текст с текстовой линейной диаграммой и текст с картинкой круга Эйлера. Каждую задачу заранее размечали: должен ли вывод логически следовать, противоречить или быть нейтральным, а также — является ли задача "ловушкой на конверсию" (переворачивание условия) и насколько правдоподобно звучит содержание.

Логика такая: если диаграммы реально помогают модели рассуждать структурно (как помогают человеку), точность должна расти именно на сложных случаях — нейтральных и конверсионных. На деле точность почти не менялась между форматами, а на диаграммах иногда даже падала. Особенно показательно, что на "нейтральных" задачах — где нужно понять, что вывод НЕ следует и НЕ противоречит — GPT-4o-mini угадывал правильно меньше чем в 3 случаях из 10, и диаграммы этого не исправляли.

Удивление исследователей: их результат прямо противоречит более ранней работе тех же авторов, где Euler-диаграммы, наоборот, помогали. Вывод — эффект диаграмм на LLM крайне неустойчив и зависит от конкретной модели, в отличие от людей, которым диаграммы помогают стабильно.


📋 Дайджест исследования

Ключевая суть

Кажется логичным: нарисуй круги Эйлера для силлогизма — модель увидит отношения множеств, как человек. Но нет. Точность не растёт, иногда даже падает. Способ проверять логическую валидность вывода без картинок — записать условия текстом через отношения множеств (S⊆P, S∩P=∅). Модель отвечает точнее не потому что «видит» структуру, а потому что текстовая символика — привычный паттерн из учебников логики. Картинка для неё — просто шум.

Принцип работы

LLM не рассуждает пространственно — она рассуждает паттернами текста. Дай ей символьную запись — она включает строгий логический режим, знакомый по учебникам доказательств. Дай ей картинку с кругами — она просто описывает увиденное, будто отвечает на вопрос «что нарисовано», а не «что логически следует». Модель не видит отношения фигур — она угадывает подпись к картинке.

Почему работает

Проблема глубже, чем «диаграммы бесполезны». Модель систематически путает «вывод не следует» (нейтральный случай) с «вывод точно следует» — классическая ошибка конверсии: «Все А — Б» в голове модели превращается в «Все Б — А». На нейтральных задачах точность падает до 20-30% — почти монетка. Диаграмма не лечит эту путаницу, потому что причина не в способе подачи данных, а в том, что модель тянет ответ из статистики текста, а не строит логическую модель мира.

Когда применять

Формальная логика и проверка выводов → для юридических формулировок, проверки контрактов на противоречия, спорных аргументов в дискуссиях, особенно когда есть риск скатиться в «вывод не следует, но звучит правдоподобно». НЕ подходит для творческих задач или интуитивных пространственных объяснений — там картинка полезна, просто не для строгой логики.

Мини-рецепт

1. Не рисуй, а записывай: переведи каждое условие в отношение множеств (⊆, ∩, =∅, ≠∅) вместо схемы или картинки.
2. Проверь конверсию: явно попроси модель проверить, не перепутала ли она «все А — Б» с «все Б — А».
3. Раздели вердикт на три варианта: следует / противоречит / нейтрально — не давай модели пространства для расплывчатого «наверное да».
4. Убери правдоподобность: если задача про реальный бизнес или жизнь, замени термины на А, Б, В — так модель меньше ведётся на «звучит похоже на правду».

Примеры

[ПЛОХО] : Посмотри на эту диаграмму Эйлера и скажи, верен ли вывод
[ХОРОШО] : Запиши условия как отношения множеств (⊆, ∩=∅), проверь на ошибку конверсии (не перепутала ли модель направление включения), и отдельно оцени: следует / противоречит / нейтрально
Источник: Do Diagrams Help Large Language Models Reason? Evidence from Syllogistic Reasoning
ArXiv ID: 2607.23513 | Сгенерировано: 2026-07-28 04:29

Проблемы LLM

ПроблемаСутьКак обойти
Модель путает "вывод не следует" с "вывод точно следует"Модель плохо различает нейтральный случай (из условий ничего не следует) и случай где вывод строго следует. На нейтральных задачах точность падает почти до угадывания. Причина — классическая логическая ошибка: модель путает "Все А — Б" с "Все Б — А", то есть переворачивает направление условияПопроси модель явно переписать условия как отношения множеств (⊆, , =∅). Отдельно спроси: "не перепутала ли ты направление включения, как будто условие можно перевернуть?"
Картинка с диаграммой не помогает логике, иногда мешаетДиаграмма (например, круги Эйлера) не даёт модели текстового якоря для рассуждения. Модель описывает то, что "видит" на картинке, а не выстраивает через неё логическую структуру. Для формальной логики это добавляет шум, а не ясностьВместо картинки проси текстовую или символьную запись условий. Формальные символы модель обрабатывает по паттернам учебников и доказательств — это работает надёжнее

Методы

МетодСуть
Символьная запись условий через отношения множествПопроси модель переписать каждое условие как отношение множеств: S⊆P (все S — это P), SP=∅ (S и P не пересекаются), SP (некоторые S — это P). Затем попроси проверить вывод через эти отношения, а не "на глаз". Работает потому что такая запись похожа на десятки тысяч учебников логики и доказательств из обучающих данных — модель переходит в более строгий режим рассуждения. Применяй: для проверки логической валидности вывода, юридических формулировок, поиска противоречий в контрактах. Не применяй: для творческих задач или интуитивного пространственного понимания — там текстовая формализация не нужна

Тезисы

ТезисКомментарий
Абстрактные символы модель обрабатывает точнее, чем конкретные жизненные утвержденияКогда содержание задачи звучит правдоподобно (реальные факты о бизнесе, людях, событиях), модель чаще опирается на "похоже на правду", а не на строгую логическую структуру. Абстрактные обозначения (А, Б, В) не тянут за собой ассоциации из реального мира, поэтому модель следует именно структуре условий. Применяй: если нужна железная проверка логики — замени реальные понятия на абстрактные буквы или символы перед тем как просить модель оценить валидность вывода
📖 Простыми словами

Do Diagrams HelpLargeLanguageModelsReason? Evidence from Syllogistic Reasoning

arXiv: 2607.23513

Логика нейросетей работает не на визуальных образах, а на жестких текстовых структурах, и в этом их главное отличие от нас. Когда ты даешь модели классический силлогизм про банкиров и консерваторов, она не строит в голове картинку, а ищет знакомые паттерны в символах. Исследование показало, что визуальные схемы для LLM — это просто лишний шум, который мешает добраться до сути. Модель лучше соображает, когда условия задачи прописаны сухим языком отношений множеств, потому что именно так выглядят правильные ответы в ее обучающей выборке.

Это как пытаться объяснить дорогу водителю: можно нарисовать кривую карту на салфетке, а можно продиктовать точные координаты и повороты. Человеку проще с картой, но навигатор от нее только зависнет. Формально ты помог, но на деле заставил систему тратить ресурсы на расшифровку твоих художеств вместо того, чтобы просто ехать по маршруту. Для нейронки текстовое описание множеств — это и есть те самые четкие координаты, которые не дают ей свернуть в кювет галлюцинаций.

В ходе тестов проверяли четыре способа подачи инфы, и результат однозначный: диаграммы Эйлера (те самые кружочки) не дают никакого буста к точности. Зато метод явной записи отношений — когда ты прямо пишешь, что одно множество входит в другое или пересекается с ним — заставляет модель решать задачу заметно чище. Оказывается, что красивая картинка для ChatGPT — это как для нас попытка читать текст, написанный вверх ногами: вроде буквы знакомые, но мозг закипает.

Этот принцип универсален и выходит далеко за рамки скучных логических задач из учебников. Если ты просишь нейронку разобрать сложный спор в комментариях или проверить юридический договор на противоречия, не пытайся скармливать ей скриншоты схем или инфографику. SEO для логики работает через текст: переведи визуальную структуру в четкие тезисы «А относится к Б», и ты увидишь, как модель перестает лажать на ровном месте.

Короче, забудь про «наглядность» в общении с AI — это чисто человеческая фишка, которая здесь только вредит. Хочешь, чтобы модель не тупила в сложных рассуждениях — убери картинки и дай ей структурированный текст. Чем меньше в запросе визуального мусора и чем больше явных логических связей, тем меньше шансов, что нейронка выдаст тебе уверенную, но абсолютно бредовую херню. Кто поймет, что текст бьет визуал, тот и получит от моделей адекватные ответы, пока остальные рисуют кружочки.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с