TL;DR
Когда просишь ChatGPT или Claude проверить, следует ли вывод из условий (классический силлогизм типа "Все банкиры — консерваторы, некоторые консерваторы не любят риск, значит..."), рисунок или схема с кругами Эйлера не помогает модели рассуждать точнее. Зато если условия записать в явном виде через отношения множеств (текстом, без картинки), модель решает задачу заметно точнее.
Главная проблема глубже, чем "диаграммы не работают". Модели плохо отличают ситуацию "вывод не следует ни туда, ни сюда" (нейтральный случай) от "вывод точно следует" (entailment). На нейтральных задачах точность падает до 20-30% — модель почти угадывает. Причина — классическая логическая ошибка конверсии: модель путает "Все А — Б" с "Все Б — А", то есть переворачивает утверждение местами, будто это одно и то же.
Диаграммы не лечат эту болезнь. У человека линии и круги делают разницу между "А входит в Б" и "Б входит в А" наглядной — и человек реже путается. LLM же, судя по результатам, тянет ответ из статистических паттернов текста, а не из пространственной структуры картинки, поэтому картинка тут просто лишняя информация, а иногда даже мешает.
Схема метода
Здесь метода в привычном смысле нет — это сравнительное исследование четырёх способов подать модели одну и ту же логическую задачу:
ФОРМАТ 1: Просто текст на естественном языке → модель выбирает: следует / противоречит / нейтрально
ФОРМАТ 2: Текст + логическая запись (S⊆P, S∩P=∅ и т.п.) → та же классификация
ФОРМАТ 3: Текст + линейная диаграмма (текстовые отрезки) → та же классификация
ФОРМАТ 4: Текст + диаграмма Эйлера (картинка с кругами) → та же классификация
Все четыре запроса выполняются как отдельные обращения к модели — сравнивается точность между ними.
Пример применения
Задача: Вы спорите в комментариях под постом с оппонентом, который выстроил логическую цепочку: "Все успешные фаундеры работают по 80 часов в неделю. Некоторые из тех, кто работает по 80 часов в неделю, не построили успешный бизнес. Значит, работа по 80 часов не гарантирует успех, но и без неё успеха не бывает." Вы хотите быстро проверить у ChatGPT, действительно ли вывод логически железный, или это подмена.
Промпт:
Проверь логическую валидность этого рассуждения.
Запиши каждое утверждение как отношение множеств (используй ⊆, ∩, =∅ или ≠∅),
затем проверь, следует ли заключение строго логически,
или это ошибка вида "переворачивание условия" (например, путают "все А есть Б" с "все Б есть А").
Условие 1: Все успешные фаундеры работают по 80 часов в неделю.
Условие 2: Некоторые из тех, кто работает по 80 часов в неделю, не построили успешный бизнес.
Заключение: Работа по 80 часов не гарантирует успех.
Ответь: следует / противоречит / не следует (нейтрально) — и объясни через отношения множеств.
Результат: Модель распишет условия в виде множеств, явно проверит, не перепутала ли она направление включения, и выдаст один из трёх вердиктов с обоснованием через отношения множеств, а не "на глаз".
Почему это работает
LLM генерирует ответ по паттернам из текста, на которых её обучали. Если формат задачи похож на десятки тысяч учебников логики с записью через множества, модель "включает" более строгий режим рассуждения. Картинка с кругами не даёт модели такого текстового якоря — она просто описывает то, что видит, и это добавляет шум, а не структуру.
Модель хорошо умеет писать формальные символьные конструкции — это частый паттерн в её обучающих данных (учебники, доказательства, код). Слабое место — визуально-пространственное рассуждение поверх картинки в применении к логике: модель не "видит" отношения фигур так, как это делает человек, глядя на диаграмму Эйлера.
Отсюда практический рычаг: если задача требует строгой логики (валидность вывода, юридическая формулировка, проверка контракта на противоречия) — просите явную символьную/текстовую запись условий, а не просите модель "посмотреть на схему". Если задача творческая или про интуитивное понимание пространства — картинка может быть уместна, но не для формальной логики.
Ограничения
⚠️ Модельная зависимость: более раннее исследование (Ando et al., 2024) на других моделях нашло, что диаграммы Эйлера, наоборот, помогают. В этой работе с другими моделями эффект пропал или стал отрицательным. Значит, поведение сильно зависит от конкретной модели — нет универсального правила "диаграммы всегда бесполезны".
⚠️ Узкая область: исследование касается только классических силлогизмов — двух условий и одного вывода с тремя терминами (Все/Некоторые/Никто). На более сложные многошаговые аргументы выводы не проверялись напрямую.
⚠️ Нейтральные случаи — слепая зона: если ваша задача предполагает возможный ответ "из этого ничего не следует", учитывайте, что модель систематически склонна путать это с "следует". Стоит явно попросить модель отдельно проверить вариант "переворачивания" условий, как в примере выше.
⚠️ Эффект правдоподобия: если содержание задачи звучит правдоподобно жизненно (например, реальные факты о бизнесе), модель чаще ошибается, ориентируясь на "похоже на правду", а не на строгую структуру. Абстрактные символы (А, Б, В) модель обрабатывает точнее, чем конкретные утверждения про реальный мир.
Как исследовали
Исследователи взяли 285 задач-силлогизмов из готового датасета (два условия + вывод про три термина, как "Все банкиры — консерваторы") и прогнали их через Claude 3.5 Sonnet и GPT-4o-mini четырьмя способами: просто текст, текст с формальной логической записью, текст с текстовой линейной диаграммой и текст с картинкой круга Эйлера. Каждую задачу заранее размечали: должен ли вывод логически следовать, противоречить или быть нейтральным, а также — является ли задача "ловушкой на конверсию" (переворачивание условия) и насколько правдоподобно звучит содержание.
Логика такая: если диаграммы реально помогают модели рассуждать структурно (как помогают человеку), точность должна расти именно на сложных случаях — нейтральных и конверсионных. На деле точность почти не менялась между форматами, а на диаграммах иногда даже падала. Особенно показательно, что на "нейтральных" задачах — где нужно понять, что вывод НЕ следует и НЕ противоречит — GPT-4o-mini угадывал правильно меньше чем в 3 случаях из 10, и диаграммы этого не исправляли.
Удивление исследователей: их результат прямо противоречит более ранней работе тех же авторов, где Euler-диаграммы, наоборот, помогали. Вывод — эффект диаграмм на LLM крайне неустойчив и зависит от конкретной модели, в отличие от людей, которым диаграммы помогают стабильно.
