3,583 papers
arXiv:2608.17105 74 17 авг. 2026 г. FREE

LLM-эксперт по инвалидности: узкое понимание "нужд человека" и разрыв между оценкой и решением

КЛЮЧЕВАЯ СУТЬ
Модель пишет «функционирование: 3 из 5» — и через абзац выдаёт «нужна постоянная помощь». Между этими фразами нет логики. Ни у LLM, ни у людей-экспертов оценка и решение статистически не связаны друг с другом. Явный промпт с широким определением потребностей и требованием показать связь между оценкой и решением даёт согласованный анализ вместо двух оторванных абзацев. Фишка: без напоминания модель сама сужает «потребности человека» до еды, гигиены и передвижения — коммуникацию и эмоции выкидывает за борт, даже когда они критичны.
Адаптировать под запрос

Когда просишь LLM оценить, нуждается ли человек в постоянной помощи — из-за инвалидности, болезни, особенностей развития — модель, скорее всего, определит "базовые потребности" узко: еда, гигиена, самостоятельное передвижение. Коммуникацию, социальные связи, эмоциональные нужды она в расчёт возьмёт реже, даже если по смыслу вопроса они важны. Это не баг конкретной модели — это паттерн, который повторяется у семи разных LLM и совпадает с тем, как рассуждают врачи (но не психологи).

Хуже другое: оценка модели "как человек функционирует" (по шкале 1-5) и её итоговое решение "нужна ли ему помощь" (да/нет) статистически не связаны друг с другом — ни у людей, ни у LLM. Модель может написать "уровень функционирования средний", а потом выдать "да, нужна постоянная помощь" — без видимой логики между этими двумя ответами. При этом LLM в разы чаще людей заявляют о своей готовности признать ошибку и пересмотреть мнение (по опроснику "интеллектуальной смиренности") — но эта декларация никак не спасает от несогласованных решений.

Исследователи прогнали 20 вымышленных кейсов людей с аутизмом, СДВГ и дислексией через 7 LLM (GPT, Claude, Gemini, Llama, Qwen) и 35 экспертов (врачей и психологов), используя реальные вопросы из польских комиссий по инвалидности. Вывод: без явного напоминания модель по умолчанию скатывается к узкому, "медицинскому" пониманию потребностей человека и не проверяет логическую связь между промежуточной оценкой и финальным вердиктом.

📋

Схема проблемы (как она проявляется в промпте)

ШАГ 1: Просишь LLM оценить состояние/функционирование человека → получаешь оценку по шкале
ШАГ 2: Просишь LLM дать решение (нужна поддержка / да-нет) → ответ может логически не следовать из шага 1
СКРЫТЫЙ ЭФФЕКТ: определение "потребностей" по умолчанию сужается до физического самообслуживания

🚀

Пример применения

Задача: Соцработник или HR-специалист просит ChatGPT дать второе мнение по заявке на инклюзивную поддержку — например, нужна ли сотруднику с аутизмом адаптация рабочего места, или ребёнку с СДВГ — сопровождение в школе.

Промпт:

Вот описание ситуации: {текст кейса}.

1) Оцени уровень функционирования человека по шкале 1-5. Учитывай не только 
физическое самообслуживание (еда, гигиена, передвижение), но и коммуникативные, 
социальные и эмоциональные потребности — по модели ВОЗ (биопсихосоциальная, 
не только медицинская).

2) Дай решение: нужна ли этому человеку постоянная или長term помощь.

3) Явно покажи, как твой ответ в пункте 2 логически следует из оценки в пункте 1. 
Если между ними есть противоречие — прямо укажи его и объясни, почему решение 
отличается от общей оценки функционирования.

Результат: Модель даст более развёрнутую оценку, где помимо физических ограничений будут явно обозначены социальные и коммуникативные факторы. Ты увидишь мостик между оценкой и решением — и, если модель "срезала" логику, сразу это заметишь, а не получишь два несвязанных абзаца.


🧠

Почему это работает

LLM (как и люди) склонны давать оценку и финальное решение как два отдельных, слабо связанных шага — модель не автоматически проверяет, вытекает ли решение из оценки. Это форма несогласованности, знакомая и человеческим экспертам под давлением времени.

Сильная сторона LLM — она хорошо выполняет явные инструкции. Если попросить её назвать конкретные категории потребностей (не только физические, но и социальные) и показать цепочку от оценки к решению — модель это сделает, потому что ей дали явную структуру, а не оставили угадывать дефолт.

Рычаг управления: формулировка определения понятия ("базовые потребности", "функционирование", "самостоятельность") — если не задать её явно, модель подставит узкое, стереотипное определение. Задал широкое определение сам — получил более полный анализ.


⚠️

Ограничения

⚠️ Самоотчёт модели о неуверенности — не индикатор надёжности: если попросить LLM оценить, насколько она может ошибаться, ответ никак не коррелирует с реальной консистентностью её решений. Фраза "я могу ошибаться" от модели — это не сигнал качества, это выученный паттерн вежливости.

⚠️ Проверка на устойчивость к манипуляциям не была подтверждена железно: ни люди, ни модели не попались на явные ловушки (порядок информации, эмоция на фото) — но неизвестно, потому что они действительно устойчивы, или потому что манипуляции были слишком тонкими.

⚠️ Маленькая выборка людей (35 экспертов): снижает статистическую мощность выводов о людях, но паттерн у LLM подтверждён на трёх повторных прогонах на каждой модели.


🔍

Как исследовали

Исследователи взяли настоящие вопросы, которые задают на польских комиссиях по инвалидности, и составили 20 вымышленных кейсов людей с аутизмом, СДВГ и дислексией. В половину кейсов вшили ловушки: негативную информацию про человека сдвинули в начало описания (тест на якорение) или прикрепили фото с грустным выражением лица вместо нейтрального (тест на представительность — оценку по стереотипу, а не по фактам).

35 экспертов (18 врачей и 17 психологов) и 7 LLM прошли одни и те же кейсы плюс опросник на "интеллектуальную смиренность" и интервью про определения ключевых понятий. Ловушки не сработали ни на людях, ни на моделях — это было ожидаемо приятным сюрпризом. Но неожиданной находкой стало то, что оценка функционирования человека и решение о поддержке вообще не связаны статистически — ни у экспертов, ни у LLM, а модели при этом заявили о себе как о значительно более "смиренных", чем люди (это не спасло от той же несогласованности).

Отдельно выяснилось: психологи в интервью определяли "базовые потребности" широко — включая общение и социальные связи, — а врачи и большинство LLM сузили это до физического самообслуживания. Именно это объясняет, почему психологи чаще выдавали "да" на поддержку, а врачи и модели — реже, при одинаковых оценках общего уровня функционирования.


📌

Адаптации

🔧 Техника: явное "definitional scaffolding" (проговаривание определений вслух) → снижает скрытый редукционизм

Перед тем как просить модель дать вердикт по чувствительному кейсу (грант, льгота, отказ/приём на работу, диагноз), сначала попроси её явно выписать, что она понимает под ключевыми понятиями кейса:

Прежде чем давать решение, выпиши явно: что ты понимаешь под 
"потребностью в поддержке" в этом случае? Перечисли все категории 
(физические, коммуникативные, социальные, эмоциональные), которые 
считаешь релевантными для этого кейса.

Это выводит скрытое узкое определение на поверхность — ты видишь, чего модель не учла, и можешь поправить до того, как она примет решение.


🔗

Ресурсы

Language Models Reproduce Human Reductionist Bias and Decision Inconsistency in Neurodevelopmental Disorders Assessment — Maciej Wodziński, Joanna Wodzińska, Kacper Dudzic, Marcin Moskalewicz (Maria Curie-Skłodowska University, IDEAS Research Institute, Poznan University of Medical Sciences).


📋 Дайджест исследования

Ключевая суть

Модель пишет «функционирование: 3 из 5» — и через абзац выдаёт «нужна постоянная помощь». Между этими фразами нет логики. Ни у LLM, ни у людей-экспертов оценка и решение статистически не связаны друг с другом. Явный промпт с широким определением потребностей и требованием показать связь между оценкой и решением даёт согласованный анализ вместо двух оторванных абзацев. Фишка: без напоминания модель сама сужает «потребности человека» до еды, гигиены и передвижения — коммуникацию и эмоции выкидывает за борт, даже когда они критичны.

Принцип работы

Дефолтное поведение LLM: оценка и решение — два независимых шага, без логического мостика между ними. Модель ставит балл по шкале, потом отдельно решает «да/нет» — как будто про разных людей. Явно попроси показать переход от оценки к вердикту — и модель обязана построить цепочку рассуждений, а не выдать два обрывка текста.

Почему работает

LLM почти идеально выполняет явные инструкции — но без них подставляет дефолтное узкое определение «потребностей», которое совпадает со взглядом врачей (не психологов). Разрыв между оценкой и решением подтверждён на 7 разных моделях и трёх повторных прогонах каждой — это не случайность, а системный паттерн. LLM в разы чаще людей пишет «я могу ошибаться» — но эта фраза никак не связана с реальной согласованностью её же решений.

Когда применять

Оценка инвалидности и инклюзии → когда LLM используется как второе мнение для соцработника, HR или комиссии, особенно при нейроотличиях (аутизм, СДВГ, дислексия), где потребности выходят за рамки физического самообслуживания. НЕ подходит как единственный источник решения без проверки человеком — модель сама не гарантирует логическую связность.

Мини-рецепт

1. Задай широкое определение: не просто «функционирование», а распиши явно — физическое, коммуникативное, социальное, эмоциональное.
2. Требуй мостик: попроси модель показать, как решение да/нет логически вытекает из оценки по шкале.
3. Ищи противоречия: если модель заметила разрыв между оценкой и решением — заставь её объяснить его, а не спрятать.
4. Не верь самоотчёту: фраза «я могу ошибаться» от модели ничего не говорит о качестве — проверяй логику фактически, а не на словах.

Примеры

[ПЛОХО] : Оцени, нужна ли этому человеку с аутизмом постоянная помощь.
[ХОРОШО] : Оцени функционирование человека по шкале 1-5, учитывая физические, коммуникативные, социальные и эмоциональные потребности. Затем дай решение да/нет и явно покажи, как оно логически следует из оценки. Если есть противоречие — укажи его прямо.
Источник: Language Models Reproduce Human Reductionist Bias and Decision Inconsistency in Neurodevelopmental Disorders Assessment
ArXiv ID: 2608.17105 | Сгенерировано: 2026-08-19 05:25

Проблемы LLM

ПроблемаСутьКак обойти
Модель сужает абстрактные понятия до стереотипного смыслаПросишь оценить "потребности", "качество", "готовность" без явного определения. Модель по умолчанию берёт узкий, привычный смысл — например, "потребности" сводит к физическим (еда, гигиена), забывая социальные и эмоциональные. Это происходит даже когда контекст явно требует более широкого взгляда. Проблема всплывает в любой задаче с оценочным понятием: анализ резюме, оценка риска, проверка полноты ответаЯвно перечисли категории понятия в запросе. Не "оцени потребности", а "оцени потребности: физические, социальные, эмоциональные, коммуникативные"
Промежуточная оценка и финальное решение логически не связаныМодель сначала даёт оценку по шкале (например 1-5), потом отдельно выдаёт вердикт (да/нет). Эти два ответа статистически никак не коррелируют между собой — модель не проверяет, следует ли решение из оценки. Возникает в любой двухшаговой задаче: скоринг + рекомендация, диагностика + план действий, рейтинг + выводПопроси модель явно показать цепочку от оценки к решению. Если есть противоречие — потребуй, чтобы модель его назвала и объяснила

Методы

МетодСуть
Явное определение оценочного понятия через категорииПеред тем как просить оценку, распиши понятие на конкретные составляющие: не "оцени функционирование", а "оцени физическое, социальное, коммуникативное, эмоциональное функционирование". Работает потому что модель хорошо выполняет явные инструкции, но при их отсутствии подставляет дефолтное узкое значение. Применяй когда оцениваешь людей, кандидатов, риски, качество — везде где понятие можно свести к частному случаю. Не нужен для однозначных числовых или фактических запросов
Требование логического мостика между шагамиВ многошаговом запросе явно проси: "покажи, как пункт 2 следует из пункта 1, и укажи противоречие если оно есть". Работает потому что без этой инструкции модель обрабатывает шаги как независимые задачи, не сверяя их друг с другом. Применяй в любой цепочке "оценка решение", "диагноз рекомендация", "рейтинг вывод". Не нужен если шаги логически не связаны по смыслу задачи
📖 Простыми словами

LanguageModelsReproduce Human Reductionist Bias and Decision Inconsistency in Neurodevelopmental Disorders Assessment

arXiv: 2608.17105

Нейросети подхватили худшую привычку людей — редукционистское смещение и полную разорванность мышления. Когда LLM анализирует сложный кейс, она делает это в два изолированных шага: сначала оценивает факты, а потом выносит вердикт. Проблема в том, что второй шаг банально не стыкуется с первым — у модели возникает логическая несогласованность, и финальное решение вообще не вытекает из её же собственных выводов.

Это как уставший терапевт в поликлинике перед концом смены. Он добросовестно записал в карту температуру под 40, жуткий кашель и хрипы, а потом на автомате выписал аскорбинку и отправил тебя на работу со словами «само пройдет». Формально осмотр проведен, но диагноз живет отдельно от рецепта, потому что мозгу проще срезать угол и выдать шаблонный ответ.

Что происходит на практике: в задачах по нейроотличиям LLM демонстрирует жесткий разрыв между оценкой и действием. Загрузи в ChatGPT кейс сотрудника с аутизмом или школьника с СДВГ: модель подробно перечислит все реальные трудности человека, но на прямой вопрос «нужна ли адаптация рабочего места?» внезапно выдаст отказ. Сетка просто копирует поверхностные человеческие стереотипы, сводя комплексную проблему к примитивному «и так сойдет».

Эксперимент ставили на оценке нарушений развития, но принцип универсален. Ровно та же лажа вылезает в HR-скрининге, одобрении кредитов, страховых выплатах и юридических спорах. Везде, где человек надеется заменить предвзятого клерка «объективным» алгоритмом, модель скатывается в примитивный редукционизм и штампует необоснованные отказы.

Короче: использовать базовые LLM как «второе мнение» в чувствительных вопросах — прямой путь к дискриминации. Модель не исправляет человеческие косяки, она их масштабирует. Если внедряешь AI в такие процессы, заставляй его использовать принудительную верификацию логики, иначе алгоритм просто продолжит рубить сплеча чужие судьбы.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с