МедицинаarXivScience Morning3 мин чтенияpreprint

Сравнение языковых моделей на основе рубрик в задачах клинического мышления, созданных экспертами

A rubric-based controlled comparison of frontier language models on expert-authored clinical reasoning tasks

Рубрика
Медицина
Источник
arXiv
Дата
02.07.2026
Автор
Science Morning
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Медицина

Аннотация

Медицинские тесты с выбором ответов становятся все более переполненными, и недавние оценки на основе рубрик, такие как HealthBench, показали, что открытая клиническая оценка далека от решения: максимальный балл в ее "Сложной" подгруппе составляет всего 32%. Мы представляем небольшой, специально сложный набор оценочных данных из пяти клинических сценариев, составленных врачами, охватывающих четыре специальности (анестезиология, внутренние/семейная медицина, неотложная медицина и акушерство), каждый из которых сопровождается атомарной, взвешенной, MECE рубрикой (от 25 до 62 критериев на задачу, всего 184 критерия), составленной на основании золотого ответа, подготовленного врачом. Мы оценили три передовые модели: GPT 5.4, Claude Opus 4.7 и Gemini 3.1 Pro. Средние показатели прохождения рубрики составили 0.47 (Claude), 0.39 (GPT) и 0.37 (Gemini). Центральный вывод заключается в инверсии клинического приоритета: наиболее важные (вес-5, критически важные) критерии были выполнены всего на 32.4-41.7%, в то время как менее значимые критерии с весом-1 прошли с результатом 80-90%. 56 из 108 критически важных (вес-5) критериев (52%) не были выполнены ни одной моделью. Три авторегистраторы LLM воспроизвели метки экспертов (выполнено/не выполнено) в 92.8-94.7% из 552 оцененных критериев. Мы рассматриваем это как вклад в методы и предварительные результаты: пять задач демонстрируют масштабируемый, обоснованный процесс, готовый к развитию в крупномасштабный эталон.

Краткое резюме

В исследовании было представлено сложное оценочное поле для клинического мышления, оцененное с использованием трех передовых языковых моделей. Наибольшее внимание уделили недостаточному выполнению критически важных критериев, в то время как менее значимые критерии оценивались значительно лучше.

Практический вывод

Данное исследование подчеркивает существующие проблемы в оценке клинического мышления по использованию языковых моделей и необходимость более строгих критериев для достижения высоких результатов.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. Основные ограничения исследования включают небольшой объем оценочного набора данных и возможность недовыявления всех важных аспектов клинического мышления на основе существующих критериев.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Медицина
Медицина
87%

Оценка больших языковых моделей в клиническом управлении пациентами с верхним желудочно-кишечным кровотечением: данные из реальной практики.

Для оценки больших языковых моделей (БЯМ) в предэндоскопической (ПЭ) стратификации риска и предсказании эндоскопических находок при кровотечении из верхних отделов желудочно-кишечного тракта (КВУГЖ), а также для сравнения их эффективности с клиническими шкалами риска, традиционными моделями машинного обучения (МО) и гибридными подходами. Это многоцентровое ретроспективное исследование включало 384 пациента с КВУГЖ, которые прошли эндоскопию. Пять БЯМ были протестированы с использованием структурированных нулевых запросов на основе клинических и лабораторных данных ПЭ. Их эффективность в выявлении пациентов с высоким риском была сопоставлена с шкалой Глазго-Блэтчфорда (GBS), AIMS65, шкалой Рокалла для ПЭ и моделями МО. Также были оценены гибридные модели БЯМ-шкала. Два гастроэнтеролога оценили качество обоснований, сгенерированных БЯМ. GBS показала наилучшие дискриминационные показатели среди клинических шкал (площадь под кривой операционной характеристикой [AUROC] 0.73). Среди БЯМ GPT-5 достиг наивысшей точности (0.66), в то время как Grok продемонстрировала наилучшие сбалансированные показатели (0.59; F1 0.47). Gemini-2.5-Flash имела наивысшую чувствительность (0.89), но низкую специфичность (0.21). Эндоскопические предсказания имели скромную производительность, при этом Gemini-2.5-Flash достигла наивысшей точности точного соответствия (0.34) и микро-F1 (0.38). Гибридные модели улучшили результаты по сравнению с отдельными БЯМ, но не превзошли GBS (лучший: GBS+GPT-5, AUROC 0.67). БЯМ показали более высокие численные показатели по сравнению с традиционными моделями МО, но статистическое сравнение было невозможно из-за отсутствия данных на уровне экземпляров. Grok получила наивысший балл человеческой оценки за качество объяснений. БЯМ показали умеренное качество в стратификации риска КВУГЖ и предсказании эндоскопии, но уступили клиническим шкалам, особенно GBS. Гибридные модели немного улучшили показатели по сравнению с отдельными БЯМ, но не превзошли GBS, поддерживая их использование как вспомогательных инструментов, а не систем поддержки клинического решения.

Медицина
Медицина
87%

Операционные характеристики методов анализа для клинических испытаний при вирусных респираторных заболеваниях: протокол симуляционного исследования

Острые вирусные респираторные инфекции (ОВРИ) являются одной из основных причин госпитализации и смертности во всем мире, однако рандомизированные клинические испытания в этой области сталкиваются с серьезными трудностями в выборе эффективных и клинически значимых первичных конечных точек. Смертность часто слишком редка, чтобы служить осуществимой первичной конечной точкой. Было предложено несколько альтернативных подходов, включая.ordinal шкалы, конечные точки «время до события», составные исходы на основе выздоровления и продольныеOrdinal модели. Однако их сравнительные операционные характеристики в условиях реалистичных курсов ОВРИ пока недостаточно изучены. Мы описываем симуляционное исследование для сравнения уровня I ошибки и мощности широко используемых и недавно предложенных конечных точек и стратегий анализа для двухгрупповых рандомизированных испытаний среди госпитализированных участников с ОВРИ. Данные будут генерироваться по нескольким механизмам, направленным на имитацию правдоподобных траекторий участников, включая латентный процесс Брауна, процесс первого порядка ординальной марки, латентный процесс повторных событий с ослаблением и повторную выборку индивидуальных данных участников из испытания ACTT-2. Смоделированные результаты будут использовать ординальные шкалы тяжести с 4-, 6- и 8 уровнями и будут отражать популяции умеренно и тяжело больных, сроки наблюдения в 28 или 60 дней, различные эффекты лечения и размеры выборки. Сравниваемые методы включают модели перехода ординальных состояний Маркова, модели пропорциональных шансов в фиксированную точку времени, анализы по шкале дней до выздоровления, модели Кокса для конечных точек «время до события», логистическую регрессию для бинарных конечных точек, обобщенные парные сравнения для иерархических составных исходов и t-тесты для дней жизни и выписки из больницы. Это исследование предоставит систематическое сравнение определений конечных точек и методов анализа для испытаний на ОВРИ при клинически обоснованных механизмах генерации данных. Результаты направлены на информирование выбора осуществимых, интерпретируемых и статистически эффективных стратегий первичного анализа для будущих клинических испытаний при вирусных респираторных заболеваниях.

Медицина
Медицина
77%

Международный травматический опросник с 'клиническими проверками' (ITQ-CC): измерение ПТСР и сложного ПТСР в популяционно-основанном исследовании в Польше.

Международный травматический опросник (ITQ) — это широко используемый инструмент для измерения посттравматического стрессового расстройства (ПТСР) и сложного ПТСР (СПТСР) согласно 11-й редакции Международной статистической классификации болезней (ICD-11), который позволяет оценивать распространенность этих расстройств как в генеральной популяции, так и в клинических выборках. В связи с опасениями, связанными с использованием самоотчетных мер, авторы оригинальной версии ввели концепцию 'клинических проверок', которые добавлены в новой версии для обеспечения отражения первоначальных ответов клинического смысла элементов шкалы. Поскольку эта концепция новая и требует тестирования в различных культурных условиях, целью данного исследования было измерить и сравнить распространенность вероятного ПТСР и СПТСР в репрезентативной выборке поляков с использованием новой версии ITQ (ITQ-CC) и оригинальной версии. Мы собрали данные от репрезентативной выборки взрослых из Польши (n=1,816) через интернет-панель. Сравнение результатов, полученных с использованием ITQ и ITQ-CC, показало, что количество индивидуальных симптому снизилось на 18,9% — 41,6%. Оценки распространенности расстройства без клинических проверок составили 5,3% для ПТСР и 6,1% для СПТСР. Эти оценки снизились до 2,4% для ПТСР и до 3,5% для СПТСР при использовании клинических проверок; таким образом, относительное снижение составило 55,7% для ПТСР и 48,7% для СПТСР, что в результате дало общий относительный уровень снижения 48,8%. Результаты исследования указывают на значительное влияние клинических проверок на скрининг посттравматических симптомов. Это привело к значительному снижению оценок распространенности ПТСР и СПТСР.

Медицина
Медицина
77%

Сочетание окситоцина с групповая терапия на основе внимательности снижает негативные симптомы при расстройствах шизофренического спектра: тройное слепое, плацебо-контролируемое, рандомизированное контролируемое клиническое пилотное исследование (OXYMIND)

Фон. Негативные симптомы при расстройствах шизофренического спектра (РШС) остаются недостаточно лечеными и требуют новых терапевтических подходов. Окситоцин может улучшить негативные симптомы, хотя его эффекты, по всей видимости, сильно зависят от контекста в соответствии с гипотезой социальной значимости. Мы провели рандомизированное, тройное слепое, плацебо-контролируемое пилотное исследование, сочетая интраназальный окситоцин с групповой терапией на основе внимательности (ГТВ), предполагая, что положительный социальный контекст ГТВ усилит эффекты, связанные с окситоцином. Методы. 47 участников с РШС (34% женщин) были рандомизированы для получения либо 24 ME окситоцина (ГТВ+ОКТ; n = 26), либо плацебо (ГТВ+ПЛА; n = 21) перед четырьмя сессиями ГТВ. Основным результатом были негативные симптомы, оцененные с помощью подшкалы негативных симптомов Шкалы позитивных и негативных синдромов (PANSS-N) после интервенции и через 4 недели. Вторичными результатами включались Шкала кратких негативных симптомов (BNSS), Шкала самооценки негативных симптомов (SNS) и дополнительные клинические показатели. Линейные смешанные модели оценили эффекты внутри и между группами. Результаты. Общее количество выбытия составило 14,89%, при этом один случай выбытия мог быть связан с лечением. Слепота была успешной. Участники завершили 95,63% сессий. Только группа ГТВ+ОКТ продемонстрировала значительные улучшения в PANSS-N от базового уровня до пост-интервенции (d = -0,74) и на контрольном осмотре (d = -0,77), с небольшим эффектом между группами на контрольном осмотре (d = 0,39). Общая оценка BNSS значительно улучшилась только в группе ГТВ+ОКТ от базового уровня до пост-интервенции (d = -0,88) и на контрольном осмотре (d = -0,91), при этом эффекты между группами были в пользу ГТВ+ОКТ на контрольном осмотре (d = -0,38). Серьезные нежелательные явления не наблюдались. Заключение. Эти данные предполагают, что окситоцин в сочетании с ГТВ может улучшить негативные симптомы при РШС и поддерживают дальнейшие масштабные исследования. Регистрация клинических испытаний: https://clinicaltrials.gov/study/NCT06136390, Регистрационный номер: NCT06136390.

Медицина
Медицина
77%

SABER: Фреймворк анализа семантически согласованной структуры мозга с помощью многомасштабных гиперграфов

Эффективная диагностика заболеваний мозга требует синергии паттернов подключения мозга и высокоуровневых семантических знаний. Однако существующие методы в значительной степени рассматривают семантику из крупных языковых моделей (LLMs) как вспомогательные признаки или руководство, что ограничивает их прямую роль в принятии решений и сужает стабильность и надежность классификации. Чтобы преодолеть это, мы предлагаем фреймворк семантически согласованной нейросети мозга, который активно интегрирует семантику, полученную от LLM, в процесс предсказания. В частности, семантика на уровне ROI сначала включается через глобальное самообращение для обогащения представлений узлов и предоставления контекста всего мозга. Затем строятся многомасштабные гиперграфы для явного моделирования функциональных подсетей и взаимодействий между несколькими ROI, что решает локальные ограничения традиционных ГНН и захватывает высокопорядковые зависимости. Наконец, механизм семантической согласованности на уровне принятия решений избирательно вводит текстовые вложения, специфичные для пациента, в графовые представления, позволяя семантике напрямую управлять предсказаниями без нарушения глубинной структуры сети. Эксперименты на публичных наборах данных сети мозга ABIDE и ADHD-200 демонстрируют состояние искусства, повышенную стабильность и улучшенную интерпретируемость, особенно в условиях небольших выборок.

Медицина
Медицина
74%

Очищенный OPSD: самодистилляция на основе политики без потери способности мыслить

Самодистилляция на основе политики (OPSD) стала перспективной парадигмой для улучшения рассуждений больших языковых моделей (LLM), где привилегированный учитель с доступом к эталонным решениям обеспечивает супервизию на уровне токенов по траекториям, создаваемым студентом. Однако мы обнаружили, что OPSD последовательно не справляется с моделями длительного цепочного рассуждения (long-CoT), давая в лучшем случае незначительные улучшения, при этом дестабилизируя способность к рефлективному рассуждению, на которой зависят эти модели. Посредством нового разложения супервизионного сигнала учителя мы выявили коренную причину: супервизия учителя доминируется компонентом, вызванным эталоном, который приводит к механическому запоминанию конкретных коротких путей, в то время как компонент, зависящий от вопроса и передающий выводы, игнорируется или активно противоречит. Основываясь на этой диагнозе, мы предлагаем двухступенчатое решение. Во-первых, мы создаем учителя только на основе эталона (та же модель, закомпонтованная на эталоне без вопроса), чтобы изолировать непередаваемый компонент супервизионного сигнала; остаток после вычитания этого компонента захватывает коррекцию, зависящую от вопроса и передающую вывод. Во-вторых, мы используем точечную взаимную информацию (PMI) как механизм для преобразования этого остатка в хорошо формируемое распределение целевых значений PMI, из которого студент может непосредственно дистиллировать, отфильтровав короткий путь, вызванный эталоном. Эксперименты над четырьмя моделями long-CoT на двух наборах данных показывают постоянные улучшения как по сравнению с базовой моделью, так и со стандартным OPSD, при этом сохраняя естественное эпистемическое поведение моделей на протяжении всего обучения.