МедицинаPubMedAkhund SA, Qazi S, Mazhar MA, Shaikh AA et al.3 мин чтенияcohort study
Согласие, калибровка и неудачи трех крупных языковых моделей в качестве оценщиков многомодальных заданий: сравнительный психометрик анализ.
Agreement, calibration, and failure of three large language models as high-stakes multimodal ospe graders: a comparative psychometric analysis.
Карточка статьи
Рубрика
Медицина
Источник
PubMed
DOI
10.1080/10872981.2026.2684837
Дата
31.12.2026
Автор
Akhund SA, Qazi S, Mazhar MA, Shaikh AA et al.
Время чтения
3 мин
Аннотация
Медицинское образование сталкивается с растущим спросом на масштабируемые решения для оценки. Крупные языковые модели были предложены в качестве автоматизированных оценщиков для важных оценочных мероприятий, но доказательства их надежности в многомодальных практических экзаменах остаются ограниченными. Это ретроспективное исследование межэкспертной надежности сравнивало три LLM: ChatGPT-4o, Gemini 2.5 Flash и Claude 3.5 Haiku с оригинальными человеческими эталонными оценками по 19 интегрированным заданиям по анатомии, гистологии и физиологии, выполненным 309 предмедицинскими студентами. Эталонные оценки выставлялись во время живого итогового оценивания двумя экспертами в данной области, которые разделили задания так, что каждое задание оценивалось одним экспертом для всех студентов; доступной оценки межэкспертной надежности у человека не было. Задания требовали одновременной интерпретации изображений и коротких ответов. Модели были оценены с использованием нулевого запуска с отражением реалистичных условий развертывания. Согласие оценивалось с помощью коэффициентов Спирмена, Кохена, внутриклассовой корреляции и анализа Бланда-Алтмана. Анализ различий на уровне заданий сравнил показатели успеха студентов с производительностью LLM по заданиям. Корреляции в порядке ранжирования были сильными для всех моделей ( = 0.784-0.921), но категориальное согласие значительно расходилось. Согласие по признаку «сдал/не сдал» варьировалось от 52.1% (ChatGPT; = 0.067, незначительное) до 84.1% (Claude; = 0.680, значительное). Анализ Бланда-Алтмана показал несоответствующее систематическое отклонение: Claude завышал оценки на +2.5 балла, Gemini занижал на -5.0 баллов, а ChatGPT на -10.0 баллов. Анализ различий на уровне заданий подчеркнул три повторяющихся паттерна расхождения: нестандартные гистологические окраски, трехмерное пространственное мышление на основе двумерных изображений и семантическую неосторожность в оценке коротких ответов. Самым крайним случаем было задание по трехмерной модели таза, по которому 93.3% студентов успешно прошли оценивание человеком, но все три LLM присвоили средний балл ноль. Сильная корреляция в порядке ранжирования сама по себе не поддерживает оценку LLM для категориальных решений в контексте высоких ставок. LLM могут служить помощниками в оценивании для начальной сортировки и сигнализации о несоответствиях, но требуется пересмотр человекочитаемого уровня для отмеченных расхождений, мониторинг профилей ошибок и сохранение человеческой власти в отношении решений «сдал/не сдал» перед развертыванием на высоком уровне.
Краткое резюме
Исследование сравнило три языковые модели на предмет их надежности в оценке многомодальных экзаменов для медицинских студентов. Несмотря на сильные корреляции в ранжировании, результаты показали значительные расхождения в оценке по критериям «сдал/не сдал», что ставит под сомнение использование LLM в высокострессовых экзаменах.
Практический вывод
Крупные языковые модели могут служить вспомогательными инструментами для первичной оценки результатов, но должна сохраняться человеческая проверка перед принятием окончательных решений.
Ограничения
Данное исследование основывалось на ограниченном объеме данных и не включает оценку межэкспертной надежности для людей, что является необходимым для полного понимания точности моделей. Кроме того, заданные типы вопросов могут влиять на производительность LLM.
Время на подготовку, определяемое как интервал между завершением приема полиэтиленгликоля и началом колоноскопии, изучалось как фактор, влияющий на качество очищения кишечника. Однако остается неясным, связано ли само время подготовки кишечника с трудностями введения колоноскопа. Наша цель заключалась в изучении взаимосвязи показателей времени подготовки кишечника с временем интубации слепой кишки (CIT) и образованием петель. В этом проспективном наблюдательном исследовании, проведенном в одном центре, мы включили последовательных пациентов, прошедших колоноскопию без седации, и проспективно зарегистрировали четыре показателя времени подготовки кишечника: время до первой дефекации, время до подтвержденного завершения подготовки кишечника, общее количество дефекаций и оцененный объем стула. Была проведена многофакторная линейная регрессия с использованием логарифмически преобразованного CIT в качестве зависимой переменной и корректировкой по возрасту, полу, индексу массы тела (ИМТ) и эндоскописту. Ассоциации с образованием петель были изучены с помощью многофакторного логистического регрессионного анализа, скорректированного по возрасту, ИМТ и эндоскописту. Всего было включено 185 пациентов. Из четырех показателей только время до подтвержденного завершения подготовки кишечника было связано с трудностями введения. В многофакторном линейном регрессионном анализе каждые 30 минут увеличения времени до подтвержденного завершения подготовки кишечника были связаны с увеличением CIT (exp(β), 1.139; 95% доверительный интервал [CI], 1.065–1.219). В многофакторном логистическом регрессионном анализе это также было связано с образованием петель (отношение шансов 1.624; 95% CI, 1.129–2.360, на каждые 30 минут увеличения). Время до подтвержденного завершения подготовки кишечника может служить простым предшествующим показателем трудностей при введении колоноскопа.
Для оценки больших языковых моделей (БЯМ) в предэндоскопической (ПЭ) стратификации риска и предсказании эндоскопических находок при кровотечении из верхних отделов желудочно-кишечного тракта (КВУГЖ), а также для сравнения их эффективности с клиническими шкалами риска, традиционными моделями машинного обучения (МО) и гибридными подходами. Это многоцентровое ретроспективное исследование включало 384 пациента с КВУГЖ, которые прошли эндоскопию. Пять БЯМ были протестированы с использованием структурированных нулевых запросов на основе клинических и лабораторных данных ПЭ. Их эффективность в выявлении пациентов с высоким риском была сопоставлена с шкалой Глазго-Блэтчфорда (GBS), AIMS65, шкалой Рокалла для ПЭ и моделями МО. Также были оценены гибридные модели БЯМ-шкала. Два гастроэнтеролога оценили качество обоснований, сгенерированных БЯМ. GBS показала наилучшие дискриминационные показатели среди клинических шкал (площадь под кривой операционной характеристикой [AUROC] 0.73). Среди БЯМ GPT-5 достиг наивысшей точности (0.66), в то время как Grok продемонстрировала наилучшие сбалансированные показатели (0.59; F1 0.47). Gemini-2.5-Flash имела наивысшую чувствительность (0.89), но низкую специфичность (0.21). Эндоскопические предсказания имели скромную производительность, при этом Gemini-2.5-Flash достигла наивысшей точности точного соответствия (0.34) и микро-F1 (0.38). Гибридные модели улучшили результаты по сравнению с отдельными БЯМ, но не превзошли GBS (лучший: GBS+GPT-5, AUROC 0.67). БЯМ показали более высокие численные показатели по сравнению с традиционными моделями МО, но статистическое сравнение было невозможно из-за отсутствия данных на уровне экземпляров. Grok получила наивысший балл человеческой оценки за качество объяснений. БЯМ показали умеренное качество в стратификации риска КВУГЖ и предсказании эндоскопии, но уступили клиническим шкалам, особенно GBS. Гибридные модели немного улучшили показатели по сравнению с отдельными БЯМ, но не превзошли GBS, поддерживая их использование как вспомогательных инструментов, а не систем поддержки клинического решения.
Эндоскопическая деторсия является основным методом лечения сигмовидной вирулентности (СВ); однако, деторсия не всегда бывает успешной. Мы оценили клинические результаты после неудачной эндоскопической деторсии и проанализировали рецидивы у пациентов, которые достигли клинического успеха после декомпрессии. Это одноцентровое ретроспективное когортное исследование включало 47 пациентов с первым эпизодом СВ, из которых 43 прошли эндоскопическое лечение. Базовые характеристики и краткосрочные исходы сравнивались между группами успешной и неудачной деторсии. Среди пациентов с клиническим успехом в больничном курсе и 1-летней кумулятивной рецидивности сравнивались группы успешной деторсии и успешной декомпрессии. Кумулятивный рецидив оценивался с использованием метода Каплан-Meier. Успешная деторсия была достигнута у 21 из 43 пациентов (48,8%). Среди 22 пациентов с неудачной деторсией 17 достигли клинического успеха после декомпрессии, в то время как пять имели клиническую неудачу, в том числе четверо, которым была проведена экстренная операция, и один, кто умер на следующий день. Общий уровень клинического успеха составил 88,4% (38/43). Неудачная деторсия была связана с более низким уровнем насыщения кислородом в воздухе и более высокими уровнями лактата. Клинический успех встречался реже в группе неудачной деторсии (77,3% против 100%, p=0,065), а время пребывания в больнице было длиннее (медиана 13 против 7 дней, p=0,071). Среди пациентов с клиническим успехом время до возобновления перорального питания было короче в группе успешной деторсии (медиана 1,5 против 3 дней, p=0,004), в то время как 1-летняя кумулятивная частота рецидивов была численно выше, но статистически незначительна (79,6% против 51,3%, log-rank=0,087). После оценки необходимости экстренной операции, декомпрессия как таковая может не всегда требовать немедленной повторной деторсии у выбранных пациентов, которые клинически улучшаются.
Настоящее исследование стремилось понять и изучить, как игроки в азартные игры ретроспективно характеризуют изменения в своей эмоциональной валентности на протяжении игрового сеанса и как они интерпретируют изменения в своем эмоциональном возбуждении по мере развития игрового сеанса. В исследовании приняли участие 20 австралийских игроков, в возрасте от 20 до 63 лет (средний возраст = 34.9, стандартное отклонение = 10.23), которые прошли ретроспективные полуструктурированные интервью. Участников попросили воссоздать и рассказать о эмоциональных изменениях, которые они испытывали на протяжении игровых сеансов, и объяснить, как они интерпретировали и понимали изменения своих эмоций по мере того, как развивался игровой сеанс. Данные были проанализированы с использованием рефлексивного тематического анализа в рамках интерпретативной эпистемологической парадигмы. На основе данных были выделены пять ключевых тем: (1) Эмоциональное восстановление: чувства гордости и компетентности через мастерство; (2) Эмоциональный сдвиг: от изоляции к чувству принадлежности; (3) Навигация в опыте негативной валентности; (4) Ожидаемое возбуждение к возбуждению во время игры; и (5) Эскалация эмоциональной интенсивности и эмоциональной срочности. Это исследование бросает вызов традиционным парадигмам, демонстрируя, что как положительные, так и отрицательные эмоции действуют как очень подвижные факторы во время и после игрового сеанса. Эти инсайты могут побудить дальнейшие исследования, направленные на изучение эмоциональных механизмов, которые управляют и поддерживают азартные игры у индивидов.
Усталость, вызванная физической нагрузкой, представляет собой сложное, не паталогическое состояние, которое резко ограничивает физическую работоспособность, и предполагается, что серотонинергическая (5-ГТР) система является важным модулятором ее центральных компонентов. Эта систематическая проверка и мета-анализ направлены на уточнение влияния серотонинергической фармакологической манипуляции на результаты, связанные с физической нагрузкой. В соответствии с рекомендациями PRISMA мы систематически искали данные в PubMed, Scopus, Web of Science, Cochrane Central и SportDiscus с момента их создания до августа 2025 года. Были включены рандомизированные контролируемые испытания, исследующие влияние серотонинергической фармакологической манипуляции на результаты, связанные с физической нагрузкой, у здоровых взрослых. Выбор исследований, извлечение данных и оценка риска предвзятости с использованием RoB 2.0 проводились независимо. Суммарные эффекты были сведены с использованием моделей случайных эффектов на трех уровнях, и надежность и стабильность доказательств были изучены в дополнительных анализах. В систематический обзор было включено 21 рандомизированное контролируемое испытание с участием 248 здоровых взрослых, из которых 19 исследований с 229 участниками были включены в мета-анализ. В основных моделях серотонинергическая фармакологическая манипуляция была связана с небольшим снижением вызванного моторного ответа (Hedges' g = -0.24, 95% ДИ -0.46 до -0.02), временной доменной ЭМГ (Hedges' g = -0.18, 95% ДИ -0.33 до -0.02), частоты сердечных сокращений (Hedges' g = -0.17, 95% ДИ -0.34 до -0.01) и уровня глюкозы в крови (Hedges' g = -0.50, 95% ДИ -0.89 до -0.11). Добровольная активация показала пограничную отрицательную суммарную оценку (Hedges' g = -0.20, 95% ДИ -0.40 до 0), в то время как оценки воспринятой нагрузки показали положительную, но статистически неопределенную суммарную оценку (Hedges' g = 0.63, 95% ДИ -0.01 до 1.28). Тормозной момент покоя показал небольшой положительный суммарный эффект (Hedges' g = 0.12, 95% ДИ 0.04 до 0.19), тогда как наложенный тормозной момент, максимальное добровольное сокращение, пролактин, молочная кислота и время до отказа в задаче не показали четких общих эффектов. В целом, этот мета-анализ указывает на то, что серотонинергическая фармакологическая манипуляция имеет специфические эффекты по отношению к результатам, связанным с усталостью во время физической нагрузки, а не однообразное влияние на все области. Наиболее последовательные сигналы в основных моделях были обнаружены для вызванного моторного ответа, временной доменной ЭМГ, частоты сердечных сокращений и уровня глюкозы в крови, тогда как явные показатели производительности и восприятия оставались более изменчивыми. Интегрируя данные по различным серотонинергическим вмешательствам и парадигмам физической нагрузки, эти результаты углубляют наше понимание того, как механизмы, связанные с 5-ГТР, могут способствовать центральной усталости во время физической активности.
В глобальном масштабе более 230 миллионов девочек и женщин прошли через женское обрезание/кожевершение (ЖО/К). Предполагается, что около четверти из них проживает в Восточной Африке. Исследования подчеркивают, что уровень образования является одним из основных факторов, способствующих этой практике. Цель данного исследования состояла в оценке неравенства, связанного с образованием матерей, в практике ЖО/К среди дочерей в возрасте 0-14 лет с использованием данных Демографического и санитарного обследования (DHS) за 2016–2022 годы из трех стран Восточной Африки. Для анализа данных использовалась версия Stata 17. Мы проанализировали объединенные, национально репрезентативные данные DHS (2016-2022) из трех стран Восточной Африки (Эфиопия, Кения и Танзания), включающие взвешенную выборку из 23,596 дочерей. Неравенство, связанное с образованием матерей, измерялось с использованием нормализованного индекса концентрации Эррейгера. Проведен анализ декомпозиции для определения процентного вклада факторов, связанных с матерью и домохозяйством, в наблюдаемое неравенство. Результаты показали прообразовательное распределение практики, с индексом Эррейгера -0.126 (<0.001), что указывает на то, что ЖО/К существенно сосредоточено среди дочерей менее образованных матерей. Анализ декомпозиции показал, что образование матерей составило наибольшую долю наблюдаемого неравенства (42.51%), за которым следовали статус ЖО/К матерей (23.79%), отсутствие доступа к СМИ (22.58%), проживание в сельской местности (13.86%) и возраст матерей <18 лет в момент первого сожительства (8.7%), тогда как индекс благосостояния уменьшил неравенство на 23.44%. ЖО/К непропорционально сосредоточено среди дочерей менее образованных матерей. Наблюдаемое неравенство в значительной степени формировалось факторами, связанными с матерями, что указывает на то, что ограниченное образование и межпоколенческая передача играют существенную роль в поддержании ЖО/К среди дочерей.