МедицинаarXivScience Morning3 мин чтенияpreprint

FaithMed: Обучение ЛЛМ для надежного доказательного медицинского рассуждения

FaithMed: Training LLMs For Faithful Evidence-Based Medical Reasoning

Рубрика
Медицина
Источник
arXiv
Дата
01.07.2026
Автор
Science Morning
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Медицина

Аннотация

Верное рассуждение имеет важное значение в медицине, где клинические решения требуют прозрачного обоснования, основанного на надежных доказательствах. Текущие медицинские крупные языковые модели либо не имеют активного доступа к доказательствам, либо используют извлеченные доказательства, не контролируя, как их следует оценивать и применять в процессе рассуждений. Чтобы решить эту проблему, мы формализуем принципы доказательной медицины как критерии на уровне процесса и представляем FaithMed — структуру, которая сочетает в себе разработанные клиницистами автоматически уточняемые рубрики с методом обучения с подкреплением, используя назначение вознаграждения на уровне процесса и группировку преимуществ. В семи медицинских тестах FaithMed показывает улучшения по сравнению с базовыми моделями агентного поиска (+9% в среднем) и методом обучения с подкреплением, ориентированным только на результат (+5.8%), при этом повышая средние показатели рубрик доказательной медицины по сравнению с базовыми моделями агентного поиска Qwen3 (+15.5%). Эта работа демонстрирует, что явный контроль на уровне этапов может улучшить как успешность выполнения задачи, так и верность процесса рассуждения. Код доступен по адресу https://github.com/cxcscmu/FaithMed.

Краткое резюме

Исследование представляет систему FaithMed, направленную на улучшение врачебного рассуждения на основе доказательной медицины с помощью обучения с подкреплением и четкого контроля этапов процесса.

Практический вывод

Система FaithMed может значительно повысить качество медицинского рассуждения, интегрируя надежные доказательства и автоматизированные метрики оценивания.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. В исследовании могут присутствовать ограничения, связанные с количеством тестов и типами медицинских данных, используемых для обучения модели.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Медицина
Медицина
87%

Эффективность обучения на основе симуляции в области знаний об оказании неотложной помощи среди интерпрофессиональных сотрудников, участвующих в практике гастроэнтероскопии.

Целью настоящего исследования было оценить эффективность обучения на основе симуляции в улучшении возможностей реагирования на неотложные ситуации во время эндоскопической практики. В обучении участвовали врачи, медсестры, лабораторные технологи и клинические инженеры, работающие в отделении эндоскопии. Программа обучения на основе симуляции использовала смоделированные сценарии и проводилась под руководством сертифицированной медсестры по неотложной помощи. Перед началом обучения, сразу после него и через месяц после завершения занятия были проведены тесты на знание. Результаты тестов сравнивались по временным промежуткам и между профессиональными группами. В исследовании приняли участие двадцать два человека (14 врачей, семь медсестер и один лабораторный технолог). Процент правильных ответов улучшился по всем пунктам сразу после обучения по сравнению с результатами до обучения: правильные сжатия груди (< 0,01), препараты для остановки сердца (< 0,01), препараты для лечения анафилаксии (= 0,13), показания к дефибрилляции (< 0,01), местоположение автоматического внешнего дефибриллятора (AED) (= 0,01) и номер телефона службы экстренной помощи (Code Blue) (< 0,01). Однако через месяц после тренировки большинство показателей вернулись к уровням до обучения, за исключением показаний к дефибрилляции и номера телефона службы экстренной помощи. В анализе подгрупп по профессиям, когда сравнивались процент правильных ответов сразу до и сразу после обучения, врачи продемонстрировали значительные улучшения в местоположении AED (= 0,03) и номере телефона Code Blue (< 0,01), тогда как медсестры показали значительное улучшение в использовании препаратов для остановки сердца (= 0,02). Обучение на основе симуляции эффективно для повышения знаний об оказании неотложной помощи в гастроэнтероскопии. Однако может потребоваться повторное или непрерывное обучение для поддержания этих результатов.

Медицина
Медицина
82%

CLAP: Замкнутая система контроля обучения, оценки и выпуска агентов доменной области после обучения

Доменные агенты часто сталкиваются с шумными бизнес-данными, неопределёнными приростами после обучения, несоответствием между оффлайн и приложением, а также риском выпуска адаптера. В данной работе представлен метод CLAP (Closed-Loop Agent Post-training) — замкнутого цикла, который преобразует бизнес-данные в структурированные образцы SFT, образцы предпочтений решений, контрольные наборы, диагностику рисков и записи о воротах выпуска. CLAP сочетает в себе проверку данных, нормализацию целей и доказательств, диагностику награды и KL, оффлайн-ворота и воспроизведение цепочки приложений, чтобы определить, подходит ли адаптер для целевой цепочки приложений. На пяти анонимизированных партиях производственных сценариев метод LoRA-SFT в стиле QLoRA демонстрирует умеренные средние приросты: общий балл увеличивается на 0.0098, процент прохождения на 0.0240 и точность доказательств на 0.0280, в то время как случаи галлюцинаций и неверных фактов уменьшаются. Тем не менее, только 3 из 5 партий показали улучшение, а в некоторых случаях наблюдался регресс, при этом GRPO выявляет высокие риски KL. Воспроизведение цепочки приложений дополнительно указывает на то, что RAG необходим для фактической экстракции; при том же базовом уровне 3B и 100 случаях воспроизведения адаптер LoRA-SFT, ориентированный на приложения RAG, улучшает ценность, ключевые поля и совпадения ответов-доказательств по сравнению с базовым+RAG, но увеличивает задержку. Эти результаты поддерживают управление постобучением доменного агента через интегрированный цикл данных, обучения, оценки и выпуска, а не полагаясь на завершение обучения или единичный оффлайн-бал.

Медицина
Медицина
82%

Полное байесовское обучение с подкреплением с помощью LF-IBIS

Обучение с подкреплением (RL) — это метод принятия решений в последовательных задачах, при котором агент обучается оптимальным политикам через взаимодействие с окружающей средой, максимизируя кумулятивные вознаграждения. Среди методов RL байесовское обучение с подкреплением (BRL) решает распространенные практические задачи, связанные с нехваткой данных, используя предварительные знания об окружении и последовательные обновления убеждений. Тем не менее, большинство подходов BRL требуют явной функции правдоподобия, которая часто недоступна или сложна для решения в реальных условиях. Мы предлагаем алгоритм, не требующий вычисления правдоподобия, — Итеративная Выборка Параметров Важности без Явного Правдоподобия (LF-IBIS), который обновляет убеждения агента в режиме онлайн по мере появления новых взаимодействий. Сочетая приближенные байесовские вычисления с итеративной выборкой параметров важности, LF-IBIS позволяет проводить полное байесовское вывод в условиях, когда динамика окружения не описана явным или управляемым правдоподобием. Метод предоставляет приближенные постериорные распределения как для параметров окружения, так и для оптимальных политик, обеспечивая количественную оценку неопределенности политики, что полезно для байесовского анализа компромисса между исследованием и эксплуатацией. Мы тестируем метод на симуляционном исследовании адаптивной рандомизации в клинических испытаниях, где закрытые формы постериоров позволяют провести валидацию. Дополнительные эксперименты рассматривают ситуации, когда постериор не имеет закрытой формы, и демонстрируют онлайн-обновление политики на основе постериорного распределения оптимальной политики.

Медицина
Медицина
79%

Идентичность без этапов: нарративное исследование об обрядах перехода, формирующих профессиональную идентичность у преподавателей медицинских профессий.

Формирование профессиональной идентичности (PIF) в медицине, как правило, поддерживается определенными этапами и хорошо исследованными ритуалами перехода. В отличие от этого, преподаватели, входящие в сферу медицинского образования (HPE), часто делают это без таких ориентирам, находясь в лиминальном пространстве, где идентичность постоянно пересматривается. Несмотря на растущее количество академических программ в области HPE, до сих пор мало что известно о том, как эти программы формируют идентичность преподавателей или какие впечатления становятся значимыми моментами формирования идентичности. Наша цель состоит в том, чтобы выявить трансформирующие «аха»-моменты, которые могут служить ритуалами перехода, помогая укрепить идентичность преподавателей медицинских профессий. Следуя социально-конструктивистской позиции, мы применили нарративное исследование для изучения историй 16 специалистов в области здравоохранения, которые учатся или недавно закончили академические программы HPE. Были проведены полуструктурированные интервью, которые затем были проанализированы с помощью техники повторного повествования. Теория трансформационного обучения (TLT) позволила понять когнитивные, эмоциональные и аффективные аспекты изменений идентичности, которые были охвачены с точки зрения эпифаний. В результате аналитической интерпретации этих историй мы выделили четыре эпифании. «Сила людей» в виде компетентных преподавателей для развития образовательных альянсов, которые повлияли на все аспекты TLT. «Язык HPE», выраженный через парадигматические ориентации и словарь, способствовал когнитивным сдвигам. «Бремя задач», отражающее уникальную природу заданий, связанных с HPE, оказывало эмоциональное давление. Наконец, «чувство принадлежности» через живые социальные взаимодействия между преподавателями и сверстниками укрепило формы принадлежности. Выявление этих трансформирующих «аха»-моментов предоставляет ясные, измеримые шаги к тому, как можно способствовать и укреплять формирование идентичности преподавателей в контексте академических программ HPE. Такие выводы требуют внимательного выбора преподавателей, улучшения структуры учебных программ и практики расписания. Уважаем истории преподавателей, мы придаем голос их жизненному опыту и признаем значимость академических программ HPE как прекрасных путей к формированию идентичности.

Медицина
Медицина
77%

Консенсус и климат обучения в временных и постоянных командах в процессе командного обучения.

В командном обучении студенты, как правило, размещаются в фиксированных командах, основываясь на идее, что стабильное членство в группе способствует сотрудничеству: по мере того как члены команды узнают друг друга, они делятся большей информацией, решают разногласия и чувствуют мотивацию вносить вклад. Однако данная логика не была протестирована в рандомизированном контролируемом исследовании. В данном исследовании сравнивается командное обучение во временных командах с постоянными командами по показателям индивидуальной и командной уверенности (iRAT, tRAT), достижению консенсуса команды, климату обучения и внутренней мотивации. В рандомизированном контролируемом испытании студенты первого курса медицинского факультета были распределены либо по постоянным TBL-командам, либо в команды, которые перераспределялись для каждой задачи. Голосование по тесту уверенности команды (tRAT), submitted индивидуально и конфиденциально, служило косвенным показателем консенсуса команды (согласованные и несогласованные голоса tRAT). Несогласованные tRAT (268, 11.8% всех голосов) подавались чаще в временных, чем в постоянных командах, как для правильных, так и для неправильных решений большинства. Самооценка климата обучения была более кооперативной в постоянных командах, чем в временных, в то время как внутренняя мотивация и результаты tRAT были схожими для обоих типов команд. Плохой климат обучения был связан с более высокой долей несогласованных tRAT. Работа в временных командах не приводит к ухудшению внутренней мотивации; это также ранее было показано для получения знаний. Однако плохой климат обучения вместе с меньшей частотой достижения консенсуса может указывать на то, что, по крайней мере, некоторые члены временных команд чувствуют себя недостаточно оценёнными в обсуждении и не принимают решение большинства. С помощью учебных стратегий, способствующих кооперативному климату обучения в временных командах, предварительные TBL-курсы могут служить ранним формирователем отношений командных компетенций, необходимых для последующего обучения на клиническом рабочем месте в временных командах.

Медицина
Медицина
77%

Очищенный OPSD: самодистилляция на основе политики без потери способности мыслить

Самодистилляция на основе политики (OPSD) стала перспективной парадигмой для улучшения рассуждений больших языковых моделей (LLM), где привилегированный учитель с доступом к эталонным решениям обеспечивает супервизию на уровне токенов по траекториям, создаваемым студентом. Однако мы обнаружили, что OPSD последовательно не справляется с моделями длительного цепочного рассуждения (long-CoT), давая в лучшем случае незначительные улучшения, при этом дестабилизируя способность к рефлективному рассуждению, на которой зависят эти модели. Посредством нового разложения супервизионного сигнала учителя мы выявили коренную причину: супервизия учителя доминируется компонентом, вызванным эталоном, который приводит к механическому запоминанию конкретных коротких путей, в то время как компонент, зависящий от вопроса и передающий выводы, игнорируется или активно противоречит. Основываясь на этой диагнозе, мы предлагаем двухступенчатое решение. Во-первых, мы создаем учителя только на основе эталона (та же модель, закомпонтованная на эталоне без вопроса), чтобы изолировать непередаваемый компонент супервизионного сигнала; остаток после вычитания этого компонента захватывает коррекцию, зависящую от вопроса и передающую вывод. Во-вторых, мы используем точечную взаимную информацию (PMI) как механизм для преобразования этого остатка в хорошо формируемое распределение целевых значений PMI, из которого студент может непосредственно дистиллировать, отфильтровав короткий путь, вызванный эталоном. Эксперименты над четырьмя моделями long-CoT на двух наборах данных показывают постоянные улучшения как по сравнению с базовой моделью, так и со стандартным OPSD, при этом сохраняя естественное эпистемическое поведение моделей на протяжении всего обучения.