МедицинаarXivScience Morning3 мин чтенияpreprint

Полное байесовское обучение с подкреплением с помощью LF-IBIS

Full Bayesian Reinforcement Learning via LF-IBIS

Рубрика
Медицина
Источник
arXiv
Дата
02.07.2026
Автор
Science Morning
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Медицина

Аннотация

Обучение с подкреплением (RL) — это метод принятия решений в последовательных задачах, при котором агент обучается оптимальным политикам через взаимодействие с окружающей средой, максимизируя кумулятивные вознаграждения. Среди методов RL байесовское обучение с подкреплением (BRL) решает распространенные практические задачи, связанные с нехваткой данных, используя предварительные знания об окружении и последовательные обновления убеждений. Тем не менее, большинство подходов BRL требуют явной функции правдоподобия, которая часто недоступна или сложна для решения в реальных условиях. Мы предлагаем алгоритм, не требующий вычисления правдоподобия, — Итеративная Выборка Параметров Важности без Явного Правдоподобия (LF-IBIS), который обновляет убеждения агента в режиме онлайн по мере появления новых взаимодействий. Сочетая приближенные байесовские вычисления с итеративной выборкой параметров важности, LF-IBIS позволяет проводить полное байесовское вывод в условиях, когда динамика окружения не описана явным или управляемым правдоподобием. Метод предоставляет приближенные постериорные распределения как для параметров окружения, так и для оптимальных политик, обеспечивая количественную оценку неопределенности политики, что полезно для байесовского анализа компромисса между исследованием и эксплуатацией. Мы тестируем метод на симуляционном исследовании адаптивной рандомизации в клинических испытаниях, где закрытые формы постериоров позволяют провести валидацию. Дополнительные эксперименты рассматривают ситуации, когда постериор не имеет закрытой формы, и демонстрируют онлайн-обновление политики на основе постериорного распределения оптимальной политики.

Краткое резюме

Предложен новый алгоритм LF-IBIS для байесовского обучения с подкреплением, который позволяет обновлять убеждения агента в режиме онлайн без необходимости в явной функции правдоподобия. Он применим в сложных реальных условиях, где традиционные методы ограничены.

Практический вывод

Алгоритм LF-IBIS может быть полезен для принятия решений в условиях нехватки данных, позволяя улучшить исследование и эксплуатацию в таких задачах, как клинические испытания.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. Основными ограничениями метода LF-IBIS являются необходимость в качественной и количественной оценке предварительных знаний об окружении, а также возможные сложности в обновлении постериорного распределения в реальных сценариях обработки данных.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Медицина
Медицина
95%

Мнения сообщества о важности, обращении за помощью и реализации программы профилактики кератита в Непале: исследование с использованием смешанных методов.

Программа профилактики кератита обучила Женщин-волонтёров здравоохранения (FCHVs) диагностировать и лечить корневые травмы в Непале. Для понимания поведения в отношении обращения за уходом за глазами, осведомленности о программе и восприятия программы. Это исследование с использованием смешанных методов проводилось в сообществах программы. Опросы оценивали осведомленность в случайной выборке 10-20 домохозяйств на сообщество через 6 и 18 месяцев после начала программы. Обсуждения в фокус-группах (FGDs) с членами сообщества и FCHVs исследовали поведение обращения за помощью и восприятие через 9 месяцев. Шесть сообществ были выбраны случайным образом для FGDs, и в каждом из них была случайно выбрана выборка из 10 мужчин и 10 женщин для участия. FCHVs из этих сообществ участвовали отдельно. Интервенция была изменена на основе FGD перед финальным опросом. Предварительный опрос перед FGD показал, что 3,1% (SD 7,2%) участников были осведомлены о программе. Все 13 FGDs (92 участника) указали на то, что травмы глаз и задержки в обращении за помощью являются обычными. Участники только из четырех FGDs сообщили об осведомленности о программе FCHV, хотя участники из всех FGDs выразили желание обратиться за уходом за глазами к FCHVs. Поскольку FGDs выявили, что сарафанное радио и акции «от двери к двери» являются эффективными подходами к публичности, были внедрены две акции «от двери к двери». Опросы домохозяйств через 9 месяцев после FGDs показали, что осведомленность о программе возросла до 32,9% (SD 26%, значение p <0,001). FGDs показали, что травмы глаз и задержки в обращении за помощью являются обычными, подчеркивая необходимость устранения барьеров для своевременной помощи. Стратегии вовлечения сообщества, выявленные во время FGDs, были успешно реализованы. Осведомленность о программе значительно выросла после FGDs, хотя причинно-следственная связь не может быть установлена в этом наблюдательном исследовании.

Медицина
Медицина
92%

FaithMed: Обучение ЛЛМ для надежного доказательного медицинского рассуждения

Верное рассуждение имеет важное значение в медицине, где клинические решения требуют прозрачного обоснования, основанного на надежных доказательствах. Текущие медицинские крупные языковые модели либо не имеют активного доступа к доказательствам, либо используют извлеченные доказательства, не контролируя, как их следует оценивать и применять в процессе рассуждений. Чтобы решить эту проблему, мы формализуем принципы доказательной медицины как критерии на уровне процесса и представляем FaithMed — структуру, которая сочетает в себе разработанные клиницистами автоматически уточняемые рубрики с методом обучения с подкреплением, используя назначение вознаграждения на уровне процесса и группировку преимуществ. В семи медицинских тестах FaithMed показывает улучшения по сравнению с базовыми моделями агентного поиска (+9% в среднем) и методом обучения с подкреплением, ориентированным только на результат (+5.8%), при этом повышая средние показатели рубрик доказательной медицины по сравнению с базовыми моделями агентного поиска Qwen3 (+15.5%). Эта работа демонстрирует, что явный контроль на уровне этапов может улучшить как успешность выполнения задачи, так и верность процесса рассуждения. Код доступен по адресу https://github.com/cxcscmu/FaithMed.

Медицина
Медицина
82%

Предсказание ранних стадий болезни Альцгеймера и выявление ключевых биомаркеров с использованием глубоких искусственных нейронных сетей и ансамбля методологий машинного обучения

Болезнь Альцгеймера (БА) – это расстройство мозга, которое развивается медленно и в основном затрагивает память, мышление, язык и повседневную деятельность. Это одно из самых распространенных причин деменции и создает множество трудностей как для пациентов, так и для их семей. На ранней стадии симптомы часто слабо выражены и могут напоминать нормальное старение. По этой причине многие люди получают диагноз слишком поздно, когда болезнь уже прогрессирует. В настоящее время полного лекарства от БА не существует. Тем не менее, ранняя диагностика может помочь врачам лучше управлять состоянием пациента и предпринять необходимые шаги вовремя. В этом исследовании предлагается модель машинного обучения для определения ранних стадий болезни Альцгеймера на основе клинических данных, результатов нейропсихологических тестов и мер, связанных с нейровизуализацией. Данные, использованные в работе, собраны из Инициативы по нейровизуализации болезни Альцгеймера (ADNI). Поскольку в наборе данных есть пропущенные значения, применяется итеративная импутация для их заполнения. Набор данных также имеет несбалансированные классы, что решается с помощью метода Borderline SVM-SMOTE. Затем проводится отбор признаков с использованием оберток и встраиваемых методов, чтобы использовать только важные признаки для обучения. Выбранные признаки делятся на обучающие и тестовые наборы, и применяется масштабирование признаков. Разрабатывается ансамблевая модель стекового обучения с использованием логистической регрессии, Extra Trees, Bagging KNN и LightGBM в качестве базовых классификаторов. Кроме того, также обучается искусственная нейронная сеть на том же наборе данных. Эффективность этих моделей сравнивается по таким метрикам, как точность, полнота, F1-меры и AUC-ROC. Цель этого исследования состоит в том, чтобы найти лучший классификатор и выявить важные биомаркеры, которые могут помочь в ранней диагностике болезни Альцгеймера.

Медицина
Медицина
82%

Улучшение классификации ультразвуковых изображений через структуру с двумя ветвями, ориентированную на атрибуты

Классификация ультразвуковых изображений имеет важное значение для компьютерной диагностики. Однако современные методы часто игнорируют клинические приоритеты, что приводит к плохой обобщаемости в сложных сценариях и отсутствию интерпретируемости, что ограничивает клиническое применение. Чтобы решить эти проблемы, мы нацелены на разработку модуля медицинских приоритетов, который можно бесшовно интегрировать в существующие конвейеры для повышения как диагностической эффективности, так и интерпретируемости. В данной статье мы предлагаем двухветвевую структуру классификации ультразвука, основанную на атрибутах, которая вводит независимые от домена медицинские атрибуты-приоритеты, улучшая обобщаемость и предоставляя интерпретируемые доказательства. В частности, базовая ветка следует традиционным архитектурам и предсказывает категории изображений с помощью полностью связанного классификатора. Ветка, ориентированная на атрибуты, вводит независимые от домена атрибуты в качестве приоритетов и производит интерпретируемые человеком подсказки для принятия решений. Наконец, адаптивный модуль принятия решений объединяет две ветви в зависимости от данных для получения окончательного предсказания. Эксперименты по различным задачам классификации ультразвука демонстрируют, что наш подход можно интегрировать в несколько основных и современных методов с низкими накладными расходами, постоянно улучшая точность и интерпретируемость.

Медицина
Медицина
77%

Метастазирование лейомиосаркомы матки в желудок, выявленное во время эндоскопического наблюдения и резектированное с помощью эндоскопической подслизистой диссекции после множественных метахронных метастазов: клинический случай.

Лейомиосаркома матки (uLMS) является редким, агрессивным злокачественным новообразованием матки, которое обычно метастазирует гематогенно, в то время как желудочно-кишечное вовлечение встречается редко. 69-летняя женщина с диагнозом uLMS, прошедшая лечение в виде гистерэктомии и адъювантной химиотерапии, развила метахронные метастазы в легкие, сигмовидную кишку, желчный пузырь и стенку живота. После лечения этих метастазов периодическое эндоскопическое наблюдение выявило субэпителиальную опухоль размером 15 мм с неглубокой центральной депрессией в нижней части желудка. Эндоскопическая ультрасонография показала четко очерченное подслизистое образование без инвазии мышечной оболочки, а биопсия подтвердила метастатическую лейомиосаркому. Была проведена эндоскопическая подслизистая диссекция (ESD), которая позволила выполнить резекцию en bloc без adverse событий. Эта редкая метахронная комбинация желудочных, колонических и желчнопузырных метастазов подчеркивает, что случайное метастазирование в желудок может происходить на протяжении длительного течения заболевания и предполагает, что ESD может быть полезной минимально инвазивной опцией для локального контроля небольших желудочных метастазов.

Медицина
Медицина
77%

Консенсус и климат обучения в временных и постоянных командах в процессе командного обучения.

В командном обучении студенты, как правило, размещаются в фиксированных командах, основываясь на идее, что стабильное членство в группе способствует сотрудничеству: по мере того как члены команды узнают друг друга, они делятся большей информацией, решают разногласия и чувствуют мотивацию вносить вклад. Однако данная логика не была протестирована в рандомизированном контролируемом исследовании. В данном исследовании сравнивается командное обучение во временных командах с постоянными командами по показателям индивидуальной и командной уверенности (iRAT, tRAT), достижению консенсуса команды, климату обучения и внутренней мотивации. В рандомизированном контролируемом испытании студенты первого курса медицинского факультета были распределены либо по постоянным TBL-командам, либо в команды, которые перераспределялись для каждой задачи. Голосование по тесту уверенности команды (tRAT), submitted индивидуально и конфиденциально, служило косвенным показателем консенсуса команды (согласованные и несогласованные голоса tRAT). Несогласованные tRAT (268, 11.8% всех голосов) подавались чаще в временных, чем в постоянных командах, как для правильных, так и для неправильных решений большинства. Самооценка климата обучения была более кооперативной в постоянных командах, чем в временных, в то время как внутренняя мотивация и результаты tRAT были схожими для обоих типов команд. Плохой климат обучения был связан с более высокой долей несогласованных tRAT. Работа в временных командах не приводит к ухудшению внутренней мотивации; это также ранее было показано для получения знаний. Однако плохой климат обучения вместе с меньшей частотой достижения консенсуса может указывать на то, что, по крайней мере, некоторые члены временных команд чувствуют себя недостаточно оценёнными в обсуждении и не принимают решение большинства. С помощью учебных стратегий, способствующих кооперативному климату обучения в временных командах, предварительные TBL-курсы могут служить ранним формирователем отношений командных компетенций, необходимых для последующего обучения на клиническом рабочем месте в временных командах.