МедицинаarXivScience Morning3 мин чтенияpreprint

CLAP: Замкнутая система контроля обучения, оценки и выпуска агентов доменной области после обучения

CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

Рубрика
Медицина
Источник
arXiv
Дата
02.07.2026
Автор
Science Morning
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Медицина

Краткое резюме

Статья представляет метод CLAP, который преобразует бизнес-данные в структурированные образцы для более эффективного анализа и оценки агентов доменной области после их обучения.

Практический вывод

Методология CLAP помогает более надежно управлять адаптерами в бизнес-приложениях, минимизируя риски и улучшая точность анализа данных.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. Некоторые пакеты показали регресс, а высокая вероятность рисков KL требует дальнейшего изучения. Результаты не являются универсальными и могут варьироваться в зависимости от конкретного применения.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Медицина
Медицина
100%

FaithMed: Обучение ЛЛМ для надежного доказательного медицинского рассуждения

Верное рассуждение имеет важное значение в медицине, где клинические решения требуют прозрачного обоснования, основанного на надежных доказательствах. Текущие медицинские крупные языковые модели либо не имеют активного доступа к доказательствам, либо используют извлеченные доказательства, не контролируя, как их следует оценивать и применять в процессе рассуждений. Чтобы решить эту проблему, мы формализуем принципы доказательной медицины как критерии на уровне процесса и представляем FaithMed — структуру, которая сочетает в себе разработанные клиницистами автоматически уточняемые рубрики с методом обучения с подкреплением, используя назначение вознаграждения на уровне процесса и группировку преимуществ. В семи медицинских тестах FaithMed показывает улучшения по сравнению с базовыми моделями агентного поиска (+9% в среднем) и методом обучения с подкреплением, ориентированным только на результат (+5.8%), при этом повышая средние показатели рубрик доказательной медицины по сравнению с базовыми моделями агентного поиска Qwen3 (+15.5%). Эта работа демонстрирует, что явный контроль на уровне этапов может улучшить как успешность выполнения задачи, так и верность процесса рассуждения. Код доступен по адресу https://github.com/cxcscmu/FaithMed.

Медицина
Медицина
95%

Консенсус и климат обучения в временных и постоянных командах в процессе командного обучения.

В командном обучении студенты, как правило, размещаются в фиксированных командах, основываясь на идее, что стабильное членство в группе способствует сотрудничеству: по мере того как члены команды узнают друг друга, они делятся большей информацией, решают разногласия и чувствуют мотивацию вносить вклад. Однако данная логика не была протестирована в рандомизированном контролируемом исследовании. В данном исследовании сравнивается командное обучение во временных командах с постоянными командами по показателям индивидуальной и командной уверенности (iRAT, tRAT), достижению консенсуса команды, климату обучения и внутренней мотивации. В рандомизированном контролируемом испытании студенты первого курса медицинского факультета были распределены либо по постоянным TBL-командам, либо в команды, которые перераспределялись для каждой задачи. Голосование по тесту уверенности команды (tRAT), submitted индивидуально и конфиденциально, служило косвенным показателем консенсуса команды (согласованные и несогласованные голоса tRAT). Несогласованные tRAT (268, 11.8% всех голосов) подавались чаще в временных, чем в постоянных командах, как для правильных, так и для неправильных решений большинства. Самооценка климата обучения была более кооперативной в постоянных командах, чем в временных, в то время как внутренняя мотивация и результаты tRAT были схожими для обоих типов команд. Плохой климат обучения был связан с более высокой долей несогласованных tRAT. Работа в временных командах не приводит к ухудшению внутренней мотивации; это также ранее было показано для получения знаний. Однако плохой климат обучения вместе с меньшей частотой достижения консенсуса может указывать на то, что, по крайней мере, некоторые члены временных команд чувствуют себя недостаточно оценёнными в обсуждении и не принимают решение большинства. С помощью учебных стратегий, способствующих кооперативному климату обучения в временных командах, предварительные TBL-курсы могут служить ранним формирователем отношений командных компетенций, необходимых для последующего обучения на клиническом рабочем месте в временных командах.

Медицина
Медицина
95%

EpiControl: инструмент на основе данных для оптимизации вмешательств в эпидемии и автоматизации планирования сценариев для поддержки оперативного ответа

Принятие решений относительно мер контроля за вспышками заболеваний представляет собой сложную задачу, поскольку доступные данные несовершенны, а эффекты вмешательства неопределенны. Сложные модели заболеваний могут моделировать экономические и медицинские последствия вмешательства, однако значительные требования к данным или вычислительным ресурсам в сочетании со специальными знаниями, необходимыми для калибровки, ограничивают их применение в реальном времени. Существуют более простые, быстрые и универсальные инструменты, но, как правило, они лишь оценивают или прогнозируют динамику передачи при заданных предположениях. Мы представляем EpiControl, гибкий инструмент (на языке R) для моделирования общественного здравоохранения, который поддерживает принятие решений и подстраивает полу-механистические модели под рутинные данные, используя управление с обратной связью и обучение на основе моделей, чтобы сбалансировать сложное моделирование политики с реакцией в реальном времени. EpiControl генерирует сценарии вмешательства, которые автоматически обновляются в соответствии с развивающейся динамикой, минимизируют затраты, соответствуют установленным пользователем целям политики (например, подавление пиков эпидемий) и остаются устойчивыми к непредвиденным изменениям. Используя примеры на основе вируса Эбола и COVID-19, мы показываем, как EpiControl может быстро находить оптимальные политики вмешательства, которые предотвращают перегрузку больниц, сокращают общественные потрясения и сохраняют контроль, несмотря на неопределенности в иммунитете, вакцинациях и динамике вариаций патогенов.

Медицина
Медицина
92%

Предсказание ранних стадий болезни Альцгеймера и выявление ключевых биомаркеров с использованием глубоких искусственных нейронных сетей и ансамбля методологий машинного обучения

Болезнь Альцгеймера (БА) – это расстройство мозга, которое развивается медленно и в основном затрагивает память, мышление, язык и повседневную деятельность. Это одно из самых распространенных причин деменции и создает множество трудностей как для пациентов, так и для их семей. На ранней стадии симптомы часто слабо выражены и могут напоминать нормальное старение. По этой причине многие люди получают диагноз слишком поздно, когда болезнь уже прогрессирует. В настоящее время полного лекарства от БА не существует. Тем не менее, ранняя диагностика может помочь врачам лучше управлять состоянием пациента и предпринять необходимые шаги вовремя. В этом исследовании предлагается модель машинного обучения для определения ранних стадий болезни Альцгеймера на основе клинических данных, результатов нейропсихологических тестов и мер, связанных с нейровизуализацией. Данные, использованные в работе, собраны из Инициативы по нейровизуализации болезни Альцгеймера (ADNI). Поскольку в наборе данных есть пропущенные значения, применяется итеративная импутация для их заполнения. Набор данных также имеет несбалансированные классы, что решается с помощью метода Borderline SVM-SMOTE. Затем проводится отбор признаков с использованием оберток и встраиваемых методов, чтобы использовать только важные признаки для обучения. Выбранные признаки делятся на обучающие и тестовые наборы, и применяется масштабирование признаков. Разрабатывается ансамблевая модель стекового обучения с использованием логистической регрессии, Extra Trees, Bagging KNN и LightGBM в качестве базовых классификаторов. Кроме того, также обучается искусственная нейронная сеть на том же наборе данных. Эффективность этих моделей сравнивается по таким метрикам, как точность, полнота, F1-меры и AUC-ROC. Цель этого исследования состоит в том, чтобы найти лучший классификатор и выявить важные биомаркеры, которые могут помочь в ранней диагностике болезни Альцгеймера.

Медицина
Медицина
90%

Многоцелевые агенты с рекуррентной памятью

Рекуррентные агенты памяти расширяют возможности больших языковых моделей (LLM) для работы с произвольно длинными контекстами, последовательно консолидируя вводимые данные в фиксированное пространство памяти. Несмотря на свою масштабируемость, эти агенты демонстрируют хорошо документированную проблему надежности: общая производительность ухудшается систематически с увеличением длины контекста. Мы диагностируем это падение производительности, разбивая её на два фактора — захват памяти и сохранение памяти — и количественно подтверждаем, что именно сохранение является доминирующим узким местом. Сохранение рушится из-за того, что существующие конструкции поддерживают память как монолитный текстовый блок, что ставит под угрозу каждое обновление, рискуя перезаписать ранее сохраненное содержимое. Учитывая эту диагностику, мы предлагаем Многоцелевую Рекуррентную Память (MHM), общую и не требующую обучения структуру, которая делит память на независимые «головы», управляемые стратегией поэтапного выбора и обновления. На каждом шаге обновляется ровно одна голова, в то время как остальные головы структурно защищены от перезаписи, смещая бремя сохранения из поведения модели на архитектурный дизайн. В качестве легковесной реализации мы вводим MHM на основе принципа «Наименее Недавно Обновлённый» (MHM-LRU), который гарантирует равномерное использование голов с нулевыми дополнительными затратами на токены. Широкие эксперименты на бенчмарках с длинными контекстами показывают, что MHM-LRU значительно улучшает как сохранение информации, так и общую точность в диапазоне от 100K до 1M токенов, где базовые модели резко теряют эффективность. На RULER-HQA при 896K токенов MHM-LRU повышает уровень сохранения памяти с менее чем 30% до 73.96%. Эти достижения обобщаются на различные семейства моделей, масштабирование и типы задач, позиционируя архитектурную оптимизацию как практический и экономичный путь к надежной рекуррентной памяти с длинным контекстом.

Медицина
Медицина
87%

Оценка больших языковых моделей в клиническом управлении пациентами с верхним желудочно-кишечным кровотечением: данные из реальной практики.

Для оценки больших языковых моделей (БЯМ) в предэндоскопической (ПЭ) стратификации риска и предсказании эндоскопических находок при кровотечении из верхних отделов желудочно-кишечного тракта (КВУГЖ), а также для сравнения их эффективности с клиническими шкалами риска, традиционными моделями машинного обучения (МО) и гибридными подходами. Это многоцентровое ретроспективное исследование включало 384 пациента с КВУГЖ, которые прошли эндоскопию. Пять БЯМ были протестированы с использованием структурированных нулевых запросов на основе клинических и лабораторных данных ПЭ. Их эффективность в выявлении пациентов с высоким риском была сопоставлена с шкалой Глазго-Блэтчфорда (GBS), AIMS65, шкалой Рокалла для ПЭ и моделями МО. Также были оценены гибридные модели БЯМ-шкала. Два гастроэнтеролога оценили качество обоснований, сгенерированных БЯМ. GBS показала наилучшие дискриминационные показатели среди клинических шкал (площадь под кривой операционной характеристикой [AUROC] 0.73). Среди БЯМ GPT-5 достиг наивысшей точности (0.66), в то время как Grok продемонстрировала наилучшие сбалансированные показатели (0.59; F1 0.47). Gemini-2.5-Flash имела наивысшую чувствительность (0.89), но низкую специфичность (0.21). Эндоскопические предсказания имели скромную производительность, при этом Gemini-2.5-Flash достигла наивысшей точности точного соответствия (0.34) и микро-F1 (0.38). Гибридные модели улучшили результаты по сравнению с отдельными БЯМ, но не превзошли GBS (лучший: GBS+GPT-5, AUROC 0.67). БЯМ показали более высокие численные показатели по сравнению с традиционными моделями МО, но статистическое сравнение было невозможно из-за отсутствия данных на уровне экземпляров. Grok получила наивысший балл человеческой оценки за качество объяснений. БЯМ показали умеренное качество в стратификации риска КВУГЖ и предсказании эндоскопии, но уступили клиническим шкалам, особенно GBS. Гибридные модели немного улучшили показатели по сравнению с отдельными БЯМ, но не превзошли GBS, поддерживая их использование как вспомогательных инструментов, а не систем поддержки клинического решения.