МедицинаarXivScience Morning3 мин чтенияpreprint

Очищенный OPSD: самодистилляция на основе политики без потери способности мыслить

Purified OPSD: On-Policy Self-Distillation Without Losing How to Think

Рубрика
Медицина
Источник
arXiv
Дата
02.07.2026
Автор
Science Morning
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Медицина

Аннотация

Самодистилляция на основе политики (OPSD) стала перспективной парадигмой для улучшения рассуждений больших языковых моделей (LLM), где привилегированный учитель с доступом к эталонным решениям обеспечивает супервизию на уровне токенов по траекториям, создаваемым студентом. Однако мы обнаружили, что OPSD последовательно не справляется с моделями длительного цепочного рассуждения (long-CoT), давая в лучшем случае незначительные улучшения, при этом дестабилизируя способность к рефлективному рассуждению, на которой зависят эти модели. Посредством нового разложения супервизионного сигнала учителя мы выявили коренную причину: супервизия учителя доминируется компонентом, вызванным эталоном, который приводит к механическому запоминанию конкретных коротких путей, в то время как компонент, зависящий от вопроса и передающий выводы, игнорируется или активно противоречит. Основываясь на этой диагнозе, мы предлагаем двухступенчатое решение. Во-первых, мы создаем учителя только на основе эталона (та же модель, закомпонтованная на эталоне без вопроса), чтобы изолировать непередаваемый компонент супервизионного сигнала; остаток после вычитания этого компонента захватывает коррекцию, зависящую от вопроса и передающую вывод. Во-вторых, мы используем точечную взаимную информацию (PMI) как механизм для преобразования этого остатка в хорошо формируемое распределение целевых значений PMI, из которого студент может непосредственно дистиллировать, отфильтровав короткий путь, вызванный эталоном. Эксперименты над четырьмя моделями long-CoT на двух наборах данных показывают постоянные улучшения как по сравнению с базовой моделью, так и со стандартным OPSD, при этом сохраняя естественное эпистемическое поведение моделей на протяжении всего обучения.

Краткое резюме

Статья обсуждает ограниченность метода самодистилляции на основе политики (OPSD) в контексте моделей длительного цепочного рассуждения. Исследование выявляет, что традиционные подходы приводят к механическому запоминанию вместо глубокого понимания. Предложено новое решение для улучшения эффективности дистилляции без потерь в способности к рассуждению.

Практический вывод

Новое подход к самодистилляции может улучшить качество рассуждений больших языковых моделей, помогая избежать запоминания конкретных торных путей и усиливая способность к глубокому анализу.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. Исследование не охватывает все возможные модели длинных цепочек рассуждений и может ограничиваться специфическими наборами данных. Необходимы дальнейшие исследования для оценки результатов в других контекстах и с различными типами задач.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Медицина
Медицина
95%

Эффективность обучения на основе симуляции в области знаний об оказании неотложной помощи среди интерпрофессиональных сотрудников, участвующих в практике гастроэнтероскопии.

Целью настоящего исследования было оценить эффективность обучения на основе симуляции в улучшении возможностей реагирования на неотложные ситуации во время эндоскопической практики. В обучении участвовали врачи, медсестры, лабораторные технологи и клинические инженеры, работающие в отделении эндоскопии. Программа обучения на основе симуляции использовала смоделированные сценарии и проводилась под руководством сертифицированной медсестры по неотложной помощи. Перед началом обучения, сразу после него и через месяц после завершения занятия были проведены тесты на знание. Результаты тестов сравнивались по временным промежуткам и между профессиональными группами. В исследовании приняли участие двадцать два человека (14 врачей, семь медсестер и один лабораторный технолог). Процент правильных ответов улучшился по всем пунктам сразу после обучения по сравнению с результатами до обучения: правильные сжатия груди (< 0,01), препараты для остановки сердца (< 0,01), препараты для лечения анафилаксии (= 0,13), показания к дефибрилляции (< 0,01), местоположение автоматического внешнего дефибриллятора (AED) (= 0,01) и номер телефона службы экстренной помощи (Code Blue) (< 0,01). Однако через месяц после тренировки большинство показателей вернулись к уровням до обучения, за исключением показаний к дефибрилляции и номера телефона службы экстренной помощи. В анализе подгрупп по профессиям, когда сравнивались процент правильных ответов сразу до и сразу после обучения, врачи продемонстрировали значительные улучшения в местоположении AED (= 0,03) и номере телефона Code Blue (< 0,01), тогда как медсестры показали значительное улучшение в использовании препаратов для остановки сердца (= 0,02). Обучение на основе симуляции эффективно для повышения знаний об оказании неотложной помощи в гастроэнтероскопии. Однако может потребоваться повторное или непрерывное обучение для поддержания этих результатов.

Медицина
Медицина
95%

Эффективность и безопасность доревирина/ислатравира при ВИЧ-1: систематический обзор и мета-анализ рандомизированных контролируемых испытаний, оцененный с использованием метода GRADE.

Сочетание дорнавирина и излатравира (DOR/ISL) является новой схемой из двух лекарств для лечения ВИЧ-1. На ранних этапах разработки возникли трудности, обусловленные дозозависимыми иммунологическими сигналами. Наша цель заключалась в синтезации данных о эффективности и безопасности DOR/ISL во всех категориях с опытом лечения, с особым акцентом на влияние дозы излатравира (0,25 мг против 0,75 мг) на клинические и иммунологические исходы. Мы провели систематический обзор и мета-анализ рандомизированных контролируемых испытаний (РКИ), следуя рекомендациям PRISMA. Мы искали в PubMed, Embase, Cochrane Library и Google Scholar с момента начала до апреля 2026 года. Основными исходами были вирусологическая супрессия (<50 копий/мл) и среднее изменение количества CD4+ T-лимфоцитов на 48-й неделе. Данные объединялись с использованием моделей случайных эффектов. Доза излатравира оценивалась как заранее определенный модератор. Качество данных оценивалось с использованием Cochrane RoB 2.0, а степень уверенности в доказательствах определялась с помощью подхода GRADE. В наш обзор были включены семь РКИ (всего 3 600 участников). На 48-й неделе DOR/ISL показал не менее (RR 1,01 [95% ДИ 0,99-1,02]; p=0,516; доказательства умеренной уверенности) и статистически значительное снижение риска вирусологической неудачи (RR 0,55 [0,33-0,92]; p=0,022) по сравнению с активным контролем. Общий прирост CD4+ был ниже с DOR/ISL (MD -34,55 клеток/мкл; доказательства низкой уверенности); однако был обнаружен значительный модераторный эффект дозы (p<0,0001). Доза 0,75 мг ассоциировалась со значительным снижением CD4+ и лимфоцитов, в то время как одобренная доза 0,25 мг оказалась иммунологически нейтральной. DOR/ISL не приводил к изменениям веса по сравнению с комбинацией биктегравир/эмтрицитабин/тенофовир алафенамид (MD -0,25 кг [-0,66 до 0,16]; доказательства низкой уверенности). DOR/ISL 100/0,25 мг один раз в день достиг вирусологической супрессии, сопоставимой со стандартной терапией ВИЧ, и был связан с более низкими показателями вирусологической неудачи по сравнению с активными сопоставителями. Проблемы с иммуно-логической безопасностью, наблюдавшиеся на ранних испытаниях, были успешно решены путем оптимизации дозы. Эти результаты поддерживают использование DOR/ISL (IDVYNSO) в качестве потенциального варианта лечения как для пациентов без предшествующего лечения, так и для взрослых с подавленной вирусной нагрузкой, подчеркивая необходимость долговременного мониторинга безопасности.

Медицина
Медицина
95%

Как спектральный уклон может повлиять на ожидания результатов тестирования: вторичное моделирование, оценивающее результаты новаторского теста на туберкулёз с использованием мазков среди различных популяций

Фон. Новый тест на основе мазков, предназначенный для ближней диагностики (NPOC), представляет собой потенциально более дешевую и простую альтернативу тестированию методом Xpert MTB/RIF Ultra (Xpert-Ultra) для диагностики туберкулеза (ТБ). Тем не менее, критически важно понять, как их эффективность может различаться среди различных популяций, чтобы информировать о внедрении в программы и принятии клинических решений в реальной практике. Методы. Мы смоделировали работу тестирования мазков мокроты с использованием анализа MiniDock MTB и Xpert MTB/RIF (Xpert), используя положительное процентное согласие (PPA) с Xpert-Ultra, разбитое по полукачественной оценке. PPA для MiniDock MTB была получена на основе метаанализа с эффектами случайных факторов трех исследований точности диагностики. PPA для Xpert была получена из данных раннего диагностического исследования. Оценки PPA были применены к 1248 положительным результатам тестов Xpert-Ultra в рамках Фазы 1 исследования Start4All по семи странам, разбитым по месту набора участников (учреждение (n=1033) и сообщество (n=215)), сравнивая общий PPA с моделью, стратифицированной по полукачественным оценкам Xpert Ultra (от Trace до High). Результаты. Объединенный общий PPA составил 84,8% (95% ДИ: 67,1-93,8%) для MiniDock MTB и 93,1% (90,3-95,2%) для Xpert. Стратифицированное по оценкам моделирование показало более низкие значения PPA.

Медицина
Медицина
95%

Сочетание окситоцина с групповая терапия на основе внимательности снижает негативные симптомы при расстройствах шизофренического спектра: тройное слепое, плацебо-контролируемое, рандомизированное контролируемое клиническое пилотное исследование (OXYMIND)

Фон. Негативные симптомы при расстройствах шизофренического спектра (РШС) остаются недостаточно лечеными и требуют новых терапевтических подходов. Окситоцин может улучшить негативные симптомы, хотя его эффекты, по всей видимости, сильно зависят от контекста в соответствии с гипотезой социальной значимости. Мы провели рандомизированное, тройное слепое, плацебо-контролируемое пилотное исследование, сочетая интраназальный окситоцин с групповой терапией на основе внимательности (ГТВ), предполагая, что положительный социальный контекст ГТВ усилит эффекты, связанные с окситоцином. Методы. 47 участников с РШС (34% женщин) были рандомизированы для получения либо 24 ME окситоцина (ГТВ+ОКТ; n = 26), либо плацебо (ГТВ+ПЛА; n = 21) перед четырьмя сессиями ГТВ. Основным результатом были негативные симптомы, оцененные с помощью подшкалы негативных симптомов Шкалы позитивных и негативных синдромов (PANSS-N) после интервенции и через 4 недели. Вторичными результатами включались Шкала кратких негативных симптомов (BNSS), Шкала самооценки негативных симптомов (SNS) и дополнительные клинические показатели. Линейные смешанные модели оценили эффекты внутри и между группами. Результаты. Общее количество выбытия составило 14,89%, при этом один случай выбытия мог быть связан с лечением. Слепота была успешной. Участники завершили 95,63% сессий. Только группа ГТВ+ОКТ продемонстрировала значительные улучшения в PANSS-N от базового уровня до пост-интервенции (d = -0,74) и на контрольном осмотре (d = -0,77), с небольшим эффектом между группами на контрольном осмотре (d = 0,39). Общая оценка BNSS значительно улучшилась только в группе ГТВ+ОКТ от базового уровня до пост-интервенции (d = -0,88) и на контрольном осмотре (d = -0,91), при этом эффекты между группами были в пользу ГТВ+ОКТ на контрольном осмотре (d = -0,38). Серьезные нежелательные явления не наблюдались. Заключение. Эти данные предполагают, что окситоцин в сочетании с ГТВ может улучшить негативные симптомы при РШС и поддерживают дальнейшие масштабные исследования. Регистрация клинических испытаний: https://clinicaltrials.gov/study/NCT06136390, Регистрационный номер: NCT06136390.

Медицина
Медицина
95%

Программируемая акустическая манипуляция отдельными клетками с помощью обучения без модели

Точное, нев invasive манипулирование отдельными живыми клетками остается центральной задачей в биомедицинских науках, имеющей далеко идущие последствия для анализа отдельных клеток, инженерии тканей и изучения взаимодействий между клетками. В данной работе мы представляем первую демонстрацию управления отдельными клетками с использованием акустической акустофлюидики на основе стоячей волны с замкнутой обратной связью. Мы вводим алгоритм VeLO (векторная локальная оптимизация), основанный на обучении с подкреплением без модели, который позволяет программируемую двумерную манипуляцию отдельными клетками с использованием одного пьезоэлектрического преобразователя. Без предварительной калибровки или физического моделирования VeLO обучает динамику системы в режиме реального времени на основе акустически индуцированных смещений клеток и автоматически адаптируется к нелинейным, изменяющимся условиям. Мы достигаем надежного управления для нескольких типов клеток (DU-145, Jurkat, K-562) и независимой манипуляции несколькими клетками, включая контролируемый контакт между клетками. Сочетая простоту аппаратного обеспечения с автономным, адаптивным управлением, этот подход устанавливает мультимодальную акустофлюидику как универсальный инструмент для безмаркерной, высокоточной манипуляции отдельными клетками.

Медицина
Медицина
95%

Возникновение и сопутствующее распространение вируса обезьяний оспы клады Ia и Ib в Южном Киву, Демократическая Республика Конго, с января по май 2026 года

В сентябре 2023 года были обнаружены первые инфекции новой линии вируса обезьяний оспы в Южном Киву. С тех пор вирус распространился на региональном, национальном и международном уровнях. В рамках непрерывных усилий по пониманию экологии и эпидемиологии обезьяньей оспы, здравоохранение района Южного Киву и партнеры организовали систематический поиск случаев и последующее наблюдение, включая характеристику вариантов вируса с помощью ПЦР и секвенирования. Образцы были собраны у 595 госпитализированных пациентов с подтвержденной инфекцией вирусом обезьяньей оспы. RT-ПЦР, различающий клады, показал, что 545 (92%) образцов были положительными для клады Ib, но также - что инфекции клады Ia были диагностированы впервые в Южном Киву. Первые случаи были выявлены на 7-й неделе в Камитуге, всего за весь период исследования было выявлено 50 случаев (8,40% от всех случаев). Филогенетический анализ первоначальных случаев выявил введения клады Ia в провинцию Южный Киву наряду с продолжающейся вспышкой вируса обезьяньей оспы клады Ib. Эти результаты подчеркивают растущую сложность вспышек вируса обезьяньей оспы клады I в ДРК.