МедицинаmedRxivScience Morning3 мин чтенияpreprint
Интеграция данных о генетике, окружающей среде, когнитивных способностях и темпераменте для прогнозирования СДВГ с использованием объяснимых моделей глубокого обучения
Integrating Genetic, Environmental, Cognitive, and Temperament Data for ADHD Prediction in Explainable Deep Learning Models
Карточка статьи
Рубрика
Медицина
Источник
medRxiv
DOI
10.64898/2026.06.29.26356796
Дата
01.07.2026
Автор
Science Morning
Время чтения
3 мин
Это предварительная публикация, она не прошла научное рецензирование.
Аннотация
Цель: Расстройство дефицита внимания и гиперактивности (СДВГ) является клинически и этиологически гетерогенным, и диагностические решения могут выиграть от интеграции нескольких источников информации. Мы разработали подход объяснимого глубокого обучения, чтобы проверить, могут ли генетические, экологические, когнитивные, демографические и темпераментные данные классифицировать диагностику СДВГ и выявить факторы, способствующие принятию решений модели. Метод: Мы проанализировали участников когорты Oregon ADHD-1000, разделенных на тренировочные, валидационные и тестовые подмножества. Мы обучили модульные нейронные сети для классификации статуса случая-контроля СДВГ с использованием данных генотипа на уровне SNP с биологическими аннотациями, полигенных баллов, демографических данных, конфликтов в родительско-семейной среде, стресса и травмы, геокодированных мер, когнитивных задач, баллов темперамента и индикаторов отсутствия данных. Оптимизация гиперпараметров выбрала архитектуру модели и включение блоков признаков. Мы оценили производительность модели, используя AUC, кривые точности и полноты, анализы калибровки и предсказательной определенности, а также анализ кривой решений. Мы использовали интегрированные градиенты для количественной оценки важности на уровне блока, признака и индивидуальной важности признаков. Результаты: Лучшая модель, использующая черты темперамента, показала AUC 0.97 в удержанном тестовом подмножестве, с высокой точностью, чувствительностью и специфичностью и Brier score 0.06. Лучшая модель, исключающая темперамент, имела AUC 0.75. Анализы важности признаков подчеркнули важность темперамента, демографических и когнитивных доменов в модели, включающей темперамент. Индивидуализированные объяснения показали, что факторы предсказания варьировались между участниками и могли помочь выявить противоречивые или поддерживающие доказательства в различных доменах. Заключение: Объяснимые многомодальные классификационные модели могут интегрировать гетерогенную информацию, релевантную СДВГ, и выявлять признаки, которые способствуют индивидуальным прогнозам. Такие модели могут продвинуть исследования риск-моделирования СДВГ и поддерживать принятие решений клиницистами, особенно в сложных или диагностически неопределенных случаях.
Краткое резюме
В ходе исследования была разработана объяснимая модель глубокого обучения для прогнозирования расстройства дефицита внимания и гиперактивности (СДВГ) с использованием интегрированных данных о генетике, окружающей среде, когнитивных способностях и темпераменте. Модель показала высокую точность классификации и выявила ключевые факторы, влияющие на прогнозы.
Практический вывод
Исследование демонстрирует, что интеграция различных источников данных может улучшить диагностику СДВГ и предоставить ценные направления для поддержки принятия решений врачами.
Ограничения
Это предварительная публикация, она не прошла научное рецензирование. В исследовании используются данные только одной когорты, что может ограничить обобщаемость результатов. Требуются дополнительные исследования для проверки подхода на более широких и разнообразных популяциях.
Быстрые диагностические тесты (БДТ) поддерживают доступную диагностику заболеваний. Машинное обучение (МО) может улучшить интерпретацию БДТ, но часто полагается на большие, собственные и дорогостоящие библиотеки изображений из реального мира. Мы представляем SynSight - конвейер сегментации и классификации БДТ на основе МО, обученный на синтетических данных. Валидация проводилась на БДТ для ВИЧ (98% чувствительность, 99% специфичность) и COVID-19 (до 99% точности), SynSight позволяет быстро обучать МО без использования реальных обучающих изображений, успевая за развитием новых БДТ.
Цель: Разработать и оценить базу данных о раке простаты, стандартизированную в соответствии с Обсервационным партнерством медицинских исходов (OMOP), из Электронной медицинской карты (ЭМК) Epic Университета Техаса в Медицинском центре (UTMB), и улучшить качество данных с помощью обработки естественного языка (NLP) и алгоритмов на основе антигена простаты (PSA).
Материалы и методы: Мы построили конвейер данных для преобразования данных ЭМК UTMB Epic (2010-2021) в Общую модель данных OMOP (CDM) версии 5.4. Качество данных оценивалось путем сравнения стандартизированных данных OMOP с данными Регистра рака Гальвестона с использованием согласия по доступности, коэффициента Каунта и внутриклассовой корреляции. NLP использовалась для извлечения PSA, оценки Глисон и стадии рака из клинического текста, а алгоритмы на основе PSA использовались для выявления отсутствующего лечения и биохимического рецидива.
Результаты: Мы извлекли 815 аналитических случаев из ЭМК UTMB. Из них 700 (85,9%) были полными и согласованы с регистром рака. PSA показал отличное согласие значений. Структурированные данные по оценке Глисон и стадии были разряженными (n<20), но NLP значительно улучшила их захват. Согласие по лечению было хорошим по сравнению с регистром рака и незначительно улучшилось для радикальной простатэктомии после применения алгоритма на основе PSA. Используя траектории PSA, мы выявили 60 случаев биохимического рецидива.
Обсуждение: Стандартизированные данные OMOP из UTMB показали хорошее согласие с регистром рака. Однако структурированные поля ЭМК неполностью фиксировали данные о диагнозе, патологии и лечении. NLP и алгоритмы на основе PSA существенно улучшили захват данных. Ручной обзор также выявил ошибки в данных регистра, показывая, что стандартизированные данные ЭМК OMOP могут дополнить и помочь улучшить качество регистра рака.
Заключение: Стандартизация OMOP в сочетании с NLP и алгоритмами на основе PSA улучшила качество данных о раке простаты и готовность к исследованию.
Для клинического применения крайне важно, чтобы автоматизированные диагностические системы оставались надежными при столкновении с ранее не виденными случаями. Однако глубокие модели регулярно неверно классифицируют данные вне распределения (OOD) с высокой уверенностью, подчеркивая необходимость более надежных методов детекции OOD. Хотя значительные усилия были направлены на улучшение устойчивости моделей, большинство существующих исследований предполагает сбалансированные наборы данных, оценивает детекцию OOD на грубых или неклинических источниках OOD или недостаточно всесторонне анализирует различные сценарии OOD. Чтобы восполнить эти пробелы, мы предлагаем новую методологию, обученную на разнообразных и несбалансированных медицинских наборах данных и оцененную на клинически репрезентативном спектре OOD. Наша структура включает три ключевых компонента: (1) нелинейный классификатор von Mises-Fisher (NvMF), способный изучать нелинейные границы решений, с теоретическим доказательством его асимптотической связи с косинусными классификаторами; (2) многопрофильная структура, в которой классификаторы NvMF, учитывающие границу, специализируются на разных областях распределения меток для лучшей обработки несбалансированности; и (3) эксперт по выбросам, специально обученный для различения инлайеров и аутлайеров, тем самым укрепляя детекцию OOD. Оценка на наборах данных RFMiD, ISIC2019 и NCTCRC демонстрирует постоянные улучшения по сравнению с передовыми методами, достигая средних уменьшений FPR95 на 8,45%, 13,02% и 36,90% соответственно. Эти достижения дополнительно поддерживаются всесторонними абляциями, которые подтвердили вклад каждого компонента. Это позволяет надежно идентифицировать незнакомые случаи для передачи клиницистам, поддерживая более безопасную диагностику с использованием искусственного интеллекта в реальных рабочих процессах. Наш код доступен по адресу https://github.com/redboxup/MARVEL.
Исследования внешней валидации имеют конечный размер выборки, что создает неопределенность относительно того, превышает ли чистая выгода (ЧВ) модели прогнозирования ЧВ базовых стратегий. Ожидаемая цена идеальной информации (ОПИ) quantifies последствия неопределенности. Текущие методы ОПИ фокусируются на одиночных исследованиях, игнорируя гетерогенность между центрами. Мы расширяем ОПИ и ожидаемую цену частичной идеальной информации (ОПЧИ), чтобы учесть гетерогенность между кластерами в многокцентровых исследованиях и метаанализах. Мы различаем глобальную и локальную оптимальную стратегию, а также наблюдаемые и ненаблюдаемые кластеры. Мы определяем ОПИглобальная, ОПИкластер_j, ОПИкластер и ОПЧИкластер,преобладание, реализованные в R-пакете MetaNB, и иллюстрируем их с помощью систематического обзора, проведенного в 36 центрах, по модели ADNEX для диагностики рака яичников. Предполагая одно глобальное решение по принятию ADNEX, нет необходимости в дополнительных данных для подтверждения, что ADNEX является превосходящим в целом (ОПИглобальная 0). Метаанализ заимствует информацию из наблюдаемых кластеров, что приводит к последовательному локальному превосходству ADNEX и ненулевому, но обычно более низкому ОПИкластер_j, чем при учете только локальных данных. Вероятность того, что базовые стратегии превосходят в ненаблюдаемых центрах, составляет 0.03. Устранение неопределенности в производительности и преобладании в каждом кластерном (ОПИкластер) дало бы 1134 чистых избегнутых ложноположительных результатов (ЛП) в год, предполагая 350000 опухолей ежегодно с 20% злокачественностей. Определение только локального преобладания с уверенностью (ОПЧИкластер, преобладание) дало бы 158 чистых избегнутых ЛП в год. Расширения ОПИ распутывают источники неопределенности и количественно оценивают необходимость дальнейшей валидации для определения глобальной или локально оптимальной стратегии. Учет неопределенности и гетерогенности в клинической полезности между кластерами имеет решающее значение для принятия решения о необходимости дополнительных валидационных исследований.
Обучение с подкреплением (RL) — это метод принятия решений в последовательных задачах, при котором агент обучается оптимальным политикам через взаимодействие с окружающей средой, максимизируя кумулятивные вознаграждения. Среди методов RL байесовское обучение с подкреплением (BRL) решает распространенные практические задачи, связанные с нехваткой данных, используя предварительные знания об окружении и последовательные обновления убеждений. Тем не менее, большинство подходов BRL требуют явной функции правдоподобия, которая часто недоступна или сложна для решения в реальных условиях. Мы предлагаем алгоритм, не требующий вычисления правдоподобия, — Итеративная Выборка Параметров Важности без Явного Правдоподобия (LF-IBIS), который обновляет убеждения агента в режиме онлайн по мере появления новых взаимодействий. Сочетая приближенные байесовские вычисления с итеративной выборкой параметров важности, LF-IBIS позволяет проводить полное байесовское вывод в условиях, когда динамика окружения не описана явным или управляемым правдоподобием. Метод предоставляет приближенные постериорные распределения как для параметров окружения, так и для оптимальных политик, обеспечивая количественную оценку неопределенности политики, что полезно для байесовского анализа компромисса между исследованием и эксплуатацией. Мы тестируем метод на симуляционном исследовании адаптивной рандомизации в клинических испытаниях, где закрытые формы постериоров позволяют провести валидацию. Дополнительные эксперименты рассматривают ситуации, когда постериор не имеет закрытой формы, и демонстрируют онлайн-обновление политики на основе постериорного распределения оптимальной политики.
Фон. Вспышка вируса Бундиbugyo Эбола в Уганде в 2026 году, связанная с текущей эпидемией в Демократической Республике Конго (ДРК), распространилась благодаря человеческой мобильности через границы и внутри страны. Мы ставили цель количественно оценить модели импорта и распространения, чтобы обеспечить целенаправленные интервенции на субнациональном уровне.
Методы. Мы построили сеть мобильности с направленным взвешиванием на основе данных Миграционной организации (IOM) о перемещении населения с 15 по 24 мая 2026 года (обнаружено 11,245 перемещений) и данных переписи населения Уганды 2024 года (45.9 миллионов человек). Была смоделирована стохастическая метапопуляционная модель SEIR, учитывающая предсимптоматическую передачу и перемещение контактных и инфекционных лиц, на протяжении 90 дней по 135 округам Уганды и двум провинциям ДРК. Реакцию 7-1-7 было явно смоделировано с динамическим охватом отслеживания контактов (40%[->]70%[->]85%). Мы оценили три сценария соблюдения (20%, 40%, 60%) для ненаркотических интервенций. Глобальный анализ чувствительности Соболя (500 выборок, 200 бутстрэппинг) выявил ключевые параметры, определяющие размер вспышки.
Результаты. Сеть мобильности была разреженной (плотность 0.11), очень неравномерной (коэффициент Джини 0.67) и модульной (модулярность 0.5). Округ Кисоро имел наибольший риск импорта (входящая сила 3,823) и риска экспорта (исходящая сила 1,350), в то время как Кампала показала значительную входящую силу (1,290), но меньшую исходящую силу (150). В рамках сценария сдерживания (эффективное R = 0.35) модель прогнозировала медиану 22 кумулятивных случаев (95% CrI: 22-24) и 2 смерти (95% CrI: 2-4) в Кампале за 90 дней. Во всех остальных 134 округах медиана составила 0 случаев. Ненаркотические интервенции при высоком, среднем и низком соблюдении не дали статистически значимого снижения числа случаев (22 случая по всем сценариям). Суперраспространительные события происходили в 34.6-40.6% симуляций. Анализ чувствительности Соболя выявил инфекционный период (первый порядок 0.838), летальность случаев (0.738) и основной коэффициент рождаемости (0.664) как наиболее влиятельные параметры; параметры, связанные с мобильностью, имели значительно более низкие индексы общего порядка. Реакция 7-1-7 сама по себе, как ожидалось, сдержит вспышку вируса Эбола Бундиbugyo до примерно 22 случаев и 2 смерти в Кампале, при этом дополнительные ненаркотические интервенции не обеспечат значимого добавочного эффекта. Ресурсы следует сосредоточить на целенаправленном наблюдении в высокорискованных центрах импорта (Кисоро для пограничного контроля) и внутриэпидемических центрах (Кампала для ресурсов реагирования), а не на ненаправленных национальных интервенциях. Инвестиции в быструю характеристику специфических штаммов биологических параметров могут повысить предсказательную точность.
Финансирование. Отсутствует.
Контекст исследования. Доказательства перед этим исследованием. Мы искали в PubMed и новостях Всемирной организации здравоохранения (Служба новостей о вспышках заболеваний от 19 мая 2026 года) исследования моделирования вспышек вируса Бундиbugyo с использованием терминов "Bundibugyo", "ebolavirus", "spillover", "cross-border" и "stochastic model". Предыдущие вспышки в Уганде (2007-08; 131 подтвержденный случай, 42 смерти) и в ДРК (2012; 38 подтвержденных случаев, 13 смертей) показывали более низкую восприимчивость и коэффициент летальности, чем в случае вируса Эбола Заира, с оценками основного коэффициента рождаемости от 1.2 до 2.6. Вспышка вируса Эбола Заира в Норте Киву и Итури в 2018-20 годах - вторая по величине вспышка за всю историю, с 3,481 случаем и 2,299 смертями - была значительно осложнена вооруженным конфликтом, недоверием сообществ, плохой инфраструктурой и миграцией населения. Чамба и др. (2026) оценили вероятность импорта для Уганды в 94.2% с использованием стохастической ансамблевой модели, откалиброванной на лабораторно подтвержденные случаи. Однако ни одно опубликованное исследование не интегрировало данные о перемещениях из матрицы отслеживания перемещения (IOM) с эпидемическими прогнозами для предоставления оценок риска импорта и распространения на субнациональном уровне. В реальном времени моделирование сверхвспышек через границу для вируса Бундиbugyo было весьма ограниченным, а отсутствие лицензированной вакцины против вируса Бундиbugyo усложняет стратегии готовности и реагирования.
Одновременно Бангелеса и коллеги проводили исследование по картированию мобильности населения в провинции Итури, используя месячные данные из Flowminder (с марта 2025 по март 2026) и вычислили нормализованный индекс интенсивности мобильности (MII) для всех 340 санитарных зон. Их анализ показал, что провинция Итури имела второй по величине средний MII в стране (25.3), уступая лишь Киншасе (26.6), и в 2.4 раза превышала национальную медиану (10.7). Критически важным является то, что три зоны эпицентра вспышки - Рвампара (MII 68.6, ранг 2), Бунья (MII 62.6, ранг 3) и Могбвалу (MII 49.9, ранг 11) - все превышали 95-й национальный перцентиль (41.4), подчеркивая исключительную связанность затронутых зон.
Дополнительные преимущества этого исследования. В то время как Бангелеса и др. установили макроуровень интенсивности мобильности провинции Итури относительно остальной части ДРК, наше исследование расширяет эту работу, строя направленную, взвешенную сеть мобильности на уровне округов в Уганде, используя данные о перемещениях из матрицы отслеживания перемещения (IOM) (11,245 наблюдаемых перемещений). Мы демонстрируем, что сеть мобильности крайне неравномерна (Джини 0.67) и модульная (модулярность 0.5), при этом Кисоро выступает в качестве основного порта импорта (входящая сила 3,823), а Кампала - как округ с самой высокой нагрузкой (22 медианных случая). Мы также показываем, что реакция 7-1-7 сама по себе вполне вероятно сдержит вспышку до примерно 22 случаев, а дополнительные ненаркотические интервенции не принесут статистически значимого добавленного эффекта. Анализ чувствительности Соболя выявляет инфекционный период (первый порядок 0.838), летальность случаев (0.738) и основной коэффициент рождаемости (0.664) как наиболее влиятельные параметры, что информирует приоритеты целенаправленного сбора данных. Это первое исследование, предоставляющее оперативные рекомендации на уровне округов для реагирования на вспышку вируса Бундиbugyo с использованием данных о мобильности в реальном времени.
Импликации всех доступных доказательств. Планы готовности должны приоритизировать целенаправленное наблюдение в высокорискованных центрах импорта (Кисоро для пограничного контроля) и внутренних эпидемических центрах (Кампала для ресурсов реагирования), а не ненаправленные национальные вмешательства. Исключительная связанность пострадавших зон, обрисованная Бангелеса и др., при том что провинция Итури имеет второй по величине MII в стране, и все три зоны эпицентра превышают 95-й процентиль, делают отслеживание контактов чрезвычайно трудоемким. Отсутствие лицензированной вакцины против вируса Бундиbugyo исключает стратегию вакцинации по кругу, которая была эффективна во всех шести предыдущих вспышках Эболы в ДРК, вызванной вирусом Эбола Заира. Быстрая характеристика специфических штаммов биологических параметров через отслеживание контактов и анализ последовательного интервала может дать большую отдачу, чем уточнение операционных протоколов. Усиленное трансграничное наблюдение в рамках Международных медицинских правил 2005 года и рамок Чрезвычайной общественной безопасности АфриканскогоCDC жизненно важно для гармонизации обнаружения и реагирования по всему тройному границе ДРК-Уганда-Южный Судан.