МедицинаmedRxivRogers, E., Turbe, V., Gareta, D., Herbst, C. et al.3 мин чтенияpreprint

Синтетические данные для снижения барьеров на пути к справедливому искусственному интеллекту в интерпретации быстрых диагностических тестов

Synthetic Data to Lower Barriers Towards Equitable Artificial Intelligence in Rapid Diagnostic Test Interpretation

Рубрика
Медицина
Источник
medRxiv
DOI
10.1101/2025.02.25.25322677
Дата
07.07.2026
Автор
Rogers, E., Turbe, V., Gareta, D., Herbst, C. et al.
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Медицина

Аннотация

Быстрые диагностические тесты (БДТ) поддерживают доступную диагностику заболеваний. Машинное обучение (МО) может улучшить интерпретацию БДТ, но часто полагается на большие, собственные и дорогостоящие библиотеки изображений из реального мира. Мы представляем SynSight - конвейер сегментации и классификации БДТ на основе МО, обученный на синтетических данных. Валидация проводилась на БДТ для ВИЧ (98% чувствительность, 99% специфичность) и COVID-19 (до 99% точности), SynSight позволяет быстро обучать МО без использования реальных обучающих изображений, успевая за развитием новых БДТ.

Краткое резюме

SynSight — это новая система, использующая машинное обучение для интерпретации быстрых диагностических тестов, обученная на синтетических данных. Это решение снижает зависимость от дорогих реальных изображений и демонстрирует высокую точность в расшифровке тестов на ВИЧ и COVID-19.

Практический вывод

Использование синтетических данных значительно упрощает и удешевляет процесс обучения моделей машинного обучения для диагностики заболеваний, что делает технологии более доступными.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. Использование синтетических данных может ограничивать общую применимость моделей в реальных условиях, поскольку они могут не полностью отражать разнообразие реальных изображений и условий тестирования.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Медицина
Медицина
92%

Моделирование импорта и распространения болезни, вызванной вирусом Эбола Бундиbugyo, в Уганде на основе сетевых данных и сценариев соблюдения ненаркотических интервенций

Фон. Вспышка вируса Бундиbugyo Эбола в Уганде в 2026 году, связанная с текущей эпидемией в Демократической Республике Конго (ДРК), распространилась благодаря человеческой мобильности через границы и внутри страны. Мы ставили цель количественно оценить модели импорта и распространения, чтобы обеспечить целенаправленные интервенции на субнациональном уровне. Методы. Мы построили сеть мобильности с направленным взвешиванием на основе данных Миграционной организации (IOM) о перемещении населения с 15 по 24 мая 2026 года (обнаружено 11,245 перемещений) и данных переписи населения Уганды 2024 года (45.9 миллионов человек). Была смоделирована стохастическая метапопуляционная модель SEIR, учитывающая предсимптоматическую передачу и перемещение контактных и инфекционных лиц, на протяжении 90 дней по 135 округам Уганды и двум провинциям ДРК. Реакцию 7-1-7 было явно смоделировано с динамическим охватом отслеживания контактов (40%[->]70%[->]85%). Мы оценили три сценария соблюдения (20%, 40%, 60%) для ненаркотических интервенций. Глобальный анализ чувствительности Соболя (500 выборок, 200 бутстрэппинг) выявил ключевые параметры, определяющие размер вспышки. Результаты. Сеть мобильности была разреженной (плотность 0.11), очень неравномерной (коэффициент Джини 0.67) и модульной (модулярность 0.5). Округ Кисоро имел наибольший риск импорта (входящая сила 3,823) и риска экспорта (исходящая сила 1,350), в то время как Кампала показала значительную входящую силу (1,290), но меньшую исходящую силу (150). В рамках сценария сдерживания (эффективное R = 0.35) модель прогнозировала медиану 22 кумулятивных случаев (95% CrI: 22-24) и 2 смерти (95% CrI: 2-4) в Кампале за 90 дней. Во всех остальных 134 округах медиана составила 0 случаев. Ненаркотические интервенции при высоком, среднем и низком соблюдении не дали статистически значимого снижения числа случаев (22 случая по всем сценариям). Суперраспространительные события происходили в 34.6-40.6% симуляций. Анализ чувствительности Соболя выявил инфекционный период (первый порядок 0.838), летальность случаев (0.738) и основной коэффициент рождаемости (0.664) как наиболее влиятельные параметры; параметры, связанные с мобильностью, имели значительно более низкие индексы общего порядка. Реакция 7-1-7 сама по себе, как ожидалось, сдержит вспышку вируса Эбола Бундиbugyo до примерно 22 случаев и 2 смерти в Кампале, при этом дополнительные ненаркотические интервенции не обеспечат значимого добавочного эффекта. Ресурсы следует сосредоточить на целенаправленном наблюдении в высокорискованных центрах импорта (Кисоро для пограничного контроля) и внутриэпидемических центрах (Кампала для ресурсов реагирования), а не на ненаправленных национальных интервенциях. Инвестиции в быструю характеристику специфических штаммов биологических параметров могут повысить предсказательную точность. Финансирование. Отсутствует. Контекст исследования. Доказательства перед этим исследованием. Мы искали в PubMed и новостях Всемирной организации здравоохранения (Служба новостей о вспышках заболеваний от 19 мая 2026 года) исследования моделирования вспышек вируса Бундиbugyo с использованием терминов "Bundibugyo", "ebolavirus", "spillover", "cross-border" и "stochastic model". Предыдущие вспышки в Уганде (2007-08; 131 подтвержденный случай, 42 смерти) и в ДРК (2012; 38 подтвержденных случаев, 13 смертей) показывали более низкую восприимчивость и коэффициент летальности, чем в случае вируса Эбола Заира, с оценками основного коэффициента рождаемости от 1.2 до 2.6. Вспышка вируса Эбола Заира в Норте Киву и Итури в 2018-20 годах - вторая по величине вспышка за всю историю, с 3,481 случаем и 2,299 смертями - была значительно осложнена вооруженным конфликтом, недоверием сообществ, плохой инфраструктурой и миграцией населения. Чамба и др. (2026) оценили вероятность импорта для Уганды в 94.2% с использованием стохастической ансамблевой модели, откалиброванной на лабораторно подтвержденные случаи. Однако ни одно опубликованное исследование не интегрировало данные о перемещениях из матрицы отслеживания перемещения (IOM) с эпидемическими прогнозами для предоставления оценок риска импорта и распространения на субнациональном уровне. В реальном времени моделирование сверхвспышек через границу для вируса Бундиbugyo было весьма ограниченным, а отсутствие лицензированной вакцины против вируса Бундиbugyo усложняет стратегии готовности и реагирования. Одновременно Бангелеса и коллеги проводили исследование по картированию мобильности населения в провинции Итури, используя месячные данные из Flowminder (с марта 2025 по март 2026) и вычислили нормализованный индекс интенсивности мобильности (MII) для всех 340 санитарных зон. Их анализ показал, что провинция Итури имела второй по величине средний MII в стране (25.3), уступая лишь Киншасе (26.6), и в 2.4 раза превышала национальную медиану (10.7). Критически важным является то, что три зоны эпицентра вспышки - Рвампара (MII 68.6, ранг 2), Бунья (MII 62.6, ранг 3) и Могбвалу (MII 49.9, ранг 11) - все превышали 95-й национальный перцентиль (41.4), подчеркивая исключительную связанность затронутых зон. Дополнительные преимущества этого исследования. В то время как Бангелеса и др. установили макроуровень интенсивности мобильности провинции Итури относительно остальной части ДРК, наше исследование расширяет эту работу, строя направленную, взвешенную сеть мобильности на уровне округов в Уганде, используя данные о перемещениях из матрицы отслеживания перемещения (IOM) (11,245 наблюдаемых перемещений). Мы демонстрируем, что сеть мобильности крайне неравномерна (Джини 0.67) и модульная (модулярность 0.5), при этом Кисоро выступает в качестве основного порта импорта (входящая сила 3,823), а Кампала - как округ с самой высокой нагрузкой (22 медианных случая). Мы также показываем, что реакция 7-1-7 сама по себе вполне вероятно сдержит вспышку до примерно 22 случаев, а дополнительные ненаркотические интервенции не принесут статистически значимого добавленного эффекта. Анализ чувствительности Соболя выявляет инфекционный период (первый порядок 0.838), летальность случаев (0.738) и основной коэффициент рождаемости (0.664) как наиболее влиятельные параметры, что информирует приоритеты целенаправленного сбора данных. Это первое исследование, предоставляющее оперативные рекомендации на уровне округов для реагирования на вспышку вируса Бундиbugyo с использованием данных о мобильности в реальном времени. Импликации всех доступных доказательств. Планы готовности должны приоритизировать целенаправленное наблюдение в высокорискованных центрах импорта (Кисоро для пограничного контроля) и внутренних эпидемических центрах (Кампала для ресурсов реагирования), а не ненаправленные национальные вмешательства. Исключительная связанность пострадавших зон, обрисованная Бангелеса и др., при том что провинция Итури имеет второй по величине MII в стране, и все три зоны эпицентра превышают 95-й процентиль, делают отслеживание контактов чрезвычайно трудоемким. Отсутствие лицензированной вакцины против вируса Бундиbugyo исключает стратегию вакцинации по кругу, которая была эффективна во всех шести предыдущих вспышках Эболы в ДРК, вызванной вирусом Эбола Заира. Быстрая характеристика специфических штаммов биологических параметров через отслеживание контактов и анализ последовательного интервала может дать большую отдачу, чем уточнение операционных протоколов. Усиленное трансграничное наблюдение в рамках Международных медицинских правил 2005 года и рамок Чрезвычайной общественной безопасности АфриканскогоCDC жизненно важно для гармонизации обнаружения и реагирования по всему тройному границе ДРК-Уганда-Южный Судан.

Медицина
Медицина
92%

EpiControl: инструмент на основе данных для оптимизации вмешательств в эпидемии и автоматизации планирования сценариев для поддержки оперативного ответа

Принятие решений относительно мер контроля за вспышками заболеваний представляет собой сложную задачу, поскольку доступные данные несовершенны, а эффекты вмешательства неопределенны. Сложные модели заболеваний могут моделировать экономические и медицинские последствия вмешательства, однако значительные требования к данным или вычислительным ресурсам в сочетании со специальными знаниями, необходимыми для калибровки, ограничивают их применение в реальном времени. Существуют более простые, быстрые и универсальные инструменты, но, как правило, они лишь оценивают или прогнозируют динамику передачи при заданных предположениях. Мы представляем EpiControl, гибкий инструмент (на языке R) для моделирования общественного здравоохранения, который поддерживает принятие решений и подстраивает полу-механистические модели под рутинные данные, используя управление с обратной связью и обучение на основе моделей, чтобы сбалансировать сложное моделирование политики с реакцией в реальном времени. EpiControl генерирует сценарии вмешательства, которые автоматически обновляются в соответствии с развивающейся динамикой, минимизируют затраты, соответствуют установленным пользователем целям политики (например, подавление пиков эпидемий) и остаются устойчивыми к непредвиденным изменениям. Используя примеры на основе вируса Эбола и COVID-19, мы показываем, как EpiControl может быстро находить оптимальные политики вмешательства, которые предотвращают перегрузку больниц, сокращают общественные потрясения и сохраняют контроль, несмотря на неопределенности в иммунитете, вакцинациях и динамике вариаций патогенов.

Медицина
Медицина
87%

Предсказание ранних стадий болезни Альцгеймера и выявление ключевых биомаркеров с использованием глубоких искусственных нейронных сетей и ансамбля методологий машинного обучения

Болезнь Альцгеймера (БА) – это расстройство мозга, которое развивается медленно и в основном затрагивает память, мышление, язык и повседневную деятельность. Это одно из самых распространенных причин деменции и создает множество трудностей как для пациентов, так и для их семей. На ранней стадии симптомы часто слабо выражены и могут напоминать нормальное старение. По этой причине многие люди получают диагноз слишком поздно, когда болезнь уже прогрессирует. В настоящее время полного лекарства от БА не существует. Тем не менее, ранняя диагностика может помочь врачам лучше управлять состоянием пациента и предпринять необходимые шаги вовремя. В этом исследовании предлагается модель машинного обучения для определения ранних стадий болезни Альцгеймера на основе клинических данных, результатов нейропсихологических тестов и мер, связанных с нейровизуализацией. Данные, использованные в работе, собраны из Инициативы по нейровизуализации болезни Альцгеймера (ADNI). Поскольку в наборе данных есть пропущенные значения, применяется итеративная импутация для их заполнения. Набор данных также имеет несбалансированные классы, что решается с помощью метода Borderline SVM-SMOTE. Затем проводится отбор признаков с использованием оберток и встраиваемых методов, чтобы использовать только важные признаки для обучения. Выбранные признаки делятся на обучающие и тестовые наборы, и применяется масштабирование признаков. Разрабатывается ансамблевая модель стекового обучения с использованием логистической регрессии, Extra Trees, Bagging KNN и LightGBM в качестве базовых классификаторов. Кроме того, также обучается искусственная нейронная сеть на том же наборе данных. Эффективность этих моделей сравнивается по таким метрикам, как точность, полнота, F1-меры и AUC-ROC. Цель этого исследования состоит в том, чтобы найти лучший классификатор и выявить важные биомаркеры, которые могут помочь в ранней диагностике болезни Альцгеймера.

Медицина
Медицина
82%

Разработка базы данных рака простаты, стандартизированной по OMOP, и улучшение качества данных с использованием NLP и алгоритмов на основе PSA

Цель: Разработать и оценить базу данных о раке простаты, стандартизированную в соответствии с Обсервационным партнерством медицинских исходов (OMOP), из Электронной медицинской карты (ЭМК) Epic Университета Техаса в Медицинском центре (UTMB), и улучшить качество данных с помощью обработки естественного языка (NLP) и алгоритмов на основе антигена простаты (PSA). Материалы и методы: Мы построили конвейер данных для преобразования данных ЭМК UTMB Epic (2010-2021) в Общую модель данных OMOP (CDM) версии 5.4. Качество данных оценивалось путем сравнения стандартизированных данных OMOP с данными Регистра рака Гальвестона с использованием согласия по доступности, коэффициента Каунта и внутриклассовой корреляции. NLP использовалась для извлечения PSA, оценки Глисон и стадии рака из клинического текста, а алгоритмы на основе PSA использовались для выявления отсутствующего лечения и биохимического рецидива. Результаты: Мы извлекли 815 аналитических случаев из ЭМК UTMB. Из них 700 (85,9%) были полными и согласованы с регистром рака. PSA показал отличное согласие значений. Структурированные данные по оценке Глисон и стадии были разряженными (n<20), но NLP значительно улучшила их захват. Согласие по лечению было хорошим по сравнению с регистром рака и незначительно улучшилось для радикальной простатэктомии после применения алгоритма на основе PSA. Используя траектории PSA, мы выявили 60 случаев биохимического рецидива. Обсуждение: Стандартизированные данные OMOP из UTMB показали хорошее согласие с регистром рака. Однако структурированные поля ЭМК неполностью фиксировали данные о диагнозе, патологии и лечении. NLP и алгоритмы на основе PSA существенно улучшили захват данных. Ручной обзор также выявил ошибки в данных регистра, показывая, что стандартизированные данные ЭМК OMOP могут дополнить и помочь улучшить качество регистра рака. Заключение: Стандартизация OMOP в сочетании с NLP и алгоритмами на основе PSA улучшила качество данных о раке простаты и готовность к исследованию.

Медицина
Медицина
82%

Интеграция данных о генетике, окружающей среде, когнитивных способностях и темпераменте для прогнозирования СДВГ с использованием объяснимых моделей глубокого обучения

Цель: Расстройство дефицита внимания и гиперактивности (СДВГ) является клинически и этиологически гетерогенным, и диагностические решения могут выиграть от интеграции нескольких источников информации. Мы разработали подход объяснимого глубокого обучения, чтобы проверить, могут ли генетические, экологические, когнитивные, демографические и темпераментные данные классифицировать диагностику СДВГ и выявить факторы, способствующие принятию решений модели. Метод: Мы проанализировали участников когорты Oregon ADHD-1000, разделенных на тренировочные, валидационные и тестовые подмножества. Мы обучили модульные нейронные сети для классификации статуса случая-контроля СДВГ с использованием данных генотипа на уровне SNP с биологическими аннотациями, полигенных баллов, демографических данных, конфликтов в родительско-семейной среде, стресса и травмы, геокодированных мер, когнитивных задач, баллов темперамента и индикаторов отсутствия данных. Оптимизация гиперпараметров выбрала архитектуру модели и включение блоков признаков. Мы оценили производительность модели, используя AUC, кривые точности и полноты, анализы калибровки и предсказательной определенности, а также анализ кривой решений. Мы использовали интегрированные градиенты для количественной оценки важности на уровне блока, признака и индивидуальной важности признаков. Результаты: Лучшая модель, использующая черты темперамента, показала AUC 0.97 в удержанном тестовом подмножестве, с высокой точностью, чувствительностью и специфичностью и Brier score 0.06. Лучшая модель, исключающая темперамент, имела AUC 0.75. Анализы важности признаков подчеркнули важность темперамента, демографических и когнитивных доменов в модели, включающей темперамент. Индивидуализированные объяснения показали, что факторы предсказания варьировались между участниками и могли помочь выявить противоречивые или поддерживающие доказательства в различных доменах. Заключение: Объяснимые многомодальные классификационные модели могут интегрировать гетерогенную информацию, релевантную СДВГ, и выявлять признаки, которые способствуют индивидуальным прогнозам. Такие модели могут продвинуть исследования риск-моделирования СДВГ и поддерживать принятие решений клиницистами, особенно в сложных или диагностически неопределенных случаях.

Медицина
Медицина
77%

К стандартизации диагностики микробиоты кишечника: нормобиоз вне географических границ.

Определение клинически значимых референсных состояний микробиоты кишечника человека остается серьезным препятствием для клинического применения тестирования микробиома, в значительной степени из-за вариативности среди популяций. Мы стремились оценить, можно ли идентифицировать дисбиоз в стандартизированном, независимом от географии формате, используя комплексную систему диагностики микробиома. Мы провели ретроспективный наблюдательный анализ 831 образца стула взрослых, собранных от здоровых людей и пациентов с воспалительными заболеваниями кишечника, синдромом раздраженного кишечника или другими хроническими воспалительными заболеваниями в семи странах. Кроме того, были проанализированы эталонные материалы человеческого кала Национального института стандартов и технологий (NIST) США. Дисбиоз оценивался с использованием фиксированной панели микробных маркеров и составных метрик расстояний, закрепленных за клинически валидированной здоровой скандинавской референсной популяцией, с использованием теста GA-map® Dysbiosis Test как примера этой диагностической схемы. Диагностическая схема воспроизводимо идентифицировала нормобиоз и дисбиоз среди географически различных популяций (США, Канада, Германия, Италия и Великобритания). Серьезный дисбиоз был обнаружен с высокой специфичностью (93,6%) и положительной прогностической ценностью (90,2%), независимо от страны происхождения испытуемых. Здоровые люди показали высокую степень сопоставимости распределения индексов дисбиоза по регионам. Эти результаты демонстрируют, что клинически полезная диагностика дисбиоза не требует географически адаптированных референсных популяций и поддерживают возможность стандартизированной, независимой от географии диагностики микробиома для клинического применения.