Улучшение классификации ультразвуковых изображений через структуру с двумя ветвями, ориентированную на атрибуты
Boosting Ultrasound Image Classification via Attribute-Guided Dual-Branch Framework
Карточка статьи
Рубрика
Медицина
Источник
arXiv
Дата
02.07.2026
Автор
Science Morning
Время чтения
3 мин
Это предварительная публикация, она не прошла научное рецензирование.
Аннотация
Классификация ультразвуковых изображений имеет важное значение для компьютерной диагностики. Однако современные методы часто игнорируют клинические приоритеты, что приводит к плохой обобщаемости в сложных сценариях и отсутствию интерпретируемости, что ограничивает клиническое применение. Чтобы решить эти проблемы, мы нацелены на разработку модуля медицинских приоритетов, который можно бесшовно интегрировать в существующие конвейеры для повышения как диагностической эффективности, так и интерпретируемости. В данной статье мы предлагаем двухветвевую структуру классификации ультразвука, основанную на атрибутах, которая вводит независимые от домена медицинские атрибуты-приоритеты, улучшая обобщаемость и предоставляя интерпретируемые доказательства. В частности, базовая ветка следует традиционным архитектурам и предсказывает категории изображений с помощью полностью связанного классификатора. Ветка, ориентированная на атрибуты, вводит независимые от домена атрибуты в качестве приоритетов и производит интерпретируемые человеком подсказки для принятия решений. Наконец, адаптивный модуль принятия решений объединяет две ветви в зависимости от данных для получения окончательного предсказания. Эксперименты по различным задачам классификации ультразвука демонстрируют, что наш подход можно интегрировать в несколько основных и современных методов с низкими накладными расходами, постоянно улучшая точность и интерпретируемость.
Краткое резюме
Исследование предлагает новый подход к классификации ультразвуковых изображений, который включает интеграцию медицинских атрибутов для повышения точности и интерпретируемости диагностики.
Практический вывод
Публикация предлагает методы, которые могут улучшить точность и интерпретируемость ультразвуковой диагностики, что способствует их более широкому применению в клинической практике.
Ограничения
Это предварительная публикация, она не прошла научное рецензирование. Данное исследование все еще требует проверки на большем количестве клинических данных, чтобы удостовериться в его универсальности и эффективности при различных типах ультразвуковых изображений.
Персонализированная генерация изображений с несколькими объектами требует точного отображения всех запрашиваемых идентичностей и их заданных взаимодействий на основе направляющего запроса. Однако современные модели все еще испытывают трудности в этом процессе, часто опуская объекты, не сохраняя внешность референсов или неверно приписывая взаимодействия. Кроме того, существующие метрики, которые в основном разработаны для оценки единственного объекта, не могут надежно фиксировать эти ошибки, страдая от сильного ухудшения различимости в ранжировании и не совпадая с человеческими предпочтениями по мере увеличения числа объектов. Для решения этой проблемы мы представляем Бенчмарк и оценщик взаимодействий между несколькими объектами (MIBE), унифицированную структуру, состоящую из Бенчмарка взаимодействий между несколькими объектами (MIB) и Оценщика взаимодействий между несколькими объектами (MIE). MIB систематически охватывает различные типы отношений и сложности сцен через декомпозированную организацию данных. Это включает 60K пар с метками VLM для масштабируемого обучения метрик и 4K пар из двойного слепого оценивания людьми для разнообразного диапазона современных генераторов, при этом набор Silver достигает 95.1% согласия по предпочтениям. Для демонстрации полезности этого бенчмарка мы представляем MIE, легковесный, ориентированный на референсы оценщик, обученный исключительно на наборе Silver с двойной целью ранжирования и диагностики. MIE демонстрирует сильную обобщающую способность между генераторами на Gold наборе, достигая 0.922 общей точности парного сравнения с человеческими предпочтениями, включая 0.982 для изученных генераторов и 0.884 для не изученных. Обогнав широкий спектр базовых метрик, включая вариации CLIP и DINO, MIE показывает, что диагностическое наблюдение может сохранить различимость в ранжировании и соответствие с людьми там, где традиционные оценщики теряются.
Фиброаденома груди (ФА) и опухоль Филлоидов (ОФ) — это фиброэпителиальные поражения груди с высоко перекрывающимися проявлениями на ультразвуковых изображениях, что делает доброкачественные и пограничные ОФ подверженными ошибочной классификации как ФА, осложняя предоперационное принятие решений. Существующие методы компьютерной помощи в диагностике обычно основываются на однородных изображениях и недостаточно используют дополнительные клинические и текстовые данные. Чтобы решить эту проблему, мы разработали набор данных FAPT-M, состоящий из 910 пациентов с строго проверенными ультразвуковыми изображениями, структурированными клиническими атрибутами и описаниями ультразвуковой диагностики. На основе этого набора данных мы предлагаем клинически ориентированную мультимодальную структуру, которая объединяет визуальное кодирование на основе DenseNet, текстовое кодирование, вдохновленное CLIP, и легковесное клиническое кодирование, а также вводит адаптивную модуляцию с учетом клинических данных, фузию между модальностями с помощью Transformers и обучение представления с двойным путем для улучшения согласования признаков и взаимодействия между модальностями. В рамках пятирубцовой перекрестной проверки на уровне пациентов предлагаемый метод достигает точности 77,64%, F1-оценки 73,38% и AUC 89,74%, что превосходит представительные эталонные методы на базе CNN, Transformers и визуально-языковых моделей. Исследования по абляции и оценки с учетом классов дополнительно подтверждают вклад фузии трех модальностей и ключевые архитектурные компоненты. В целом, эта работа предоставляет эффективный мультимодальный подход для детальной классификации ФА и ОФ и устанавливает высококачественный эталон для мультимодального анализа ультразвука молочной железы.
Системы накопления энергии на базе батарей (BESS) крупного масштаба требуют решений по эксплуатации и обслуживанию (O&M), которые объединяют тревожные сигналы, измерения на уровне ячеек, топологию устройств, диагностические таблицы, исторические случаи и документы по техническому обслуживанию. Платформы мониторинга могут выявлять нарушения пороговых значений, но они часто не могут объяснить, требует ли вмешательства несоответствие напряжения, дрейф сопротивления, риск короткого замыкания, расхождение в емкости или термическая аномалия. В этом материале представлен отслеживаемый помощник по диагностике неисправностей BESS, который использует многократное рассуждение с использованием поиска для соединения операционных данных, знаний в области, визуальных доказательств и генерации отчетов. Надежность повышается за счет специфической маршрутизации задач для BESS, доступа к базе данных естественного языка с ограничениями схемы, гибридного поиска текста и изображений, а также синтеза ответов на основе доказательств. Приведены предварительные внутренние оценки для маршрутизации, доступа к базе данных и диагностического рассуждения.
Эффективная диагностика заболеваний мозга требует синергии паттернов подключения мозга и высокоуровневых семантических знаний. Однако существующие методы в значительной степени рассматривают семантику из крупных языковых моделей (LLMs) как вспомогательные признаки или руководство, что ограничивает их прямую роль в принятии решений и сужает стабильность и надежность классификации. Чтобы преодолеть это, мы предлагаем фреймворк семантически согласованной нейросети мозга, который активно интегрирует семантику, полученную от LLM, в процесс предсказания. В частности, семантика на уровне ROI сначала включается через глобальное самообращение для обогащения представлений узлов и предоставления контекста всего мозга. Затем строятся многомасштабные гиперграфы для явного моделирования функциональных подсетей и взаимодействий между несколькими ROI, что решает локальные ограничения традиционных ГНН и захватывает высокопорядковые зависимости. Наконец, механизм семантической согласованности на уровне принятия решений избирательно вводит текстовые вложения, специфичные для пациента, в графовые представления, позволяя семантике напрямую управлять предсказаниями без нарушения глубинной структуры сети. Эксперименты на публичных наборах данных сети мозга ABIDE и ADHD-200 демонстрируют состояние искусства, повышенную стабильность и улучшенную интерпретируемость, особенно в условиях небольших выборок.
Быстрые диагностические тесты (БДТ) поддерживают доступную диагностику заболеваний. Машинное обучение (МО) может улучшить интерпретацию БДТ, но часто полагается на большие, собственные и дорогостоящие библиотеки изображений из реального мира. Мы представляем SynSight - конвейер сегментации и классификации БДТ на основе МО, обученный на синтетических данных. Валидация проводилась на БДТ для ВИЧ (98% чувствительность, 99% специфичность) и COVID-19 (до 99% точности), SynSight позволяет быстро обучать МО без использования реальных обучающих изображений, успевая за развитием новых БДТ.
Обучение с подкреплением (RL) — это метод принятия решений в последовательных задачах, при котором агент обучается оптимальным политикам через взаимодействие с окружающей средой, максимизируя кумулятивные вознаграждения. Среди методов RL байесовское обучение с подкреплением (BRL) решает распространенные практические задачи, связанные с нехваткой данных, используя предварительные знания об окружении и последовательные обновления убеждений. Тем не менее, большинство подходов BRL требуют явной функции правдоподобия, которая часто недоступна или сложна для решения в реальных условиях. Мы предлагаем алгоритм, не требующий вычисления правдоподобия, — Итеративная Выборка Параметров Важности без Явного Правдоподобия (LF-IBIS), который обновляет убеждения агента в режиме онлайн по мере появления новых взаимодействий. Сочетая приближенные байесовские вычисления с итеративной выборкой параметров важности, LF-IBIS позволяет проводить полное байесовское вывод в условиях, когда динамика окружения не описана явным или управляемым правдоподобием. Метод предоставляет приближенные постериорные распределения как для параметров окружения, так и для оптимальных политик, обеспечивая количественную оценку неопределенности политики, что полезно для байесовского анализа компромисса между исследованием и эксплуатацией. Мы тестируем метод на симуляционном исследовании адаптивной рандомизации в клинических испытаниях, где закрытые формы постериоров позволяют провести валидацию. Дополнительные эксперименты рассматривают ситуации, когда постериор не имеет закрытой формы, и демонстрируют онлайн-обновление политики на основе постериорного распределения оптимальной политики.