Структурированные гауссовские процессы для классификации омических данных с учетом неопределенности в условиях высокой размерности и малых выборок
Structured Gaussian Processes for Uncertainty-Aware Classification of High-Dimensional, Small-Sampled Omics Data
Карточка статьи
Рубрика
Биология
Источник
arXiv
Дата
02.07.2026
Автор
Science Morning
Время чтения
3 мин
Это предварительная публикация, она не прошла научное рецензирование.
Аннотация
Классификация гетерогенных омических данных по-прежнему остается основной проблемой в вычислительной биологии, особенно в условиях высокой размерности и малых выборок, где доминируют нелинейные взаимодействия, а дисбаланс классов дополнительно усложняет надежное предсказание редких фенотипов. Хотя традиционные методы на основе ядров полагаются на изобилие признаков, они не используют известные ландшафты взаимодействий биологических систем. В данной работе мы предлагаем структуру классификации на основе гауссовского процесса, которая интегрирует закодированные графом биологические пути непосредственно в конструкцию ядра. Пропагируя информацию вдоль известных сетей взаимодействия и комбинируя это с признаками, основанными на изобилии, полученный классификатор захватывает как количественные измерения, так и топологический контекст. Мы проводим оценку нашей предложенной методологии на трех общедоступных наборах данных по микробиому кишечника и кала. Для решения проблемы серьезного дисбаланса классов мы оцениваем дополнительные стратегии, включая ресемплирование на уровене данных, калибровку порогов и корректировки на основе матрицы замешательства, и сообщаем о результатах для класса меньшинства наряду с общей точностью. Гибридный подход дает прирост производительности по сравнению с неструктурированными базовыми решениями и соответствует показателям установленных эталонов для аналогичных наборов данных. Кроме того, вероятностная природа данного подхода естественным образом предоставляет откалиброванную предсказательную неопределенность, позволяя надежно различать уверенные предсказания и неоднозначные образцы.
Краткое резюме
Данная работа представляет новый подход к классификации омических данных, сочетая структурированные гауссовские процессы с графами биологических путей, что позволяет улучшить качество предсказаний в условиях небольших выборок и дисбаланса классов.
Практический вывод
Предложенный метод может служить полезным инструментом для исследователей в области биологии, помогая более точно классифицировать омические данные с учетом сложности взаимодействий в биологических системах.
Ограничения
Это предварительная публикация, она не прошла научное рецензирование. Ограничения исследования включают зависимость результатов от качества и полноты используемых данных, а также необходимость подтверждения предложенной методологии на более разнообразных наборах данных.
Недавние модели генерации и редактирования изображений могут создавать визуально привлекательные натуральные изображения, однако они остаются ненадежными, когда целевое изображение представляет собой знания-интенсивную диаграмму, корректность которой зависит от дисциплинарных концепций, символической структуры и точных пространственных отношений. Мы представляем DisciplineGen-1M, набор данных многодисциплинарного масштаба с миллионом образцов, который поддерживает генерацию изображений из текста и редактирование изображений. Он содержит 1,2 миллиона образцов из математики, физики, химии, биологии, географии, информатики, экономики, истории, музыки и спорта. Для создания набора данных мы разрабатываем масштабируемую структуру, которая объединяет рендеринг векторной графики, редактирование на основе OCR, программный синтез и крупномасштабную фильтрацию текстов в изображения. Эти рабочие процессы обеспечивают создание аннотаций, инструкций по редактированию, структурированных аннотаций и пар изображений с контролируемыми семантическими различиями. Основываясь на DisciplineGen-1M, мы дополнительно представляем модель генерации рассуждений, учитывающую дисциплину, для генерации изображений из текста и редактирования изображений. Эксперименты на связанных с дисциплиной моделях, GenExam и GRADE, показывают значительные улучшения по сравнению с открытыми эталонами, в то время как оценки на общих моделях, информированных рассуждениями, WISE и RISE, дополнительно указывают на более широкий перенос. Результаты свидетельствуют о том, что структурированные академические визуальные данные большого объема являются ключевым компонентом для перехода генерации изображений от эстетической правдоподобности к верифицируемому созданию визуального контента на основе знаний. Мы публично выпустим наш набор данных, модель и исходный код процесса кураторства данных, чтобы обеспечить воспроизводимость и содействовать будущим исследованиям.
Статус мутации гистона H3K27M определяет клинически агрессивную подгруппу педиатрической диффузной срединной глиомы и влияет на прогноз и право участия в клинических испытаниях, однако подтверждение обычно требует биопсии из важных срединных структур. Мы оценили, может ли радиомика, основанная на стандартной МРТ с T2-взвешиванием, предоставить дополнительный сигнал для скрининга в неоднородной выборке, где сканирование часто выполняется внешними учреждениями, и MРТ с T2-взвешиванием является единственной последовательно доступной последовательностью. Было проанализировано 98 педиатрических пациентов с подтвержденным статусом по биопсии (73 с положительной мутацией, 25 с дикой формой). Экспертные сегментации опухоли определили области интереса для извлечения признаков PyRadiomics после изотропной переработки, двойного исключения черепной кости и фильтрации на разных масштабах. Мы систематически отключали предобработку, устраняли корреляцию с помощью повторного рекурсивного выбора признаков, объема опухоли и синтетической миноритарной агментации TabDDPM по 100 стратифицированным выборкам обучения/тестирования с реальными тестовыми наборами. Чистая радиомика достигла точности 0.664 и F1-оценки 0.784. Лучший процесс включал предобработку, выбор признаков и объем с CatBoost, достигнув точности 0.730 $\pm$ 0.068 и F1-оценки 0.826 $\pm$ 0.044. TabDDPM улучшил TabPFN до F1-оценки 0.81 $\pm$ 0.05 при 200 увеличенных строках. Эти результаты поддерживают использование радиомики на МРТ с T2-взвешиванием как умеренной вспомогательной помощи для скрининга и триажа, но не заменяют диагностику на основе ткани.
Глубокое обучение в области компьютерного зрения для научных приложений требует сбора и аннотирования больших наборов данных в трудоемком, дорогом и подверженном ошибкам процессе. Генерация синтетических данных с помощью 3D-моделирования и рендеринга может упростить этот процесс и повысить точность аннотаций, генерируя их программно. Однако минимизация разрыва между реальными и синтетическими изображениями визуально является субъективной и не имеет систематических количественных критериев. Мы представляем GraNatPy, пакет для Python с метриками, помогающими улучшить рендеринг сцены. Мы показываем, что количественное увеличение реалистичности, разнообразия и размера созданного набора данных коррелирует с улучшением визуального восприятия сцены и более высоким качеством нулевого отслеживания в модели обнаружения объектов. Более того, мы продемонстрировали на примере фотографий вирусологических анализов, что сходство градиентов влияет на эффективность обнаружения небольших объектов, что может быть улучшено смешиванием реальных и синтетических данных. Наконец, мы превращаем процедурный рендеринг данных в агентную технологию (SynthClaw) для автоматизации оптимизации процедурных параметров.
Современные вычислительные подходы к дизайну лекарств обычно сосредоточены на генерации молекул, основанных на определенных мишенях или общих молекулярных свойствах, часто забывая о влиянии контекста болезни на поведение мишеней и терапевтические результаты. Чтобы устранить этот недостаток, мы представляем DrugGen-2, новую генеративную модель, которая разрабатывает маломолекулярные соединения с учетом как онтологии болезни, так и последовательностей целевых белков. DrugGen-2 была разработана путем дообучения предобученной модели GPT-2 на курированном наборе данных одобренных лекарств, связанных с их заболеваниями и мишенями, с использованием двухступенчатой стратегии, которая включает контролируемое дообучение, за которым следует обучение с подкреплением через оптимизацию групповой относительной политики (GRPO). Этот процесс был направлен функциями вознаграждения, которые оптимизировали химическую валидность, новизну, разнообразие и высокую предсказанную связующую аффинность. При оценке на пяти белковых мишенях, связанных с диабетической нефропатией, DrugGen-2 значительно превзошла базовые модели (DrugGPT и DrugGen). Она продемонстрировала превосходные способности генерировать уникальные молекулы, показала большую структурную схожесть с одобренными лекарствами и достигла улучшенной предсказанной связующей аффинности для всех целевых объектов. Анализы молекулярного докинга дополнительно подтвердили эти выводы, выявив кандидатов-лигандов с сильным связывающим потенциалом, включая соединения с предсказанными аффинностями (-9.917, -9.485 и -9.367), которые превышают таковые дляReference drugs, таких как эналаприл, для ангиотензин-превращающего фермента (-8.283). Интегрируя специфический для болезни контекст в генерацию молекул, DrugGen-2 продвигает вспомогательное основанное на ИИ открытие лекарств, предлагая мощный инструмент для нового дизайна и перепрофилирования лекарств с учетом сложного взаимодействия между заболеваниями и молекулярными мишенями.
Респираторный синцитиальный вирус (RSV) является одной из ведущих причин бронхиолита и других инфекций нижних дыхательных путей у детей. Увеличение циркуляции вируса в постковидную эпоху и неоднородные стратегии профилактики в разных регионах усложнили контроль за RSV. Мы разработали модель, структурированную по стадиям и стратифицированную по возрасту, dirigida к итальянским условиям, чтобы исследовать влияние профилактики у новорождённых с использованием Нирсевимаба, моноклонального антитела длительного действия. Сценарные симуляции на многолетнем горизонте показывают, что увеличение охвата защиты новорождённых существенно снижает заболеваемость RSV среди младенцев и также приносит косвенные выгоды для более старших возрастных групп. В частности, расширение охвата для младенцев, родившихся вне эпидемического сезона, дополнительно снижает кумулятивную заболеваемость, хотя профилактика, нацеленная только на младенцев, не уменьшает контролируемый репродуктивный номер ниже эпидемического порога в исследуемом диапазоне параметров. Эти результаты предполагают, что более широкий и последовательный охват Нирсевимабом новорождённых может уменьшить бремя RSV и поддержать оценку альтернативных стратегий реализации в итальянском контексте.
Динамический оптимальный транспорт объединяет оптимальный транспорт, механику жидкостей и теорию градиентного течения в рамках непрерывной динамики, предлагая язык, учитывающий геометрию, для применения в физике, биологии и машинном обучении. Однако традиционные формулировки рассматривают его как задачу ограниченной оптимизации, которая должна явно удовлетворять уравнению сохранения массы, что затрудняет реконструкцию базовой динамики напрямую из данных. Мы предлагаем энергетический вариационный метод для динамического оптимального транспорта (EVMDOT), который реформулирует проблему в рамках энергетической вариационной теории, сочетая карту потока, принцип наименьшего действия и принцип максимальной диссипации. Карта потока преобразует ограниченную задачу в неограниченную, автоматически обеспечивая выполнение уравнения сохранения массы, в то время как баланс между консервативными и диссипативными силами определяет поле скоростей. Примененный к уравнению Фоккера-Планка, EVMDOT восстанавливает как энергетический ландшафт, так и ландшафт Уаддингтона напрямую из временных данными о плотности. В ходе численных экспериментов мы выяснили, что EVMDOT достигает внутреннего баланса между количеством и качеством данных: достаточное количество данных компенсирует ограниченное качество данных, что делает реконструкцию устойчивой к выбору окна наблюдения. Мы также применили EVMDOT к набору данных Инициативы нейровизуализации болезни Альцгеймера (ADNI) для вывода потенциального ландшафта амилоидного бета и тау, выявляя два минимума, соответствующих когнитивно нормальному состоянию и стадии болезни Альцгеймера, а также переходный путь между ними.