MERLIN-SUITE: Вероятностная модульная инференция генетических регуляторных сетей из многоомиксных данных с интеграцией регуляторных приоритетов и активности транскрипционных факторов
MERLIN-SUITE: Probabilistic modular GRN inference from multi-omics data integrating regulatory priors and transcription factor activity
Карточка статьи
Рубрика
Биология
Источник
arXiv
Дата
02.07.2026
Автор
Science Morning
Время чтения
3 мин
Это предварительная публикация, она не прошла научное рецензирование.
Краткое резюме
MERLIN-SUITE – это набор инструментов для восстановления генетических регуляторных сетей, который использует данные многоомики и интегрирует внешние приоритеты. Он позволяет более точно предсказывать регуляторные взаимодействия, используя латентную активность транскрипционных факторов.
Практический вывод
MERLIN-SUITE может улучшить анализ генетических регуляторных сетей в биологических исследованиях, предлагая более точные инструменты для работы с сигнальными путями и регуляцией генов.
Ограничения
Это предварительная публикация, она не прошла научное рецензирование. Методология зависит от качества и доступности внешних регуляторных данных, что может ограничивать его применение в определенных условиях. Также, возможно, потребуется дополнительная валидация результатов для подтверждения точности извлеченных регуляторных программ.
Статус мутации гистона H3K27M определяет клинически агрессивную подгруппу педиатрической диффузной срединной глиомы и влияет на прогноз и право участия в клинических испытаниях, однако подтверждение обычно требует биопсии из важных срединных структур. Мы оценили, может ли радиомика, основанная на стандартной МРТ с T2-взвешиванием, предоставить дополнительный сигнал для скрининга в неоднородной выборке, где сканирование часто выполняется внешними учреждениями, и MРТ с T2-взвешиванием является единственной последовательно доступной последовательностью. Было проанализировано 98 педиатрических пациентов с подтвержденным статусом по биопсии (73 с положительной мутацией, 25 с дикой формой). Экспертные сегментации опухоли определили области интереса для извлечения признаков PyRadiomics после изотропной переработки, двойного исключения черепной кости и фильтрации на разных масштабах. Мы систематически отключали предобработку, устраняли корреляцию с помощью повторного рекурсивного выбора признаков, объема опухоли и синтетической миноритарной агментации TabDDPM по 100 стратифицированным выборкам обучения/тестирования с реальными тестовыми наборами. Чистая радиомика достигла точности 0.664 и F1-оценки 0.784. Лучший процесс включал предобработку, выбор признаков и объем с CatBoost, достигнув точности 0.730 $\pm$ 0.068 и F1-оценки 0.826 $\pm$ 0.044. TabDDPM улучшил TabPFN до F1-оценки 0.81 $\pm$ 0.05 при 200 увеличенных строках. Эти результаты поддерживают использование радиомики на МРТ с T2-взвешиванием как умеренной вспомогательной помощи для скрининга и триажа, но не заменяют диагностику на основе ткани.
Глубокое обучение в области компьютерного зрения для научных приложений требует сбора и аннотирования больших наборов данных в трудоемком, дорогом и подверженном ошибкам процессе. Генерация синтетических данных с помощью 3D-моделирования и рендеринга может упростить этот процесс и повысить точность аннотаций, генерируя их программно. Однако минимизация разрыва между реальными и синтетическими изображениями визуально является субъективной и не имеет систематических количественных критериев. Мы представляем GraNatPy, пакет для Python с метриками, помогающими улучшить рендеринг сцены. Мы показываем, что количественное увеличение реалистичности, разнообразия и размера созданного набора данных коррелирует с улучшением визуального восприятия сцены и более высоким качеством нулевого отслеживания в модели обнаружения объектов. Более того, мы продемонстрировали на примере фотографий вирусологических анализов, что сходство градиентов влияет на эффективность обнаружения небольших объектов, что может быть улучшено смешиванием реальных и синтетических данных. Наконец, мы превращаем процедурный рендеринг данных в агентную технологию (SynthClaw) для автоматизации оптимизации процедурных параметров.
Мы разрабатываем теорию \emph{вероятностных псевдозавязей}, предоставляя основу для моделирования диаграмм узлов с неопределенной информацией о пересечениях. Диаграммы псевдозавязей обобщают классические диаграммы, позволяя определенным пересечениям оставаться неуточненными; в вероятностной интерпретации каждое такое \emph{предпересечение}, а именно пересечение с неопределенной информацией о положении, получает вероятность, описывающую вероятность разрешения как положительное пересечение, в то время как комплементарная вероятность отводится негативному разрешению. Это порождает распределение вероятностей для полных классических разрешений и, путем агрегирования, распределение по классическим типам узлов, захватывая неопределенность, возникающую в физических, биологических и вычислительных контекстах. Мы вводим \emph{вероятностное равенство}, определенное через расстояние полной вариации между распределениями разрешений, и расширяем классические численные величины, такие как завиток и число связывания, на эту область. Мы также разрабатываем новые вероятностные конструкции, включая вероятностный индекс хиральности, минимальный род разрешения, распределения вероятностных поверхностей Сейферт и полиномиальные инварианты, расширяющие скобочную запись Кауффмана. Мы далее обсуждаем конструкции, основанные на матрицах, включая вероятностные матрицы Сейферт и Гёртица, а также вероятностную хирургию, производящую распределения по 3-многообразиям. Наконец, мы обсуждаем потенциальные приложения в молекулярной биологии, материаловедении и вычислительной топологии.
Динамический оптимальный транспорт объединяет оптимальный транспорт, механику жидкостей и теорию градиентного течения в рамках непрерывной динамики, предлагая язык, учитывающий геометрию, для применения в физике, биологии и машинном обучении. Однако традиционные формулировки рассматривают его как задачу ограниченной оптимизации, которая должна явно удовлетворять уравнению сохранения массы, что затрудняет реконструкцию базовой динамики напрямую из данных. Мы предлагаем энергетический вариационный метод для динамического оптимального транспорта (EVMDOT), который реформулирует проблему в рамках энергетической вариационной теории, сочетая карту потока, принцип наименьшего действия и принцип максимальной диссипации. Карта потока преобразует ограниченную задачу в неограниченную, автоматически обеспечивая выполнение уравнения сохранения массы, в то время как баланс между консервативными и диссипативными силами определяет поле скоростей. Примененный к уравнению Фоккера-Планка, EVMDOT восстанавливает как энергетический ландшафт, так и ландшафт Уаддингтона напрямую из временных данными о плотности. В ходе численных экспериментов мы выяснили, что EVMDOT достигает внутреннего баланса между количеством и качеством данных: достаточное количество данных компенсирует ограниченное качество данных, что делает реконструкцию устойчивой к выбору окна наблюдения. Мы также применили EVMDOT к набору данных Инициативы нейровизуализации болезни Альцгеймера (ADNI) для вывода потенциального ландшафта амилоидного бета и тау, выявляя два минимума, соответствующих когнитивно нормальному состоянию и стадии болезни Альцгеймера, а также переходный путь между ними.
Большие языковые модели (LLM) демонстрируют замечательные способности к рассуждению, однако их статическая архитектура в корне ограничивает применение в долгосрочных исследовательских процессах, требующих непрерывности между сессиями и количественной строгости. Здесь мы представляем Ensemble QSP, многоагентную структуру с трехуровневой иерархической архитектурой памяти, которая сохраняет внедренный контекст в рамках и постоянным на протяжении проекта (среднее состояние проекта: медиана 301 токен, максимум 4,050, по 104 запускам) за счет ограничения каждого состояния категории и удаления завершенной работы, что обеспечивает непрерывную автономную работу без ухудшения контекста. Система организует работу пяти специалистов-агентов под руководством экспертов в области, внедряя физические ограничения через контрольные списки на основе физических законов и структурированных знаний в области. Комплексное тестирование демонстрирует надежный автоматизированный выбор фармакокинетических и фармакодинамических моделей без человеческого вмешательства, постоянное качество результатов как для более дешевых, так и для передовых LLM, улучшенное восстановление параметров PK по сравнению с базовыми моделями с одним агентом и стабильный выбор моделей по лингвистически разнообразным подсказкам одной и той же задачи. Уровневое исключение возможностей на основе физиологической фармакокинетики (PBPK) на широком диапазоне сложности показывает, что контроль PI-агента улучшает эффективность отладки при сохранении конечной точности в различных условиях. Архитектура является структурно независимой от области, добавление новой научной области требует лишь новой конфигурации PI-агента.
Пространственная и одноклеточная транскриптомика являются трансформирующими подходами в расшифровке клеточной динамики. Поскольку основной парадигмой для реконструкции путей развития клеток является вывод траекторий, этот процесс критически важен. Однако существующие методы требуют значительного ручного вмешательства и знаний о разнородных инструментах, что создает значительные барьеры для эффективного анализа траекторий. Чтобы преодолеть этот разрыв, мы предлагаем SpaCellAgent — автономную многоагентную структуру, которая автоматизирует анализ спатиовременных данных и генерацию нарративов от начала до конца. SpaCellAgent использует многоагентную архитектуру для стратегического планирования рабочего процесса, динамический движок оркестровки инструментов для адаптивного выбора алгоритмов и модуль самоэволюции, который поэтапно уточняет производительность на основе обратной связи. Мы оцениваем SpaCellAgent на шести разнородных наборах данных, охватывающих сложные временные траектории развития, различные платформы секвенирования и пространственно разрешенные архитектуры тканей. SpaCellAgent последовательно демонстрирует улучшение аналитической эффективности более чем на 40% при сохранении производительности, соответствующей экспертным стандартам. Конвертируя спецификации на естественном языке в оптимизированные аналитические рабочие процессы и полностью автоматизируя конвейер, SpaCellAgent демократизирует продвинутое спатиовременное моделирование и устанавливает масштабируемую, управляемую агентами парадигму для вычислительной биологии. Код и материалы доступны по адресу https://github.com/LittleXH-shw/SpaCellAgent.