БиологияarXivScience Morning3 мин чтенияpreprint

О различимости деревьев и полной идентифицируемости филогенетических сетей

On Tree-Network Distinguishability and Full Identifiability of Phylogenetic Networks

Рубрика
Биология
Источник
arXiv
Дата
14.07.2026
Автор
Science Morning
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Биология

Аннотация

Филогенетические сети обобщают филогенетические деревья для эволюционных историй, которые включают ретикулярные события, такие как рекомбинация, горизонтальный перенос генов и гибридизация. В рамках марковской модели замещения нуклеотидов филогенетическая сеть определяет распределение паттернов листьев. В данной работе мы исследуем идентифицируемость топологии сети из этого распределения в рамках моделей Джукса-Кантера (JC), Кимуры с двумя параметрами (K2P) и Кимуры с тремя параметрами (K3P). Нашим первым результатом является то, что полуправильный параметр сети уровня 1 (с учётом перенаправления треугольников) полностью идентифицируем по всем трем моделям на биологически разумном пространстве параметров, где скорости замещения являются вероятностными, а параметры смешивания нетривиальны (т.е. не равны 0 или 1). В отличие от общепринятой идентифицируемости, установленной в предыдущих работах, это действительно для каждой точки параметрического пространства, а не только для подмножества нулевой меры. Наш второй результат отличает филогенетические сети от филогенетических деревьев в том же пространстве параметров при JC и K2P. Мы доказываем, что ни одна филогенетическая сеть и филогенетическое дерево не могут порождать одно и то же распределение паттернов листьев, если только сеть не является деревом, возможно, дополненным определёнными подструктурами, называемыми $2$-болбами. Это означает, что наличие ретикулярной эволюции создает, в большинстве случаев, обнаружимый след в распределении паттернов листьев. Более широко, эти результаты имеют последствия для идентифицируемости за пределами изученных моделей и классов сетей, включая несколько моделей на основе коалесценции.

Краткое резюме

Исследование идентифицируемости топологии филогенетических сетей показывает, что наличие ретикулей в эволюции оставляет заметные следы в распределении паттернов листьев. Это имеет важные последствия для понимания различий между филогенетическими сетями и деревьями.

Практический вывод

Исследование подчеркивает важность различий между филогенетическими сетями и деревьями в биологических исследованиях, что может помочь в понимании сложных эволюционных процессов.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. В работе рассматриваются только определённые модели замещения и классы сетей, что может ограничивать применимость результатов. Также не рассматриваются альтернативные модели и подходы к анализу филогенетических данных.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Биология
Биология
100%

MERLIN-SUITE: Вероятностная модульная инференция генетических регуляторных сетей из многоомиксных данных с интеграцией регуляторных приоритетов и активности транскрипционных факторов

Точное восстановление генетических регуляторных сетей (ГРС) необходимо для понимания транскрипционных процессов в разработке и заболеваниях. MERLIN-SUITE (https://github.com/Roy-lab/MERLIN-SUITE) представляет собой набор алгоритмических расширений на базе MERLIN (Модульное обучение регуляторных сетей с учетом информации по генам), это вероятностная структура, которая позволяет выявлять специфические для генов и модуля регуляторные программы ко-регулируемых модулей, захватывая как детализированные, так и модульные аспекты транскрипционных сетей. Хотя восстановление, основанное на экспрессии, эффективно, зачастую оно плохо соотносится с экспериментально подтвержденными регуляторными взаимодействиями. MERLIN-P решает эту проблему, интегрируя внешние регуляторные приоритеты, такие как мотивы, ChIP и данные о perturbations, для повышения биологической значимости и предсказательной точности. MERLIN-P-TFA дополнительно развивает рамки, включая регуляризованную оценку латентной активности транскрипционных факторов (TFA), преодолевая ограничение, что уровни мРНК TF могут не отражать активность белков. Интегрируя данные экспрессии, заранее известные данные и моделирование с учетом активности, этот унифицированный подход поддерживает надежное восстановление ГРС как в пакетных, так и в одноядерных наборах данных. Эта глава представляет MERLIN-SUITE с акцентом на MERLIN-P-TFA и демонстрирует его использование на одномодальном многомодальном наборе данных о перетасовке клеток мыши для вывода ГРС и выявления ключевых регуляторов.

Биология
Биология
100%

Ограничения идентифицируемости физически обоснованного вывода для пространственной стохастической динамики на основе статических снимков

Несмотря на увеличение масштаба и разрешения, многие биологические измерения остаются разрушительными, раскрывая лишь пространственную информацию, а не динамику, которую они кодируют. Совмещая гибкие представления с механистическими ограничениями, физически обоснованное машинное обучение предлагает многообещающий путь для вывода этих динамик из статических снимков. Исходя из субклеточной визуализации экспрессии генов, мы задаемся вопросом, когда статический пространственный паттерн молекул может идентифицировать пространственно изменяющуюся диффузию, создание, разрушение и обмен на границе, и как различные схемы вывода выполняют эту задачу. Структурный анализ идентифицируемости показывает, что распределенные источники не могут быть идентифицированы, тогда как точечный источник, такой как место транскрипции, может восстановить идентифицируемость. Эти ограничения дополнительно формируются, казалось бы, безобидными выборами моделей: граничные условия, пространственная регулярность базовой динамики и даже конвенция стохастического исчисления. Затем мы адаптируем несколько схем, основанных на физических принципах, отличающихся тем, как они представляют решение и учитывают управляющие уравнения, и демонстрируем эффективный вывод из одного снимка. Таким образом, подходы, основанные на физических принципах, могут восстановить пространственные гетерогенности биологических динамик из статических данных, но их использование должно сопровождаться и направляться тщательным анализом идентифицируемости для значительной интерпретации результатов.

Биология
Биология
92%

scMTNI: Использование клеточной траектории и контекста для вывода динамических генетических регуляторных сетей из данных многократно омных одиночных клеток

Генетические регуляторные сети (ГРС) описывают направленные отношения между регуляторами и целевыми генами, определяя шаблоны экспрессии генов специфично для клеточных типов. Технологии многократного омного секвенирования одиночных клеток, такие как секвенирование РНК одиночных клеток (scRNA-seq) и секвенирование для оценки доступности хроматина одиночной клетки (scATAC-seq), позволяют высокоточно измерять экспрессию генов и регуляцию, специфичные для клеточных типов, как никогда ранее. Тем не менее, инструменты для вывода специфичных для клеточных типов ГРС и моделирования их динамики по-прежнему остаются редкостью. Для содействия выводу и анализу специфичных для клеточных типов ГРС в контекстах, таких как клеточное развитие или прогрессирование заболеваний, где структура и динамика клеточных линий важны, мы разработали рамочные структуру многофункционального обучения, называемую выводом сетей на базе одиночных клеток (scMTNI). ScMTNI и его сопутствующие инструменты анализа сетей предлагают комплексный пакет для определения специфичных для клеточных типов ГРС и изучения их динамики. Эта глава книги описывает инструмент scMTNI и демонстрирует его применение к существующему набору данных о многомодальной репрограммировании одиночных клеток для вывода специфичных для клеточных типов ГРС и выявления ключевых регуляторов переходов клеточной судьбы во время репрограммирования клеток.

Биология
Биология
90%

Максимизация филоразнообразия по всем путям: параметризованные подходы для сетей

Филоразнообразие (PD) является фундаментальной мерой биологического разнообразия, изначально определенной для филогенетических деревьев и широко используемой в охране природы. Филогенетические деревья часто обобщаются на направленные ациклические графы, называемые филогенетическими сетями. В связи с этим требуется соответствующее обобщение PD. Естественным обобщением для взвешенных по рёдам филогенетических сетей является мера всех путей, где разнообразие множества S видов (таксонов) определяется как общая масса всех рёбер, которые лежат на пути от корня к хотя бы одному виду из S. Хотя максимизация PD на деревьях может быть решена за полиномиальное время, соответствующая задача для сетей является NP-трудной и трудной для аппроксимации. Мы проводим систематическое исследование параметризованной сложности проблемы Max-All-Paths-PD (MapPD). Мы устанавливаем W[2]-трудность, когда задача параметризована количеством видов, включённых в решение, и W[1]-трудность для количества видов, исключённых из решения. С положительной стороны, мы показываем, что проблема является фиксированно-параметрически разрешимой в зависимости от порога разнообразия и допустимой потери разнообразия. Мы дополнительно анализируем, как близость сети к дереву влияет на алгоритмическое поведение, и представляем алгоритмы с фиксированным параметром с одноэкспоненциальной сложностью, учитывающие количество ретруксаций и ширину дерева основного графа. Наконец, мы представляем полиномиальную ядровизацию для MapPD относительно количества рёбер ретруксации.

Биология
Биология
90%

Надежное восстановление механистических операторов с использованием нейронных сетей, учитывающих биологические аспекты: принципы проектирования архитектуры и оптимизации

Многие биологические процессы управляются сложными динамическими механизмами, которые остаются недостаточно понятными, несмотря на растущий объем экспериментальных данных. Нейронные сети, учитывающие биологические аспекты (BINNs), стремятся решить эту проблему, внедряя механистические дифференциальные уравнения в обучение нейронной сети, что позволяет восстанавливать интерпретируемые конститутивные операторы непосредственно из разреженных и зашумленных наблюдений. Однако надежное восстановление операторов чувствительно к архитектуре сети, стратегии оптимизации и информативности данных. В настоящей работе мы представляем систематическое эмпирическое исследование того, как эти факторы влияют на механистическую интерпретацию с использованием BINNs, примененных к каноническим моделям одномерного адекватно-диффузионно-реакционного уравнения вpartial differential equations. В рамках набора контрольных задач мы исследуем, как выразительность сети, скорость обучения, вес потерь и размер пакета влияют на поведение оптимизации и восстановление операторов. Мы показываем, что успешная механистическая интерпретация зависит от баланса competing objectives, а не от максимизации какого-либо единственного аспекта модели или оптимизации. Умеренно выразительные архитектуры превосходят чрезмерно сложные нейронные сети, промежуточные скорости обучения улучшают стабильность оптимизации, сбалансированные данные и потери PDE являются необходимыми для точного восстановления операторов, а промежуточные размеры пакетов обеспечивают наилучший компромисс между вычислительной эффективностью и воспроизводимостью. Мы также определяем практические диагностические методы для распознавания распространенных способов отказа, включая переобучение, нестабильную оптимизацию и плохое механистическое восстановление, когда истинные данные недоступны. Все эти результаты предоставляют обоснованные рекомендации для применения BINNs в качестве надежных инструментов для открытия биологических моделей.

Биология
Биология
85%

Теория контравариантности: сильное выравнивание для минимальных решений сложных задач

За последние пятнадцать лет ряд результатов из области НейроИскусственного Интеллекта подняли основные вопросы как о том, как сравнивать модели глубоких нейронных сетей (ДНС) с мозгом, так и о том, насколько ожидаемо конвергентное развитие между искусственными сетями и реальными мозговыми сетями. Здесь мы показываем, что для любых двух минимальных решений ДНС для достаточно сложной задачи: (i) 'слабое' выравнивание представлений сети на основе аффинных преобразований гарантирует 'сильное' выравнивание привилегированных осей, и (ii) выравнивание 'молний' в иерархии сети приводит к возникновению привилегированных осей в результате оптимизации задачи по принципу 'от конца до конца'. Эти результаты формализуют понятие контравариантности, предложенное Као и Яминсом [2024], и иллюстрируют важные последствия для теории НейроИскусственного Интеллекта: при достаточно сложных задачах выбор метрики для межсетевого сравнения не так чувствителен, а конвергентное развитие, вероятно, неизбежно.