Искусственный интеллектbioRxivScience Morning3 мин чтенияpreprint
Сложность на уровне генов объясняет вариации в распределении эффектов на фитнес по всему геному
Gene-level complexity explains genome-wide variation in the distribution of fitness effects
Карточка статьи
Рубрика
Искусственный интеллект
Источник
bioRxiv
DOI
10.64898/2026.04.08.717178
Дата
29.06.2026
Автор
Science Morning
Время чтения
3 мин
Это предварительная публикация, она не прошла научное рецензирование.
Краткое резюме
Исследование выявило, что генетическая сложность на уровне генов более точно объясняет вариации в распределении эффектов на фитнес (DFE), чем организационная сложность отдельных видов. Отметив, что консервация, структура генов и экспрессия играют важную роль в предсказании селективных ограничений, авторы показали, что высококоннектированные и активно экспрессируемые гены испытывают более выраженные негативные эффекты. Влияние сложных свойств генов на адаптацию также варьировалось между видами и по геному, что подчеркивает разнообразие в эволюционных процессах.
Практический вывод
Результаты исследования подчеркивают важность анализа генетической сложности на уровне генов для лучшего понимания эволюционных механизмов и адаптации популяций.
Ограничения
Это предварительная публикация, она не прошла научное рецензирование. Одним из ограничений исследования является то, что данные были извлечены только из трех видов, что может ограничивать обобщаемость выводов на другие организмы. Кроме того, модель не учитывает все возможные факторы, влияющие на селективные ограничения и адаптацию.
Мотивация: Графы разнообразия пангеномов (PVGs) все чаще используются для представления геномного разнообразия, однако в настоящее время отсутствует общая структура для прямого генерирования популяционных пангеномов из явных эволюционных историй. Существующие симуляторы обычно сосредоточены на отдельных классах вариации и не интегрируют эти вариации в рамках генеалогической структуры, основанной на явных демографических историях. В результате оценка методов пангеномов в реалистичных популяционно-генетических условиях остается сложной задачей, а эталонные наборы данных с известной эволюционной истинной редко встречаются. Результаты: Мы представляем MSpangenome - структуру, учитывающую генеалогию, которая связывает симуляции популяционной генетики по модели коалесценции и анализы графов пангеномов. Этот конвейер объединяет симуляцию предков с msprime и алгоритм построения графов de novo для генерации PVGs непосредственно из смоделированных генеалогий. Явно моделируя рекомбинацию, демографическую историю и неполную сортировку линий, MSpangenome производит структурно сложные пангеномы, в которых вложенные и перекрывающиеся структурные варианты естественным образом возникают из базовых генеалогий, в то время как их эволюционная история и топология графа остаются известными по конструкции. Это обеспечивает общую структуру для генерации реалистичных популяционных пангеномов и установления наборов данных с известной истинной для методической оценки. Мы демонстрируем его полезность, генерируя пангеномы на уровне популяции и используя их в качестве контролируемых ссылок для оценки широко используемых инструментов построения графов, таких как PGGB и Minigraph-Cactus. Наши анализы выявили контрастные режимы производительности в зависимости от уровней разнообразия последовательностей, размеров образцов и классов структурной вариации, подчеркивая ценность симуляционных оценок для выявления ошибок реконструкции, которые трудно обнаружить, используя только эмпирические наборы данных. Доступность и реализация: MSpangenome реализован на Python, полностью контейнеризирован, доступен бесплатно по адресу https://forge.inrae.fr/pangepop/MSpangepop и зеркалирован на https://github.com/inrae/MSpangepop.
Технологии пространственной транскриптомики (СТ) позволяют изучать экспрессию генов в контексте пространственной организации тканей, предоставляя идеи о структуре тканей, клеточных взаимодействиях и прогрессии заболеваний. Однако существующие методы уменьшения размерности часто игнорируют пространственную информацию или не могут отличить пространственные генетические паттерны от паттернов, вызванных различиями в клеточных типах, что ограничивает биологическую интерпретацию, сворачивая различия в паттернах экспрессии генов с различиями в пропорциях клеточных типов. Чтобы решить эти проблемы, мы представляем масштабируемую много групповую ненегативную пространственную факторизацию (smNSF) — вычислительно удобную вероятностную модель, которая интегрирует пространственные координаты и метки клеточных типов в единую модель матричной факторизации. Используя много групповые гауссовские процессы (MGGP) в качестве априорных значений, наша модель захватывает сложные пространственные вариации специфическим для клеточного типа образом, при этом обеспечивая ненегативность для улучшения интерпретируемости. Мы разрабатываем вариационную инференцию для MGGP, которая поддерживает масштабируемую оптимизацию и улучшает численную стабильность smNSF. На семи наборах данных пространственной транскриптомики, охватывающих разнообразные технологии и ткани, smNSF восстанавливает разреженные, интерпретируемые пространственные факторы и, через свои умовные постериоры для клеточных типов, организует их в пространственные программы, обогащенные клеточными типами, специфичные для клеточных типов и универсальные, которые не очевидны из маргинальных факторов. Учитывая метки клеточных типов в данных СТ, smNSF дает возможность проводить пространственные декомпозиции с учетом клеточных типов и поддерживает умовные постериоры для in silico исследования взаимосвязей между пространственными паттернами и клеточной идентичностью.
Резюме автора: Большинство современных методов анализа пространственной транскриптомики либо игнорируют пространственную структуру, либо не могут отделить пространственные паттерны, обусловленные геном, от различий, вызванных клеточными типами. В данной работе мы разрабатываем метод, который использует пространственные координаты и метки клеточных типов вместе, чтобы лучше выявить паттерны экспрессии генов. Наш подход, масштабируемая много групповая ненегативная пространственная факторизация (smNSF), использует гауссовские процессы для моделирования пространственной структуры, которые мы расширяем, чтобы захватить как пространственную структуру, так и клеточный тип в единой рамке, называемой много групповыми гауссовскими процессами.
Применяя smNSF к наборам данных пространственной транскриптомики из мозга мыши и тканей человека, мы обнаруживаем, что условие на разные клеточные типы выявляет пространственные паттерны, которые невидимы в стандартных анализах: некоторые клеточные типы подавляют паттерн, другие усиливают его, а некоторые раскрывают структуру, которая проявляется только после условия. Это помогает нам понять, как специфические для клеточных типов пространственные программы способствуют организации тканей.
Чтобы сделать этот анализ выполнимым на масштабе современных пространственных экспериментов, мы также вводим новую вычислительную аппроксимацию для гауссовских процессов, которая в принципе может быть прямо применена к другим моделям латентных переменных GP. Вместе эти инструменты помогают разбирать биологические источники вариации и поддерживают in silico исследование того, как может изменяться экспрессия генов при различных композициях тканей или клеточных типов.
Эффективная ассоциация ячеек остается фундаментальной задачей в системах пятого поколения (5G) «автомобиль-все» (V2X) из-за быстрых изменений топологии, гетерогенных развертываний и строгих требований к задержке. Конвенциональные подходы на основе обучения часто опираются на мелкие представления или независимые стратегии оптимизации, что ограничивает их адаптивность в густых и быстро меняющихся условиях. В данной работе предлагается структура многоуровневого графового представления, которая моделирует взаимодействия между автомобилями и базовыми станциями в иерархических пространственных структурах. Предложенный подход интегрирует контекстное встраивание узлов с графовым обучением, основанным на внимании, для выявления паттернов мобильности, характеристик сигналов и зависимостей нагрузки сети. Кроме того, в механизм обучения на стадии подготовки включен оптимизационный механизм для уточнения параметров внимания, что улучшает сходимость без увеличения сложности вывода. Структура была оценена на реальном наборе данных мобильности автомобилей, что продемонстрировало постоянные улучшения в стабильности ассоциации, надежности переключения и общей производительности сети по сравнению с существующими методами глубокого обучения и графами. Экспериментальные результаты показывают приросты точности (94,17%) и F1-меры (93,93%), что указывает на повышение устойчивости решений в динамических условиях. Хотя валидация проводилась на городском наборе данных, предложенная архитектура обеспечивает масштабируемую основу для адаптивного выбора ячеек в системах интеллектуального транспорта следующего поколения.
Мы анализируем влияние оптимизации начальной популяции генетического программирования (ГП) для символьной регрессии (СР) на точность и сложность решений. Мы сравниваем три хорошо известные методы случайной инициализации, а также инициализацию с небольшими оптимизированными решениями из исчерпывающей символьной регрессии (ИСР), используя реализацию ГП/СР, основанную на многокритериальном эволюционном алгоритме NSGA-II. Мы сравниваем конечные парето-фронты, найденные с помощью каждого метода инициализации, на двенадцати синтетических задачах различной сложности и одной реальной выборке. Мы не обнаружили значительных различий в точности или сложности моделей среди методов инициализации. Начальное преимущество инициализации с использованием ИСР исчезает всего через несколько поколений. Наши результаты показывают, что при сходной диверсификации в начальной популяции влияние метода инициализации в символьной регрессии на основе ГП на конечный парето-фронт представляет собой незначительный фактор.
Фоновая информация: Эндометриоз — это сложное заболевание, зависящее от эстрогенов, и обладающее значительным генетическим компонентом. Хотя геномные ассоциативные исследования (GWAS) выявили множество локусов предрасположенности, большинство связанных вариантов находится в некодирующих регионах, что ограничивает биологическую интерпретацию и идентификацию причинных генов. Приоритизация генов в GWAS также ограничена неполным охватом аннотации, специфичной для тканей (например, GTEx, ENCODE, детальная маршрутизация, менделевская рандомизация и методы на основе сетей). Мы применили искусственный интеллект AlphaGenome для приоритизации вариантов, ассоциированных с эндометриозом, на основе предсказанных регуляторных эффектов, специфичных для матки. Методы: Мы проанализировали 10 000 ассоциированных с эндометриозом однонуклеотидных полиморфизмов (SNP), идентифицированных в ранее опубликованных GWAS под руководством Рахмиоглу и др., используя AlphaGenome для различных типов геномных выходов. Предсказания, специфичные для матки с высоконадежными эффектами (квантильный балл ≥ 0.90), были сгруппированы по основным регуляторным модальностям. SNP, приоритизированные AlphaGenome в пределах ±500 кБ от известных локусов GWAS, были классифицированы по уровням на основе числа поддерживаемых регуляторных модальностей; более широкий уровень поддержки указывает на более сильные многослойные регуляторные доказательства. Также была оценена частота аллеля эффекта, связанное равновесие (LD) и перекрытие с ранее опубликованными вариантами, ассоциированными с эндометриозом. Результаты: AlphaGenome сгенерировал специфичные для матки 147 033 высоконадежных сигнала по 10 000 вариантов, ассоциированных с эндометриозом, охватывающих шесть регуляторных модальностей, включая экспрессию генов, активность промоторов, доступность хроматина, связывание транскрипционных факторов, модификацию гистонов и сплайсинг РНК. В рамках 42 установленных локусов GWAS по эндометриозу AlphaGenome идентифицировал 42 альтернативных подпороговых SNP с более сильными предсказанными регуляторными эффектами, специфичными для матки, чем опубликованные ведущие варианты GWAS. Девятнадцать SNP, приоритизированных AlphaGenome, были классифицированы как уровень 1, показывая поддержку по всем шести регуляторным модальностям, в то время как среди пяти ведущих SNP GWAS такая поддержка наблюдалась только у пяти. Анализ связанного равновесия выявил восемь SNP уровня 1 с низким и слабым LD (r² < 0.5) относительно соответствующих ведущих вариантов GWAS, регулируя большинство генов, вовлеченных в пролиферацию, опосредованную эстрогенами, и воспалительную сигнализацию, подчеркивая их потенциальную значимость для патогенеза эндометриоза. Кроме того, мы идентифицировали 167 значительных SNP по всему геному вне 42 опубликованных локусов ведущих SNP GWAS, включая шесть SNP уровня 1 (rs1482061, rs7772579, rs6557140, rs2982571, rs12631337 и rs79626929), охватывающих гены рядом с ESR1/6q25.1, что подтверждает биологическую значимость для патогенеза эндометриоза. Заключения: На основе регуляторной приоритизации AlphaGenome были уточнены локусы геномного ассоциированного исследования, ассоциированные с эндометриозом, путем идентификации вариантов с более сильной предсказанной функциональной значимостью, специфичной для матки. Эти результаты предоставляют регуляторную основу для приоритизации кандидатных вариантов и генов для дальнейшей функциональной валидации в эндометриозе.
Лесные характеристики имеют ключевое значение для мониторинга ресурсов на национальном уровне. Метрики воздушного LiDAR являются одними из дополнительных переменных, наиболее сильно коррелирующих с лесными характеристиками, используемыми для оценки в Национальном лесном инвентаре (NFI). Однако создание предсказаний на всей территории остается сложной задачей, когда данные LiDAR собираются в гетерогенных условиях. С расширением национальных программ LiDAR в Европе изменчивость датчиков, параметров полета, сезонов и углов сканирования ограничивает надежность существующих моделей, которые часто откалиброваны для местных условий. Мы представляем FLORA (Регрессия лесного LiDAR на основе октодерева с использованием вспомогательных данных), фреймворк глубокого обучения, который предсказывает шесть лесных показателей: доминирующую высоту, общий объем, объем лиственных древесных пород, объем хвойных древесных пород, базальную площадь и плотность стволов на основе гетерогенных точечных облаков LiDAR. FLORA объединяет основу на основе октодерева с экологическими и спатиально-временными вспомогательными переменными с помощью механизма поздней фузии. Модели обучаются и оцениваются на 32,052 участках Национального лесного инвентаря по материковой Франции с использованием данных из программы LiDAR HD во Франции. Одна модель, обученная как на лиственном, так и на безлистном захвате, превосходит модели, специфичные для сезона, и улучшает надежность по сезонам. Вспомогательные переменные обеспечивают скромные общие приросты, но в большей степени способствуют предсказанию объема по видам. FLORA достигает значения rRMSE около 12,3% (R2 = 0,88) для доминирующей высоты и 39% (R2 = 0,74) для общего объема, предоставляя надежную основу для оценки лесных характеристик в крупных масштабах на основе гетерогенных национальных программ LiDAR.