EntroPath: Встраивание ансамбля путей с максимальной энтропией для обучения многообразия
EntroPath: Maximum Entropy Path Ensemble Embedding for Manifold Learning
Карточка статьи
Рубрика
Биология
Источник
arXiv
Дата
07.07.2026
Автор
Science Morning
Время чтения
3 мин
Это предварительная публикация, она не прошла научное рецензирование.
Аннотация
Мы представляем метод обучения многообразия EntroPath, который восстанавливает геодезическую геометрию из графов данных с помощью ансамблей диффузионных путей. Многие существующие встраивания на основе графов полагаются либо на локально нормализованные случайные блуждания, либо на расстояния по кратчайшему пути. Первые могут сосредотачивать диффузию в плотно sampled областях, в то время как последние чувствительны к ложным кратким мостам в графе. EntroPath, в свою очередь, строит свои различия на основе случайного блуждания с максимальной энтропией (MERW), которое агрегирует полный ансамбль путей длины k между точками, а не полагается на какую-либо одну траекторию. Мы показываем, что полученное различие свободной энергии сходится к квадратному геодезическому расстоянию в пределе короткого времени, используя формулу теплового ядра Варадхана. Глубина диффузии k плавно интерполирует между локальной структурой окружения и глобальной геометрией многообразия, а симметризованное ядро допускает точную факторизацию Грама, соединяющую EntroPath с методами ядровых функций. Мы также предоставляем масштабируемые расширения через проекцию знаковых точек и псевдовремя диффузионного потенциала. На синтетических многообразиях и Benchmarks для одиночных клеток EntroPath последовательно соответствует или превосходит методы на основе диффузии и кратчайшего пути, оставаясь конкурентоспособным по сравнению с встраиваниями, сохраняющими соседство (UMAP, t-SNE), по метрикам локальной структуры. Его преимущества наиболее выражены на многообразиях с неравномерной плотностью выборки и хорошо разделенными ветвящимися траекториями, где диффузия по ансамблю путей более точно сохраняет основную геодезическую геометрию.
Краткое резюме
Метод EntroPath восстанавливает геометрию многообразий, используя ансамбли случайных путей, что позволяет независимо от локальных нормализаций более точно сохранять геодезическую структуру данных.
Практический вывод
EntroPath может быть полезен для анализа данных в сложных геометрических пространствах, особенно когда доступны данные с неравномерной выборкой.
Ограничения
Это предварительная публикация, она не прошла научное рецензирование. Метод может иметь ограничения при применении к очень большим графам из-за вычислительных затрат, а также возможные ошибки при обработке шумных данных.
Пневмония, полученная в сообществе (ППС), является одной из самых распространенных причин смерти среди детей. Получение образцов из нижних дыхательных путей у детей с ППС до сих пор представляет собой сложную задачу. В этом многопрофильном исследовании приняли участие 198 детей с ППС, которым показана фибробронхоскопия. Были собраны назофарингеальные аспираты и жидкость бронхоальвеолярного лаважа (ЖБАЛ) для целевой секвенирования следующего поколения (tNGS) и секвенирования 16S рибосомной РНК (рРНК) для сравнения патогенов и микробиоты. Сначала сравнивались разнообразия микробиоты между верхними и нижними дыхательными путями. Затем анализировалось разнообразие микробиоты нижних дыхательных путей среди различных групп патогенов и групп исхода. Высокая согласованность была наблюдена между первым патогеном, обнаруженным в верхних и нижних дыхательных путях у детей с ППС по tNGS. Индексы разнообразия были выше в верхних дыхательных путях, чем в нижних дыхательных путях у детей с ППС. Индексы богатства верхних дыхательных путей были выше в группе с постоянными ведущими патогенами между верхними и нижними дыхательными путями. Инфекция была связана с уменьшением разнообразия микробиоты нижних дыхательных путей по сравнению с группами бактерий и вирусов. Группа с кислородом показала более высокую распространенность, с наибольшей репрезентативной микробиотой в этой группе.
Механизмы реакций состоят из пошаговых последовательностей элементарных реакций, которые объясняют химические преобразования. Поэтому изучение логики механизмов имеет решающее значение для повышения фундаментального химического интеллекта больших языковых моделей (БЯМ). Пошаговое выведение механизмов реакций естественно соответствует парадигмам рассуждений БЯМ. Однако текущие химические БЯМ в первую очередь акцентируют внимание на грубых наименованиях реакций для предсказания продуктов и ретросинтеза, что часто приводит к физическим несоответствиям и галлюцинациям. В отличие от этого, специализированные небольшие генеративные модели для вывода механизмов, как правило, страдают от ограниченной способности к обобщению в различных химических пространствах. Чтобы преодолеть эти ограничения, мы создали новый обширный набор данных для рассуждения о механизмах реакций. Более того, мы разработали FukuyamaBench — сложный эталон, основанный на книге Фукуямы «Современные механизмы органических реакций», для строгой оценки производительности моделей в иерархическом рассуждении о механизмах. Наша дообученная модель Qwen3-30B-A3B достигает 8,3% точного совпадения путей в наборе FukuyamaBench Set~A, превосходя специализированную модель FlowER (5,1%), что демонстрирует, что обучение с учетом механизмов значительно улучшает химическое рассуждение в языковых моделях.
Мы представляем выбор энергии Гамильтона с переходом интерфейса (HRETIS) — рамочную структуру для выборки путей, предназначенную для эффективного выбора редких событий в системах со сложными потенциальными ландшафтами. HRETIS вводит вспомогательный потенциал в рамках схемы обмена Гамильтоном, что усиливает исследование пространства путей, когда основной потенциал не подходит для традиционных подходов к выборке путей. Это особенно выгодно для систем, демонстрирующих множественные пути, разделенные ортогональными барьерами, например, при (не)связывании лекарств, где стандартные алгоритмы часто показывают медленную сходимость, поскольку они застревают в определенных путях. Обмениваясь Гамильтонами между ансамблями путей, HRETIS преодолевает эти ограничения и увеличивает декорреляцию между последующими путями в цепочке Монте-Карло. Мы демонстрируем, что HRETIS обеспечивает надежную и точную кинетику в нескольких системах, включая грубосеточные симуляции проницаемости аминокислот через мембрану дипальмитоилфосфатидилхолина (DPPC). Более того, HRETIS, как выясняется, улучшает эффективность выборки и сходимость, иллюстрируя свой потенциал как мощного инструмента для выборки редких событий в сложных молекулярных системах.
Точное ранжирование кандидатов на антитела в зависимости от их аффинности связывания имеет решающее значение для открытия терапевтических антител. Однако существующие методы рассматривают сравнения аффинности независимо и игнорируют контекстуальную информацию, закодированную в других помеченных сравнениях, что ограничивает их способность захватывать специфические для антигена пейзажи связывания. Для многих целевых антигенов часто доступно лишь небольшое количество экспериментально охарактеризованных сравнений аффинности. Важный вопрос заключается в том, может ли модель использовать эти существующие сравнения для вывода специфичных для антигена паттернов ранжирования, которые облегчят последующее ранжирование аффинности. Эта форма обучения на основе помеченных демонстраций тесно напоминает парадигму обучения в контексте, что побуждает нас пересмотреть ранжирование аффинности антител с точки зрения ICL. С этой целью мы предлагаем AbICL, структуру ICL для специфичного для антигена ранжирования аффинности антител. AbICL сочетает предобученный структурный кодировщик с контекстной головой ранжирования и обучается с помощью эпизодической мета-стратегии обучения, что позволяет модели использовать поддерживающие демонстрации для адаптации в момент тестирования без обновления градиентов. Эксперименты на контрольной метрике AbRank показывают, что AbICL последовательно превосходит существующие базовые линии ранжирования практически по всем разделам данных и контрольным метрикам. Дальнейший анализ показывает, что ценность контекстуальных демонстраций зависит от того, насколько хорошо они соответствуют целевой задаче вывода и становится все более выраженной при изменении распределения и тонкой дискриминации аффинности. Эти результаты подчеркивают потенциал ICL в качестве эффективной парадигмы для специфичного для антигена ранжирования аффинности антител, особенно в сложных условиях, когда одной глобальной функции ранжирования недостаточно.
Квантово-механические (КМ) кластерные модели предоставляют эффективную платформу для механистических исследований ферментативных реакций, но остаются вычислительно сложными. Нейронные сетевые потенциалы (НСП) предлагают многообещающий путь для снижения этих затрат, однако ферменты предъявляют требования, отличные от маломолекулярных соединений, включая большие размеры систем, условия с неявным растворителем, значительную поляризацию и перенос заряда. В данном исследовании мы представляем интегрированную программную платформу для эффективного обучения НСП для механистических исследований ферментов, продемонстрированную на КМ моделях S-аденозил-L-метионинзависимых метилтрансфераз (MTases). Наш код Enerzyme вводит модульные архитектуры НСП, учитывающие электростатики, и сочетает автоматизированное строительство КМ с генерацией реактивных наборов данных. Пакет Enerzymette автоматизирует исследование реакционных путей как на уровне НСП, так и на уровне DFT. Мы показываем, что итеративные гибкие сканирования и расчеты с использованием сдвинутых эластичных линий накладывают более строгие требования на НСП, чем традиционные метрики наборов данных. Тем не менее, НСП, обученные на менее чем 1000 специфичных для системы точках данных, воспроизводят энергетические характеристики реакций и структуры переходного состояния для кластеров MTase, содержащих до 545 атомов, с близкой к химической точностью. Прямое управление атомными зарядами и постоянное диэлектрическое экранирование значительно улучшают стабильность и точность симуляций, в то время как заряды, обученные в режиме многозадачности, захватывают тенденции переноса заряда и поляризации и предоставляют химически значимые дескрипторы реактивности. Наконец, переносимость на химически разнообразные субстраты катехол O-метилтрансферазы указывает на то, что НСП учат универсальные паттерны реактивности по мере расширения учебных данных на несколько ферментов. В целом, эти результаты устанавливают основу для ускорения механистических исследований ферментов и направляют дальнейшую разработку НСП для биомолекулярной реактивности.
Профилирование метилирования ДНК стало мощным инструментом для классификации опухолей центральной нервной системы (ЦНС), однако существуют важные проблемы, касающиеся переносимости результатов между кохортами, методологической правильности и надежной многоклассовой оценки. В данной работе мы предлагаем новый и методологически строгий подход машинного обучения для классификации опухолей ЦНС на основе метилирования, который сочетает в себе метод разброса с разреженной проекцией для уменьшения размерности и многочленную логистическую регрессию для классификации. Мы оцениваем предложенный подход в том же общем экспериментальном контексте, который установлен широко используемым эталонным классификатором. В когорте из 2,801 образца наш метод достигает средней точности 96% при стратифицированной трехкратной перекрестной проверке. На независимой оценочной когорте из 1,104 образцов он достигает 86% точности на уровне 91 класса и 93% при оценке предсказаний на уровне семейства классов метилирования. Эти результаты превосходят соответствующие показатели современного эталона, составляя 82% согласованности на уровне классов и 88% согласованности на уровне семейства, что дает абсолютное увеличение примерно на 4 и 5 процентных пунктов соответственно. Это улучшение имеет клиническое значение: в диагностической практике увеличение на 5 пунктов в правильной классификации опухолей может напрямую повлиять на назначение подтипа рака и, в свою очередь, повлиять на выбор лечения и последующие клинические решения. Наши результаты показывают, что предложенная модель, основанная на более строгих методологических практиках в области машинного обучения, последовательно превосходит предыдущие современные достижения в различных условиях оценки и может существенно повысить надежность классификации опухолей ЦНС.