БиологияarXivScience Morning3 мин чтенияpreprint

Enerzyme: Рамочная структура для эффективного обучения реактивных нейронных сетевых потенциалов для катализа ферментов с применением к метилтрансферазам

Enerzyme: A Framework for Efficient Training of Reactive Neural Network Potentials for Enzyme Catalysis with Application to Methyltransferases

Рубрика
Биология
Источник
arXiv
Дата
01.07.2026
Автор
Science Morning
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Биология

Аннотация

Квантово-механические (КМ) кластерные модели предоставляют эффективную платформу для механистических исследований ферментативных реакций, но остаются вычислительно сложными. Нейронные сетевые потенциалы (НСП) предлагают многообещающий путь для снижения этих затрат, однако ферменты предъявляют требования, отличные от маломолекулярных соединений, включая большие размеры систем, условия с неявным растворителем, значительную поляризацию и перенос заряда. В данном исследовании мы представляем интегрированную программную платформу для эффективного обучения НСП для механистических исследований ферментов, продемонстрированную на КМ моделях S-аденозил-L-метионинзависимых метилтрансфераз (MTases). Наш код Enerzyme вводит модульные архитектуры НСП, учитывающие электростатики, и сочетает автоматизированное строительство КМ с генерацией реактивных наборов данных. Пакет Enerzymette автоматизирует исследование реакционных путей как на уровне НСП, так и на уровне DFT. Мы показываем, что итеративные гибкие сканирования и расчеты с использованием сдвинутых эластичных линий накладывают более строгие требования на НСП, чем традиционные метрики наборов данных. Тем не менее, НСП, обученные на менее чем 1000 специфичных для системы точках данных, воспроизводят энергетические характеристики реакций и структуры переходного состояния для кластеров MTase, содержащих до 545 атомов, с близкой к химической точностью. Прямое управление атомными зарядами и постоянное диэлектрическое экранирование значительно улучшают стабильность и точность симуляций, в то время как заряды, обученные в режиме многозадачности, захватывают тенденции переноса заряда и поляризации и предоставляют химически значимые дескрипторы реактивности. Наконец, переносимость на химически разнообразные субстраты катехол O-метилтрансферазы указывает на то, что НСП учат универсальные паттерны реактивности по мере расширения учебных данных на несколько ферментов. В целом, эти результаты устанавливают основу для ускорения механистических исследований ферментов и направляют дальнейшую разработку НСП для биомолекулярной реактивности.

Краткое резюме

Статья представляет новую программную платформу Enerzyme для эффективного обучения нейронных сетевых потенциалов в механистических исследованиях ферментативных реакций, предлагая уникальные архитектуры и методы автоматизации.

Практический вывод

Эта работа предлагает новые способы повышения точности и стабильности симуляций ферментов, что может ускорить открытия в области биохимии и катализа.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. Основными ограничениями исследования являются необходимость в большом количестве данных для обучения нейронных сетей и возможная ограниченность моделей в специфических условиях или системах.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Биология
Биология
100%

Точное, междисциплинарное и прозрачное понимание взаимосвязей структура-свойство с помощью глубокой структурной логики

Взаимосвязи структура-свойство являются основополагающими для биологии, химии и науки о материалах, где функция, реактивность и физический ответ возникают из пространственной, химической и периодической организации. Механистическое объяснение этих взаимосвязей требует интерпретации структурных доказательств с помощью научных принципов и физических ограничений, начиная с стереохимии и связи и заканчивая симметрией, энергиями и периодическим порядком. Однако применение искусственного интеллекта к этому процессу представляет собой общую задачу представления и логического вывода: модели должны сохранять информацию о структурах, характерную для области, и демонстрировать, как конкретные доказательства поддерживают предсказания в этих рамках. Здесь мы представляем SciReasoner, многомодальную научную модель, основанную на native структурной логике, охватывающую белки, небольшие молекулы и неорганические кристаллы. SciReasoner дискретизирует координаты, топологии и периодические связи в единый словарь, учитывающий структуру, рассматривая структурные токены как адресуемые единицы доказательства во время логического вывода. В контролируемом по гомологии прогнозировании систематики генов SciReasoner улучшает аннотацию клеточных компонентов для белков с низкой гомологией и сиротоподобных белков, увеличивая $F_{\max}$ с 0.42 до 0.55. В химии он увеличивает точность одностадийного ретросинтеза с 0.63 до 0.72, генерируя следы разрыва на уровне фрагментов и проверки предшественников. В науке о материалах его представления разделяют элементарные и композитные фазы и разрешают режимы с высоким и низким энергетическим зазором. По 86 тестовым задачам SciReasoner достигает лучших в своем классе результатов по 67 задачам. Двойная слепая экспертная оценка оценивала его логические следы как предпочтительные или хотя бы сопоставимые с таковыми у модели большого языка передового уровня в 98% случаев. Делая структуру проверяемым субстратом для логического вывода в рамках научных ограничений, SciReasoner связывает точное предсказание с интерпретируемым научным выводом.

Биология
Биология
82%

О различимости деревьев и полной идентифицируемости филогенетических сетей

Филогенетические сети обобщают филогенетические деревья для эволюционных историй, которые включают ретикулярные события, такие как рекомбинация, горизонтальный перенос генов и гибридизация. В рамках марковской модели замещения нуклеотидов филогенетическая сеть определяет распределение паттернов листьев. В данной работе мы исследуем идентифицируемость топологии сети из этого распределения в рамках моделей Джукса-Кантера (JC), Кимуры с двумя параметрами (K2P) и Кимуры с тремя параметрами (K3P). Нашим первым результатом является то, что полуправильный параметр сети уровня 1 (с учётом перенаправления треугольников) полностью идентифицируем по всем трем моделям на биологически разумном пространстве параметров, где скорости замещения являются вероятностными, а параметры смешивания нетривиальны (т.е. не равны 0 или 1). В отличие от общепринятой идентифицируемости, установленной в предыдущих работах, это действительно для каждой точки параметрического пространства, а не только для подмножества нулевой меры. Наш второй результат отличает филогенетические сети от филогенетических деревьев в том же пространстве параметров при JC и K2P. Мы доказываем, что ни одна филогенетическая сеть и филогенетическое дерево не могут порождать одно и то же распределение паттернов листьев, если только сеть не является деревом, возможно, дополненным определёнными подструктурами, называемыми $2$-болбами. Это означает, что наличие ретикулярной эволюции создает, в большинстве случаев, обнаружимый след в распределении паттернов листьев. Более широко, эти результаты имеют последствия для идентифицируемости за пределами изученных моделей и классов сетей, включая несколько моделей на основе коалесценции.

Биология
Биология
82%

ANGLE: Угловое нейронное генеративное обучение через регрессию

Круговые данные, представляющие собой углы или направления, часто встречаются в таком областях, как компьютерное зрение, биология, геология и метеорология. Традиционная регрессия ориентируется на условное среднее, что часто оказывается геометрически вводящим в заблуждение для круговых откликов при многомодальных, скошенных или асимметричных структурах данных. Для решения этих ограничений предлагается легковесная глубокая генеративная структура, именуемая ANGLE, для непараметрической распределительной регрессии на круге. Полное условное распределение углового отклика, с учетом евклидовых и круговых ковариант, изучается через генеративную карту, оптимизированную с помощью обобщенной круговой энергетической оценки (GCES) потерь. Установлены желаемые теоретические свойства, включая строгую законность потерь и вращательную эквивариантность оценок. Кроме того, учитываются модели аддитивного шума как до, так и после. Предоставлен унифицированный инструмент для решения ранее недостаточно исследованных задач в круговой статистике: экстраполяция, достаточное уменьшение размерности и тестирование равенства условных распределений. Эффективность структуры продемонстрирована через обширные симуляции и реальные приложения. В частности, предложение используется для оценки поз объектов на изображениях и предсказания направления ветра, что имеет важное значение для систем наблюдения, автономных транспортных средств и энергетических систем соответственно. Были выявлены превосходные предсказательные характеристики и надежная оценка неопределенности предлагаемого метода в этих задачах.

Биология
Биология
82%

SpaCellAgent: Саморазвивающаяся многоагентная структура на основе LLM для анализа траекторий

Пространственная и одноклеточная транскриптомика являются трансформирующими подходами в расшифровке клеточной динамики. Поскольку основной парадигмой для реконструкции путей развития клеток является вывод траекторий, этот процесс критически важен. Однако существующие методы требуют значительного ручного вмешательства и знаний о разнородных инструментах, что создает значительные барьеры для эффективного анализа траекторий. Чтобы преодолеть этот разрыв, мы предлагаем SpaCellAgent — автономную многоагентную структуру, которая автоматизирует анализ спатиовременных данных и генерацию нарративов от начала до конца. SpaCellAgent использует многоагентную архитектуру для стратегического планирования рабочего процесса, динамический движок оркестровки инструментов для адаптивного выбора алгоритмов и модуль самоэволюции, который поэтапно уточняет производительность на основе обратной связи. Мы оцениваем SpaCellAgent на шести разнородных наборах данных, охватывающих сложные временные траектории развития, различные платформы секвенирования и пространственно разрешенные архитектуры тканей. SpaCellAgent последовательно демонстрирует улучшение аналитической эффективности более чем на 40% при сохранении производительности, соответствующей экспертным стандартам. Конвертируя спецификации на естественном языке в оптимизированные аналитические рабочие процессы и полностью автоматизируя конвейер, SpaCellAgent демократизирует продвинутое спатиовременное моделирование и устанавливает масштабируемую, управляемую агентами парадигму для вычислительной биологии. Код и материалы доступны по адресу https://github.com/LittleXH-shw/SpaCellAgent.

Биология
Биология
77%

Представительная геометрия как метрическая мера достоверности для сетей, ограниченных коннектомом: доказательства из зрительной системы Drosophila

Какое значение имеет биологическая проводка для нейронных вычислений? Поведенческие эксперименты могут проверить правильность выводов модели, но они не могут определить, являются ли ее внутренние представления биологически верными. Брунтон и др. (2026) сделали это конкретным: коннектом червя C. elegans, обученный с помощью глубокого обучения с подкреплением, генерирует реалистичную походку мухи Drosophila, однако модель не имеет биологического смысла, так как достоверность поведения может быть достигнута без биологической достоверности. Нам нужен метрический показатель на уровне популяции, который отличал бы настоящую биологическую проводку от произвольной, не требуя поведенческого декодера. Мы предлагаем представительную геометрию как такой метрический показатель. Представительная геометрия — это структура парных расстояний между ответами популяции на различные стимулы — отражает, как нейронная цепь организует свое представительное пространство независимо от того, какое поведение она вызывает. Мы применяем анализ представительной схожести (RSA) и центрированное выравнивание ядер (CKA) к ансамблю зрительной системы Drosophila melanogaster Flyvis (Лаппалаинен и др. (2024)): 50 сетей, архитектура которых фиксирована на коннектоме Flyvis (восстановленном на основе частичных источников электронной микроскопии), в сравнении с ограниченными по стабильности случайными базelines (перетасовка весов, сохраняющая знак, выборка отклонений для динамической стабильности, n = 50). Сети, ограниченные коннектомом, создают гладкую круговую геометрию направления, которую случайные сети не могут воспроизвести: RSA Спирмен r = 0.686 (p < 0.0001) для стимулов на границе ON и r = 0.846 (p < 0.0001) для стимулов ON+OFF границы, что подтверждается CKA (p < 0.05 в обоих экспериментах). Геометрия также отслеживает биологическую настройку направления T4/T5, зарегистрированную у живых мух (Майсак и др. 2013): геометрия, ограниченная коннектомом, значительно лучше соответствует биологии, чем случайная геометрия (r = 0.930 против r = 0.603, разрыв {triangleup}r = 0.327, p < 0.0001). В пределах каждой полярности стимула путь ON кодирует направление с более сильным геометрическим разделением, чем путь OFF ({triangleup}r = 0.138, 95% CI [0.091, 0.236]); мы сообщаем об этом как о свойстве представлений ансамблей модели, а не как об установленной биологической разнице: Майсак и др. (2013) находят T4 и T5 функционально эквивалентными, кроме полярности контраста. Чтобы устранить смещение в обучении, мы сравнили незатренированные сети с перетасованными базелинами: предшествующий коннектом формирует геометрию направления на уровне ансамбля до любой тренировки задачи (r = 0.260, p = 0.041 и r = 0.215, p = 0.048; оба предельные, не откорректированные), что предполагает, что проводка кодирует геометрический предшественник, который обучение усиливает. Эти результаты устанавливают представительную геометрию как кандидата на метрическую меру достоверности, которая позволяет различать биологическую и произвольную проводку, используя только ответы популяции на структурированный набор стимулов, и указывает на практический путь к метрическим мерам достоверности для эмуляций на уровне коннектома, приближающихся к коре млекопитающих.

Биология
Биология
74%

Обнаружение падений в реальном времени на основе компьютерного зрения для низкопотребляющих платформ на краю сети

Обнаружение падений имеет важное значение для ухода за пожилыми людьми и интеллектуального наблюдения; однако существующие подходы на основе компьютерного зрения в основном рассматривают его как классификацию статической позы или сопоставление дискретных временных шаблонов, в корне упуская нестабильную динамику человеческой опорной системы. В данной статье предлагается основанная на физике структура для обнаружения падений, которая трактует падение как событие утраты устойчивости в связанной динамической системе. Мы вводим новую архитектуру двойной LTC, состоящую из подсистемы центра масс (CoM) и подсистемы базы поддержки (BoS), обе реализованы как нейронные сети с жидкими временными константами (LTC), которые непрерывно моделируют эволюцию инерциальной траектории и адаптацию к контакту с землёй с помощью адаптивных временных констант. Физическая интерпретируемость движения при падении. Обучаемый модуль связывания имитирует физическое взаимодействие между двумя подсистемами, в то время как классификатор стабильности Manifold работает в объединённом латентном пространстве для обнаружения пересечения границы через метрики стабильности, вдохновлённые методом Ляпунова. Дополнительное проецирование контрфактической траектории и оценка времени до столкновения (TTC) дальше позволяют оценить необратимость и осуществить раннее предупреждение. Архитектура разработана для поддержки парадигмы предсказания с тремя состояниями (Нормально, Падает, Упал); в этом предварительном исследовании мы проверяем основную способность различения стабильности на датасете из двух классов (Нормально против Падает), оставляя полную трехстадийную временную трансформацию для будущей работы. В отличие от традиционных конвейеров CNN-RNN, предлагаемая формулировка кодирует механическую инерцию непрерывного времени, что позволяет создать сеть с менее чем 50 тыс. параметров, способную выполнять вывод в реальном времени на устройствах с ограниченными ресурсами. Обширные эксперименты демонстрируют конкурентоспособную точность с превосходной физической интерпретируемостью, подтверждая её эффективность для визуального обнаружения падений при низких вычислительных затратах.