Переосмысляя эталоны и модели для предсказания специфичности ферментов
Rethinking Benchmarks and Models for Enzyme Specificity Prediction
Карточка статьи
Рубрика
Биология
Источник
arXiv
Дата
06.07.2026
Автор
Science Morning
Время чтения
3 мин
Это предварительная публикация, она не прошла научное рецензирование.
Аннотация
Искусственный интеллект оказал глубокое влияние на биологические науки и, в частности, значительно ускорил исследования в области формы и функции белков. Ферменты не являются исключением: в последнее время было разработано множество предсказательных моделей для решения различных задач, связанных с ферментами. Модели, рассматривающие совместимость фермент-субстрат (ES) или фермент-реакция (ER), могут быть особенно полезными для аннотирования ферментов, расшифровки биосинтетических путей и извлечения биокаталитиков, главной задачей которых является идентификация истинного катализатора (или действительно совместимой реакции) среди множества схожих кандидатов. В то время как существующие модели демонстрируют высокую эффективность на альтернативных эталонах, менее известны их возможности в данном контексте. В этом исследовании мы оцениваем четыре недавно выпущенные модели предсказания ES и ER, используя задачи и наборы данных, адаптированные для данного условия. Сначала мы показываем, что две представительные модели предсказания ES показывают результаты, близкие к случайным исходным данным, по двум семействам ферментов, когда речь идет о ферментах и субстратах, не встреченных во время обучения. Для оценки дополнительных моделей по последовательному набору данных мы далее собираем самый крупный на сегодняшний день набор данных реакций цитохрома P450 (CYP) — 2922 реакции по 768 ферментам, и строим эталон ранжирования CYP, в котором правильно выбранный фермент должен быть приоритезирован среди всех CYP в своем естественном организме. Мы снова обнаруживаем, что большинство моделей не превосходят базовые показатели на основе последовательностей (BLAST), даже после тонкой настройки. Наконец, мы адаптируем модель предсказания биомолекулярной структуры Boltz для предсказания ES, обучая контролируемые классификаторы на векторных вложениях остатков-лигандов, и показываем, что этот подход последовательно превосходит базовые показатели BLAST на нашем эталоне ранжирования CYP. В совокупности наши результаты свидетельствуют о необходимости более актуального бенчмаркинга и предполагают, что учитывающие взаимодействия представления из полных биомолекулярных комплексов могут служить многообещающей основой для приоритизации ферментов.
Краткое резюме
В новом исследовании изучаются возможности предсказательных моделей для определения специфичности ферментов. Несмотря на высокие показатели на обычных эталонах, модели показывают низкую эффективность при применении к новым данным. Ученые подчеркивают необходимость более релевантных методов оценки и смотрят в сторону учета взаимодействий между компонентами.
Практический вывод
Исследование подчеркивает, что несмотря на наличие продвинутых моделей, их применение на практике может требовать дополнительных доработок для достижения более высокой точности в предсказаниях ферментов.
Ограничения
Это предварительная публикация, она не прошла научное рецензирование. Основные ограничения исследования заключаются в том, что многие модели не показывают успехов за пределами обучающих данных, и их эффективность в новых условиях все еще неясна. Также существующие подходы могут недостаточно учитывать сложные взаимодействия в биомолекулярных комплексах.
Ученые часто стремятся делать причинные выводы на основе структурированных данных, которые не являются независимыми и одинаково распределенными, таких как пространственные данные, данные сетей или молекулярные данные. Мы разрабатываем геометрические причинные модели (ГПМ), представляющие собой рамки для причинного вывода на основе зависимых данных, которые учитывают основные симметрии процесса генерации данных. Например, в пространственных данных мы рассматриваем процессы, которые симметричны относительно трансляций, или в графовых данных, симметричны относительно пермутаций узлов. Мы показываем, как симметрии, формализованные с помощью теории групп, могут способствовать идентификации и оценке причинных отношений. Мы используем эргодическую теорию для удобных групп, чтобы установить идентификацию, и комбинируем геометрическое глубокое обучение с масштабируемым байесовским выводом для оценки. Мы восстанавливаем причинные модели i.i.d. и do-калькул, когда данные представляют собой последовательность, и симметрия является пермутационной эквивариантностью, и находим новые типы причинных моделей, когда используем альтернативные структуры и симметрии. В качестве примера мы строим причинную модель, которая удовлетворяет симметриям ДНК. Эта ГПМ позволяет получить новые оценки эффектов генетической вариации, комбинируя глубокие функциональные модели геномики для описания исходов и языковые модели ДНК для описания склонностей. Мы иллюстрируем это на семисинтетических данных.
Рамкришна, Компала и Цао предложили кибернетическую модель микробного роста, в которой клетки распределяют ресурсы синтеза ферментов в соответствии с правилом соответствия, имитирующим рациональное принятие решений. Позже было показано, что это правило является оптимальным при общих предположениях о лежащей в его основе структуре доходности, однако конкретная цель, которую максимизирует клетка, и ограничения, определяющие этот выбор, никогда не были записаны как явное экономическое решение. Здесь мы предоставляем это отсутствующее решение, пересматривая управление синтезом ферментов как проблему потребительского выбора из микроэкономической теории: клетка выделяет ограниченный бюджет протеома между конкурентирующими катаболическими ферментами как линейную программу (ЛП), максимизируя линейную утилиту роста при условии линейного ограничения бюджета протеома. Поскольку утилита линейна, решение ЛП является геометрическим: всякий раз, когда наклон изо-утилитной линии отличается от наклона бюджетного ограничения, оптимум оказывается в углу, и весь бюджет протеома распределяется на фермент для одного наилучшего субстрата. Угловые решения соответствуют диауксному росту, а последовательное потребление субстрата вытекает из выбора угла, а не из отдельного регуляторного механизма. Только когда наклоны двух линий совпадают, оптимум распределяется по всей линии бюджета, а не сосредоточивается в одном углу; этот редукционный случай лежит в основе одновременного использования субстратов. Используя только параметры, оцененные независимо от экспериментов с одним субстратом, кибернетические переменные, полученные из ЛП, воспроизвели диауксный и триауксный рост партии Klebsiella oxytoca на смесях глюкозы-иксирозы и глюкозы-иксирозы-лактозы, достигая точности, сопоставимой с классическим законом соответствия. Таким образом, последовательное использование субстратов является обобщенным результатом специализации, нацеленной на максимизацию роста при идеальной заменяемости, а совместное использование является редукционным случаем равной прибыльности.
В данной работе мы рассмотрели различные подходы к математическому моделированию биологически правдоподобных нейронных систем. Модели характеризуются и классифицируются на основе их общих черт и специализированных случаев использования. В дополнение к моделям с всплесками также рассматриваются различные типы дискретных и непрерывных аналогов, чтобы точно смоделировать биологические процессы, включая динамику мембранного потенциала. Под исследование попадают нейроны и различные компоненты, встречающиеся в нейронных системах и влияющие на динамику. Выбор конкретных подходов был продиктован их распространенностью и инновационными перспективами с целью повышения актуальности представленной информации.
Большинство потенциально обитаемых планет, обнаруженных на сегодняшний день, вероятно, довольно отличаются от Земли, например, они имеют больший радиус и массу, различающийся уровень вращения и спектр родительской звезды, отличающийся от Солнца. Поэтому первая обнаруженная внеземная жизнь, возможно, будет существовать в условиях, которые не встречаются на нашей планете. Это требует универсального подхода к моделированию биологии, который можно применить к многочисленным планетарным сценариям, опираясь на базовые знания о жизни на Земле, но не ограничиваясь ими. Здесь мы исследуем универсальную модель микробной клетки, чья метаболическая скорость определяется термодинамикой и диффузией субстрата через клеточную мембрану. Мы моделируем биосферу с одним видом, состоящим из метанопродуцирующих микробов, и определяем, как изменение размера клетки, скорости клеточной гибели и затрат на синтез биомассы влияют на биосигнатуру на планете - в данном случае метан. Мы обсуждаем подходы к предсказанию верхних оценок для изобилия газов-биосигнатур и применимость модели к другим метаболизмам. Этот инструмент пополняет массив работ, стремящихся справиться со сложностью потенциальных внеземных биосфер.
Компьютерное моделирование и симуляция являются мощными инструментами для оценки производительности и безопасности медицинских устройств, особенно для клинических испытаний in silico для автоматизированных медицинских систем. В вентиляции, где необходимо управлять газообменом, респираторной механикой и взаимодействием пациента с аппаратом вентиляции в условиях изменяющейся патофизиологии, клинический перевод автоматизированных контрольных стратегий остается медленным и ресурсоемким. В данной статье применяется структура, соответствующая стандартам, для оценки достоверности вычислительной дыхательной модели, продемонстрированная на примере автоматизированного прекращения вентиляции. Эта структура реализует принципы ASME V&V 40 и FDA в рамках структурированного, основанного на руководствах процесса валидации. Вычислительная физиологическая модель интегрирует респираторную механику, газообмен, контроль дыхания и представление вентилятора, валидация которой осуществляется в четко определенном контексте применения и с ясными вопросами интереса. Достоверность модели оценивается через калибровку, физиологическую правдоподобность, оценку на основе популяции и воспроизведение возникающего поведения. Все требования к модели, вытекающие из предполагаемого контекста использования, рассматриваются в предлагаемой программе оценки достоверности, а документированные пробелы сообщаются открыто. Полученный аргумент в пользу достоверности поддерживает применимость модели для ее контекста использования. Сильные стороны демонстрируются в сравнении на основе популяции и механистической правдоподобности, в то время как остаточные ограничения связаны с объемом in vivo данных, представительностью популяции и внешней валидацией. В целом, модель считается подходящей для проведения клинических испытаний in silico со средне-низким риском автоматизированных стратегий прекращения вентиляции. Более того, описанная в данной статье процедура валидации предоставляет пример для валидации этой и аналогичных моделей в других алгоритмах механической вентиляции и сопутствующих случаях использования.
3D-фенотипирование растений известно сложностью процедур и низкой производительностью из-за обширной многовидовой съемки, хрупкой цепочки 3D-реконструкции и дополнительных затрат на извлечение фенотипической информации из восстановленной геометрии. Эти ограничения усиливаются при низкозатратном сборе данных, когда видео со смартфонов или малонагруженные многовидовые изображения обеспечивают ограниченное перекрытие видов и самозатемнение. В этой работе мы показываем, что традиционную схему 3D-фенотипирования растений можно упростить и значительно ускорить с помощью 3D-фундаментальных моделей (3DFMs), и в частности, представляем одну из первых схем 3D-фенотипирования кросс-культур, основанную на 3DFMs. Эта схема заменяет разреженную инициализацию в стиле COLMAP на основанное на 3DFM геометрическое восстановление с прямой связью, сочетает 3D Gaussian Splatting с ограничениями по геометрии для плотной реконструкции, позволяет реконструировать из нескольких видов через итеративный синтез и уточнение видов и преобразует восстановленную геометрию в измеримые органы через семантический перенос из 2D в 3D, восстановление метрического масштаба и разделение экземпляров органов. Мы также создаем набор данных для кросс-культур с приобретением изображений на основе смартфонов, разнообразными морфологиями растений и ручными аннотациями для сегментации и фенотипической оценки. Эксперименты на 26 последовательностях растений показывают, что 3D-фундаментальные модели сокращают среднее время реконструкции с 6,52 минут до 1,58 секунд, сохраняя при этом высокое качество реконструкции и точность фенотипирования. Эти результаты предполагают новый технический путь для высокопроизводительного 3D-фенотипирования растений, начиная с недорогого получения изображений и заканчивая быстрой реконструкцией, восприятием, восстановлением масштаба и фенотипическим измерением.