Искусственный интеллектbioRxivYou, R., Wang, Z., Liu, K., Zheng, W. et al.3 мин чтенияpreprint
Эффективное выравнивание белков с учетом структуры с использованием контрастного обучения на уровне остатков
Effective structure-aware protein alignment via residue-level contrastive learning
Карточка статьи
Рубрика
Искусственный интеллект
Источник
bioRxiv
DOI
10.1101/2024.03.09.583681
Дата
27.06.2026
Автор
You, R., Wang, Z., Liu, K., Zheng, W. et al.
Время чтения
3 мин
Это предварительная публикация, она не прошла научное рецензирование.
Аннотация
Выравнивание белков является незаменимым инструментом для биологических открытий, поддерживая сравнение структур, функциональную аннотацию и эволюционные выводы. Хотя методы, основанные на структуре, очень эффективны для обнаружения структурного сходства, их применение ограничено ограниченной доступностью экспериментально разрешенных структур белков и высокой вычислительной сложностью. Подходы, основанные на последовательностях, с использованием предварительно обученных языковых моделей белков (pLMs), предлагают масштабируемые альтернативы, однако контролируемые методы, основанные на дифференцируемом динамическом программировании, не всегда превосходят более простые неконтролируемые стратегии. В данной работе мы представляем CLAlign, структуреосознательную рамочную систему для выравнивания белков, основанную на контрастном обучении. CLAlign дообучает предварительно обученную pLM для генерации структурыосознательных эмбеддингов на уровне остатков, обогащенных структурным контекстом, не полагаясь на дифференцируемое динамическое программирование. Это первая контролируемая методика, которая последовательно превосходит неконтролируемые методы на основе pLM и естественно расширяется как для выравнивания на основе последовательности, так и на основе структуры, гибко принимая различные кодировщики языковых моделей белков. CLAlign достигает передовой точности на контрольных точках MALIDUP и MALISAM, значительно превосходя существующие последовательные методы, оставаясь при этом высокоэффективным. Более того, его показатели выравнивания имеют четкую биологическую интерпретацию: при обнаружении удаленной гомологии на SCOPe CLAlign показывает сопоставимые результаты с методами на основе структур, такими как TM-align, в то время как значительно превосходит все базовые методы на основе последовательностей. В совокупности эти результаты утверждают CLAlign как простую, расширяемую и биологически значимую основу для выравнивания белков.
Краткое резюме
CLAlign представляет собой новый подход к выравниванию белков, использующий контрастное обучение для учета структурного контекста, что позволяет значительно увеличивать точность по сравнению с существующими методами.
Практический вывод
CLAlign позволяет проводить выравнивание белков с высокой точностью и эффективностью, что может быть полезно в различных областях биологии, таких как сравнение структур и функциональная аннотация.
Ограничения
Это предварительная публикация, она не прошла научное рецензирование. Хотя CLAlign демонстрирует превосходные результаты, его эффективность может зависеть от наличия предварительно обученных языковых моделей белков и качества исходных данных.
Генеративные модели на основе выборок все чаще используются для вероятностного прогнозирования в условиях высоких ставок, однако их цели обучения не обращают внимания на структуру затрат принятием решений. Обычно эти модели обучают с использованием строго корректных оценивательных правил, таких как энергетический рейтинг, которые распределяют сигнал обучения пропорционально плотности данных, не учитывая, где ошибки прогнозов наиболее затратны для последующих решений. Поэтому мы предлагаем обучение с учетом принятия решений для генеративных моделей на основе выборок, дополняя цель энергетического рейтинга дифференцируемой функцией потерь, которая непосредственно штрафует за затраты, понесенные при принятии решения на основе прогноза модели. Эта комбинированная функция потерь имеет теоретическую основу, поскольку функция потерь по решению сама по себе является корректным оценивательным правилом. Мы проверяем наш метод на одной синтетической и двух реальных задачах, демонстрируя целевые улучшения в чувствительных к затратам областях, при этом сохраняя полные вероятностные прогнозы.
Агентное обучение с подкреплением требует назначения кредита действиям, направленным на взаимодействие с окружением, таким как поиски, клики, редактирования, команды навигации и взаимодействия с объектами. Стандартный GRPO использует итоговый результат проверки как единый сигнал преимущества для всех токенов действий. Этот сигнал результата полезен, но структурно неполон: он наказывает полезные исследования в неудачных имитациях и усиливает избыточные или регрессивные действия в успешных результатах. Мы предлагаем TRIAGE, структуру назначения кредита с учетом роли, которая добавляет семантическую ось роли к кредиту результата. Структурированный судья классифицирует каждый сегмент как решающий прогресс, полезное исследование, инфраструктуру без прогресса или регрессию, а фиксированное правило, зависящее от роли, отображает эти метки на ограниченные вознаграждения процесса на уровне сегмента. Это сохраняет результаты проверки как источник направления оптимизации, при этом correcting два основных слепых пятна кредита, основанного только на результате. Мы также показываем, что кредит, зависящий от роли, является оптимальной коррекцией на уровне сегмента, которую можно выразить исключительно из меток ролей — проекцией остатка преимущества на сегмент на переменную роли, — таким образом фиксированные роли снижают ошибку оценки преимущества, когда судья надежен, и мы связываем это со снижением дисперсии градиентов политики. В ALFWorld, Search-QA и WebShop TRIAGE повышает показатели успеха по сравнению с GRPO для двух моделей политики и превышает как процессные вознаграждения, извлеченные из судьи, так и базу значений, контролируемую результатом. Аблации показывают, что прирост происходит благодаря типизации ролей, а не просто добавлению плотных вознаграждений: надежное обнаружение регрессии внутри успешных траекторий является доминирующим элементом, в то время как кредит на исследование предоставляет устойчивый вторичный прирост; на завершенных результатах ALFWorld и WebShop TRIAGE также снижает количество ходов, направленных на окружение, на дополнительные 10.4% и 14.8% соответственно по сравнению с GRPO.
Дисфункция пероксисом приводит к широкому спектру многосистемных заболеваний, однако механистическое понимание и терапевтические опции остаются ограниченными, что создает серьезные трудности для клинического управления. Стратегии вычислительного моделирования на основе сетей поддерживают генерирование гипотез, открытие биомаркеров и перераспределение лекарств, но их использование ограничено неполным охватом человеческого интерактома — особенно нехваткой достоверных данных о взаимодействиях белков (PPI) для пероксисомальных белков. Мы представляем первую всестороннюю карту пероксисомального интерактома, сгенерированную с использованием автоматизированной стратегии биолюминесцентного резонансного энергообмена, направляемой информатикой. Мы проанализировали PPI для 92 пероксисомальных белков и шести изоформ, подтвердив 68% известных взаимодействий и идентифицировав 333 новые. Интеграция с кураторскими PPI привела к расширенному пероксисомальному интерактому, обогащенному мишенями для лекарств и белками, связанными с заболеваниями. Подсеть, связанная с заболеваниями, позволила приоритизировать кандидатов для перераспределения лекарств. Производные от трансприптомных данных тканеспецифические варианты расширенного пероксисомального интерактома раскрыли различные функциональные подсистемы в девяти тканях. Анализ генетической онтологии 1,272 непероксисомальных интеракторов предположил пути, способствующие тканевой уязвимости. Наш подход предоставляет системный уровень для механистической информации о пероксисомальных заболеваниях, определения мишеней для лечения и применения к другим органеллам.
Беспилотные летательные аппараты (БПЛА) играют важную роль в различных гражданских и коммерческих приложениях, что требует точной классификации их радиочастотных (РЧ) сигналов. Современные подходы на основе глубокого обучения сталкиваются с высокой вычислительной сложностью, чувствительностью к шуму и ограниченной точностью. В данной статье предлагается новая структура классификации сигналов БПЛА, которая сочетает в себе вейвлетное извлечение признаков с иерархической архитектурой U-Net, дополненной механизмами внимания с раздельным временем (STCA) и остаточной связанностью. Модель WUSTCA эффективно классифицирует сигналы БПЛА и их контроллеров, достигая средней точности классификации 96,6% для БПЛА и 95,83% для контроллеров БПЛА на наборе данных CardRF. Решая такие проблемы, как помехи шума и разнообразие сигналов, данная работа предоставляет надежное и эффективное решение для классификации сигналов БПЛА, открывая путь для приложений в реальном времени в сложных условиях.
Распределение эффектов на фитнес (DFE) — описывающее, насколько вредными, нейтральными или полезными являются новые мутации — является центральным для понимания того, как популяции эволюционируют. Хотя DFE варьируется между геномами и видами, остается неясным, какие аспекты геномной организации вызывают эту вариацию. В данной работе мы оценили селективные ограничения на уровне генов по геномам Mus musculus castaneus, Drosophila melanogaster и Saccharomyces cerevisiae, используя сочетание популяционной генетики и машинного обучения, обученного на различных генетических характеристиках. Многие генетические характеристики предсказывали селективные ограничения, среди которых наиболее информативными оказались консервация, структура гена и экспрессия. Эти селективные ограничения обозначили классы генов с различными DFE. Гены с большей связанностью и экспрессией — характеристиками, отражающими количество признаков, на которые влияет ген — испытывали более сильные и менее разбросанные вредные эффекты с увеличением селективных ограничений. Между видами скорость адаптации снижалась с увеличением организационной сложности, в то время как по всему геному она не уменьшалась монотонно с увеличением селективных ограничений, а, напротив, имела тенденцию быть выше на промежуточных уровнях. Хотя сравнения DFE между видами были менее согласованы с прогнозами геометрической модели Фишера (FGM), основанными на организационной сложности, вариация параметров DFE по всему геному более близко соответствовала FGM, когда сложность рассматривалась на уровне генов. Наши результаты предполагают, что сложность на уровне генов, зафиксированная через прокси геномных характеристик, обеспечивает более информативное определение сложности для вариации DFE, чем обозначения на уровне организма, и подчеркивают ценность использования генетических характеристик в совокупности для связи геномной архитектуры, фитнес-ландшафтов и моделей молекулярной эволюции.
Кинаватные рецепторы (KARs) медиируют эксайтаторную синаптическую передачу и регулируют высвобождение нейротрансмиттеров. В центральной нервной системе KARs преимущественно существуют в виде гетеротетрамеров, состоящих из низкоафинных (GluK1-3) и высокоафинных (GluK4-5) субъединиц, с наибольшим содержанием GluK2/GluK5. Для прояснения их конформационных переходов мы определили структуры GluK2/GluK5 KARs с помощью криоэлектронной микроскопии в апо- и различных связанных состояниях. Апо-структура показала плотную упаковку с обширными межсубъединичными взаимодействиями между доменами связывания лиганда за пределами консервативных контактов D1-D1 в верхней части. Структура, связанная с глутаматом, продемонстрировала улучшенную упаковку, которая стабилизировала десенситивированную конформацию за счет увеличения межсубъединичных контактов по сравнению с гомомери́ческими KARs, что указывает на то, что гетеротетрамеры были конформационно менее динамичными. Чтобы исследовать специфический антагонизм по подтипам, мы разработали мутанты GluK2 и GluK5 с измененными аффинностями к конкурентному антагонисту UBP310. Структурный анализ этих мутантов выявил различные режимы связывания UBP310 на субъединицах GluK2 и GluK5. Более того, мы продемонстрировали, что нацеливание на GluK5 было более эффективным, чем нацеливание на GluK2. В частности, блокировка GluK5 зафиксировала рецептор в состоянии, заблокированном порами, в то время как антагонизм GluK2 сохранял структурную гибкость над отверстием. Эти результаты предоставляют структурную основу для понимания различных вкладов субъединиц GluK2 и GluK5 в функцию KAR.