БиологияarXivScience Morning3 мин чтенияpreprint

Предсказание сложной кристаллической структуры с использованием многоминимального итеративного генетического алгоритма, улучшенного машинным обучением

Complex crystal structure prediction using ML-enhanced multi-minima iterative genetic algorithm

Рубрика
Биология
Источник
arXiv
Дата
01.07.2026
Автор
Science Morning
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Биология

Аннотация

Современные подходы машинного обучения (МО) в области открытия новых материалов сильно зависят от известных структурных баз данных, что ограничивает их способность выявлять совершенно новые типы структур. В данной работе мы разработали многоминимальный итеративный генетический алгоритм (MMIGA), который интегрирует межатомный потенциал, основанный на искусственной нейронной сети (ANN-ML), с итеративной схемой наказаний, вдохновленной метадинамикой. Мы демонстрируем надежность этого метода на сложной тернарной системе La-Co-Pb, характеризующейся несовместимостью Co-Pb и сложным энергетическим ландшафтом. Алгоритм MMIGA, улучшенный с помощью МО, успешно предсказывает основнойPbam структуру недавно синтезированной антагонистической пары фаз La4Co4Pb, новую структуру, упущенную в предыдущих предсказаниях, зависящих от баз данных МО, одновременно выявляя несколько метастабильных конкурирующих фаз. Кроме того, мы поставили задачу предсказать структуру антагонистической пары фаз La5CoPb2, нового соединения, найденного в ходе предыдущих попыток синтезировать предсказанную фазу La3CoPb. Имея всего лишь информацию о составе, наш подход MMIGA успешно предсказывает орторомбическую структуру La5CoPb2, точно совпадая со структурой, независимо определенной с помощью рентгеновской дифракции. Эффективно сопоставляя как глобальный минимум, так и соответствующие конкурирующие метастабильные состояния, этот подход предоставляет критически важные теоретические понимания выбора фаз для новых квантовых и магнитных материалов.

Краткое резюме

Исследование представляет новый подход к предсказанию кристаллических структур с использованием итеративного генетического алгоритма, улучшенного машинным обучением. Этот метод успешно использован для предсказания сложных структур La4Co4Pb и La5CoPb2, которые ранее не были выявлены.

Практический вывод

Предложенный алгоритм MMIGA может значительно повысить эффективность поиска новых материалов с уникальными свойствами, что открывает перспективы для разработки новых квантовых и магнитных технологий.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. Метод недостаточно протестирован на более широком диапазоне составов и типов структур, что может ограничить его универсальность. Также требуется больше экспериментов для проверки предсказанных структур в реальных условиях.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Биология
Биология
85%

Изучение общей структуры здоровья человека в разных заболеваниях, модальностях и во времени

Риск заболеваний у человека возникает под воздействием совместных факторов, таких как генетика, окружающая среда, образ жизни и сопутствующие заболевания, которые действуют на протяжении времени, что приводит к повторяющимся паттернам восприимчивости к различным состояниям. Однако большинство моделей предсказания риска рассматривают заболевания как независимые исходы или полагаются на ограниченное количество входных переменных, что ограничивает их способность выявлять эти общие паттерны. Здесь мы представляем RisQ, платформу, которая изучает унифицированное представление здоровья человека в различных заболеваниях, модальностях и во времени. Это представление запрашивается на естественном языке для оценки риска заболевания для произвольных заболеваний и прогнозных горизонтов. Обобщение на невидимые группы заболеваний и прогнозные горизонты указывает на то, что информация передается между заболеваниями и со временем, выявляя общую структуру риска заболеваний, которую можно изучить. Обученный и проверенный на 488,170 участников из UK Biobank и оцененный без повторного обучения на 257,538 участников из независимой когорты All of Us, RisQ использует эту общую структуру, чтобы превзойти модели, специфичные для заболеваний, многозаболевные платформы и табличные фундаментальные модели в предсказании риска. Мы показываем, что совместное моделирование увеличивающегося числа заболеваний, входных модальностей и прогнозных горизонтов улучшает производительность, что указывает на то, что масштабирование этих осей увеличивает передачу информации и обогащает изученную структуру. Затем мы показываем, что эта структура многомасштабная: она захватывает демографические детерминанты восприимчивости к заболеваниям, одновременно организуя индивидуумов в воспроизводимые кластеры риска по заболеваниям внутри демографически ограниченных подгрупп. Генетические анализы дополнительно поддерживают биологическую обоснованность структуры, связывая потерю функции на уровне генов с профилями риска по заболеваниям. Это выявляет известные взаимосвязи HBB, SLC22A12, CASR и LDLR, в то время как также подчеркивает менее охарактеризованные ассоциации. В целом, эти результаты указывают на то, что риск заболеваний человека демонстрирует общую структуру, которую можно изучить на основе мультимодальных данных для улучшения предсказания риска, стратификации индивидуумов по восприимчивости к заболеваниям и поддержки открытия взаимосвязей между заболеваниями.

Биология
Биология
85%

PEPstrMOD2: Прогнозирование третичной структуры химически модифицированных и неметаболических пептидов нового поколения

В то время как большинство существующих методов ограничивается предсказанием третичной структуры белков, содержащих только канонические остатки, сервер PEPstrMOD (разработанный в 2015 году) стал пионером в предсказании структуры химически модифицированных и неестественных пептидов. Несмотря на широкое использование, первоначальная система была ограничена пептидами длиной от 7 до 25 остатков и полагалась на устаревшие алгоритмы предсказания спинальных структур. Чтобы устранить эти ограничения, мы представляем PEPstrMOD2, который предлагает три основных усовершенствования по сравнению с предшественником. Во-первых, он заменяет оригинальную генерацию координат высококачественными алгоритмами глубокого обучения, используя AlphaFold2 и ESMFold для высокоточного предсказания начальной структуры. Во-вторых, он значительно расширяет доступное химическое пространство за счет включения новой библиотеки совместимых с силовым полем AMBER, содержащей 257 посттрансляционных модификаций (PTMs), 428 неканонических аминокислот (NCAAs) и 243 терминальных модификаций. Наконец, благодаря применению нативной масштабируемости AlphaFold2 и ESMFold, PEPstrMOD2 устраняет оригинальные ограничения по длине, позволяя структурное моделирование более длинных и сложных терапевтических пептидов и малых белков. Мы оценили производительность PEPstrMOD2 по сравнению с современными методами на трех различных наборах данных пептидов. Для набора данных AfCyc, состоящего из 80 циклических пептидов, PEPstrMOD2 продемонстрировал конкурентоспособное среднее значение отклонения корня среднеквадратичного (RMSD) 2.05 Å по сравнению с 1.13 Å от AlphaFold3 и 1.82 Å от AfCycDesign. Примечательно, что для набора модифицированных пептидов ModPep433 PEPstrMOD2 превзошел AlphaFold3, достигнув более низкого среднего RMSD 4.49 Å против 4.67 Å у AlphaFold3. Кроме того, в случае эталона ModPep16 PEPstrMOD2 достиг среднего RMSD 2.50 Å, что в два раза точнее показателя оригинального PEPstrMOD (5.84 Å). В заключение, PEPstrMOD2 предоставляет мощную, высокопроизводительную и высокоточную платформу для содействия разработке пептидных лекарств и исследованиям в области структурной биологии. В то время как оригинальный PEPstrMOD был ограничен интерфейсом веб-сервера, PEPstrMOD2 доступен как интуитивно понятный веб-сервер, так и как самостоятельный инструмент командной строки через GitHub, предлагая поддержку Docker для простой развертки и воспроизводимых, крупномасштабных моделей (https://webs.iiitd.edu.in/raghava/pepstrmod/). Основные моменты: PEPstrMOD2 предсказывает структуры химически модифицированных пептидов с использованием глубокого обучения и уточнения молекулярной динамики. Поддерживает 928 химических модификаций через пользовательские библиотеки силового поля AMBER, включая PTMs, NCAAs, терминальные, D- и циклические модификации. Устраняет ограничения по длине пептидов благодаря интеграции AlphaFold2 и ESMFold. Превосходит PEPstrMOD и конкурентоспособен с AlphaFold3 на различных эталонных наборах данных. Доступен как веб-сервер и самостоятельная платформа через GitHub и Docker.

Биология
Биология
82%

Теория контравариантности: сильное выравнивание для минимальных решений сложных задач

За последние пятнадцать лет ряд результатов из области НейроИскусственного Интеллекта подняли основные вопросы как о том, как сравнивать модели глубоких нейронных сетей (ДНС) с мозгом, так и о том, насколько ожидаемо конвергентное развитие между искусственными сетями и реальными мозговыми сетями. Здесь мы показываем, что для любых двух минимальных решений ДНС для достаточно сложной задачи: (i) 'слабое' выравнивание представлений сети на основе аффинных преобразований гарантирует 'сильное' выравнивание привилегированных осей, и (ii) выравнивание 'молний' в иерархии сети приводит к возникновению привилегированных осей в результате оптимизации задачи по принципу 'от конца до конца'. Эти результаты формализуют понятие контравариантности, предложенное Као и Яминсом [2024], и иллюстрируют важные последствия для теории НейроИскусственного Интеллекта: при достаточно сложных задачах выбор метрики для межсетевого сравнения не так чувствителен, а конвергентное развитие, вероятно, неизбежно.

Биология
Биология
82%

Точное, междисциплинарное и прозрачное понимание взаимосвязей структура-свойство с помощью глубокой структурной логики

Взаимосвязи структура-свойство являются основополагающими для биологии, химии и науки о материалах, где функция, реактивность и физический ответ возникают из пространственной, химической и периодической организации. Механистическое объяснение этих взаимосвязей требует интерпретации структурных доказательств с помощью научных принципов и физических ограничений, начиная с стереохимии и связи и заканчивая симметрией, энергиями и периодическим порядком. Однако применение искусственного интеллекта к этому процессу представляет собой общую задачу представления и логического вывода: модели должны сохранять информацию о структурах, характерную для области, и демонстрировать, как конкретные доказательства поддерживают предсказания в этих рамках. Здесь мы представляем SciReasoner, многомодальную научную модель, основанную на native структурной логике, охватывающую белки, небольшие молекулы и неорганические кристаллы. SciReasoner дискретизирует координаты, топологии и периодические связи в единый словарь, учитывающий структуру, рассматривая структурные токены как адресуемые единицы доказательства во время логического вывода. В контролируемом по гомологии прогнозировании систематики генов SciReasoner улучшает аннотацию клеточных компонентов для белков с низкой гомологией и сиротоподобных белков, увеличивая $F_{\max}$ с 0.42 до 0.55. В химии он увеличивает точность одностадийного ретросинтеза с 0.63 до 0.72, генерируя следы разрыва на уровне фрагментов и проверки предшественников. В науке о материалах его представления разделяют элементарные и композитные фазы и разрешают режимы с высоким и низким энергетическим зазором. По 86 тестовым задачам SciReasoner достигает лучших в своем классе результатов по 67 задачам. Двойная слепая экспертная оценка оценивала его логические следы как предпочтительные или хотя бы сопоставимые с таковыми у модели большого языка передового уровня в 98% случаев. Делая структуру проверяемым субстратом для логического вывода в рамках научных ограничений, SciReasoner связывает точное предсказание с интерпретируемым научным выводом.

Биология
Биология
82%

BUS: Вдохновленное мозгом несупервизированное саморефлексия для продвинутого мультимодального мышления

Современные модели "визуального языка" (VLMs) часто испытывают трудности с выполнением сложных визуальных задач, которые требуют последовательного и детализированного мышления. Недавние методы нацелены на обучение моделей, способствующих саморефлексии, то есть пересмотру и улучшению сгенерированного рассуждения. Однако они требуют больших объемов аннотированных данных и не обладают явным рефлексивным поведением во время тестирования. Эта работа направлена на устранение этого разрыва через вдохновение из нейробиологии. Человеческий мозг демонстрирует эффективное обратное предсказание, то есть предсказание того, какие текущие состояния вероятны для предшествования данному будущему состоянию. В этой работе мы сначала подтверждаем, что основные VLMs могут выполнять обратное предсказание, аналогично человеческому мозгу. Затем мы предлагаем "Вдохновленное мозгом несупервизированное саморефлексия" (BUS), бесконечную рамку для обучения, чтобы улучшить возможности рефлексивного мышления в сложном анализе изображений. BUS позволяет VLMs выполнять обратное предсказание и предоставляет явные сигналы обучения на данных без истинных меток. Тем самым, BUS устраняет зависимость от аннотированных данных, улучшая при этом производительность рассуждений. Заметим, что BUS совместим с популярными методами тонкой настройки, такими как супервизированная тонкая настройка (SFT) и обучение с подкреплением (RL). Наконец, обширные эксперименты на 8 бенчмарках демонстрируют эффективность BUS в широком диапазоне сложных визуальных задач. Она достигает значительных улучшений по сравнению с базовой моделью, используя только необработанные данные для обучения. Наши экспериментальные данные подтверждают, что способность к обратному предсказанию имеет решающее значение для рассуждений VLM.

Биология
Биология
82%

Типология многомодального рассуждения для обоснования согласованности графиков и изображений в научной коммуникации

Графики и изображения появляются в научных публикациях вместе, однако большинство вычислительных работ не характеризует их согласованность. Мы утверждаем, что график, сопутствующее изображение и подпись, которая связывает их, образуют многомодальную единицу, и что индуктивная работа, необходимая для их чтения, меняется систематически. Чтобы захватить это разнообразие, мы разработали типологию разрывов в рассуждениях, от R1 до R5, которая характеризует, как график, изображение и текст совместно передают научное утверждение и какую интерпретационную работу это требует от читателя. Некоторые пары повторяют одни и те же данные, в то время как в других парах графики используются для количественной оценки структуры, которую локализует изображение, проецируют содержание изображения на внешнюю переменную, проверяют утверждение, основанное на изображении, или совместно создают рамку, которую ни один из панелей не может установить отдельно. Типология основана на теории обоснования коммуникации и была выведена в нижнем порядке с экспертом в области нейробиологии, на основе корпуса из 79 статей о травмах головного мозга и 32 пар графиков и изображений. Критически важно, что уровни предоставляют систематический механизм для определения, где обоснование успешно или дает сбой, вместо того, чтобы оставлять это на усмотрение субъективной интерпретации. Мы демонстрируем это в исследовании, в котором эксперт в области и три неэксперта оценивают описания модели зрительно-языкового моделирования (VLM) для 25 пар: уровень предсказывает, где их оценки совпадают и где расходятся, изолируя точки, в которых контекстуальные знания, а не фигура, несут согласованность. Таким образом, эта типология предлагает создателям фигур систематический способ балансировать текст с парами графиков и изображений, преодолевая разрыв между экспертами и неэкспертами в понимании научных выводов.