Точное, междисциплинарное и прозрачное понимание взаимосвязей структура-свойство с помощью глубокой структурной логики
Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning
Карточка статьи
Рубрика
Биология
Источник
arXiv
Дата
08.07.2026
Автор
Science Morning
Время чтения
3 мин
Это предварительная публикация, она не прошла научное рецензирование.
Аннотация
Взаимосвязи структура-свойство являются основополагающими для биологии, химии и науки о материалах, где функция, реактивность и физический ответ возникают из пространственной, химической и периодической организации. Механистическое объяснение этих взаимосвязей требует интерпретации структурных доказательств с помощью научных принципов и физических ограничений, начиная с стереохимии и связи и заканчивая симметрией, энергиями и периодическим порядком. Однако применение искусственного интеллекта к этому процессу представляет собой общую задачу представления и логического вывода: модели должны сохранять информацию о структурах, характерную для области, и демонстрировать, как конкретные доказательства поддерживают предсказания в этих рамках. Здесь мы представляем SciReasoner, многомодальную научную модель, основанную на native структурной логике, охватывающую белки, небольшие молекулы и неорганические кристаллы. SciReasoner дискретизирует координаты, топологии и периодические связи в единый словарь, учитывающий структуру, рассматривая структурные токены как адресуемые единицы доказательства во время логического вывода. В контролируемом по гомологии прогнозировании систематики генов SciReasoner улучшает аннотацию клеточных компонентов для белков с низкой гомологией и сиротоподобных белков, увеличивая $F_{\max}$ с 0.42 до 0.55. В химии он увеличивает точность одностадийного ретросинтеза с 0.63 до 0.72, генерируя следы разрыва на уровне фрагментов и проверки предшественников. В науке о материалах его представления разделяют элементарные и композитные фазы и разрешают режимы с высоким и низким энергетическим зазором. По 86 тестовым задачам SciReasoner достигает лучших в своем классе результатов по 67 задачам. Двойная слепая экспертная оценка оценивала его логические следы как предпочтительные или хотя бы сопоставимые с таковыми у модели большого языка передового уровня в 98% случаев. Делая структуру проверяемым субстратом для логического вывода в рамках научных ограничений, SciReasoner связывает точное предсказание с интерпретируемым научным выводом.
Краткое резюме
Статья представляет SciReasoner — новую модель для глубокого понимания взаимосвязей структура-свойство в биологии, химии и науке о материалах. Она позволяет лучше интерпретировать структурные данные и улучшает точность предсказаний. Данная работа демонстрирует значительные улучшения в аннотации белков и химических прогнозах.
Практический вывод
SciReasoner способен улучшить точность предсказаний взаимосвязей структура-свойство, что может быть полезно в различных областях науки, включая биологию и химию.
Ограничения
Это предварительная публикация, она не прошла научное рецензирование. Исследование основывается на высококачественных данных и может не полностью применяться к данным низкого качества. Также модель может столкнуться с трудностями в интерпретации слишком сложных структур.
Рибосомы — это незаменимые нано-машины, отвечающие за синтез всех клеточных белков. Их производство, известное как биогенез рибосом, представляет собой высоко сложный и энергоемкий процесс, требующий согласованных действий сотен белков и РНК-факторов для сборки и созревания функциональных компонентов рибосом. Биогенез рибосом все больше признается ключевым фактором, способствующим человеческим заболеваниям: чрезмерное производство рибосом может способствовать возникновению опухолей, в то время как недостаточное или дефективное производство рибосом наблюдается в группе тканеспецифических расстройств, известных как рибосомопатии. Хотя основа этой тканевой специфичности остаётся плохо понятной, наиболее часто затрагиваемыми системами являются кровь, мозг и кости. Недавние достижения в структурной биологии позволили получить высокоразрешимые снимки предшественников (пре-)рибосом на различных стадиях созревания, предлагая новые понимания того, как патогенные вариантами рибосомных белков или факторов сборки нарушают критические молекулярные взаимодействия. В этом обзоре мы выделяем избранные примеры, где структурная информация начинает прояснять молекулярные основы рибосомопатий.
Аденозинтрифосфат-связывающий белок, семейство G, член 2 (ABCG2) является ключевым регулятором гомеостаза мочевой кислоты, и его дисфункция является основным генетическим фактором риска гиперурикемии и подагры как у людей, так и у животных. Изначально ABCG2 был известен своей ролью в множественной лекарственной устойчивости. Позже ABCG2 был идентифицирован как насос с высоким потенциалом для выведения мочевой кислоты, расположенный на апикальных мембранах проксимальных трубочек почек, энтероцитов кишечника и печеночных канальцев. Настоящий обзор охватывает молекулярную структуру, физиологические функции и патофизиологические эффекты ABCG2, с особо вниманием к распространенному варианту Q141K (rs2231142), который приводит к утрате функции. Вариант Q141K нарушает стабильность и транспортировку белка, снижая транспорт мочевой кислоты и увеличивая риск подагры и кардиоренальных сопутствующих заболеваний. В обзоре рассматривается центральная роль ABCG2 в транспортом мочевой кислоты, подчеркивая его контрастные и кооперативные взаимодействия с реабсорбтивными и секреторными транспортерами, а также его регуляцию новыми механизмами, включая кишечный микробиом и микробные метаболиты. Эти наблюдения имеют значительные клинические последствия для подходов в фармакогеномике, так как носители варианта Q141K демонстрируют сниженный ответ на урикозурические препараты. В обзоре также подчеркиваются новые методы лечения, выходящие за рамки стандартной терапии, снижающей уровень мочевой кислоты, включая активаторы ABCG2, модулаторы микробиома и методы редактирования генов, что может привести к переходу к персонализированным подходам к профилактике и лечению подагры. Понимание многогранной роли ABCG2 имеет ключевое значение для разработки целевых стратегий борьбы с первопричинами нарушения экскреции мочевой кислоты.
Кворм-сенсоринг (QS) известен в биологии как форма межклеточной коммуникации, опосредованной сигнальными молекулами, называемыми автоиндукторами. Протокол QS регулирует переход от индивидуального к коллективному поведению клеток, как только достигается критическая плотность популяции. С помощью численных симуляций мы исследуем, как дефекты влияют на переход QS и структурную организацию полученных колоний. Наша модельная система состоит из смеси медленно («холодные») и быстро («горячие») диффузирующих коллоидных частиц, подчиняющихся протоколу QS, наряду с дефектными частицами, характеризующимися постоянной диффузией. Поразительная реэнтрантная солидфикация QS частиц, характеризующаяся дальнодействующим порядком, индуцируется горячими дефектами, в то время как холодные дефекты приводят к образованию аморфных структур с лишь краткосрочным порядком. Эти результаты углубляют наше понимание взаимодействия QS и предоставляют механизм для контроля степени организации в системах QS, с потенциальными приложениями в робототехнике, социальных науках и медицине - например, для преодоления антимикробной устойчивости.
Использование крупных языковых моделей (LLM) для молекул в качестве единой платформы для понимания молекулярных структур и функций становится новой тенденцией в таких задачах, как молекулярный дизайн и открытие лекарств. Тем не менее, эти модели не способны в полной мере отражать визуальное представление молекулярных структур, что ограничивает их потенциал. Хотя существующие молекулярные модели визуального языка (VLM) показывают обнадеживающие результаты, они по-прежнему сталкиваются с проблемами структурной подгонки и недостатком необходимого топологического моделирования для точного понимания молекул. Чтобы решить эту проблему, мы предлагаем MolSight — платформу модели визуального языка, учитывающую графы, предназначенную для повышения понимания молекулярных изображений с помощью VLM. MolSight интегрирует Модуль молекулярной топологии, чтобы внедрить информацию о соседстве химических связей в визуальные токены, и Модуль молекулярного сопоставления для согласования визуальных особенностей с химической символикой семантики. Наши эксперименты показывают, что MolSight значительно превосходит существующие VLM, молекулярные LLM и специализированные инструменты по множеству задач понимания химических изображений, достигая нового уровня рассуждений о молекулярных изображениях.
Глубокое обучение в области компьютерного зрения для научных приложений требует сбора и аннотирования больших наборов данных в трудоемком, дорогом и подверженном ошибкам процессе. Генерация синтетических данных с помощью 3D-моделирования и рендеринга может упростить этот процесс и повысить точность аннотаций, генерируя их программно. Однако минимизация разрыва между реальными и синтетическими изображениями визуально является субъективной и не имеет систематических количественных критериев. Мы представляем GraNatPy, пакет для Python с метриками, помогающими улучшить рендеринг сцены. Мы показываем, что количественное увеличение реалистичности, разнообразия и размера созданного набора данных коррелирует с улучшением визуального восприятия сцены и более высоким качеством нулевого отслеживания в модели обнаружения объектов. Более того, мы продемонстрировали на примере фотографий вирусологических анализов, что сходство градиентов влияет на эффективность обнаружения небольших объектов, что может быть улучшено смешиванием реальных и синтетических данных. Наконец, мы превращаем процедурный рендеринг данных в агентную технологию (SynthClaw) для автоматизации оптимизации процедурных параметров.
Механизмы реакций состоят из пошаговых последовательностей элементарных реакций, которые объясняют химические преобразования. Поэтому изучение логики механизмов имеет решающее значение для повышения фундаментального химического интеллекта больших языковых моделей (БЯМ). Пошаговое выведение механизмов реакций естественно соответствует парадигмам рассуждений БЯМ. Однако текущие химические БЯМ в первую очередь акцентируют внимание на грубых наименованиях реакций для предсказания продуктов и ретросинтеза, что часто приводит к физическим несоответствиям и галлюцинациям. В отличие от этого, специализированные небольшие генеративные модели для вывода механизмов, как правило, страдают от ограниченной способности к обобщению в различных химических пространствах. Чтобы преодолеть эти ограничения, мы создали новый обширный набор данных для рассуждения о механизмах реакций. Более того, мы разработали FukuyamaBench — сложный эталон, основанный на книге Фукуямы «Современные механизмы органических реакций», для строгой оценки производительности моделей в иерархическом рассуждении о механизмах. Наша дообученная модель Qwen3-30B-A3B достигает 8,3% точного совпадения путей в наборе FukuyamaBench Set~A, превосходя специализированную модель FlowER (5,1%), что демонстрирует, что обучение с учетом механизмов значительно улучшает химическое рассуждение в языковых моделях.