MolSight: Модель визуального языка с учетом графов для универсального понимания химических изображений
MolSight: A Graph-Aware Vision-Language Model for Unified Chemical Image Understanding
Карточка статьи
Рубрика
Биология
Источник
arXiv
Дата
02.07.2026
Автор
Science Morning
Время чтения
3 мин
Это предварительная публикация, она не прошла научное рецензирование.
Аннотация
Использование крупных языковых моделей (LLM) для молекул в качестве единой платформы для понимания молекулярных структур и функций становится новой тенденцией в таких задачах, как молекулярный дизайн и открытие лекарств. Тем не менее, эти модели не способны в полной мере отражать визуальное представление молекулярных структур, что ограничивает их потенциал. Хотя существующие молекулярные модели визуального языка (VLM) показывают обнадеживающие результаты, они по-прежнему сталкиваются с проблемами структурной подгонки и недостатком необходимого топологического моделирования для точного понимания молекул. Чтобы решить эту проблему, мы предлагаем MolSight — платформу модели визуального языка, учитывающую графы, предназначенную для повышения понимания молекулярных изображений с помощью VLM. MolSight интегрирует Модуль молекулярной топологии, чтобы внедрить информацию о соседстве химических связей в визуальные токены, и Модуль молекулярного сопоставления для согласования визуальных особенностей с химической символикой семантики. Наши эксперименты показывают, что MolSight значительно превосходит существующие VLM, молекулярные LLM и специализированные инструменты по множеству задач понимания химических изображений, достигая нового уровня рассуждений о молекулярных изображениях.
Краткое резюме
MolSight — это новая модель, предназначенная для улучшения анализа молекулярных изображений. Она использует графовую структуру для более точного отображения молекулярных свойств и значительно превосходит предшествующие модели в ряде химических задач.
Практический вывод
MolSight может стать мощным инструментом в области молекулярного дизайна и разработки лекарств, обеспечивая более глубокое понимание химических изображений.
Ограничения
Это предварительная публикация, она не прошла научное рецензирование. Работа основана на предварительных результатах и требует дальнейшего валидации и тестирования в реальных условиях, чтобы подтвердить ее эффективность и применимость.
Происхождение импульсного излучения гамма-всплесков (ГВ, GRB) остается открытым вопросом. Модель внутренних ударов (МВУ) является одним из ведущих сценариев преобразования кинетической энергии релятивистских выбросов в гамма-лучи, однако её параметры еще не были полностью откалиброваны на основе наблюдаемых кривых света ГВ для воспроизведения их разнообразия. Мы принимаем машинное обучение как основу для оптимизации модели МВУ, сравнивая свойства симулированных и наблюдаемых кривых света из трех каталогов ГВ (Swift/BAT, Fermi/GBM, CGRO/BATSE). Предполагая зависимость скорости формирования ГВ от красного смещения, мы используем генетический алгоритм для минимизации функции потерь, основанной на шести независимых метриках, которые учитывают как средние значения, так и статистические распределения. Оптимизированная модель воспроизводит несколько ключевых наблюдательных свойств, включая средний временной профиль после пика, функцию автокорреляции и распределения длительности, отношения сигнал/шум, числа пиков, пикового потока и потока энергии. Мы также выводим ограничения на активность центрального двигателя: (i) количество выбрасываемых оболочек хорошо описывается обобщенным распределением Ципфа, аналогичным закону Гутенберга-Рихтера для землетрясений, и (ii) времена эмиссии оболочек в системе покоя следуют отрицательному экспоненциальному распределению, указывая на стохастический процесс с постоянной вероятностью выброса. Эта откалиброванная модель МВУ предоставляет физически обоснованную основу для интерпретации изменчивости ГВ и прогнозирования популяций ГВ, detectable в будущих миссиях.
Современные вычислительные подходы к дизайну лекарств обычно сосредоточены на генерации молекул, основанных на определенных мишенях или общих молекулярных свойствах, часто забывая о влиянии контекста болезни на поведение мишеней и терапевтические результаты. Чтобы устранить этот недостаток, мы представляем DrugGen-2, новую генеративную модель, которая разрабатывает маломолекулярные соединения с учетом как онтологии болезни, так и последовательностей целевых белков. DrugGen-2 была разработана путем дообучения предобученной модели GPT-2 на курированном наборе данных одобренных лекарств, связанных с их заболеваниями и мишенями, с использованием двухступенчатой стратегии, которая включает контролируемое дообучение, за которым следует обучение с подкреплением через оптимизацию групповой относительной политики (GRPO). Этот процесс был направлен функциями вознаграждения, которые оптимизировали химическую валидность, новизну, разнообразие и высокую предсказанную связующую аффинность. При оценке на пяти белковых мишенях, связанных с диабетической нефропатией, DrugGen-2 значительно превзошла базовые модели (DrugGPT и DrugGen). Она продемонстрировала превосходные способности генерировать уникальные молекулы, показала большую структурную схожесть с одобренными лекарствами и достигла улучшенной предсказанной связующей аффинности для всех целевых объектов. Анализы молекулярного докинга дополнительно подтвердили эти выводы, выявив кандидатов-лигандов с сильным связывающим потенциалом, включая соединения с предсказанными аффинностями (-9.917, -9.485 и -9.367), которые превышают таковые дляReference drugs, таких как эналаприл, для ангиотензин-превращающего фермента (-8.283). Интегрируя специфический для болезни контекст в генерацию молекул, DrugGen-2 продвигает вспомогательное основанное на ИИ открытие лекарств, предлагая мощный инструмент для нового дизайна и перепрофилирования лекарств с учетом сложного взаимодействия между заболеваниями и молекулярными мишенями.
Мы предлагаем феноменологическую модель Глобального Нейронного Рабочего Пространства (ГНРП), в которой ранняя сенсорная обработка создает эффективный комплекснозначный ландшафт, управляющий динамикой высокоуровневых представлений стимулов. Этот ландшафт служит динамическим мостом между сенсорным кодированием и сознательным доступом, позволяя описывать оба процесса в единой рамке. Высокоуровневые представления кодируются в облачной функции, определенной на Гильбертовом пространстве над пространством перцептивных состояний, таким образом сочетая целостную структуру ментальных образов с нейронной реализацией. Его динамика управляется нелинейным уравнением типа Шредингера в мнимом времени с некортежевающим, ненормальным Гамильтонианом и нелинейным членом типа Лотки—Вольтерры, который сохраняет норму и позволяет пространственные нелокальные взаимодействия. Гермиетиное и антигермиетиное части Гамильтониана генерируют дополняющие процессы: распознавание через диссипативную локализацию на минимумах ландшафта ГНРП и трансляцию информации через пространственное распространение по пространству состояний. В результате динамика воспроизводит иерархию сенсорной обработки: подсознательное—предсознательное—сознательное. Сознательный доступ соответствует появлению связного состояния, которое возникает только тогда, когда и глубина ландшафта ГНРП, и степень внимательности сверху вниз превышают пороговые значения. В результате полученная рамка предоставляет управляемое динамическое описание, связывающее сенсорную обработку, внимание и сознательный доступ в едином динамическом контексте.
Проектирование белковых последовательностей, которые связывают специфические лиганды, выигрывает от модели обратного сворачивания, основанной на полной геометрии лиганда. Мы представляем UMA-Inverse, которая заменяет разреженную графовую основу LigandMPNN на плотный кодировщик парного представления: шесть блоков PairMixer (умножение треугольников, без самовнимания треугольника или отслеживания последовательности) уточняют все пары остатков-остатков и остатки-атомы лиганда, под контролем вспомогательной цели дистограммы, а авторегрессионный декодер обращает внимание на атомы лиганда через обученное, позиционно-специфическое считывание парного тензора. Модель компактна (~3.3 млн параметров). На тестовых подвыборках LigandMPNN она достигает 56.1%/55.1%/35.3% восстановления интерфейса (маломолекулярный/металлический/нуклеотидный). Она уступает LigandMPNN, но не так сильно, как это предполагают опубликованные данные: повторный запуск по нашему идентичному протоколу дает LigandMPNN баллы 59.8/64.4/53.3 (по сравнению с опубликованными 63.3/77.5/50.5). В условиях фиксированного кармана переработанные конструкции уверенно сворачиваются и способны связываться с лигандом при совместном сворачивании Boltz-2, снова немного уступая LigandMPNN. Ее отличительной чертой является представительная способность: плотный кодировщик передает идентичность лиганда на остатки далеко за пределами интерфейса, где сигнал LigandMPNN затухает. Мы предлагаем UMA-Inverse в качестве компактной базовой модели для обратного сворачивания, реагирующего на лиганд, которая уступает LigandMPNN в точности, вместе с характеристикой того, как плотный кодировщик всех пар распространяет информацию о лигандe.
Большинство потенциально обитаемых планет, обнаруженных на сегодняшний день, вероятно, довольно отличаются от Земли, например, они имеют больший радиус и массу, различающийся уровень вращения и спектр родительской звезды, отличающийся от Солнца. Поэтому первая обнаруженная внеземная жизнь, возможно, будет существовать в условиях, которые не встречаются на нашей планете. Это требует универсального подхода к моделированию биологии, который можно применить к многочисленным планетарным сценариям, опираясь на базовые знания о жизни на Земле, но не ограничиваясь ими. Здесь мы исследуем универсальную модель микробной клетки, чья метаболическая скорость определяется термодинамикой и диффузией субстрата через клеточную мембрану. Мы моделируем биосферу с одним видом, состоящим из метанопродуцирующих микробов, и определяем, как изменение размера клетки, скорости клеточной гибели и затрат на синтез биомассы влияют на биосигнатуру на планете - в данном случае метан. Мы обсуждаем подходы к предсказанию верхних оценок для изобилия газов-биосигнатур и применимость модели к другим метаболизмам. Этот инструмент пополняет массив работ, стремящихся справиться со сложностью потенциальных внеземных биосфер.
Недавние модели генерации и редактирования изображений могут создавать визуально привлекательные натуральные изображения, однако они остаются ненадежными, когда целевое изображение представляет собой знания-интенсивную диаграмму, корректность которой зависит от дисциплинарных концепций, символической структуры и точных пространственных отношений. Мы представляем DisciplineGen-1M, набор данных многодисциплинарного масштаба с миллионом образцов, который поддерживает генерацию изображений из текста и редактирование изображений. Он содержит 1,2 миллиона образцов из математики, физики, химии, биологии, географии, информатики, экономики, истории, музыки и спорта. Для создания набора данных мы разрабатываем масштабируемую структуру, которая объединяет рендеринг векторной графики, редактирование на основе OCR, программный синтез и крупномасштабную фильтрацию текстов в изображения. Эти рабочие процессы обеспечивают создание аннотаций, инструкций по редактированию, структурированных аннотаций и пар изображений с контролируемыми семантическими различиями. Основываясь на DisciplineGen-1M, мы дополнительно представляем модель генерации рассуждений, учитывающую дисциплину, для генерации изображений из текста и редактирования изображений. Эксперименты на связанных с дисциплиной моделях, GenExam и GRADE, показывают значительные улучшения по сравнению с открытыми эталонами, в то время как оценки на общих моделях, информированных рассуждениями, WISE и RISE, дополнительно указывают на более широкий перенос. Результаты свидетельствуют о том, что структурированные академические визуальные данные большого объема являются ключевым компонентом для перехода генерации изображений от эстетической правдоподобности к верифицируемому созданию визуального контента на основе знаний. Мы публично выпустим наш набор данных, модель и исходный код процесса кураторства данных, чтобы обеспечить воспроизводимость и содействовать будущим исследованиям.