БиологияarXivScience Morning3 мин чтенияpreprint

DrugGen 2: Модель языка, учитывающая болезни для улучшения открытия лекарств

DrugGen 2: A disease-aware language model for enhancing drug discovery

Рубрика
Биология
Источник
arXiv
Дата
09.07.2026
Автор
Science Morning
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Биология

Аннотация

Современные вычислительные подходы к дизайну лекарств обычно сосредоточены на генерации молекул, основанных на определенных мишенях или общих молекулярных свойствах, часто забывая о влиянии контекста болезни на поведение мишеней и терапевтические результаты. Чтобы устранить этот недостаток, мы представляем DrugGen-2, новую генеративную модель, которая разрабатывает маломолекулярные соединения с учетом как онтологии болезни, так и последовательностей целевых белков. DrugGen-2 была разработана путем дообучения предобученной модели GPT-2 на курированном наборе данных одобренных лекарств, связанных с их заболеваниями и мишенями, с использованием двухступенчатой стратегии, которая включает контролируемое дообучение, за которым следует обучение с подкреплением через оптимизацию групповой относительной политики (GRPO). Этот процесс был направлен функциями вознаграждения, которые оптимизировали химическую валидность, новизну, разнообразие и высокую предсказанную связующую аффинность. При оценке на пяти белковых мишенях, связанных с диабетической нефропатией, DrugGen-2 значительно превзошла базовые модели (DrugGPT и DrugGen). Она продемонстрировала превосходные способности генерировать уникальные молекулы, показала большую структурную схожесть с одобренными лекарствами и достигла улучшенной предсказанной связующей аффинности для всех целевых объектов. Анализы молекулярного докинга дополнительно подтвердили эти выводы, выявив кандидатов-лигандов с сильным связывающим потенциалом, включая соединения с предсказанными аффинностями (-9.917, -9.485 и -9.367), которые превышают таковые дляReference drugs, таких как эналаприл, для ангиотензин-превращающего фермента (-8.283). Интегрируя специфический для болезни контекст в генерацию молекул, DrugGen-2 продвигает вспомогательное основанное на ИИ открытие лекарств, предлагая мощный инструмент для нового дизайна и перепрофилирования лекарств с учетом сложного взаимодействия между заболеваниями и молекулярными мишенями.

Краткое резюме

DrugGen-2 — новая генеративная модель для разработки маломолекулярных соединений, учитывающая контекст заболеваний и последовательности белков-мишеней. Она значительно превосходит предыдущие модели по качеству генерации и связывающей аффинности.

Практический вывод

DrugGen-2 может стать важным инструментом для разработки новых лекарств и перепрофилирования существующих с учетом влияния заболеваний на молекулы.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. Модель может иметь ограничения по общему охвату заболеваний и белков, а также требует дальнейших исследований для проверки на других заболеваниях и мишенях.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Биология
Биология
100%

Модель внутренних ударов, откалиброванная с использованием реальных кривых света гамма-всплесков с помощью генетического алгоритма

Происхождение импульсного излучения гамма-всплесков (ГВ, GRB) остается открытым вопросом. Модель внутренних ударов (МВУ) является одним из ведущих сценариев преобразования кинетической энергии релятивистских выбросов в гамма-лучи, однако её параметры еще не были полностью откалиброваны на основе наблюдаемых кривых света ГВ для воспроизведения их разнообразия. Мы принимаем машинное обучение как основу для оптимизации модели МВУ, сравнивая свойства симулированных и наблюдаемых кривых света из трех каталогов ГВ (Swift/BAT, Fermi/GBM, CGRO/BATSE). Предполагая зависимость скорости формирования ГВ от красного смещения, мы используем генетический алгоритм для минимизации функции потерь, основанной на шести независимых метриках, которые учитывают как средние значения, так и статистические распределения. Оптимизированная модель воспроизводит несколько ключевых наблюдательных свойств, включая средний временной профиль после пика, функцию автокорреляции и распределения длительности, отношения сигнал/шум, числа пиков, пикового потока и потока энергии. Мы также выводим ограничения на активность центрального двигателя: (i) количество выбрасываемых оболочек хорошо описывается обобщенным распределением Ципфа, аналогичным закону Гутенберга-Рихтера для землетрясений, и (ii) времена эмиссии оболочек в системе покоя следуют отрицательному экспоненциальному распределению, указывая на стохастический процесс с постоянной вероятностью выброса. Эта откалиброванная модель МВУ предоставляет физически обоснованную основу для интерпретации изменчивости ГВ и прогнозирования популяций ГВ, detectable в будущих миссиях.

Биология
Биология
100%

Некортежевая модель потенциала для сознательного, предсознательного и подсознательного процессов

Мы предлагаем феноменологическую модель Глобального Нейронного Рабочего Пространства (ГНРП), в которой ранняя сенсорная обработка создает эффективный комплекснозначный ландшафт, управляющий динамикой высокоуровневых представлений стимулов. Этот ландшафт служит динамическим мостом между сенсорным кодированием и сознательным доступом, позволяя описывать оба процесса в единой рамке. Высокоуровневые представления кодируются в облачной функции, определенной на Гильбертовом пространстве над пространством перцептивных состояний, таким образом сочетая целостную структуру ментальных образов с нейронной реализацией. Его динамика управляется нелинейным уравнением типа Шредингера в мнимом времени с некортежевающим, ненормальным Гамильтонианом и нелинейным членом типа Лотки—Вольтерры, который сохраняет норму и позволяет пространственные нелокальные взаимодействия. Гермиетиное и антигермиетиное части Гамильтониана генерируют дополняющие процессы: распознавание через диссипативную локализацию на минимумах ландшафта ГНРП и трансляцию информации через пространственное распространение по пространству состояний. В результате динамика воспроизводит иерархию сенсорной обработки: подсознательное—предсознательное—сознательное. Сознательный доступ соответствует появлению связного состояния, которое возникает только тогда, когда и глубина ландшафта ГНРП, и степень внимательности сверху вниз превышают пороговые значения. В результате полученная рамка предоставляет управляемое динамическое описание, связывающее сенсорную обработку, внимание и сознательный доступ в едином динамическом контексте.

Биология
Биология
100%

Универсальная модель микробной клетки для предсказания метановых биосигнатур

Большинство потенциально обитаемых планет, обнаруженных на сегодняшний день, вероятно, довольно отличаются от Земли, например, они имеют больший радиус и массу, различающийся уровень вращения и спектр родительской звезды, отличающийся от Солнца. Поэтому первая обнаруженная внеземная жизнь, возможно, будет существовать в условиях, которые не встречаются на нашей планете. Это требует универсального подхода к моделированию биологии, который можно применить к многочисленным планетарным сценариям, опираясь на базовые знания о жизни на Земле, но не ограничиваясь ими. Здесь мы исследуем универсальную модель микробной клетки, чья метаболическая скорость определяется термодинамикой и диффузией субстрата через клеточную мембрану. Мы моделируем биосферу с одним видом, состоящим из метанопродуцирующих микробов, и определяем, как изменение размера клетки, скорости клеточной гибели и затрат на синтез биомассы влияют на биосигнатуру на планете - в данном случае метан. Мы обсуждаем подходы к предсказанию верхних оценок для изобилия газов-биосигнатур и применимость модели к другим метаболизмам. Этот инструмент пополняет массив работ, стремящихся справиться со сложностью потенциальных внеземных биосфер.

Биология
Биология
100%

GlycoMAC: Мультимасштабная метаболическая и гликозилирующая модель для предсказания гликозилирования в условиях культур млекопитающих клеток

Продуктивность антител и качество гликозилирования в культурах CHO возникают из динамически меняющейся метаболической среды, однако модели часто работают в изоляции или на одном уровне. В данной работе мы представляем мультимасштабную механистическую модель, связывающую молекулярный, клеточный и процессный уровни, для предсказания того, как входные параметры формируют траектории биопроцессов. Основой модели является кинетическая модель на уровне одной клетки, которая связывает метаболические и гликозилирующие сети, управляющие выходом и критическими качественными характеристиками (CQA). Стохастическая модель одной клетки описывает зависящие от окружающей среды переходы между ростом, производством и упадком, учитывая гетерогенность популяции. Мы также вводим накопительное изменение скорости поглощения кислорода, интегрируя общее метаболическое изменение со временем, как компактный биомаркер для предсказания метаболических изменений. В отличие от подходов, основанных на среднем по популяции, модель передает метаболические состояния с разрешением на уровень клеток (включая pH Гольджи, регулируемое аммиаком, доступность нуклеотидных сахаров, марганцевые кофакторы и скорость синтеза) в процесс гликозилирования. Модель была оценена на культурах CHO-K1, производящих VRC01 IgG1 при целевом стрессе от аммиака, в условиях контроля и с использованием стратегии пирамидальной подачи с более строгим контролем. Она точно предсказывает траектории плотности клеток, метаболитов, продуктивности и гликозилирования, включая увеличение G0F и снижение галактилирования при стрессе от аммиака, и количественно оценивает, как метаболическая гетерогенность влияет на изменчивость продуктивности и CQA. Эта работа предоставляет единое основание для предсказательной биопроизводства и продвинутого управления процессами.

Биология
Биология
95%

Эффективность плазменных биомаркеров болезни Альцгеймера у пациентов с прионными заболеваниями.

Прионные болезни могут имитировать болезнь Альцгеймера (БА) при первичном обращении. Критерии диагностирования БА, предложенные Ассоциацией Альцгеймера, указывают на то, что один аномальный высокоспецифичный плазменный биомаркер (включая p-tau217) достаточен для биологической диагностики. Мы исследовали эффективность плазменных биомаркеров БА в различении БА и прионных болезней. Мы проанализировали данные плазменных биомаркеров от пациентов с прионными болезнями из проспективного когортного исследования, набранного через Национальную прионовую клинику Великобритании. Клиническая диагностика прионных заболеваний проводилась или клинически, или с подтверждением при аутопсии, а диагностика БА происходила клинически с подтверждением биомаркеров в ликворе. Плазменные p-tau217, p-tau181, соотношение Aβ42/40, тау, полученный из мозга (BD-tau), легкая цепь нейрофиламентов (NfL) и глиальный фибриллярный кислый белок (GFAP) измерялись с помощью метода Simoa. Медианные значения биомаркеров в разных группах сравнивались с помощью теста Крускала-Уоллиса, а площадь под кривой операционной характеристики использовалась для сравнения точности в различении прионных болезней от спорадической БА (сБА). p-tau217 и NfL измерялись в валидирующем исследовании в другой лаборатории. В основном исследовании мы проанализировали 345 образцов от 278 человек (средний возраст 58 [SD 13.5], 48.2% женщин), включая 204 с прионными болезнями (121 спорадическая болезнь Крейцфельда-Якоба [БКЯ], 11 iatrogenных БКЯ, 9 варианта БКЯ, 47 медленно прогрессирующих наследственных прионных болезней (НПБ) и 16 быстро прогрессирующих НПБ), 33 с БА и 41 здорового контрольного образца. Для различения прионной болезни без сопутствующей патологии БА от сБА ни один из p-tau217 (площадь под кривой [AUC] [95% ДИ] 0.605 [0.486-0.724]), p-tau181 (AUC 0.554 [0.446-0.661]) или GFAP (AUC 0.514 [0.389-0.640]) не продемонстрировал хороших результатов. Aβ42/40 продемонстрировал умеренные результаты (AUC 0.770 [0.684-0.856]). Соотношение NfL/p-tau217 (AUC 0.996 [0.987-1.000]), NfL (AUC 0.988 [0.974-1.000]), соотношение BD-tau/p-tau217 (AUC 0.963 [0.929-0.996]) и BD-tau (AUC 0.934 [0.890-0.978]) продемонстрировали очень хорошие результаты. В независимом валидирующем исследовании были проанализированы последовательные образцы от 32 пациентов с сБА и 35 пациентов с спорадической болезнью Крейцфельда-Якоба (средний возраст 65.0 [SD 6.4], 56.7% женщин). Соотношение NfL/p-tau217 снова различалось практически идеально (AUC 0.986 [95% ДИ 0.966-1.000]). Плазменные p-tau217 и p-tau181 повышены как при БА, так и при прионных болезнях (независимо от нагрузки сопутствующей патологии БА). Диагностика БА с использованием одного аномального плазменного биомаркера p-tau рискует привести к ошибочной диагностике прионных болезней как БА. Плазменное соотношение NfL/p-tau217 различает почти идеально и может служить сигналом для подозрения на прионные болезни, где это является диагностической возможностью. Это исследование предоставляет доказательства класса II, что плазменное соотношение NfL/p-tau217 различает пациентов с БКЯ от пациентов с БА.

Биология
Биология
95%

Генетический ландшафт болезни Паркинсона в странах Вишеградской группы: исследование CEGEMOD

Аннотация Введение: Генетика болезни Паркинсона (БП) в основном изучалась на популяциях Западной Европы и Северной Америки, в то время как Центральная Европа была недостаточно представлена. Целью нашего исследования было охарактеризовать генетическую архитектуру БП в странах В4 (Словакия, Чехия, Венгрия и Польша). Методы: Исследование CEGEMOD объединило систематический обзор опубликованных генетических исследований БП из региона В4 с проспективным генетическим скринингом 1373 пациентов. Все участники прошли генотипирование, в то время как генетически неразрешенные пациенты с ранним началом или семейной формой БП прошли анализ полного экзома. Варианты интерпретировались с использованием современных клинических стандартов и валидировались с помощью секвенирования по Сэнгеру. Результаты: Систематический обзор выявил 48 подходящих исследований, сообщающих о патогенных или рискованных вариантах у пациентов с БП из стран В4. В проспективной когортной группе были идентифицированы патогенные, вероятно патогенные или установленные рискованные варианты у 157 из 1373 пациентов (11,4%). Варианты GBA1 составили большинство обнаруженных, в первую очередь определяемые двумя мягкими распространенными рискованными вариантами GBA1:p.(Thr408Met) и p.(Glu365Lys), после чего следуют LRRK2, PRKN, POLG, PLA2G6 и ATP1A3. Секвенирование полного экзома обеспечило дополнительную диагностическую доходность в 5% у генетически неразрешенных высокорисковых пациентов. Наши результаты также демонстрируют значительные различия в генетических исследованиях по Центральной Европе. Заключение: Данное исследование предоставляет крупнейшую генетическую характеристику БП в Центральной Европе на сегодняшний день. Исследование CEGEMOD расширяет знания о региональном генетическом ландшафте, поддерживает внедрение генетического тестирования в клиническую практику и создает важный ресурс для будущей прецизионной медицины и совместных исследований генетики БП.