БиологияarXivScience Morning3 мин чтенияpreprint

Аффинаж: механистическая аннотация генома на основе опубликованной литературы

Affinage: genome-scale mechanistic gene annotation from the published literature

Рубрика
Биология
Источник
arXiv
Дата
02.07.2026
Автор
Science Morning
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Биология

Аннотация

Понимание механистической функции гена является критически важной отправной точкой для биологии. Однако, для значительной части человеческого протеома эти знания разбросаны по тысячам первичных публикаций или остаются плохо установленными, в то время как кураторские базы данных, на которые полагаются биологи, могут отставать на годы от свежей литературы. Большие языковые модели теперь могут читать и синтезировать эту литературу по запросу, но делать это достоверно для многих генов — это дорогостоящая, неповторяемая сессия извлечения, которая не масштабируется среди пользователей. Здесь мы представляем Аффинаж, конвейер LLM, который выполняет это извлечение и механистическое рассуждение один раз для каждого гена — только на основе первичной литературы — и хранит результат в виде структурированной аннотации, которую можно повторно использовать. Программа чтения, разработанная биологами, извлекает только прямые экспериментальные доказательства, а синтетический этап рассуждает только на основе этих находок. Применяя анализ по всему геному, Аффинаж аннотирует 19 293 человеческих белок-кодирующих генов. Этот анализ предоставляет механизмы для тысяч генов, чей функционал в UniProt пуст или неполный, превосходя кураторские справочные материалы по 99.1% генов в прямом сравнении, оцененным независимо судьями LLM разных семейств. Аффинаж также определяет 10% протеома, которые остаются механистически не охарактеризованными, и будет служить постоянно обновляемым, основанным на литературе перепиской функций генов. Все записи доступны открыто по адресу https://affinage.wi.mit.edu. Более широко, Аффинаж служит примером того, как эксперты в области могут закодировать свои знания в масштабируемые конвейеры LLM, чтобы улучшить публично доступные данные, которые направляют биологические гипотезы и эксперименты.

Краткое резюме

Аффинаж представляет собой новый инструмент для аннотации генов, который использует большие языковые модели для извлечения и интерпретации данных из научной литературы. Он аннотирует более 19 000 белок-кодирующих генов человека, предоставляя механистические данные для генов с недостаточной информацией.

Практический вывод

Инструмент Аффинаж облегчает доступ к актуальной информации о функциях генов, что может значительно ускорить процессы научных исследований и разработки гипотез в биологии.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. Хотя Аффинаж эффективно аннотирует многие гены, оно основывается на существующей литературе, и его возможности зависят от доступности и качества этих данных. Некоторые гены могут быть недостаточно охарактеризованы в литературе, что ограничивает информацию, доступную через этот инструмент.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Биология
Биология
92%

Генетический алгоритм для формирования составов рецензионных панелей

Состав научных рецензионных панелей является задачей ограниченной оптимизации, в которой конечный пул экспертов должен быть распределен по нескольким панелям с учетом научной экспертизы и демографического разнообразия. Поскольку количество возможных конфигураций панелей растет очень быстро с увеличением числа рецензентов, исчерпывающие поиски быстро становятся вычислительно нецелесообразными. В этой работе я представляю генетический алгоритм, разработанный для оптимизации состава панелей в процессе оценки предложений Европейской южной обсерватории (ESO). Назначения панелей представлены через кодирование на основе хромосом. Кандидатные решения оцениваются с использованием функции приспособленности, основанной на четырех индикаторах дисбаланса: научной экспертизе, гендере, принадлежности к стране и профессиональной старшинстве. Метод тестируется с использованием реальных данных рецензентов из системы обработки предложений ESO. Результаты показывают, что генетический алгоритм быстро определяет конфигурации панелей с существенно меньшим дисбалансом, чем те, которые получены из случайных назначений, и постепенно улучшает качество общей популяции. Кроме того, вместо того, чтобы создавать одну оптимизированную конфигурацию, подход генерирует набор высококачественных реализаций панелей, которые могут быть впоследствии отфильтрованы в соответствии с дополнительными операционными ограничениями, не включенными явно в функцию приспособленности. Хотя методология была разработана для ESO, она является общей и применима к широкому спектру систем рецензирования на основе панелей.

Биология
Биология
92%

Ненавязчивое сканирование H3 K27M в педиатрической диффузной срединной глиоме с использованием радиомики на неоднородной МРТ с T2-взвешиванием

Статус мутации гистона H3K27M определяет клинически агрессивную подгруппу педиатрической диффузной срединной глиомы и влияет на прогноз и право участия в клинических испытаниях, однако подтверждение обычно требует биопсии из важных срединных структур. Мы оценили, может ли радиомика, основанная на стандартной МРТ с T2-взвешиванием, предоставить дополнительный сигнал для скрининга в неоднородной выборке, где сканирование часто выполняется внешними учреждениями, и MРТ с T2-взвешиванием является единственной последовательно доступной последовательностью. Было проанализировано 98 педиатрических пациентов с подтвержденным статусом по биопсии (73 с положительной мутацией, 25 с дикой формой). Экспертные сегментации опухоли определили области интереса для извлечения признаков PyRadiomics после изотропной переработки, двойного исключения черепной кости и фильтрации на разных масштабах. Мы систематически отключали предобработку, устраняли корреляцию с помощью повторного рекурсивного выбора признаков, объема опухоли и синтетической миноритарной агментации TabDDPM по 100 стратифицированным выборкам обучения/тестирования с реальными тестовыми наборами. Чистая радиомика достигла точности 0.664 и F1-оценки 0.784. Лучший процесс включал предобработку, выбор признаков и объем с CatBoost, достигнув точности 0.730 $\pm$ 0.068 и F1-оценки 0.826 $\pm$ 0.044. TabDDPM улучшил TabPFN до F1-оценки 0.81 $\pm$ 0.05 при 200 увеличенных строках. Эти результаты поддерживают использование радиомики на МРТ с T2-взвешиванием как умеренной вспомогательной помощи для скрининга и триажа, но не заменяют диагностику на основе ткани.

Биология
Биология
92%

Новый подход машинного обучения для классификации опухолей центральной нервной системы на основе метилирования ДНК

Профилирование метилирования ДНК стало мощным инструментом для классификации опухолей центральной нервной системы (ЦНС), однако существуют важные проблемы, касающиеся переносимости результатов между кохортами, методологической правильности и надежной многоклассовой оценки. В данной работе мы предлагаем новый и методологически строгий подход машинного обучения для классификации опухолей ЦНС на основе метилирования, который сочетает в себе метод разброса с разреженной проекцией для уменьшения размерности и многочленную логистическую регрессию для классификации. Мы оцениваем предложенный подход в том же общем экспериментальном контексте, который установлен широко используемым эталонным классификатором. В когорте из 2,801 образца наш метод достигает средней точности 96% при стратифицированной трехкратной перекрестной проверке. На независимой оценочной когорте из 1,104 образцов он достигает 86% точности на уровне 91 класса и 93% при оценке предсказаний на уровне семейства классов метилирования. Эти результаты превосходят соответствующие показатели современного эталона, составляя 82% согласованности на уровне классов и 88% согласованности на уровне семейства, что дает абсолютное увеличение примерно на 4 и 5 процентных пунктов соответственно. Это улучшение имеет клиническое значение: в диагностической практике увеличение на 5 пунктов в правильной классификации опухолей может напрямую повлиять на назначение подтипа рака и, в свою очередь, повлиять на выбор лечения и последующие клинические решения. Наши результаты показывают, что предложенная модель, основанная на более строгих методологических практиках в области машинного обучения, последовательно превосходит предыдущие современные достижения в различных условиях оценки и может существенно повысить надежность классификации опухолей ЦНС.

Биология
Биология
90%

Обработка данных с использованием мягкой разметки позволяет масштабировать классификацию ДНК для деконволюции клеточных типов всего тела

Деконволюция клеточных типов, задача оценки пропорций составляющих клеточных типов в гетерогенной биологической пробе, является основной проблемой в вычислительной биологии. Методы, основанные на эпигенетических маркерах, таких как метилирование ДНК, обычно работают с агрегированными оценками метилирования, игнорируя информацию о паттернах, содержащуюся в отдельных чтениях ДНК. Существующие подходы на уровне чтений, которые используют эту информацию, редки, и все они ограничены настройками с небольшим количеством классов; расширение их применения является открытой проблемой, поскольку на больших масштабах недискриминативные чтения доминируют, а жесткие метки противоречат многоместному соответствию между метилированиями и клеточными типами, что препятствует сходимости классификаторов. Чтобы преодолеть это, мы предлагаем данные-управляемую мягкую разметку, которая оценивает условное распределение клеточных типов для каждого чтения и интегрируем эту схему в Syto, новую модульную структуру для деконволюции на основе классификации на уровне чтений. На атласе всего тела из 39 типов клеток человека Syto снижает среднеквадратичную ошибку (MSE) в 2.56 раз по сравнению с SoTA, при этом улучшения переносятся на датасет вне распределения, охватывающий 16 тканей. Syto закладывает основу для моделирования все более крупных панелей клеточных типов с улучшенными приложениями в биологии и здравоохранении. Предложенная схема мягкой разметки также может быть адаптирована для любого сценария с многоместным соответствием сигнала и метки.

Биология
Биология
82%

О различимости деревьев и полной идентифицируемости филогенетических сетей

Филогенетические сети обобщают филогенетические деревья для эволюционных историй, которые включают ретикулярные события, такие как рекомбинация, горизонтальный перенос генов и гибридизация. В рамках марковской модели замещения нуклеотидов филогенетическая сеть определяет распределение паттернов листьев. В данной работе мы исследуем идентифицируемость топологии сети из этого распределения в рамках моделей Джукса-Кантера (JC), Кимуры с двумя параметрами (K2P) и Кимуры с тремя параметрами (K3P). Нашим первым результатом является то, что полуправильный параметр сети уровня 1 (с учётом перенаправления треугольников) полностью идентифицируем по всем трем моделям на биологически разумном пространстве параметров, где скорости замещения являются вероятностными, а параметры смешивания нетривиальны (т.е. не равны 0 или 1). В отличие от общепринятой идентифицируемости, установленной в предыдущих работах, это действительно для каждой точки параметрического пространства, а не только для подмножества нулевой меры. Наш второй результат отличает филогенетические сети от филогенетических деревьев в том же пространстве параметров при JC и K2P. Мы доказываем, что ни одна филогенетическая сеть и филогенетическое дерево не могут порождать одно и то же распределение паттернов листьев, если только сеть не является деревом, возможно, дополненным определёнными подструктурами, называемыми $2$-болбами. Это означает, что наличие ретикулярной эволюции создает, в большинстве случаев, обнаружимый след в распределении паттернов листьев. Более широко, эти результаты имеют последствия для идентифицируемости за пределами изученных моделей и классов сетей, включая несколько моделей на основе коалесценции.

Биология
Биология
82%

Обнаружение падений в реальном времени на основе компьютерного зрения для низкопотребляющих платформ на краю сети

Обнаружение падений имеет важное значение для ухода за пожилыми людьми и интеллектуального наблюдения; однако существующие подходы на основе компьютерного зрения в основном рассматривают его как классификацию статической позы или сопоставление дискретных временных шаблонов, в корне упуская нестабильную динамику человеческой опорной системы. В данной статье предлагается основанная на физике структура для обнаружения падений, которая трактует падение как событие утраты устойчивости в связанной динамической системе. Мы вводим новую архитектуру двойной LTC, состоящую из подсистемы центра масс (CoM) и подсистемы базы поддержки (BoS), обе реализованы как нейронные сети с жидкими временными константами (LTC), которые непрерывно моделируют эволюцию инерциальной траектории и адаптацию к контакту с землёй с помощью адаптивных временных констант. Физическая интерпретируемость движения при падении. Обучаемый модуль связывания имитирует физическое взаимодействие между двумя подсистемами, в то время как классификатор стабильности Manifold работает в объединённом латентном пространстве для обнаружения пересечения границы через метрики стабильности, вдохновлённые методом Ляпунова. Дополнительное проецирование контрфактической траектории и оценка времени до столкновения (TTC) дальше позволяют оценить необратимость и осуществить раннее предупреждение. Архитектура разработана для поддержки парадигмы предсказания с тремя состояниями (Нормально, Падает, Упал); в этом предварительном исследовании мы проверяем основную способность различения стабильности на датасете из двух классов (Нормально против Падает), оставляя полную трехстадийную временную трансформацию для будущей работы. В отличие от традиционных конвейеров CNN-RNN, предлагаемая формулировка кодирует механическую инерцию непрерывного времени, что позволяет создать сеть с менее чем 50 тыс. параметров, способную выполнять вывод в реальном времени на устройствах с ограниченными ресурсами. Обширные эксперименты демонстрируют конкурентоспособную точность с превосходной физической интерпретируемостью, подтверждая её эффективность для визуального обнаружения падений при низких вычислительных затратах.