БиологияarXivScience Morning3 мин чтенияpreprint

Новый подход машинного обучения для классификации опухолей центральной нервной системы на основе метилирования ДНК

A Novel Machine Learning Approach for Central Nervous System Tumor Classification from DNA Methylation

Рубрика
Биология
Источник
arXiv
Дата
01.07.2026
Автор
Science Morning
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Биология

Аннотация

Профилирование метилирования ДНК стало мощным инструментом для классификации опухолей центральной нервной системы (ЦНС), однако существуют важные проблемы, касающиеся переносимости результатов между кохортами, методологической правильности и надежной многоклассовой оценки. В данной работе мы предлагаем новый и методологически строгий подход машинного обучения для классификации опухолей ЦНС на основе метилирования, который сочетает в себе метод разброса с разреженной проекцией для уменьшения размерности и многочленную логистическую регрессию для классификации. Мы оцениваем предложенный подход в том же общем экспериментальном контексте, который установлен широко используемым эталонным классификатором. В когорте из 2,801 образца наш метод достигает средней точности 96% при стратифицированной трехкратной перекрестной проверке. На независимой оценочной когорте из 1,104 образцов он достигает 86% точности на уровне 91 класса и 93% при оценке предсказаний на уровне семейства классов метилирования. Эти результаты превосходят соответствующие показатели современного эталона, составляя 82% согласованности на уровне классов и 88% согласованности на уровне семейства, что дает абсолютное увеличение примерно на 4 и 5 процентных пунктов соответственно. Это улучшение имеет клиническое значение: в диагностической практике увеличение на 5 пунктов в правильной классификации опухолей может напрямую повлиять на назначение подтипа рака и, в свою очередь, повлиять на выбор лечения и последующие клинические решения. Наши результаты показывают, что предложенная модель, основанная на более строгих методологических практиках в области машинного обучения, последовательно превосходит предыдущие современные достижения в различных условиях оценки и может существенно повысить надежность классификации опухолей ЦНС.

Краткое резюме

Статья предлагает новый подход к классификации опухолей центральной нервной системы на основе метилирования ДНК с использованием машинного обучения, который обеспечивает высокую точность и надежность результатов.

Практический вывод

Предложенный метод повысит точность классификации опухолей ЦНС, что может повлиять на диагностику и выбор лечения для пациентов.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. Необходимо провести дальнейшие исследования для оценки переносимости метода на разные когорты и уточнения его эффективности в клинической практике.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Биология
Биология
100%

Квантование доказательств энтрайнмента: сравнение частотного и байесовского подходов для карт обработки информации

Картографические модели обработки информации (IPPM) предлагают масштабируемую основу для формализации сложной последовательности математических преобразований, применяемых к сенсорным стимулам. Эти карты отображают задержку и кортикальное выражение вычислительных шагов, полагаясь на статистическое выведение для связи выходных данных модели с наблюдаемой нейронной активностью. Традиционно это картографирование основывалось на частотном тестировании гипотез. Тем не менее, определение того, какая из нескольких конкурирующих вычислительных моделей лучше всего объясняет нейронные данные, является задачей судебного разбирательства модели, которая, вероятно, лучше подходит для вероятностного вывода. Здесь мы представляем прямое сравнение между установленным частотным подходом и новым байесовским подходом для картирования кортикального энтрайнмента. Хотя байесовская формулировка сохраняет основную силу IPPM — генерация явных предсказаний временно изменяющихся нейронных сигналов — она кардинально изменяет критерий выбора, переходя от отвергания нулевой гипотезы к количественной оценке относительных доказательств конкурирующих вычислительных гипотез. Мы оцениваем производительность и интерпретируемость обоих подходов, используя набор данных аудионейровизуализации для реконструкции известного пути обработки громкости. Мы обсуждаем последствия этого сдвига для системной нейронауки, в частности, касательно обработки коллинеарных моделей и надежного накопления доказательств.

Биология
Биология
100%

Глубокое обучение для анализа семени при мужском бесплодии: компьютерное зрение, многомодальная интеграция и клинический перевод

Мужское бесплодие значительно увеличивает глобальную проблему бесплодия, а анализ спермы остается центральным элементом для диагностики, планирования лечения и вспомогательных репродуктивных технологий. Однако традиционная оценка семенной жидкости трудоемка, зависит от оператора и ограничена вариативностью между и внутри наблюдателей, что побуждает к разработке объективных и воспроизводимых вычислительных подходов. Этот обзор представляет собой всесторонний и перспективный синтез анализа спермы с использованием искусственного интеллекта, с акцентом на компьютерное зрение, глубокое обучение, многомодальную интеграцию, надежность и клинический перевод. Сначала мы рассматриваем специальные методы для обнаружения и подсчета сперматозоидов, оценки подвижности на основе отслеживания, семантической и экземплярной сегментации, классификации морфологии и дефектов, функциональной оценки и оценки генетической целостности. Затем мы подводим итоги открытых наборов данных, эталонов, метрик оценки и возникающих многомодальных стратегий, которые интегрируют микроскопические изображения, временные видеозаписи, параметры, полученные из CASA, тесты на целостность ДНК и клинические метаданные. Помимо алгоритмической эффективности, мы обсуждаем ключевые препятствия для внедрения в реальный мир, включая дефицит данных, межцентровый сдвиг домена, непоследовательность аннотаций, интерпретируемость, калибровку неопределенности, сохранение конфиденциальности данных и интеграцию в рабочие процессы. Наконец, мы очерчиваем поэтапный дорожный план клинического перевода, охватывающий техническую стандартизацию, многогранную ретроспективную валидацию, молчаливую перспективную оценку, клиническое тестирование с участием человека, валидацию результатов ВРТ, получение регуляторного одобрения и мониторинг после выхода на рынок. Упорядочивая область от задач визуального распознавания до надежного многомодального репродуктивного интеллекта, этот обзор подчеркивает как достижения, так и неразрешенные проблемы, необходимые для перевода анализа спермы с помощью ИИ в клинически значимую поддержку решений.

Биология
Биология
100%

Обработка данных с использованием мягкой разметки позволяет масштабировать классификацию ДНК для деконволюции клеточных типов всего тела

Деконволюция клеточных типов, задача оценки пропорций составляющих клеточных типов в гетерогенной биологической пробе, является основной проблемой в вычислительной биологии. Методы, основанные на эпигенетических маркерах, таких как метилирование ДНК, обычно работают с агрегированными оценками метилирования, игнорируя информацию о паттернах, содержащуюся в отдельных чтениях ДНК. Существующие подходы на уровне чтений, которые используют эту информацию, редки, и все они ограничены настройками с небольшим количеством классов; расширение их применения является открытой проблемой, поскольку на больших масштабах недискриминативные чтения доминируют, а жесткие метки противоречат многоместному соответствию между метилированиями и клеточными типами, что препятствует сходимости классификаторов. Чтобы преодолеть это, мы предлагаем данные-управляемую мягкую разметку, которая оценивает условное распределение клеточных типов для каждого чтения и интегрируем эту схему в Syto, новую модульную структуру для деконволюции на основе классификации на уровне чтений. На атласе всего тела из 39 типов клеток человека Syto снижает среднеквадратичную ошибку (MSE) в 2.56 раз по сравнению с SoTA, при этом улучшения переносятся на датасет вне распределения, охватывающий 16 тканей. Syto закладывает основу для моделирования все более крупных панелей клеточных типов с улучшенными приложениями в биологии и здравоохранении. Предложенная схема мягкой разметки также может быть адаптирована для любого сценария с многоместным соответствием сигнала и метки.

Биология
Биология
95%

Новый фенотипический подход к приоритизации кандидатных генетических вариантов для расстройства аутистического спектра.

Цель: Расстройство аутистического спектра (РАС) является генетически и фенотипически гетерогенным состоянием, что усложняет выявление причинных вариантов. Современные диагностические подходы имеют ограниченную эффективность, подчеркивая необходимость в новых стратегиях. Методы: Мы разработали фенотипический каркас для приоритизации генетических вариантов, ассоциированных с РАС, используя полные фенотипические данные и данные экзомного секвенирования (ЭС) от 125 детей с РАС. Мы использовали номенклатуру Общей фенотипической онтологии (HPO) для приоритизации кандидатных вариантов у каждого ребенка на основе сходства между наблюдаемыми фенотипами и ожидаемыми фенотипами, специфичными для вариантов. Результаты: Мы идентифицировали 228 терминов HPO, объединенных в 41 категорию фенотипов. Гены, ассоциированные с РАС, согласно базам данных HPO и SFARI Gene, были значительно обогащены этими фенотипами по сравнению с не-РАС генами (среднее 16.1+/-5.7 против 6.5+/-5.4; p=1.1e-231; HPO, и 16.0+/-6.7 против 7.3+/-6.0; p=2.1e-57; SFARI), что подтверждает актуальность этой батареи фенотипов для генетики РАС. У 36 генетически разрешенных участников подход, основанный на сходстве фенотипов, поставил 58% причинных вариантов на первое место и 89% в топ-3. В 89 неразрешенных случаях он выделил шесть новых клинически значимых вариантов, что увеличило диагностическую эффективность на 45%. Заключение: Наша новая батарея фенотипов РАС облегчает приоритизацию клинически значимых вариантов РАС и, следовательно, может повысить диагностическую эффективность, открытие генов и точную медицину на основе фенотипов для РАС.

Биология
Биология
92%

Изучение механистического рассуждения для химических реакций с помощью больших языковых моделей

Механизмы реакций состоят из пошаговых последовательностей элементарных реакций, которые объясняют химические преобразования. Поэтому изучение логики механизмов имеет решающее значение для повышения фундаментального химического интеллекта больших языковых моделей (БЯМ). Пошаговое выведение механизмов реакций естественно соответствует парадигмам рассуждений БЯМ. Однако текущие химические БЯМ в первую очередь акцентируют внимание на грубых наименованиях реакций для предсказания продуктов и ретросинтеза, что часто приводит к физическим несоответствиям и галлюцинациям. В отличие от этого, специализированные небольшие генеративные модели для вывода механизмов, как правило, страдают от ограниченной способности к обобщению в различных химических пространствах. Чтобы преодолеть эти ограничения, мы создали новый обширный набор данных для рассуждения о механизмах реакций. Более того, мы разработали FukuyamaBench — сложный эталон, основанный на книге Фукуямы «Современные механизмы органических реакций», для строгой оценки производительности моделей в иерархическом рассуждении о механизмах. Наша дообученная модель Qwen3-30B-A3B достигает 8,3% точного совпадения путей в наборе FukuyamaBench Set~A, превосходя специализированную модель FlowER (5,1%), что демонстрирует, что обучение с учетом механизмов значительно улучшает химическое рассуждение в языковых моделях.

Биология
Биология
92%

Обучение LDPC-кодов с квантизированной эволюцией плотности по расслабленным протографам

Мы рассматриваем проектирование кодов с низкой плотностью проверок на четность (LDPC) для данного итеративного декодера. Несмотря на такие инструменты, как прямая симуляция, эволюция плотности (DE) и анализ EXIT-графиков, выбор матрицы проверок на четность остается сложной комбинаторной задачей оптимизации. Существующие подходы часто полагаются на основанные на популяции методы поиска, случайные мутации, генетические алгоритмы или связанные эвристики, которые требуют тщательной настройки параметров и могут быть вычислительно затруднительными. Недавние методы, основанные на градиентном спуске (GD), оптимизируют расслабленные матрицы проверок на четность, дифференцируя через симуляции декодера. Однако такие стратегии с «декодером в петле» полагаются на шумные оценки Монте-Карло, требуют поиска по линии для мягких представлений матриц и остаются дорогостоящими для длинных кодов LDPC. Более того, хотя оптимизация проводится в расслабленной области, потери обычно оцениваются только для матриц проверок на четность с целочисленными значениями. В этой работе мы сосредотачиваемся на проектировании кодов LDPC на основе длинных протографов и предлагаем детерминированную структуру на основе GD, которая работает непосредственно с расслабленным представлением протографа. Каждая ячейка протографа интерпретируется как вероятность того, что соответствующий элемент равен единице. Функция потерь основана на показателе битовой ошибки (BER) в эволюции плотности и может быть непосредственно оценена для расслабленных протографов. Чтобы обосновать это расслабление, мы связываем расслабленное представление с ансамблем двоичных протографов и показываем, что предложенная расслабленная DE дает усредненные показатели DE для ансамбля. В результате оптимизационная процедура полностью автономна и использует стандартные методы GD. Благодаря детерминированной оценке DE и информативным градиентам предложенный подход обеспечивает быструю и надежную сходимость. Численные эксперименты для декодера min-sum показывают, что оптимизированные протографы превосходят коды LDPC 5G с теми же размерами протографов.