Использование иерархических статистических моделей обучения для моделирования индивидуального статистического обучения
Using hierarchical statistical learning models to model individual statistical learning
Карточка статьи
Рубрика
Биология
Источник
arXiv
Дата
07.07.2026
Автор
Science Morning
Время чтения
3 мин
Это предварительная публикация, она не прошла научное рецензирование.
Аннотация
Статистическое обучение является важным для того, чтобы индивидуумы могли обнаруживать структуры в сенсорной среде, особенно во время общения через речь или музыку. Индивидуальные различия в способностях статистического обучения были предложены для объяснения различий в различных когнитивных функциях и их развитии, включая развивающиеся расстройства такие, как дислексия. В данном исследовании мы использовали иерархическую байесовскую модель статистического обучения (HBSL) для моделирования индивидуальных траекторий обучения, которые были зарегистрированы с помощью электроэнцефалограммы (ЭЭГ), в то время как взрослые с дислексией и без неё слушали структурированные тоновые последовательности. Хотя мы не обнаружили значительных различий между группами, наши результаты показали близкое соответствие между моделированием и реальными данными ЭЭГ, а новые последовательности, созданные на основе индивидуальных моделей, были очень похожи на оригинальную стимульную последовательность. Это предоставляет доказательство концепции для будущих исследований и предполагает, что модель HBSL точно отражала статистическую структуру последовательностей так же, как и человеческие слушатели.
Краткое резюме
Исследование показало, что индивидуальные различия в статистическом обучении могут объяснить различия в когнитивных функциях, включая дислексию. Модель HBSL продемонстрировала хорошее соответствие с нейрофизиологическими данными, что способствует дальнейшему анализу.
Практический вывод
Результаты исследования подтверждают, что использование иерархических моделей статистического обучения может быть полезным инструментом для понимания когнитивных процессов, связанных с обучением.
Ограничения
Это предварительная публикация, она не прошла научное рецензирование. Отсутствие значительных различий между группами ограничивает возможность общих выводов о влиянии дислексии на статистическое обучение. Также нуждаются в дальнейшем исследовании другие факторы, которые могут влиять на результаты.
Механизмы реакций состоят из пошаговых последовательностей элементарных реакций, которые объясняют химические преобразования. Поэтому изучение логики механизмов имеет решающее значение для повышения фундаментального химического интеллекта больших языковых моделей (БЯМ). Пошаговое выведение механизмов реакций естественно соответствует парадигмам рассуждений БЯМ. Однако текущие химические БЯМ в первую очередь акцентируют внимание на грубых наименованиях реакций для предсказания продуктов и ретросинтеза, что часто приводит к физическим несоответствиям и галлюцинациям. В отличие от этого, специализированные небольшие генеративные модели для вывода механизмов, как правило, страдают от ограниченной способности к обобщению в различных химических пространствах. Чтобы преодолеть эти ограничения, мы создали новый обширный набор данных для рассуждения о механизмах реакций. Более того, мы разработали FukuyamaBench — сложный эталон, основанный на книге Фукуямы «Современные механизмы органических реакций», для строгой оценки производительности моделей в иерархическом рассуждении о механизмах. Наша дообученная модель Qwen3-30B-A3B достигает 8,3% точного совпадения путей в наборе FukuyamaBench Set~A, превосходя специализированную модель FlowER (5,1%), что демонстрирует, что обучение с учетом механизмов значительно улучшает химическое рассуждение в языковых моделях.
Большие языковые модели (LLM) демонстрируют замечательные способности к рассуждению, однако их статическая архитектура в корне ограничивает применение в долгосрочных исследовательских процессах, требующих непрерывности между сессиями и количественной строгости. Здесь мы представляем Ensemble QSP, многоагентную структуру с трехуровневой иерархической архитектурой памяти, которая сохраняет внедренный контекст в рамках и постоянным на протяжении проекта (среднее состояние проекта: медиана 301 токен, максимум 4,050, по 104 запускам) за счет ограничения каждого состояния категории и удаления завершенной работы, что обеспечивает непрерывную автономную работу без ухудшения контекста. Система организует работу пяти специалистов-агентов под руководством экспертов в области, внедряя физические ограничения через контрольные списки на основе физических законов и структурированных знаний в области. Комплексное тестирование демонстрирует надежный автоматизированный выбор фармакокинетических и фармакодинамических моделей без человеческого вмешательства, постоянное качество результатов как для более дешевых, так и для передовых LLM, улучшенное восстановление параметров PK по сравнению с базовыми моделями с одним агентом и стабильный выбор моделей по лингвистически разнообразным подсказкам одной и той же задачи. Уровневое исключение возможностей на основе физиологической фармакокинетики (PBPK) на широком диапазоне сложности показывает, что контроль PI-агента улучшает эффективность отладки при сохранении конечной точности в различных условиях. Архитектура является структурно независимой от области, добавление новой научной области требует лишь новой конфигурации PI-агента.
Искусственный интеллект оказал глубокое влияние на биологические науки и, в частности, значительно ускорил исследования в области формы и функции белков. Ферменты не являются исключением: в последнее время было разработано множество предсказательных моделей для решения различных задач, связанных с ферментами. Модели, рассматривающие совместимость фермент-субстрат (ES) или фермент-реакция (ER), могут быть особенно полезными для аннотирования ферментов, расшифровки биосинтетических путей и извлечения биокаталитиков, главной задачей которых является идентификация истинного катализатора (или действительно совместимой реакции) среди множества схожих кандидатов. В то время как существующие модели демонстрируют высокую эффективность на альтернативных эталонах, менее известны их возможности в данном контексте. В этом исследовании мы оцениваем четыре недавно выпущенные модели предсказания ES и ER, используя задачи и наборы данных, адаптированные для данного условия. Сначала мы показываем, что две представительные модели предсказания ES показывают результаты, близкие к случайным исходным данным, по двум семействам ферментов, когда речь идет о ферментах и субстратах, не встреченных во время обучения. Для оценки дополнительных моделей по последовательному набору данных мы далее собираем самый крупный на сегодняшний день набор данных реакций цитохрома P450 (CYP) — 2922 реакции по 768 ферментам, и строим эталон ранжирования CYP, в котором правильно выбранный фермент должен быть приоритезирован среди всех CYP в своем естественном организме. Мы снова обнаруживаем, что большинство моделей не превосходят базовые показатели на основе последовательностей (BLAST), даже после тонкой настройки. Наконец, мы адаптируем модель предсказания биомолекулярной структуры Boltz для предсказания ES, обучая контролируемые классификаторы на векторных вложениях остатков-лигандов, и показываем, что этот подход последовательно превосходит базовые показатели BLAST на нашем эталоне ранжирования CYP. В совокупности наши результаты свидетельствуют о необходимости более актуального бенчмаркинга и предполагают, что учитывающие взаимодействия представления из полных биомолекулярных комплексов могут служить многообещающей основой для приоритизации ферментов.
Хроническая болезнь почек (ХБП) является глобальной проблемой здравоохранения, характеризующейся высокой распространенностью и смертностью, однако её патогенез остается недостаточно изученным. Цель данного исследования заключалась в изучении микробных биомаркеров, связанных с прогрессированием ХБП на различных стадиях, с применением секвенирования 16S рДНК, дополненного методами машинного обучения, включая регрессию Lasso, алгоритм Boruta и K-кратную перекрестную проверку, а также анализом микробной сети. Фекальные образцы были собраны от группы, состоящей из шести пациентов со стадией II ХБП, пяти со стадией III ХБП, семи со стадией IV ХБП и девяти здоровых контролей. После контроля качества секвенирования мы проанализировали микробный состав, богатство и разнообразие, выявив значительные различия между группами. Были идентифицированы десять дифференциальных микробных таксонов, при этом наибольшее относительное abundantest имели и. Методы машинного обучения выделили шесть микробных биомаркеров, включая и, все с показателями AUC более 0.7, что указывает на их потенциал в различении пациентов с ХБП и здоровых людей. Более того, анализ факторов воздействия выявил 26, 27 и 39 микробных взаимодействий между стадиями II, III, IV ХБП и контролями соответственно. В заключение, наш интегративный анализ проясняет специфические для стадии биомаркеры кишечной микробиоты и функциональные пути, которые участвуют в прогрессировании ХБП, тем самым поддерживая механистическую роль кишечно-почечного взаимодействия и подчеркивая потенциал для интервенций на основе микробиоты и ранних диагностических подходов при ХБП.
Глубокое обучение в области компьютерного зрения для научных приложений требует сбора и аннотирования больших наборов данных в трудоемком, дорогом и подверженном ошибкам процессе. Генерация синтетических данных с помощью 3D-моделирования и рендеринга может упростить этот процесс и повысить точность аннотаций, генерируя их программно. Однако минимизация разрыва между реальными и синтетическими изображениями визуально является субъективной и не имеет систематических количественных критериев. Мы представляем GraNatPy, пакет для Python с метриками, помогающими улучшить рендеринг сцены. Мы показываем, что количественное увеличение реалистичности, разнообразия и размера созданного набора данных коррелирует с улучшением визуального восприятия сцены и более высоким качеством нулевого отслеживания в модели обнаружения объектов. Более того, мы продемонстрировали на примере фотографий вирусологических анализов, что сходство градиентов влияет на эффективность обнаружения небольших объектов, что может быть улучшено смешиванием реальных и синтетических данных. Наконец, мы превращаем процедурный рендеринг данных в агентную технологию (SynthClaw) для автоматизации оптимизации процедурных параметров.
Многие биологические процессы управляются сложными динамическими механизмами, которые остаются недостаточно понятными, несмотря на растущий объем экспериментальных данных. Нейронные сети, учитывающие биологические аспекты (BINNs), стремятся решить эту проблему, внедряя механистические дифференциальные уравнения в обучение нейронной сети, что позволяет восстанавливать интерпретируемые конститутивные операторы непосредственно из разреженных и зашумленных наблюдений. Однако надежное восстановление операторов чувствительно к архитектуре сети, стратегии оптимизации и информативности данных. В настоящей работе мы представляем систематическое эмпирическое исследование того, как эти факторы влияют на механистическую интерпретацию с использованием BINNs, примененных к каноническим моделям одномерного адекватно-диффузионно-реакционного уравнения вpartial differential equations. В рамках набора контрольных задач мы исследуем, как выразительность сети, скорость обучения, вес потерь и размер пакета влияют на поведение оптимизации и восстановление операторов. Мы показываем, что успешная механистическая интерпретация зависит от баланса competing objectives, а не от максимизации какого-либо единственного аспекта модели или оптимизации. Умеренно выразительные архитектуры превосходят чрезмерно сложные нейронные сети, промежуточные скорости обучения улучшают стабильность оптимизации, сбалансированные данные и потери PDE являются необходимыми для точного восстановления операторов, а промежуточные размеры пакетов обеспечивают наилучший компромисс между вычислительной эффективностью и воспроизводимостью. Мы также определяем практические диагностические методы для распознавания распространенных способов отказа, включая переобучение, нестабильную оптимизацию и плохое механистическое восстановление, когда истинные данные недоступны. Все эти результаты предоставляют обоснованные рекомендации для применения BINNs в качестве надежных инструментов для открытия биологических моделей.