Искусственный интеллектbioRxivHohmann, N., Warnock, R. C. M., Jarochowska, E.3 мин чтенияpreprint

Филогенетическая интерпретация на основе неполного ископаемого материала

Phylogenetic inference from an incomplete fossil record

Рубрика
Искусственный интеллект
Источник
bioRxiv
DOI
10.64898/2026.06.24.734220
Дата
28.06.2026
Автор
Hohmann, N., Warnock, R. C. M., Jarochowska, E.
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Искусственный интеллект

Аннотация

Ископаемые данные имеют важное значение для построения филогенетических временных деревьев, которые служат основой для проверки широкого спектра эволюционных гипотез. Хотя известно, что ископаемая летопись неполна, современные стратиграфия предоставляет прогнозы о структуре ископаемой летописи, выраженные в виде местоположения и продолжительности пробелов. Достижения в разработке филогенетических моделей позволяют нам распространять эту информацию в байесовскую филогенетическую интерпретацию в виде приоритетов на фоссильном отборе с временными изменениями. Однако влияние и роль стратиграфических архитектур на интерпретацию временных деревьев до сих пор оставались не изученными. Мы представляем новую симуляционную рамку, которая комбинирует реалистичные стратиграфические модели с филогенетическими симуляциями. С помощью этой рамки мы изучаем (1) как стратиграфически правдоподобные нарушения моделей отбора ископаемых из-за пробелов влияют на интерпретацию с полными доказательствами в рамках модели фоссилизированного рождения-смерти и (2) улучшает ли стратиграфическое знание о продолжительности и времени пробелов интерпретацию, когда оно включено в приоритеты на отбор ископаемых. Мы обнаружили, что анализ с полными доказательствами устойчив к стратиграфически правдоподобному распределению пробелов в различных стратиграфических архитектурах, при этом результаты в большей степени определяются количеством морфологических признаков. Удивительно, но включение информации о значительных пробелах в стратиграфической летописи не улучшает филогенетическую интерпретацию. Наши результаты предполагают, что филогенетическая интерпретация устойчива к нарушениям моделей, вызванным стратиграфическими пробелами на коротких временных интервалах, при этом результаты определяются заранее известными ограничениями доступности данных, такими как размер матрицы морфологических признаков. Это исследование закладывает основы для совместного моделирования филогенетических и стратиграфических процессов и сокращает пробелы в знаниях между палеонтологией, стратиграфией и неонтологией.

Краткое резюме

Исследование рассматривает влияние неполноты ископаемого материала на филогенетические интерпретации, выявляя, что аналоги с полными доказательствами устойчивы к нарушениям, вызванным пробелами в стратиграфических данных.

Практический вывод

Филогенетическая интерпретация остается эффективной, несмотря на наличие стратиграфических пробелов, что открывает новые возможности для совместного изучения палеонтологических и стратиграфических процессов.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. Исследование сфокусировано на коротких временных масштабах и может не учитывать более долгосрочные эффекты стратиграфических нарушений; необходимо дальнейшее изучение взаимодействия между различными стратиграфическими архитектурами и морфологическими данными.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Искусственный интеллект
Искусственный интеллект
87%

Обнаружение болезни Альцгеймера на основе магнитно-резонансной томографии с использованием структуры EfficientNet-CMSACCN.

Болезнь Альцгеймера (БА) — это дегенеративное неврологическое заболевание, характеризующееся потерей памяти, ухудшением когнитивных функций и уменьшением объема мозговой ткани. Обнаружить его на ранней стадии сложно из-за вариаций в прогрессировании заболевания и ограниченных возможностей методов нейровизуализации с единственной модальностью. Диагностика болезни Альцгеймера на основе магнитно-резонансной томографии (МРТ) предоставляет дополнительные структурные и функциональные данные, однако существующие методы глубокого обучения часто сталкиваются с проблемами несбалансированности данных, высокой вычислительной сложности и ограниченной обобщаемостью. Для устранения этих пробелов разработана структура извлечения признаков из МРТ на основе EfficientNet для классификации стадий болезни Альцгеймера. EfficientNet, оснащенный комбинированным масштабированием, слоями с разделением по глубине и компонентами сжатием и возбуждением, позволяет точно охарактеризовать корковые структуры и вариации во всем мозге, сохраняя при этом вычислительную эффективность. Извлеченные признаки классифицируются с помощью сети свёрточной многомасштабной внимательной сети на основе сжатия (C-MSACCN), которая объединяет механизмы внимания и стратегии сжатия для повышения точности и снижения сложности модели. Более того, улучшенный оптимизатор соседей клеток (ICNO) тонко настраивает гиперпараметры, находя баланс между исследованием и эксплуатацией для оптимального сходимости и устойчивости. С точностью 99,9%, точностью, полнотой и F1-мерой на наборах данных модель превосходит предыдущие работы. Валидация подтверждает согласованность, а методы визуализации выделяют области, связанные с заболеванием, для предоставления клинической информации.

Искусственный интеллект
Искусственный интеллект
87%

Имитационное обучение с критикой языка на основе субоптимальных демонстраций

Предыдущие работы по имитационному обучению на основе субоптимальных демонстраций обычно полагаются на сжатые сигналы супервизии, такие как оценки уверенности, баллы дискриминатора или веса важности. Эти скалярные сигналы имеют свои ограничения, так как не могут явно выразить промежуточные размышления о ходе выполнения задачи, режимах неудачи или корректирующих действиях. Мы предлагаем рамки имитационного обучения с критическим анализом языка, которое вместо этого использует естественный язык в качестве структурированного сигнала супервизии, избегая сворачивания выразительной обратной связи в скаляры. Наш метод сначала создает языковые метки на основе демонстраций, которые явно описывают текущий прогресс, идентифицируют субоптимальное поведение и предоставляют детализированные корректирующие рекомендации. Затем мы вводим функцию потерь критики языка, которая непосредственно обучает политики, используя эти структурированные сигналы, не сводя их к скалярам, и инстанцируем ее для как имитационного клонирования поведения, так и диффузионных политик, получая LC-BC и LC-DP. Мы также предоставляем теоретический результат, показывающий, что предложенная цель обеспечивает верхнюю границу разрыва производительности эксперта при стандартных предположениях. Эмпирически мы проводим оценку на различных задачах непрерывного управления, охватывающих навигацию, манипуляцию и игровую деятельность, где наши методы последовательно превосходят сильные базы имитационного обучения и оффлайн обучения с подкреплением. Эти результаты демонстрируют, что язык может служить мощной и структурированной формой супервизии для обучения устойчивым политикам на основе субоптимальных данных.

Искусственный интеллект
Искусственный интеллект
87%

Графы знаний на основе мета-анализов улучшают качество формирования случаев: смешанный метод исследования.

Формирование случаев (ФС) является ключевым навыком для терапевтов; однако создание качественных ФС требует значительного времени. Данное исследование направлено на демонстрацию того, что использование графа знаний на основе мета-аналитической литературы может повысить качество ФС. Были сформированы пять групп, включая 4 группы больших языковых моделей и 1 группу профессионалов, каждая из которых создала 25 ФС на основе 25 ситуаций. Контрольная группа с Claude (Sonnet 3.7; Anthropic) создала 25 ФС. Группа персонализации служила контрольной группой с дополнительными подсказками о персонализации. Группа графа знаний использовала большую языковую модель, которая сгенерировала 25 ФС, предоставленную с графом знаний по мета-анализу. Далее дополнительная персонализация составила группу графа знаний с персонализацией. Наконец, экспертная группа состояла из 25 ФС, созданных человеком-экспертом. Эти 125 ФС в общей сложности были оценены на общую качество (т.е. правильность, полнота, осуществимость и согласованность) с использованием 7-балльной шкалы и 18 основных элементов с бинарными оценками (0 или 1) другим экспертом. ФС также были качественно проанализированы. Группы графа знаний и графа знаний с персонализацией набрали значительно более высокие баллы, чем контрольная группа по таким показателям, как правильность, полнота и осуществимость. Экспертная группа значительно лучше набрала баллы за согласованность, чем группы сгенерированные машинами. Кроме того, не было значительных различий в оценках осуществимости среди групп графов знаний, графов знаний с персонализацией и экспертной группы. Качественная оценка показала, что ФС, созданные человеком, сужают текст до содержания, легко воспринимаемого клиентом, в то время как ФС, созданные машинами, более склонны включать выражения, которые неестественны для клиента. Эти результаты указывают на то, что предоставление графов знаний начинающим терапевтам увеличивает правильность, полноту и осуществимость ФС. Предоставление опытным терапевтам графов знаний также рекомендуется для улучшения качества их ФС и услуг в области психического здоровья.

Искусственный интеллект
Искусственный интеллект
87%

Infoxmed2.0-27B: Настройка инструкций, выравнивание предпочтений и обучение модели вознаграждения на основе GRPO для медицинских LLM

Аннотация. Большие языковые модели (LLM) продемонстрировали замечательные способности в общих областях, однако их применение в специализированных медицинских контекстах требует строгой адаптации к предметной области. Мы представляем Infoxmed2.0-27B, медицинскую базовую модель, построенную на основе Qwen3.5-27B через комплексный многосложный пост-тренировочный процесс: (1) синтез проприетарных медицинских данных из базы данных MySQL с организацией MedicalCategoryTree, валидация командой докторов наук в области медицины, семантическая дедупликация на основе Chinese RoBERTa и языковая доработка с помощью API; (2) тонкая настройка Qwen3.5-27B с использованием LoRA (r = 8, d = 32) через MS-Swift, что привело к итерациям Infoxmed2.0.0 → 2.0.2 → 2.0.4; (3) прямая оптимизация предпочтений на 6,283 курируемых медицинских предпочтениях с использованием потерь DPO-RPO (β = 0.3, RPO = 0.1) на протяжении восьми прогрессивных тренировочных итераций (v0-v7); и (4) параллельное обучение медицинской модели награды на основе групповой относительной оптимизации политики (GRPO) на Qwen3.5, комбинируя внутренние наградные функции на основе правил с внешними сигналами DeepSeek. Всесторонние оценки в рамках единой системы LLM-as-Judge с использованием GPT-5.4 продемонстрировали точность 77.0% (средний качественный балл +7.18) на MedMCQA и +2.59 на HLE, с прогрессией от +6.69 (база) к +7.06 (тонкая настройка) и к +7.18 (финал).

Искусственный интеллект
Искусственный интеллект
85%

Мультимасштабное временное обучение на основе Wi-Fi CSI для совместного распознавания активности и indoor локализации.

Бесконтактное сенсирование на основе информации о состоянии канала Wi-Fi (CSI) продемонстрировало значительный потенциал в распознавании человеческой активности и локализации в помещениях. Однако совместное решение этих двух задач остается сложной задачей, поскольку сырые сигналы CSI, как правило, страдают от высокой размерности каналов, не относящихся к задаче, и временно запутанных многомасштабных флуктуаций. В этой работе предлагается структура двойного обучения, которая акцентирует внимание на конструировании подпространства, согласованного с задачами, и структурированном временном разложении. В частности, разработан модуль многоцелевого переранжированного подпространства главных компонент (MARS-PCA), который переоценивает главные компоненты в соответствии с их дискриминативной значимостью как для распознавания активности, так и для локализации, тем самым сохраняя компактное представление CSI, более соответствующее двойной задаче. Вдобавок, представлен многоуровневый фронтенд с вейвлет-разложением для разделения временных откликов CSI на подполосные компоненты, позволяя более явно представлять динамику, связанную с временной активностью, и относительно стабильные паттерны, связанные с местоположением. Затем уточненные и разложенные характеристики моделируются с помощью легковесного модуля временного предсказания с регуляцией задач по каналам. Эксперименты на публичном наборе данных WiFi CSI показывают, что предложенный метод демонстрирует хорошие результаты как в распознавании активности, так и в indoor локализации.

Искусственный интеллект
Искусственный интеллект
85%

Переосмысленный самообучение: скрытая хрупкость обучения на основе самосгенерированных QA

Языковые модели все чаще обучаются с использованием синтетической супервизии вопросов и ответов (QA): модель генерирует вопросы о документе, отвечает на них, используя тот же текст, и полученные пары используются для дообучения, дистилляции или сжатия знаний в другую модель. Мы показываем, что этот этап генерации не является нейтральной предобработкой. Это неявная политика, которая как выбирает, какие доказательства становятся обучающим сигналом, так и решает, как это доказательство будет отвечено, и она хрупка на обоих этапах. При выборе, что спросить, генераторы не обходят документ равномерно. Покрытие быстро достигает насыщения и концентрируется на заметных отрезках, разнообразные подсказки сливаются в одни и те же области, а то, что выглядит достойным вопроса, определяется локальным представлением. В результате заметные артефакты, такие как плохо очищенные разметки, могут захватить генерацию вопросов среди семейств и масштабов моделей. При ответах модель, генерирующая супервизию, склонна подчиняться инструкциям, внедренным в текст. Эта приверженность зависит от намерения и поверхностной формы отрывка, а не от его строгости, и ухудшается при конфликте задач, где более крупные модели подчиняются чаще. Эти режимы сбоев возникают из-за выборов, сделанных во время генерации QA, поэтому их можно сократить, не меняя цикл обучения. Привязка каждого вопроса к фиксированной цели уменьшает предвзятую селекцию, а фильтрация отрывков, похожих на инструкции, перед ответом снижает среднюю степень соблюдения инъекций с $88\%$ до $13\%$ в нашей оценке, сохраняя при этом почти весь чистый текст.