Составление рекуррентных соотношений в биоинформатике
Compiling Bioinformatics Recurrences
Карточка статьи
Рубрика
Биология
Источник
arXiv
Дата
07.07.2026
Автор
Science Morning
Время чтения
3 мин
Это предварительная публикация, она не прошла научное рецензирование.
Аннотация
Многие алгоритмы биоинформатики, такие как выравнивание последовательностей и прогнозирование структуры, могут быть выражены как рекуррентные уравнения в матрице динамического программирования. Эффективные реализации этих алгоритмов для больших биологических данных часто требуют изменения порядка, в котором рассчитываются ячейки матрицы, и полного исключения неэффективных областей матрицы из рассмотрения, однако эти техники обычно усложняют реализацию. Мы представляем FILTR, языковую платформу специфического назначения (DSL) и фреймворк компилятора для рекуррентных соотношений в биоинформатике. FILTR отделяет основные правила рекуррентности от методов обрезки и стратегий планирования, где обрезка используется как приближение для ограничения местоположения вычисления ячеек в матрице динамического программирования, а планирование определяет порядок итераций для того, как исследуются ячейки. FILTR компилирует эти высокоуровневые описания в оптимизированный C++ код, который сопоставим по производительности с реализациями, настроенными вручную, одновременно позволяя быстро исследовать новые эвристики. FILTR конкурирует с библиотеками для выравнивания последовательностей, оптимизированными вручную, показывая скорость от 0.95x до 30x быстрее по биологическим эталонам.
Краткое резюме
FILTR — это новый фреймворк для оптимизации биоинформатических алгоритмов, который упрощает реализацию рекуррентных соотношений, отделяя их от методов обрезки и планирования. Это позволяет быстрее адаптировать алгоритмы к большим объемам данных.
Практический вывод
Использование FILTR позволяет улучшить производительность алгоритмов биоинформатики без значительных затрат на ручную оптимизацию, что делает его полезным инструментом для исследователей в этой области.
Ограничения
Это предварительная публикация, она не прошла научное рецензирование. FILTR может быть ограничен в применимости к специфическим задачам, для которых могут потребоваться особые методы оптимизации, не предусмотренные стандартной реализацией. Также, как и в любом абстрактном фреймворке, могут возникнуть накладные расходы на уровень абстракции, которые могут снизить производительность в некоторых сценариях.
Всеоптическая двухфотонная голографическая оптогенетика позволяет проводить причинное картирование цепей, стимулируя определенные нейроны или ансамбли при одновременной визуализации активности популяций. Однако полное картирование связей остается экспериментально непрактичным из-за комбинаторной сложности, нагрева тканей, фотоповреждений и временных затрат на эксперименты. Мы представляем OPhELIA (Оптимальный Выбор Фотостимуляции для Итеративных Карт Активности), байесовскую структуру для выбора информативных возмущений при ограниченных бюджетах испытаний. OPhELIA сочетает в себе инференцию связанности Бета-Бернулли с эвристикой приобретения, основанной на неоднозначности, и усвоенными приоритетами, полученными из нейронной активности до стимуляции, что улучшает активное обучение и сжатое ощущение. В автономных симуляциях и in vivo экспериментах с визуомоторными действиями личинок данио, OPhELIA с активным обучением улучшает эффективность испытаний при приближении к полным функциональным коннектомам. В комбинаторных in vivo экспериментах OPhELIA с сжатым восприятием наиболее точно восстанавливает полный коннектом, используя только 5% испытаний. Эти результаты подтверждают OPhELIA как эффективную структуру для причинных коннектомов.
Филогенетические сети обобщают филогенетические деревья для эволюционных историй, которые включают ретикулярные события, такие как рекомбинация, горизонтальный перенос генов и гибридизация. В рамках марковской модели замещения нуклеотидов филогенетическая сеть определяет распределение паттернов листьев. В данной работе мы исследуем идентифицируемость топологии сети из этого распределения в рамках моделей Джукса-Кантера (JC), Кимуры с двумя параметрами (K2P) и Кимуры с тремя параметрами (K3P). Нашим первым результатом является то, что полуправильный параметр сети уровня 1 (с учётом перенаправления треугольников) полностью идентифицируем по всем трем моделям на биологически разумном пространстве параметров, где скорости замещения являются вероятностными, а параметры смешивания нетривиальны (т.е. не равны 0 или 1). В отличие от общепринятой идентифицируемости, установленной в предыдущих работах, это действительно для каждой точки параметрического пространства, а не только для подмножества нулевой меры. Наш второй результат отличает филогенетические сети от филогенетических деревьев в том же пространстве параметров при JC и K2P. Мы доказываем, что ни одна филогенетическая сеть и филогенетическое дерево не могут порождать одно и то же распределение паттернов листьев, если только сеть не является деревом, возможно, дополненным определёнными подструктурами, называемыми $2$-болбами. Это означает, что наличие ретикулярной эволюции создает, в большинстве случаев, обнаружимый след в распределении паттернов листьев. Более широко, эти результаты имеют последствия для идентифицируемости за пределами изученных моделей и классов сетей, включая несколько моделей на основе коалесценции.
Обнаружение падений имеет важное значение для ухода за пожилыми людьми и интеллектуального наблюдения; однако существующие подходы на основе компьютерного зрения в основном рассматривают его как классификацию статической позы или сопоставление дискретных временных шаблонов, в корне упуская нестабильную динамику человеческой опорной системы. В данной статье предлагается основанная на физике структура для обнаружения падений, которая трактует падение как событие утраты устойчивости в связанной динамической системе. Мы вводим новую архитектуру двойной LTC, состоящую из подсистемы центра масс (CoM) и подсистемы базы поддержки (BoS), обе реализованы как нейронные сети с жидкими временными константами (LTC), которые непрерывно моделируют эволюцию инерциальной траектории и адаптацию к контакту с землёй с помощью адаптивных временных констант. Физическая интерпретируемость движения при падении. Обучаемый модуль связывания имитирует физическое взаимодействие между двумя подсистемами, в то время как классификатор стабильности Manifold работает в объединённом латентном пространстве для обнаружения пересечения границы через метрики стабильности, вдохновлённые методом Ляпунова. Дополнительное проецирование контрфактической траектории и оценка времени до столкновения (TTC) дальше позволяют оценить необратимость и осуществить раннее предупреждение. Архитектура разработана для поддержки парадигмы предсказания с тремя состояниями (Нормально, Падает, Упал); в этом предварительном исследовании мы проверяем основную способность различения стабильности на датасете из двух классов (Нормально против Падает), оставляя полную трехстадийную временную трансформацию для будущей работы. В отличие от традиционных конвейеров CNN-RNN, предлагаемая формулировка кодирует механическую инерцию непрерывного времени, что позволяет создать сеть с менее чем 50 тыс. параметров, способную выполнять вывод в реальном времени на устройствах с ограниченными ресурсами. Обширные эксперименты демонстрируют конкурентоспособную точность с превосходной физической интерпретируемостью, подтверждая её эффективность для визуального обнаружения падений при низких вычислительных затратах.
Глубокое обучение в области компьютерного зрения для научных приложений требует сбора и аннотирования больших наборов данных в трудоемком, дорогом и подверженном ошибкам процессе. Генерация синтетических данных с помощью 3D-моделирования и рендеринга может упростить этот процесс и повысить точность аннотаций, генерируя их программно. Однако минимизация разрыва между реальными и синтетическими изображениями визуально является субъективной и не имеет систематических количественных критериев. Мы представляем GraNatPy, пакет для Python с метриками, помогающими улучшить рендеринг сцены. Мы показываем, что количественное увеличение реалистичности, разнообразия и размера созданного набора данных коррелирует с улучшением визуального восприятия сцены и более высоким качеством нулевого отслеживания в модели обнаружения объектов. Более того, мы продемонстрировали на примере фотографий вирусологических анализов, что сходство градиентов влияет на эффективность обнаружения небольших объектов, что может быть улучшено смешиванием реальных и синтетических данных. Наконец, мы превращаем процедурный рендеринг данных в агентную технологию (SynthClaw) для автоматизации оптимизации процедурных параметров.
Круговые данные, представляющие собой углы или направления, часто встречаются в таком областях, как компьютерное зрение, биология, геология и метеорология. Традиционная регрессия ориентируется на условное среднее, что часто оказывается геометрически вводящим в заблуждение для круговых откликов при многомодальных, скошенных или асимметричных структурах данных. Для решения этих ограничений предлагается легковесная глубокая генеративная структура, именуемая ANGLE, для непараметрической распределительной регрессии на круге. Полное условное распределение углового отклика, с учетом евклидовых и круговых ковариант, изучается через генеративную карту, оптимизированную с помощью обобщенной круговой энергетической оценки (GCES) потерь. Установлены желаемые теоретические свойства, включая строгую законность потерь и вращательную эквивариантность оценок. Кроме того, учитываются модели аддитивного шума как до, так и после. Предоставлен унифицированный инструмент для решения ранее недостаточно исследованных задач в круговой статистике: экстраполяция, достаточное уменьшение размерности и тестирование равенства условных распределений. Эффективность структуры продемонстрирована через обширные симуляции и реальные приложения. В частности, предложение используется для оценки поз объектов на изображениях и предсказания направления ветра, что имеет важное значение для систем наблюдения, автономных транспортных средств и энергетических систем соответственно. Были выявлены превосходные предсказательные характеристики и надежная оценка неопределенности предлагаемого метода в этих задачах.
Механизмы реакций состоят из пошаговых последовательностей элементарных реакций, которые объясняют химические преобразования. Поэтому изучение логики механизмов имеет решающее значение для повышения фундаментального химического интеллекта больших языковых моделей (БЯМ). Пошаговое выведение механизмов реакций естественно соответствует парадигмам рассуждений БЯМ. Однако текущие химические БЯМ в первую очередь акцентируют внимание на грубых наименованиях реакций для предсказания продуктов и ретросинтеза, что часто приводит к физическим несоответствиям и галлюцинациям. В отличие от этого, специализированные небольшие генеративные модели для вывода механизмов, как правило, страдают от ограниченной способности к обобщению в различных химических пространствах. Чтобы преодолеть эти ограничения, мы создали новый обширный набор данных для рассуждения о механизмах реакций. Более того, мы разработали FukuyamaBench — сложный эталон, основанный на книге Фукуямы «Современные механизмы органических реакций», для строгой оценки производительности моделей в иерархическом рассуждении о механизмах. Наша дообученная модель Qwen3-30B-A3B достигает 8,3% точного совпадения путей в наборе FukuyamaBench Set~A, превосходя специализированную модель FlowER (5,1%), что демонстрирует, что обучение с учетом механизмов значительно улучшает химическое рассуждение в языковых моделях.