Генетический алгоритм для формирования составов рецензионных панелей
A genetic algorithm for peer-review panel composition
Карточка статьи
Рубрика
Биология
Источник
arXiv
Дата
14.07.2026
Автор
Science Morning
Время чтения
3 мин
Это предварительная публикация, она не прошла научное рецензирование.
Аннотация
Состав научных рецензионных панелей является задачей ограниченной оптимизации, в которой конечный пул экспертов должен быть распределен по нескольким панелям с учетом научной экспертизы и демографического разнообразия. Поскольку количество возможных конфигураций панелей растет очень быстро с увеличением числа рецензентов, исчерпывающие поиски быстро становятся вычислительно нецелесообразными. В этой работе я представляю генетический алгоритм, разработанный для оптимизации состава панелей в процессе оценки предложений Европейской южной обсерватории (ESO). Назначения панелей представлены через кодирование на основе хромосом. Кандидатные решения оцениваются с использованием функции приспособленности, основанной на четырех индикаторах дисбаланса: научной экспертизе, гендере, принадлежности к стране и профессиональной старшинстве. Метод тестируется с использованием реальных данных рецензентов из системы обработки предложений ESO. Результаты показывают, что генетический алгоритм быстро определяет конфигурации панелей с существенно меньшим дисбалансом, чем те, которые получены из случайных назначений, и постепенно улучшает качество общей популяции. Кроме того, вместо того, чтобы создавать одну оптимизированную конфигурацию, подход генерирует набор высококачественных реализаций панелей, которые могут быть впоследствии отфильтрованы в соответствии с дополнительными операционными ограничениями, не включенными явно в функцию приспособленности. Хотя методология была разработана для ESO, она является общей и применима к широкому спектру систем рецензирования на основе панелей.
Краткое резюме
Исследование предлагает генетический алгоритм для оптимизации составов научных рецензионных панелей в Европейской южной обсерватории. Алгоритм использует кодирование на основе хромосом и учитывает дисбалансы по ряду критериев, включая научную экспертизу и демографическое разнообразие.
Практический вывод
Разработанный алгоритм позволяет значительно улучшить баланс в составлении рецензионных панелей, что может повысить качество научных оценок и предложений.
Ограничения
Это предварительная публикация, она не прошла научное рецензирование. Изученный метод требует наличия достаточного объема данных о рецензентах и может не учитывать все специфические операционные ограничения, которые могут возникнуть в различных системах рецензирования.
Современные подходы машинного обучения (МО) в области открытия новых материалов сильно зависят от известных структурных баз данных, что ограничивает их способность выявлять совершенно новые типы структур. В данной работе мы разработали многоминимальный итеративный генетический алгоритм (MMIGA), который интегрирует межатомный потенциал, основанный на искусственной нейронной сети (ANN-ML), с итеративной схемой наказаний, вдохновленной метадинамикой. Мы демонстрируем надежность этого метода на сложной тернарной системе La-Co-Pb, характеризующейся несовместимостью Co-Pb и сложным энергетическим ландшафтом. Алгоритм MMIGA, улучшенный с помощью МО, успешно предсказывает основнойPbam структуру недавно синтезированной антагонистической пары фаз La4Co4Pb, новую структуру, упущенную в предыдущих предсказаниях, зависящих от баз данных МО, одновременно выявляя несколько метастабильных конкурирующих фаз. Кроме того, мы поставили задачу предсказать структуру антагонистической пары фаз La5CoPb2, нового соединения, найденного в ходе предыдущих попыток синтезировать предсказанную фазу La3CoPb. Имея всего лишь информацию о составе, наш подход MMIGA успешно предсказывает орторомбическую структуру La5CoPb2, точно совпадая со структурой, независимо определенной с помощью рентгеновской дифракции. Эффективно сопоставляя как глобальный минимум, так и соответствующие конкурирующие метастабильные состояния, этот подход предоставляет критически важные теоретические понимания выбора фаз для новых квантовых и магнитных материалов.
Мы исследуем, могут ли жизнеспособные модели $f(R)$, подобные Hu-Sawicki, приводить к отклонениям от $Λ\mathrm{CDM}$, которые можно проверить с помощью текущих космологических данных. Мы применяем подход машинного обучения, основанный на генетических алгоритмах (ГА), для восстановления аналитических возмущений вокруг класса моделей Hu-Sawicki. Мы разрабатываем пайплайн, который связывает код ГА с космологическим кодом. Каждая функция $f(R)$, сгенерированная ГА, сначала проверяется на теоретические условия жизнеспособности, включая стабильность, восстановление стандартной эпохи, доминируемой веществом, предел общей теории относительности и механизм экранования шемеллона. Жизнеспособные кандидаты передаются в космологический код для восстановления соответствующей фоновой космологии и тестируются на соответствие измерениям BAO из DESI DR2 и каталогу сверхновых типа Ia Pantheon+. Отклонения, которые мы находим, наиболее заметны в поздние времена, когда пониженная кривизна делает эффекты изменённой гравитации более значительными, и быстро подавляются при более высоких красных смещениях, что соответствует наложенному соответствию с эпохой доминирования вещества. Чтобы дополнительно количественно оценить отклонения от стандартной космологической модели, мы вычисляем диагностический параметр $Om(z)$. Он показывает лишь очень небольшое отклонение от постоянного поведения $Λ\mathrm{CDM}$. Эффективное уравнение состояния темной энергии, связанное с восстановленной функцией $f(R)$, также слабо эволюционирует, демонстрируя мягкий переход от эффективной природы квинтэссенции к эффективному режиму фантома. В целом, наши результаты указывают на то, что в рамках возмущений вокруг класса моделей Hu-Sawicki текущие фоновые данные допускают лишь ограниченные отклонения от $Λ\mathrm{CDM}$.
Филоразнообразие (PD) является фундаментальной мерой биологического разнообразия, изначально определенной для филогенетических деревьев и широко используемой в охране природы. Филогенетические деревья часто обобщаются на направленные ациклические графы, называемые филогенетическими сетями. В связи с этим требуется соответствующее обобщение PD. Естественным обобщением для взвешенных по рёдам филогенетических сетей является мера всех путей, где разнообразие множества S видов (таксонов) определяется как общая масса всех рёбер, которые лежат на пути от корня к хотя бы одному виду из S. Хотя максимизация PD на деревьях может быть решена за полиномиальное время, соответствующая задача для сетей является NP-трудной и трудной для аппроксимации. Мы проводим систематическое исследование параметризованной сложности проблемы Max-All-Paths-PD (MapPD). Мы устанавливаем W[2]-трудность, когда задача параметризована количеством видов, включённых в решение, и W[1]-трудность для количества видов, исключённых из решения. С положительной стороны, мы показываем, что проблема является фиксированно-параметрически разрешимой в зависимости от порога разнообразия и допустимой потери разнообразия. Мы дополнительно анализируем, как близость сети к дереву влияет на алгоритмическое поведение, и представляем алгоритмы с фиксированным параметром с одноэкспоненциальной сложностью, учитывающие количество ретруксаций и ширину дерева основного графа. Наконец, мы представляем полиномиальную ядровизацию для MapPD относительно количества рёбер ретруксации.
Цель исследования заключалась в оценке реальной реализации генетического скрининга новорожденных (ГСН) в отношении уровня позитивности, частоты носительства и диагностической точности при наследственных метаболических расстройствах (НМР), а также в изучении осуществимости и проблем в региональном клиническом применении. В исследование было включено 1590 новорожденных (август 2023 — ноябрь 2024), родители которых выбрали ГСН. Применялась целевая панель секвенирования, охватывающая 465 генов, относящихся к 596 заболеваниям, вместе с традиционным биохимическим скринингом на 46 нарушений. Варианты были классифицированы согласно рекомендациям ACMG. Позитивные случаи были повторно вызваны для подтверждающего секвенирования методом Сангера и дополнительных биохимических тестов. Мы рассчитали уровень принятия, частоту носительства, идентифицировали горячие варианты и сравнили частоты аллелей с данными gnomAD_EAS. Диагностическую эффективность сравнили с биохимическим скринингом. Уровень принятия составил 10,41% (1590/15,272). Общая позитивность составила 7,74% (123/1590). Из них 10 оказались положительными на гены, связанные с НМР, 8 из которых были подтверждены, что дало положительное прогностическое значение (PPV) 80,00% для НМР, что значительно выше, чем 5,71% у биохимического скрининга. Мы обнаружили 2354 варианта с частотой носительства 70,94%. Горячие варианты НМР включали c.609G>A, c.658_660del и c.1286A>G, частоты малых аллелей которых отличались от gnomAD, что указывает на региональную специфику. Высокие показатели носительства также наблюдались у генов лизосомного хранения (c.1901T>C, 53,57%; c.2041G>A, 32,14%). ГСН показывает высокое PPV и специфичность, сокращая количество ложноположительных результатов и предоставляя ранние молекулярные данные о НМР. Отличия горячих и малых аллельных частот подчеркивают необходимость создания местной генетической базы данных. Несмотря на растущее принятие ГСН, такие факторы, как стоимость и различные уровни осведомленности среди медицинских работников, остаются барьерами для его более широкого внедрения. Это исследование предоставляет предварительные данные в поддержку реализации региональных программ генетического скрининга новорожденных и информирует стратегии вторичной и третичной профилактики.
Многие алгоритмы биоинформатики, такие как выравнивание последовательностей и прогнозирование структуры, могут быть выражены как рекуррентные уравнения в матрице динамического программирования. Эффективные реализации этих алгоритмов для больших биологических данных часто требуют изменения порядка, в котором рассчитываются ячейки матрицы, и полного исключения неэффективных областей матрицы из рассмотрения, однако эти техники обычно усложняют реализацию. Мы представляем FILTR, языковую платформу специфического назначения (DSL) и фреймворк компилятора для рекуррентных соотношений в биоинформатике. FILTR отделяет основные правила рекуррентности от методов обрезки и стратегий планирования, где обрезка используется как приближение для ограничения местоположения вычисления ячеек в матрице динамического программирования, а планирование определяет порядок итераций для того, как исследуются ячейки. FILTR компилирует эти высокоуровневые описания в оптимизированный C++ код, который сопоставим по производительности с реализациями, настроенными вручную, одновременно позволяя быстро исследовать новые эвристики. FILTR конкурирует с библиотеками для выравнивания последовательностей, оптимизированными вручную, показывая скорость от 0.95x до 30x быстрее по биологическим эталонам.
Происхождение импульсного излучения гамма-всплесков (ГВ, GRB) остается открытым вопросом. Модель внутренних ударов (МВУ) является одним из ведущих сценариев преобразования кинетической энергии релятивистских выбросов в гамма-лучи, однако её параметры еще не были полностью откалиброваны на основе наблюдаемых кривых света ГВ для воспроизведения их разнообразия. Мы принимаем машинное обучение как основу для оптимизации модели МВУ, сравнивая свойства симулированных и наблюдаемых кривых света из трех каталогов ГВ (Swift/BAT, Fermi/GBM, CGRO/BATSE). Предполагая зависимость скорости формирования ГВ от красного смещения, мы используем генетический алгоритм для минимизации функции потерь, основанной на шести независимых метриках, которые учитывают как средние значения, так и статистические распределения. Оптимизированная модель воспроизводит несколько ключевых наблюдательных свойств, включая средний временной профиль после пика, функцию автокорреляции и распределения длительности, отношения сигнал/шум, числа пиков, пикового потока и потока энергии. Мы также выводим ограничения на активность центрального двигателя: (i) количество выбрасываемых оболочек хорошо описывается обобщенным распределением Ципфа, аналогичным закону Гутенберга-Рихтера для землетрясений, и (ii) времена эмиссии оболочек в системе покоя следуют отрицательному экспоненциальному распределению, указывая на стохастический процесс с постоянной вероятностью выброса. Эта откалиброванная модель МВУ предоставляет физически обоснованную основу для интерпретации изменчивости ГВ и прогнозирования популяций ГВ, detectable в будущих миссиях.