БиологияarXivScience Morning3 мин чтенияpreprint

DisciplineGen-1M: Массированный набор данных для многодисциплинарного визуального генерирования и редактирования

DisciplineGen-1M: A Large-Scale Dataset for Multidisciplinary Visual Generation and Editing

Рубрика
Биология
Источник
arXiv
Дата
02.07.2026
Автор
Science Morning
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Биология

Аннотация

Недавние модели генерации и редактирования изображений могут создавать визуально привлекательные натуральные изображения, однако они остаются ненадежными, когда целевое изображение представляет собой знания-интенсивную диаграмму, корректность которой зависит от дисциплинарных концепций, символической структуры и точных пространственных отношений. Мы представляем DisciplineGen-1M, набор данных многодисциплинарного масштаба с миллионом образцов, который поддерживает генерацию изображений из текста и редактирование изображений. Он содержит 1,2 миллиона образцов из математики, физики, химии, биологии, географии, информатики, экономики, истории, музыки и спорта. Для создания набора данных мы разрабатываем масштабируемую структуру, которая объединяет рендеринг векторной графики, редактирование на основе OCR, программный синтез и крупномасштабную фильтрацию текстов в изображения. Эти рабочие процессы обеспечивают создание аннотаций, инструкций по редактированию, структурированных аннотаций и пар изображений с контролируемыми семантическими различиями. Основываясь на DisciplineGen-1M, мы дополнительно представляем модель генерации рассуждений, учитывающую дисциплину, для генерации изображений из текста и редактирования изображений. Эксперименты на связанных с дисциплиной моделях, GenExam и GRADE, показывают значительные улучшения по сравнению с открытыми эталонами, в то время как оценки на общих моделях, информированных рассуждениями, WISE и RISE, дополнительно указывают на более широкий перенос. Результаты свидетельствуют о том, что структурированные академические визуальные данные большого объема являются ключевым компонентом для перехода генерации изображений от эстетической правдоподобности к верифицируемому созданию визуального контента на основе знаний. Мы публично выпустим наш набор данных, модель и исходный код процесса кураторства данных, чтобы обеспечить воспроизводимость и содействовать будущим исследованиям.

Краткое резюме

DisciplineGen-1M — это новый крупномасштабный набор данных для генерации и редактирования изображений с учетом дисциплинарных концепций, включающий более миллиона образцов из различных научных областей.

Практический вывод

Данный набор данных и разработанная модель представляют собой важный шаг к улучшению генерации изображений, основанных на знаниях, что поможет в применениях от образования до научных исследований.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. Хотя набор данных DisciplineGen-1M охватывает множество дисциплин, он не включает все возможные области знаний, что может ограничить его универсальность. Кроме того, как и любая система на основе данных, она может сталкиваться с предвзятостью в данных и их интерпретации.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Биология
Биология
92%

Изучение механистического рассуждения для химических реакций с помощью больших языковых моделей

Механизмы реакций состоят из пошаговых последовательностей элементарных реакций, которые объясняют химические преобразования. Поэтому изучение логики механизмов имеет решающее значение для повышения фундаментального химического интеллекта больших языковых моделей (БЯМ). Пошаговое выведение механизмов реакций естественно соответствует парадигмам рассуждений БЯМ. Однако текущие химические БЯМ в первую очередь акцентируют внимание на грубых наименованиях реакций для предсказания продуктов и ретросинтеза, что часто приводит к физическим несоответствиям и галлюцинациям. В отличие от этого, специализированные небольшие генеративные модели для вывода механизмов, как правило, страдают от ограниченной способности к обобщению в различных химических пространствах. Чтобы преодолеть эти ограничения, мы создали новый обширный набор данных для рассуждения о механизмах реакций. Более того, мы разработали FukuyamaBench — сложный эталон, основанный на книге Фукуямы «Современные механизмы органических реакций», для строгой оценки производительности моделей в иерархическом рассуждении о механизмах. Наша дообученная модель Qwen3-30B-A3B достигает 8,3% точного совпадения путей в наборе FukuyamaBench Set~A, превосходя специализированную модель FlowER (5,1%), что демонстрирует, что обучение с учетом механизмов значительно улучшает химическое рассуждение в языковых моделях.

Биология
Биология
92%

Изучение энергетических ландшафтов динамических систем с помощью энергетического вариационного оптимального транспорта в условиях компромисса между количеством и качеством данных

Динамический оптимальный транспорт объединяет оптимальный транспорт, механику жидкостей и теорию градиентного течения в рамках непрерывной динамики, предлагая язык, учитывающий геометрию, для применения в физике, биологии и машинном обучении. Однако традиционные формулировки рассматривают его как задачу ограниченной оптимизации, которая должна явно удовлетворять уравнению сохранения массы, что затрудняет реконструкцию базовой динамики напрямую из данных. Мы предлагаем энергетический вариационный метод для динамического оптимального транспорта (EVMDOT), который реформулирует проблему в рамках энергетической вариационной теории, сочетая карту потока, принцип наименьшего действия и принцип максимальной диссипации. Карта потока преобразует ограниченную задачу в неограниченную, автоматически обеспечивая выполнение уравнения сохранения массы, в то время как баланс между консервативными и диссипативными силами определяет поле скоростей. Примененный к уравнению Фоккера-Планка, EVMDOT восстанавливает как энергетический ландшафт, так и ландшафт Уаддингтона напрямую из временных данными о плотности. В ходе численных экспериментов мы выяснили, что EVMDOT достигает внутреннего баланса между количеством и качеством данных: достаточное количество данных компенсирует ограниченное качество данных, что делает реконструкцию устойчивой к выбору окна наблюдения. Мы также применили EVMDOT к набору данных Инициативы нейровизуализации болезни Альцгеймера (ADNI) для вывода потенциального ландшафта амилоидного бета и тау, выявляя два минимума, соответствующих когнитивно нормальному состоянию и стадии болезни Альцгеймера, а также переходный путь между ними.

Биология
Биология
92%

Аффинаж: механистическая аннотация генома на основе опубликованной литературы

Понимание механистической функции гена является критически важной отправной точкой для биологии. Однако, для значительной части человеческого протеома эти знания разбросаны по тысячам первичных публикаций или остаются плохо установленными, в то время как кураторские базы данных, на которые полагаются биологи, могут отставать на годы от свежей литературы. Большие языковые модели теперь могут читать и синтезировать эту литературу по запросу, но делать это достоверно для многих генов — это дорогостоящая, неповторяемая сессия извлечения, которая не масштабируется среди пользователей. Здесь мы представляем Аффинаж, конвейер LLM, который выполняет это извлечение и механистическое рассуждение один раз для каждого гена — только на основе первичной литературы — и хранит результат в виде структурированной аннотации, которую можно повторно использовать. Программа чтения, разработанная биологами, извлекает только прямые экспериментальные доказательства, а синтетический этап рассуждает только на основе этих находок. Применяя анализ по всему геному, Аффинаж аннотирует 19 293 человеческих белок-кодирующих генов. Этот анализ предоставляет механизмы для тысяч генов, чей функционал в UniProt пуст или неполный, превосходя кураторские справочные материалы по 99.1% генов в прямом сравнении, оцененным независимо судьями LLM разных семейств. Аффинаж также определяет 10% протеома, которые остаются механистически не охарактеризованными, и будет служить постоянно обновляемым, основанным на литературе перепиской функций генов. Все записи доступны открыто по адресу https://affinage.wi.mit.edu. Более широко, Аффинаж служит примером того, как эксперты в области могут закодировать свои знания в масштабируемые конвейеры LLM, чтобы улучшить публично доступные данные, которые направляют биологические гипотезы и эксперименты.

Биология
Биология
92%

Структурированные гауссовские процессы для классификации омических данных с учетом неопределенности в условиях высокой размерности и малых выборок

Классификация гетерогенных омических данных по-прежнему остается основной проблемой в вычислительной биологии, особенно в условиях высокой размерности и малых выборок, где доминируют нелинейные взаимодействия, а дисбаланс классов дополнительно усложняет надежное предсказание редких фенотипов. Хотя традиционные методы на основе ядров полагаются на изобилие признаков, они не используют известные ландшафты взаимодействий биологических систем. В данной работе мы предлагаем структуру классификации на основе гауссовского процесса, которая интегрирует закодированные графом биологические пути непосредственно в конструкцию ядра. Пропагируя информацию вдоль известных сетей взаимодействия и комбинируя это с признаками, основанными на изобилии, полученный классификатор захватывает как количественные измерения, так и топологический контекст. Мы проводим оценку нашей предложенной методологии на трех общедоступных наборах данных по микробиому кишечника и кала. Для решения проблемы серьезного дисбаланса классов мы оцениваем дополнительные стратегии, включая ресемплирование на уровене данных, калибровку порогов и корректировки на основе матрицы замешательства, и сообщаем о результатах для класса меньшинства наряду с общей точностью. Гибридный подход дает прирост производительности по сравнению с неструктурированными базовыми решениями и соответствует показателям установленных эталонов для аналогичных наборов данных. Кроме того, вероятностная природа данного подхода естественным образом предоставляет откалиброванную предсказательную неопределенность, позволяя надежно различать уверенные предсказания и неоднозначные образцы.

Биология
Биология
92%

MERLIN-SUITE: Вероятностная модульная инференция генетических регуляторных сетей из многоомиксных данных с интеграцией регуляторных приоритетов и активности транскрипционных факторов

Точное восстановление генетических регуляторных сетей (ГРС) необходимо для понимания транскрипционных процессов в разработке и заболеваниях. MERLIN-SUITE (https://github.com/Roy-lab/MERLIN-SUITE) представляет собой набор алгоритмических расширений на базе MERLIN (Модульное обучение регуляторных сетей с учетом информации по генам), это вероятностная структура, которая позволяет выявлять специфические для генов и модуля регуляторные программы ко-регулируемых модулей, захватывая как детализированные, так и модульные аспекты транскрипционных сетей. Хотя восстановление, основанное на экспрессии, эффективно, зачастую оно плохо соотносится с экспериментально подтвержденными регуляторными взаимодействиями. MERLIN-P решает эту проблему, интегрируя внешние регуляторные приоритеты, такие как мотивы, ChIP и данные о perturbations, для повышения биологической значимости и предсказательной точности. MERLIN-P-TFA дополнительно развивает рамки, включая регуляризованную оценку латентной активности транскрипционных факторов (TFA), преодолевая ограничение, что уровни мРНК TF могут не отражать активность белков. Интегрируя данные экспрессии, заранее известные данные и моделирование с учетом активности, этот унифицированный подход поддерживает надежное восстановление ГРС как в пакетных, так и в одноядерных наборах данных. Эта глава представляет MERLIN-SUITE с акцентом на MERLIN-P-TFA и демонстрирует его использование на одномодальном многомодальном наборе данных о перетасовке клеток мыши для вывода ГРС и выявления ключевых регуляторов.

Биология
Биология
92%

scMTNI: Использование клеточной траектории и контекста для вывода динамических генетических регуляторных сетей из данных многократно омных одиночных клеток

Генетические регуляторные сети (ГРС) описывают направленные отношения между регуляторами и целевыми генами, определяя шаблоны экспрессии генов специфично для клеточных типов. Технологии многократного омного секвенирования одиночных клеток, такие как секвенирование РНК одиночных клеток (scRNA-seq) и секвенирование для оценки доступности хроматина одиночной клетки (scATAC-seq), позволяют высокоточно измерять экспрессию генов и регуляцию, специфичные для клеточных типов, как никогда ранее. Тем не менее, инструменты для вывода специфичных для клеточных типов ГРС и моделирования их динамики по-прежнему остаются редкостью. Для содействия выводу и анализу специфичных для клеточных типов ГРС в контекстах, таких как клеточное развитие или прогрессирование заболеваний, где структура и динамика клеточных линий важны, мы разработали рамочные структуру многофункционального обучения, называемую выводом сетей на базе одиночных клеток (scMTNI). ScMTNI и его сопутствующие инструменты анализа сетей предлагают комплексный пакет для определения специфичных для клеточных типов ГРС и изучения их динамики. Эта глава книги описывает инструмент scMTNI и демонстрирует его применение к существующему набору данных о многомодальной репрограммировании одиночных клеток для вывода специфичных для клеточных типов ГРС и выявления ключевых регуляторов переходов клеточной судьбы во время репрограммирования клеток.