Синтетическая генерация изображений с использованием метрических характеристик для глубокого обучения, совместимого с агентным ИИ
Metric-Guided Synthetic Image Data Rendering for Deep Learning compatible with Agentic AI
Карточка статьи
Рубрика
Биология
Источник
arXiv
Дата
14.07.2026
Автор
Science Morning
Время чтения
3 мин
Это предварительная публикация, она не прошла научное рецензирование.
Аннотация
Глубокое обучение в области компьютерного зрения для научных приложений требует сбора и аннотирования больших наборов данных в трудоемком, дорогом и подверженном ошибкам процессе. Генерация синтетических данных с помощью 3D-моделирования и рендеринга может упростить этот процесс и повысить точность аннотаций, генерируя их программно. Однако минимизация разрыва между реальными и синтетическими изображениями визуально является субъективной и не имеет систематических количественных критериев. Мы представляем GraNatPy, пакет для Python с метриками, помогающими улучшить рендеринг сцены. Мы показываем, что количественное увеличение реалистичности, разнообразия и размера созданного набора данных коррелирует с улучшением визуального восприятия сцены и более высоким качеством нулевого отслеживания в модели обнаружения объектов. Более того, мы продемонстрировали на примере фотографий вирусологических анализов, что сходство градиентов влияет на эффективность обнаружения небольших объектов, что может быть улучшено смешиванием реальных и синтетических данных. Наконец, мы превращаем процедурный рендеринг данных в агентную технологию (SynthClaw) для автоматизации оптимизации процедурных параметров.
Краткое резюме
Статья рассматривает методы генерации синтетических изображений для глубокого обучения, подчеркивая важность минимизации разрыва между реальными и синтетическими данными, а также представляется новый пакет GraNatPy для повышения качества визуального представления.
Практический вывод
Смесь реальных и синтетических данных может улучшить результаты обнаружения объектов, особенно для малых объектов, что открывает новые возможности для автоматизации и повышения эффективности в научных исследованиях.
Ограничения
Это предварительная публикация, она не прошла научное рецензирование. Изучение ограничено использованием конкретных типов изображений и моделей, что может повлиять на обобщаемость результатов. Необходимы дополнительные исследования для проверки эффективности методов на различных типах данных и задачах.
Графики и изображения появляются в научных публикациях вместе, однако большинство вычислительных работ не характеризует их согласованность. Мы утверждаем, что график, сопутствующее изображение и подпись, которая связывает их, образуют многомодальную единицу, и что индуктивная работа, необходимая для их чтения, меняется систематически. Чтобы захватить это разнообразие, мы разработали типологию разрывов в рассуждениях, от R1 до R5, которая характеризует, как график, изображение и текст совместно передают научное утверждение и какую интерпретационную работу это требует от читателя. Некоторые пары повторяют одни и те же данные, в то время как в других парах графики используются для количественной оценки структуры, которую локализует изображение, проецируют содержание изображения на внешнюю переменную, проверяют утверждение, основанное на изображении, или совместно создают рамку, которую ни один из панелей не может установить отдельно. Типология основана на теории обоснования коммуникации и была выведена в нижнем порядке с экспертом в области нейробиологии, на основе корпуса из 79 статей о травмах головного мозга и 32 пар графиков и изображений. Критически важно, что уровни предоставляют систематический механизм для определения, где обоснование успешно или дает сбой, вместо того, чтобы оставлять это на усмотрение субъективной интерпретации. Мы демонстрируем это в исследовании, в котором эксперт в области и три неэксперта оценивают описания модели зрительно-языкового моделирования (VLM) для 25 пар: уровень предсказывает, где их оценки совпадают и где расходятся, изолируя точки, в которых контекстуальные знания, а не фигура, несут согласованность. Таким образом, эта типология предлагает создателям фигур систематический способ балансировать текст с парами графиков и изображений, преодолевая разрыв между экспертами и неэкспертами в понимании научных выводов.
Недавние модели генерации и редактирования изображений могут создавать визуально привлекательные натуральные изображения, однако они остаются ненадежными, когда целевое изображение представляет собой знания-интенсивную диаграмму, корректность которой зависит от дисциплинарных концепций, символической структуры и точных пространственных отношений. Мы представляем DisciplineGen-1M, набор данных многодисциплинарного масштаба с миллионом образцов, который поддерживает генерацию изображений из текста и редактирование изображений. Он содержит 1,2 миллиона образцов из математики, физики, химии, биологии, географии, информатики, экономики, истории, музыки и спорта. Для создания набора данных мы разрабатываем масштабируемую структуру, которая объединяет рендеринг векторной графики, редактирование на основе OCR, программный синтез и крупномасштабную фильтрацию текстов в изображения. Эти рабочие процессы обеспечивают создание аннотаций, инструкций по редактированию, структурированных аннотаций и пар изображений с контролируемыми семантическими различиями. Основываясь на DisciplineGen-1M, мы дополнительно представляем модель генерации рассуждений, учитывающую дисциплину, для генерации изображений из текста и редактирования изображений. Эксперименты на связанных с дисциплиной моделях, GenExam и GRADE, показывают значительные улучшения по сравнению с открытыми эталонами, в то время как оценки на общих моделях, информированных рассуждениями, WISE и RISE, дополнительно указывают на более широкий перенос. Результаты свидетельствуют о том, что структурированные академические визуальные данные большого объема являются ключевым компонентом для перехода генерации изображений от эстетической правдоподобности к верифицируемому созданию визуального контента на основе знаний. Мы публично выпустим наш набор данных, модель и исходный код процесса кураторства данных, чтобы обеспечить воспроизводимость и содействовать будущим исследованиям.
Использование крупных языковых моделей (LLM) для молекул в качестве единой платформы для понимания молекулярных структур и функций становится новой тенденцией в таких задачах, как молекулярный дизайн и открытие лекарств. Тем не менее, эти модели не способны в полной мере отражать визуальное представление молекулярных структур, что ограничивает их потенциал. Хотя существующие молекулярные модели визуального языка (VLM) показывают обнадеживающие результаты, они по-прежнему сталкиваются с проблемами структурной подгонки и недостатком необходимого топологического моделирования для точного понимания молекул. Чтобы решить эту проблему, мы предлагаем MolSight — платформу модели визуального языка, учитывающую графы, предназначенную для повышения понимания молекулярных изображений с помощью VLM. MolSight интегрирует Модуль молекулярной топологии, чтобы внедрить информацию о соседстве химических связей в визуальные токены, и Модуль молекулярного сопоставления для согласования визуальных особенностей с химической символикой семантики. Наши эксперименты показывают, что MolSight значительно превосходит существующие VLM, молекулярные LLM и специализированные инструменты по множеству задач понимания химических изображений, достигая нового уровня рассуждений о молекулярных изображениях.
Мужское бесплодие значительно увеличивает глобальную проблему бесплодия, а анализ спермы остается центральным элементом для диагностики, планирования лечения и вспомогательных репродуктивных технологий. Однако традиционная оценка семенной жидкости трудоемка, зависит от оператора и ограничена вариативностью между и внутри наблюдателей, что побуждает к разработке объективных и воспроизводимых вычислительных подходов. Этот обзор представляет собой всесторонний и перспективный синтез анализа спермы с использованием искусственного интеллекта, с акцентом на компьютерное зрение, глубокое обучение, многомодальную интеграцию, надежность и клинический перевод. Сначала мы рассматриваем специальные методы для обнаружения и подсчета сперматозоидов, оценки подвижности на основе отслеживания, семантической и экземплярной сегментации, классификации морфологии и дефектов, функциональной оценки и оценки генетической целостности. Затем мы подводим итоги открытых наборов данных, эталонов, метрик оценки и возникающих многомодальных стратегий, которые интегрируют микроскопические изображения, временные видеозаписи, параметры, полученные из CASA, тесты на целостность ДНК и клинические метаданные. Помимо алгоритмической эффективности, мы обсуждаем ключевые препятствия для внедрения в реальный мир, включая дефицит данных, межцентровый сдвиг домена, непоследовательность аннотаций, интерпретируемость, калибровку неопределенности, сохранение конфиденциальности данных и интеграцию в рабочие процессы. Наконец, мы очерчиваем поэтапный дорожный план клинического перевода, охватывающий техническую стандартизацию, многогранную ретроспективную валидацию, молчаливую перспективную оценку, клиническое тестирование с участием человека, валидацию результатов ВРТ, получение регуляторного одобрения и мониторинг после выхода на рынок. Упорядочивая область от задач визуального распознавания до надежного многомодального репродуктивного интеллекта, этот обзор подчеркивает как достижения, так и неразрешенные проблемы, необходимые для перевода анализа спермы с помощью ИИ в клинически значимую поддержку решений.
Влияние статинов на эректильную дисфункцию (ЭД) остается предметом интенсивных клинических дискуссий. Предыдущие наблюдательные исследования дали непоследовательные результаты и часто ограничены факторами спутания и обратной причинностью. Чтобы исследовать причинную связь между использованием статинов и риском ЭД, было проведено анализ с использованием двух образцов Менделевской рандомизации на основе данных об ассоциации геномов из UK Biobank и FinnGen. Генетические варианты для общих статинов и специфических типов (аторвастатин, симвастатин и розувастатин) использовались в качестве инструментария. Основной эффект оценивался с использованием метода взвешенного обратного дисперсионного анализа (IVW). Были проведены анализы чувствительности, включая MR-Egger, взвешенное медианное, MR-PRESSO и анализ «оставь один», чтобы обеспечить надежность результатов, а также тест направления MR Steiger для проверки причинной ориентации. Анализ IVW показал, что общее использование статинов связано с повышенным риском ЭД (OR = 1.064; 95% CI, 1.011-1.119; p = .018). Подгрупповый анализ показал, что липофильные статины значительно увеличивают риск ЭД: аторвастатин (OR = 27.892; 95% CI, 1.912-40.977; p = .015) и симвастатин (OR = 4.948; 95% CI, 1.598-15.319; p = .006). В то же время, причинная связь для гидрофильного розувастатина не была установлена (p = .428). Анализы чувствительности подтвердили отсутствие горизонтального плеиотропизма и гетерогенности. Тест направления MR Steiger подтвердил, что причинное направление от использования статинов к ЭД является надежным. Кроме того, анализ «оставь один» продемонстрировал, что общие результаты не обусловлены каким-либо отдельным SNP. Использование статинов, в частности аторвастатина и симвастатина, причинно увеличивает риск ЭД, в то время как розувастатин, похоже, имеет нейтральный эффект.
Качественный анализ при микроскопии бактерий часто затруднен разнообразными морфологиями клеток, гетерогенностью популяции и необходимостью специализированной компьютерной экспертизы. Чтобы решить эти проблемы, представляется mAIcrobe — открытая платформа, которая расширяет доступ к современному анализу изображений бактерий, интегрируя набор моделей глубокого обучения. mAIcrobe включает несколько алгоритмов сегментации, таких как StarDist, CellPose и U-Net, наряду с комплексной морфологической профилизацией и адаптивным классификатором нейронной сети, все это в экосистеме napari. Эта единая платформа позволяет анализировать широкий спектр бактериальных видов, от сферических Staphylococcus aureus до палочковидных Escherichia coli, в различных микроскопических методах в одной среде. Биологическая полезность mAIcrobe демонстрируется через его применение к антибиотикофенотипированию в E. coli и выявлению дефектов клеточного цикла в мутантах DnaA S. aureus. Модульный дизайн, поддерживаемый Jupyter notebooks, облегчает разработку пользовательских моделей и расширяет возможности анализа изображений на основе искусственного интеллекта для широкой микробиологической аудитории. Основываясь на основании, установленном eHooke, mAIcrobe представляет собой значительный шаг вперед в автоматизированной и воспроизводимой микроскопии бактерий.