БиологияarXivScience Morning3 мин чтенияpreprint

Типология многомодального рассуждения для обоснования согласованности графиков и изображений в научной коммуникации

A Multimodal Reasoning Typology for Grounding Chart-Image Coherence in Science Communication

Рубрика
Биология
Источник
arXiv
Дата
06.07.2026
Автор
Science Morning
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Биология

Аннотация

Графики и изображения появляются в научных публикациях вместе, однако большинство вычислительных работ не характеризует их согласованность. Мы утверждаем, что график, сопутствующее изображение и подпись, которая связывает их, образуют многомодальную единицу, и что индуктивная работа, необходимая для их чтения, меняется систематически. Чтобы захватить это разнообразие, мы разработали типологию разрывов в рассуждениях, от R1 до R5, которая характеризует, как график, изображение и текст совместно передают научное утверждение и какую интерпретационную работу это требует от читателя. Некоторые пары повторяют одни и те же данные, в то время как в других парах графики используются для количественной оценки структуры, которую локализует изображение, проецируют содержание изображения на внешнюю переменную, проверяют утверждение, основанное на изображении, или совместно создают рамку, которую ни один из панелей не может установить отдельно. Типология основана на теории обоснования коммуникации и была выведена в нижнем порядке с экспертом в области нейробиологии, на основе корпуса из 79 статей о травмах головного мозга и 32 пар графиков и изображений. Критически важно, что уровни предоставляют систематический механизм для определения, где обоснование успешно или дает сбой, вместо того, чтобы оставлять это на усмотрение субъективной интерпретации. Мы демонстрируем это в исследовании, в котором эксперт в области и три неэксперта оценивают описания модели зрительно-языкового моделирования (VLM) для 25 пар: уровень предсказывает, где их оценки совпадают и где расходятся, изолируя точки, в которых контекстуальные знания, а не фигура, несут согласованность. Таким образом, эта типология предлагает создателям фигур систематический способ балансировать текст с парами графиков и изображений, преодолевая разрыв между экспертами и неэкспертами в понимании научных выводов.

Краткое резюме

Данная работа представляет собой исследование согласованности графиков и изображений в научных публикациях. Авторы предлагают типологию разрывов в рассуждении, которая помогает понять, как взаимодействуют график, изображение и текст, и как это влияет на восприятие информации читателями. Типология основана на эмпирических данных и предназначена для улучшения коммуникации в науке.

Практический вывод

Типология разрывов в рассуждении помогает дизайнерам научных графиков и изображений лучше сочетать текст с визуальными материалами, что делает научные статьи более доступными для широкой аудитории.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. Исследование основано на ограниченном корпусе публикаций, что может ограничивать обобщаемость типологии на другие области науки.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Биология
Биология
92%

Изучение механистического рассуждения для химических реакций с помощью больших языковых моделей

Механизмы реакций состоят из пошаговых последовательностей элементарных реакций, которые объясняют химические преобразования. Поэтому изучение логики механизмов имеет решающее значение для повышения фундаментального химического интеллекта больших языковых моделей (БЯМ). Пошаговое выведение механизмов реакций естественно соответствует парадигмам рассуждений БЯМ. Однако текущие химические БЯМ в первую очередь акцентируют внимание на грубых наименованиях реакций для предсказания продуктов и ретросинтеза, что часто приводит к физическим несоответствиям и галлюцинациям. В отличие от этого, специализированные небольшие генеративные модели для вывода механизмов, как правило, страдают от ограниченной способности к обобщению в различных химических пространствах. Чтобы преодолеть эти ограничения, мы создали новый обширный набор данных для рассуждения о механизмах реакций. Более того, мы разработали FukuyamaBench — сложный эталон, основанный на книге Фукуямы «Современные механизмы органических реакций», для строгой оценки производительности моделей в иерархическом рассуждении о механизмах. Наша дообученная модель Qwen3-30B-A3B достигает 8,3% точного совпадения путей в наборе FukuyamaBench Set~A, превосходя специализированную модель FlowER (5,1%), что демонстрирует, что обучение с учетом механизмов значительно улучшает химическое рассуждение в языковых моделях.

Биология
Биология
92%

BUS: Вдохновленное мозгом несупервизированное саморефлексия для продвинутого мультимодального мышления

Современные модели "визуального языка" (VLMs) часто испытывают трудности с выполнением сложных визуальных задач, которые требуют последовательного и детализированного мышления. Недавние методы нацелены на обучение моделей, способствующих саморефлексии, то есть пересмотру и улучшению сгенерированного рассуждения. Однако они требуют больших объемов аннотированных данных и не обладают явным рефлексивным поведением во время тестирования. Эта работа направлена на устранение этого разрыва через вдохновение из нейробиологии. Человеческий мозг демонстрирует эффективное обратное предсказание, то есть предсказание того, какие текущие состояния вероятны для предшествования данному будущему состоянию. В этой работе мы сначала подтверждаем, что основные VLMs могут выполнять обратное предсказание, аналогично человеческому мозгу. Затем мы предлагаем "Вдохновленное мозгом несупервизированное саморефлексия" (BUS), бесконечную рамку для обучения, чтобы улучшить возможности рефлексивного мышления в сложном анализе изображений. BUS позволяет VLMs выполнять обратное предсказание и предоставляет явные сигналы обучения на данных без истинных меток. Тем самым, BUS устраняет зависимость от аннотированных данных, улучшая при этом производительность рассуждений. Заметим, что BUS совместим с популярными методами тонкой настройки, такими как супервизированная тонкая настройка (SFT) и обучение с подкреплением (RL). Наконец, обширные эксперименты на 8 бенчмарках демонстрируют эффективность BUS в широком диапазоне сложных визуальных задач. Она достигает значительных улучшений по сравнению с базовой моделью, используя только необработанные данные для обучения. Наши экспериментальные данные подтверждают, что способность к обратному предсказанию имеет решающее значение для рассуждений VLM.

Биология
Биология
82%

Глубокое обучение для анализа семени при мужском бесплодии: компьютерное зрение, многомодальная интеграция и клинический перевод

Мужское бесплодие значительно увеличивает глобальную проблему бесплодия, а анализ спермы остается центральным элементом для диагностики, планирования лечения и вспомогательных репродуктивных технологий. Однако традиционная оценка семенной жидкости трудоемка, зависит от оператора и ограничена вариативностью между и внутри наблюдателей, что побуждает к разработке объективных и воспроизводимых вычислительных подходов. Этот обзор представляет собой всесторонний и перспективный синтез анализа спермы с использованием искусственного интеллекта, с акцентом на компьютерное зрение, глубокое обучение, многомодальную интеграцию, надежность и клинический перевод. Сначала мы рассматриваем специальные методы для обнаружения и подсчета сперматозоидов, оценки подвижности на основе отслеживания, семантической и экземплярной сегментации, классификации морфологии и дефектов, функциональной оценки и оценки генетической целостности. Затем мы подводим итоги открытых наборов данных, эталонов, метрик оценки и возникающих многомодальных стратегий, которые интегрируют микроскопические изображения, временные видеозаписи, параметры, полученные из CASA, тесты на целостность ДНК и клинические метаданные. Помимо алгоритмической эффективности, мы обсуждаем ключевые препятствия для внедрения в реальный мир, включая дефицит данных, межцентровый сдвиг домена, непоследовательность аннотаций, интерпретируемость, калибровку неопределенности, сохранение конфиденциальности данных и интеграцию в рабочие процессы. Наконец, мы очерчиваем поэтапный дорожный план клинического перевода, охватывающий техническую стандартизацию, многогранную ретроспективную валидацию, молчаливую перспективную оценку, клиническое тестирование с участием человека, валидацию результатов ВРТ, получение регуляторного одобрения и мониторинг после выхода на рынок. Упорядочивая область от задач визуального распознавания до надежного многомодального репродуктивного интеллекта, этот обзор подчеркивает как достижения, так и неразрешенные проблемы, необходимые для перевода анализа спермы с помощью ИИ в клинически значимую поддержку решений.

Биология
Биология
72%

Синтетическая генерация изображений с использованием метрических характеристик для глубокого обучения, совместимого с агентным ИИ

Глубокое обучение в области компьютерного зрения для научных приложений требует сбора и аннотирования больших наборов данных в трудоемком, дорогом и подверженном ошибкам процессе. Генерация синтетических данных с помощью 3D-моделирования и рендеринга может упростить этот процесс и повысить точность аннотаций, генерируя их программно. Однако минимизация разрыва между реальными и синтетическими изображениями визуально является субъективной и не имеет систематических количественных критериев. Мы представляем GraNatPy, пакет для Python с метриками, помогающими улучшить рендеринг сцены. Мы показываем, что количественное увеличение реалистичности, разнообразия и размера созданного набора данных коррелирует с улучшением визуального восприятия сцены и более высоким качеством нулевого отслеживания в модели обнаружения объектов. Более того, мы продемонстрировали на примере фотографий вирусологических анализов, что сходство градиентов влияет на эффективность обнаружения небольших объектов, что может быть улучшено смешиванием реальных и синтетических данных. Наконец, мы превращаем процедурный рендеринг данных в агентную технологию (SynthClaw) для автоматизации оптимизации процедурных параметров.

Биология
Биология
72%

Точное, междисциплинарное и прозрачное понимание взаимосвязей структура-свойство с помощью глубокой структурной логики

Взаимосвязи структура-свойство являются основополагающими для биологии, химии и науки о материалах, где функция, реактивность и физический ответ возникают из пространственной, химической и периодической организации. Механистическое объяснение этих взаимосвязей требует интерпретации структурных доказательств с помощью научных принципов и физических ограничений, начиная с стереохимии и связи и заканчивая симметрией, энергиями и периодическим порядком. Однако применение искусственного интеллекта к этому процессу представляет собой общую задачу представления и логического вывода: модели должны сохранять информацию о структурах, характерную для области, и демонстрировать, как конкретные доказательства поддерживают предсказания в этих рамках. Здесь мы представляем SciReasoner, многомодальную научную модель, основанную на native структурной логике, охватывающую белки, небольшие молекулы и неорганические кристаллы. SciReasoner дискретизирует координаты, топологии и периодические связи в единый словарь, учитывающий структуру, рассматривая структурные токены как адресуемые единицы доказательства во время логического вывода. В контролируемом по гомологии прогнозировании систематики генов SciReasoner улучшает аннотацию клеточных компонентов для белков с низкой гомологией и сиротоподобных белков, увеличивая $F_{\max}$ с 0.42 до 0.55. В химии он увеличивает точность одностадийного ретросинтеза с 0.63 до 0.72, генерируя следы разрыва на уровне фрагментов и проверки предшественников. В науке о материалах его представления разделяют элементарные и композитные фазы и разрешают режимы с высоким и низким энергетическим зазором. По 86 тестовым задачам SciReasoner достигает лучших в своем классе результатов по 67 задачам. Двойная слепая экспертная оценка оценивала его логические следы как предпочтительные или хотя бы сопоставимые с таковыми у модели большого языка передового уровня в 98% случаев. Делая структуру проверяемым субстратом для логического вывода в рамках научных ограничений, SciReasoner связывает точное предсказание с интерпретируемым научным выводом.

Биология
Биология
72%

MolSight: Модель визуального языка с учетом графов для универсального понимания химических изображений

Использование крупных языковых моделей (LLM) для молекул в качестве единой платформы для понимания молекулярных структур и функций становится новой тенденцией в таких задачах, как молекулярный дизайн и открытие лекарств. Тем не менее, эти модели не способны в полной мере отражать визуальное представление молекулярных структур, что ограничивает их потенциал. Хотя существующие молекулярные модели визуального языка (VLM) показывают обнадеживающие результаты, они по-прежнему сталкиваются с проблемами структурной подгонки и недостатком необходимого топологического моделирования для точного понимания молекул. Чтобы решить эту проблему, мы предлагаем MolSight — платформу модели визуального языка, учитывающую графы, предназначенную для повышения понимания молекулярных изображений с помощью VLM. MolSight интегрирует Модуль молекулярной топологии, чтобы внедрить информацию о соседстве химических связей в визуальные токены, и Модуль молекулярного сопоставления для согласования визуальных особенностей с химической символикой семантики. Наши эксперименты показывают, что MolSight значительно превосходит существующие VLM, молекулярные LLM и специализированные инструменты по множеству задач понимания химических изображений, достигая нового уровня рассуждений о молекулярных изображениях.