Искусственный интеллектbioRxivIsmail, T., Chavez, A. G., Yan, X., Zhu, H. et al.3 мин чтенияpreprint

Оценка нейронной настройки для значения слов на основе пассивно записанной естественной речи

Estimation of neuronal tuning for word meaning from passively recorded naturalistic speech

Рубрика
Искусственный интеллект
Источник
bioRxiv
DOI
10.64898/2026.06.23.733980
Дата
28.06.2026
Автор
Ismail, T., Chavez, A. G., Yan, X., Zhu, H. et al.
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Искусственный интеллект

Аннотация

Способность разрабатывать модели языкового кодирования на нейронном уровне имеет огромный научный и клинический потенциал. Текущие подходы ограничены масштабом и этологической валидностью входных данных; приложения, требующие больших, редких или естественных образцов, в частности, выиграли бы от возможности выводить нейронное кодирование из случайной повседневной речи. В данной работе мы представляем новый конвейер, разработанный для использования спонтанной и случайной естественной речи. Этот конвейер выполняет транскрипцию, сегментацию и диаризацию с помощью видео, а также выравнивание и обнаружение спайков нейронных данных. Мы применяем этот конвейер к набору данных, полученному от 21 пациента (по 6+ дней на каждого, более 800 часов и в общей сложности 5 миллионов слов). Мы тестировали как модели кодирования, так и декодирования на обширных и редких контрольных наборах данных с истинными значениями, состоящих из временного выравнивания на уровне слов, отобранного человеком, и вручную отсортированных спайков. Мы дополнительно проверяем наш подход, количественно оценивая представительное дрейфование, эффект размера набора данных и различия между шестю областями мозга. В совокупности эти результаты демонстрируют, что случайная естественная речь достаточно обрабатывается в мозге, чтобы дать возможность оценить нейронные уровневые эмбеддинги.

Краткое резюме

Исследование анализирует возможности использования естественной речи для создания нейронных моделей языка. Разработанный конвейер позволяет обрабатывать речевые данные пациентов для извлечения информации о значении слов. Результаты показывают, что повседневная речь может быть полезна для изучения нейронного кодирования.

Практический вывод

Это исследование открывает новые возможности для использования повседневной естественной речи в нейронауках и клинической практике, что может привести к улучшению моделей языкового понимания на нейронном уровне.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. Основные ограничения исследования включают ограниченное количество пациентов и возможность влияния индивидуальных различий в нейронной активности на результаты. Дополнительно, обработка случайной речи может быть менее точной в сравнении с специально подготовленными набором данных.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Искусственный интеллект
Искусственный интеллект
92%

Нейронное отслеживание речевой огибающей волны как индикатор пространственного освобождения от маскировки

Понимание речи в шумных условиях сильно зависит от бинауральных подсказок, таких как межушные временные и уровеньные различия (ITDs и ILDs), которые поддерживают пространственное слуховое восприятие и сегрегацию конкурирующих звуковых источников. Когда эти подсказки ухудшаются, слушатели испытывают значительные трудности в сложных акустических условиях. Поведенческие меры бинауральной выгоды, такие как различия уровней маскировки и различия уровня разборчивости, а также пространственное освобождение от маскировки (SRM), хорошо изучены у слушателей с нормальным слухом (NH), однако они требуют активного поведенческого ответа. Нейронное отслеживание речи с использованием электроэнцефалографии (ЭЭГ) стало многообещающим подходом для количественной оценки нейронной обработки непрерывной речи, однако его чувствительность к пространственным слуховым подсказкам остается недостаточно охарактеризованной. Мы исследовали нейронные корреляты пространственного освобождения от маскировки у слушателей с нормальным слухом с использованием нейронного отслеживания речи на основе ЭЭГ. Девятнадцать участников слушали непрерывные голландские речевые истории, представлены с маскирующим шумом в двух пространственных конфигурациях: совмещенные (S0N0) и пространственно разделенные (S0N90) при различных соотношениях сигнал-шум (SNR). Нейронное отслеживание огибающей волны речи было количественно оценено с помощью анализа реконструкции огибающей волны и анализа временной реакции (TRF). Пространственное разделение усилило нейронное отслеживание огибающей волны целевой речи, особенно при сложных соотношениях SNR, где также наблюдалось поведенческое SRM. Анализ TRF дополнительно показал, что увеличились амплитуды и уменьшились задержки поздних корковых компонентов, что соответствует эффектам пространственного раскрепощения. Эти результаты демонстрируют, что нейронное отслеживание речи фиксирует корковые сигнатуры пространственного раскрепощения и closely отображает поведенческие улучшения в понимании речи. Установление этих взаимосвязей у слушателей с нормальным слухом поддерживает разработку объективных нейронных мер для оценки бинауральной выгоды у трудно тестируемых групп.

Искусственный интеллект
Искусственный интеллект
77%

QVal: Экономичная оценка сигналов плотного контроля для агентов LLM на длинных горизонтах

Агенты LLM все чаще действуют на длинных горизонтах, где одна траектория может содержать сотни или тысячи действий. В таких случаях награды, основанные только на результатах, предоставляют слишком скудные сигналы, не информируя модель о качестве промежуточных действий. Методы плотного контроля旨енты к решению этой проблемы путем оценки промежуточных шагов, начиная от внутренней уверенности и заканчивая самодистилляцией и сходством вложений. Однако обычно эти методы оцениваются путем измерения последующей производительности тренировочного процесса, который интегрирует их. Это дорого, смешивает качество контроля с инженерными факторами обучения и делает различные методологические группы несравнимыми из-за необходимости различных настроек обучения. В результате методы плотного контроля редко проверяются на общем основании. Мы представляем QVal, тестовую платформу без необходимости в обучении для прямой оценки сигналов плотного контроля. Учитывая пару состояние-действие, QVal измеряет, насколько хорошо оценка метода соответствует Q: упорядочивает ли она действия согласно Q-значениям сильной эталонной политики. Это позволяет нам сравнивать сигналы еще до любого запуска обучения и отделять качество сигнала от других инженерных решений. Мы внедрили QVal в виде QVal-v1.0, оценив 21 метод плотного контроля в четырех различных средах и семи методологических группах, проведя более 1,2 тысячи экспериментов по оценке на шести основных моделях с открытыми весами. Мы обнаружили, что простые базовые подходы к подсказкам постоянно превосходят современные методы плотного контроля из литературы, и что производительность сильно кластеризуется по семействам. Эти результаты подтверждаются на различных размерах моделей, средах и модальностях наблюдения. QVal разработан с учетом простоты расширения для новых сред и методов, что позволяет исследователям дорабатывать методы плотного контроля до любого запуска обучения.

Искусственный интеллект
Искусственный интеллект
77%

CoMet: Декомпозиция контекста и множественности для оценки неопределенности в мультимодальных моделях

Оценка неопределенности остается давней проблемой в AI-моделях; это сводится к «знанию того, что вы не знаете», и метапознание с этим связано, что крайне сложно даже для людей (см. эффект Даннинга-Крюгера). Несмотря на то, что эта задача все еще далека от решения, даже в более простых классификационных системах, ее решение в мультимодальных больших языковых моделях (MLLM) становится все более важным. В рамках MLLM неопределенность может возникать из самых различных источников, а также из их взаимодействий, и дальше может возникнуть из неограниченных ответов в открытой среде. Для решения этих проблем мы предлагаем CoMet, метод оценки неопределенности в MLLM, который декомпозирует неопределенность на специфическую для контекста составляющую и составляющую множественности. Первая захватывает неоднозначность, вызванную данным контекстом (например, задачей или подсказкой), в то время как последняя фиксирует, сколько правдоподобных ответов, определяемых контекстом, остается совместимыми с данным входом. Мы обучаем легкий модуль оценки неопределенности постфактум для оценки этих количеств, что позволяет эффективно проводить оценку неопределенности без генерации ответов в автогрессивном режиме или повторного семплирования. Эксперименты на различных мультимодальных открытых бенчмарках, в детекции галлюцинаций и на бенчмарках визуального вопросно-ответного подхода с множественным выбором показывают, что CoMet последовательно улучшает оценку неопределенности по сравнению с существующими базовыми методами, оставаясь при этом эффективным на практике. Код доступен по ссылке https://github.com/princetonvisualai/comet_uncertainty

Искусственный интеллект
Искусственный интеллект
77%

Искусственный интеллект отвечает на вопросы пациентов о фемороацетабулярном импинджменте: полезный инструмент или риск для здоровья? Оценка ответов NIPRGPT на часто задаваемые вопросы о фемороацетабулярном импинджменте.

С развитием технологий пациенты все чаще ищут медицинскую информацию в интернете, и чат-боты на базе искусственного интеллекта (ИИ), такие как NIPRGPT — наиболее доступный инструмент ИИ для пользователей компьютеров Министерства обороны США — предлагают новый ресурс для ответов на вопросы о фемороацетабулярном импинджменте (ФАИ). На данный момент не проводилось исследований, оценивающих ответы NIPRGPT на ортопедические медицинские вопросы. Основная цель данного исследования заключалась в оценке точности, полноты и читаемости ответов NIPRGPT на распространенные вопросы о ФАИ. Были выбраны двенадцать часто задаваемых вопросов (ЧЗВ) о ФАИ из подготовленного списка и заданы NIPRGPT. Точность и достаточность ответов оценивались панелью сертифицированных хирургов по четырем критериям: отлично (без необходимости в уточнениях), удовлетворительно (необходимы минимальные уточнения), удовлетворительно (необходимы умеренные уточнения) и неудовлетворительно (необходимы существенные уточнения). Кроме того, была оценена читаемость с использованием коэффициента читаемости Флеш-Кинкейда. Из 12 ответов четыре (33,3%) были оценены как отличные, не требующие уточнения, семь (58,3%) — как удовлетворительные, требующие минимальных уточнений, и один (8,3%) — как удовлетворительный, требующий умеренных уточнений. Не было неудовлетворительных ответов. Средняя оценка качества составила 3,38 из 4,0. Однако средний коэффициент читаемости Флеш-Кинкейда составил 19,6, что соответствует уровню читаемости для лиц с послевузовским или специализированным академическим образованием. Согласованность оценок между наблюдателями была низкой, с альфа-коэффициентом Криппендорфа 0,046. NIPRGPT предоставляет ответы на ЧЗВ о ФАИ, которые в целом являются точными и надежными. Однако сложность ответов значительно превышает рекомендуемый уровень читаемости для образовательных материалов для пациентов. Хотя это может быть полезным дополнением в условиях военной медицины, где доступ к информации может быть ограничен, врачам следует учитывать высокие требования к грамотности, которые налагаются на пациентов, использующих этот инструмент.

Искусственный интеллект
Искусственный интеллект
77%

Динамическое представление графов для обучения на основе данных в стадировании болезни Хантингтона: оценка по сравнению с существующими методами эмбеддинга и моделями пространственного состояния

Болезнь Хантингтона (БХ) имеет гетерогенное нейродегенеративное течение, при котором моторные, когнитивные и функциональные симптомы развиваются по-разному у различных людей. Такое нетипичное течение осложняет определение дискретных стадий болезни, что затрудняет понимание траекторий заболевания, timely pa- tient care и разработку терапии. В результате существующие клинические системы стадирования в значительной степени полагаются на критерии, определяемые клиницистами, специфичные для области, и фиксированные границы клинического измерения для назначения стадии, что снижает объективность и часто приводит к перекрытию клинических измерений между стадиями. Хотя методы машинного обучения могут помочь, существующие подходы не могут полностью уловить сложные временные зависимости внутри и между пациентами. Мы предлагаем URL-STFN, модель динамического представления графов, которая кодирует как меж-, так и внутри-пациентные временные паттерны на основе долгосрочных клинических измерений. Затем мы оцениваем стадии заболевания, образованные через кластеризацию и анализ стабильности латентных представлений URL-STFN, и сравниваем их с представлениями, полученными с помощью традиционных методов эмбеддинга. Мы также проводим бенчмаркинг этих стадий, основанных на кластеризации, по сравнению с состояниями, полученными из традиционных временных моделей, включая DHMM. Мы предполагаем, что кластеризация латентных представлений URL-STFN позволяет идентифицировать стадии БХ с уменьшением перекрытия клинических измерений. Предложенная структура оценивается с использованием 1,477 клинических визитов из набора данных Enroll-HD, крупной продольной когорты с повторными клиническими оценками. Для стадирования мы использовали 44 клинических измерения, охватывающих моторную, когнитивную и функциональную области. URL-STFN определяет клинически значимые стадии БХ, которые соответствуют установленному прогрессированию заболевания, одновременно уменьшая перекрытие значений клинических признаков по сравнению с подходами, основанными на DHMM, и клиническими стадиями. Эти выводы подчеркивают потенциал модели обучения представления на основе динамических графов и фреймворка кластеризации для поддержки более объективного, основанного на данных и точного стадирования БХ.

Искусственный интеллект
Искусственный интеллект
77%

Infoxmed2.0-27B: Настройка инструкций, выравнивание предпочтений и обучение модели вознаграждения на основе GRPO для медицинских LLM

Аннотация. Большие языковые модели (LLM) продемонстрировали замечательные способности в общих областях, однако их применение в специализированных медицинских контекстах требует строгой адаптации к предметной области. Мы представляем Infoxmed2.0-27B, медицинскую базовую модель, построенную на основе Qwen3.5-27B через комплексный многосложный пост-тренировочный процесс: (1) синтез проприетарных медицинских данных из базы данных MySQL с организацией MedicalCategoryTree, валидация командой докторов наук в области медицины, семантическая дедупликация на основе Chinese RoBERTa и языковая доработка с помощью API; (2) тонкая настройка Qwen3.5-27B с использованием LoRA (r = 8, d = 32) через MS-Swift, что привело к итерациям Infoxmed2.0.0 → 2.0.2 → 2.0.4; (3) прямая оптимизация предпочтений на 6,283 курируемых медицинских предпочтениях с использованием потерь DPO-RPO (β = 0.3, RPO = 0.1) на протяжении восьми прогрессивных тренировочных итераций (v0-v7); и (4) параллельное обучение медицинской модели награды на основе групповой относительной оптимизации политики (GRPO) на Qwen3.5, комбинируя внутренние наградные функции на основе правил с внешними сигналами DeepSeek. Всесторонние оценки в рамках единой системы LLM-as-Judge с использованием GPT-5.4 продемонстрировали точность 77.0% (средний качественный балл +7.18) на MedMCQA и +2.59 на HLE, с прогрессией от +6.69 (база) к +7.06 (тонкая настройка) и к +7.18 (финал).