Нейронное отслеживание речевой огибающей волны как индикатор пространственного освобождения от маскировки
Neural Tracking of Speech Envelope as an Index of Spatial Release from Masking
Карточка статьи
Рубрика
Искусственный интеллект
Источник
bioRxiv
DOI
10.64898/2026.06.29.734758
Дата
02.07.2026
Автор
Galeano-Otalvaro, J.-D., Dieudonne, B., Francart, T., Wouters, J.
Время чтения
3 мин
Это предварительная публикация, она не прошла научное рецензирование.
Аннотация
Понимание речи в шумных условиях сильно зависит от бинауральных подсказок, таких как межушные временные и уровеньные различия (ITDs и ILDs), которые поддерживают пространственное слуховое восприятие и сегрегацию конкурирующих звуковых источников. Когда эти подсказки ухудшаются, слушатели испытывают значительные трудности в сложных акустических условиях.
Поведенческие меры бинауральной выгоды, такие как различия уровней маскировки и различия уровня разборчивости, а также пространственное освобождение от маскировки (SRM), хорошо изучены у слушателей с нормальным слухом (NH), однако они требуют активного поведенческого ответа. Нейронное отслеживание речи с использованием электроэнцефалографии (ЭЭГ) стало многообещающим подходом для количественной оценки нейронной обработки непрерывной речи, однако его чувствительность к пространственным слуховым подсказкам остается недостаточно охарактеризованной.
Мы исследовали нейронные корреляты пространственного освобождения от маскировки у слушателей с нормальным слухом с использованием нейронного отслеживания речи на основе ЭЭГ. Девятнадцать участников слушали непрерывные голландские речевые истории, представлены с маскирующим шумом в двух пространственных конфигурациях: совмещенные (S0N0) и пространственно разделенные (S0N90) при различных соотношениях сигнал-шум (SNR). Нейронное отслеживание огибающей волны речи было количественно оценено с помощью анализа реконструкции огибающей волны и анализа временной реакции (TRF).
Пространственное разделение усилило нейронное отслеживание огибающей волны целевой речи, особенно при сложных соотношениях SNR, где также наблюдалось поведенческое SRM. Анализ TRF дополнительно показал, что увеличились амплитуды и уменьшились задержки поздних корковых компонентов, что соответствует эффектам пространственного раскрепощения.
Эти результаты демонстрируют, что нейронное отслеживание речи фиксирует корковые сигнатуры пространственного раскрепощения и closely отображает поведенческие улучшения в понимании речи. Установление этих взаимосвязей у слушателей с нормальным слухом поддерживает разработку объективных нейронных мер для оценки бинауральной выгоды у трудно тестируемых групп.
Краткое резюме
Исследование показывает, что нейронное отслеживание огибающей волны речи может использоваться для оценки пространственного освобождения от маскировки и улучшения понимания речи в шумных условиях.
Практический вывод
Результаты исследования могут способствовать разработке новых методов оценки слуховых трудностей и улучшения понимания речи у людей с нарушениями слуха.
Ограничения
Это предварительная публикация, она не прошла научное рецензирование. Исследование проводилось только на ограниченной выборке участников, что может ограничить обобщаемость полученных результатов. Также необходимо дальнейшее исследование влияния различных типов шумов на нейронные сигналы.
Способность разрабатывать модели языкового кодирования на нейронном уровне имеет огромный научный и клинический потенциал. Текущие подходы ограничены масштабом и этологической валидностью входных данных; приложения, требующие больших, редких или естественных образцов, в частности, выиграли бы от возможности выводить нейронное кодирование из случайной повседневной речи. В данной работе мы представляем новый конвейер, разработанный для использования спонтанной и случайной естественной речи. Этот конвейер выполняет транскрипцию, сегментацию и диаризацию с помощью видео, а также выравнивание и обнаружение спайков нейронных данных. Мы применяем этот конвейер к набору данных, полученному от 21 пациента (по 6+ дней на каждого, более 800 часов и в общей сложности 5 миллионов слов). Мы тестировали как модели кодирования, так и декодирования на обширных и редких контрольных наборах данных с истинными значениями, состоящих из временного выравнивания на уровне слов, отобранного человеком, и вручную отсортированных спайков. Мы дополнительно проверяем наш подход, количественно оценивая представительное дрейфование, эффект размера набора данных и различия между шестю областями мозга. В совокупности эти результаты демонстрируют, что случайная естественная речь достаточно обрабатывается в мозге, чтобы дать возможность оценить нейронные уровневые эмбеддинги.
Поэзия конденсирует язык в минимальные формы, вызывая эмоции, визуальные образы и эстетические суждения, однако нейронная основа таких оценок остается плохо изученной. Мы исследовали, как мозг оценивает две структурно сопоставленные, но тематически разные поэтические формы: хайку на тему природы и сенрю на тему эмоций. Участники читали стихи и оценивали их по пяти критериям - эстетическая привлекательность, яркость образов, эмоциональная вовлеченность, оригинальность и креативность - в то время как записывалась ЭЭГ. Используя многоклассовые модели градиентного бустинга с SHapley Additive exPlanations, мы предсказали оценочные рейтинги на основе осцилляторных нейронных характеристик в разных временных окнах и областях скальпа. Модели показали лучшие результаты по сравнению с линейными базовыми моделями и имели ограниченную обобщаемость между темами, указывая на контентно-специфическое нейронное кодирование. Обнаружились различия в процессах обработки: сенрю продемонстрировала более сильные вкладки в бета-диапазон, в то время как хайку задействовало более распределенные многочастотные динамики. Временные профили также различались, при этом хайку показывало устойчивое вовлечение на этапах чтения и размышления, а сенрю демонстрировала более раннюю оценку во время чтения. Предшествующая нейронная активность способствовала предсказанию последующих оценок, что предполагает роль предвосхищающего состояния мозга в эстетической оценке. По всем стихотворениям оценочные измерения сходились на доминирующей общей оси, которая надежно предсказывалась на основе нейронных характеристик. В совокупности эти результаты указывают на то, что эстетическая оценка поэзии отражает взаимодействие между предвосхищающими нейронными состояниями, контентно-специфической осцилляторной динамикой и процессами, специфичными для измерений, организованными вокруг общей оценочной оси. Эта работа устанавливает поэзию как удобную модельную систему для изучения того, как мозг конструирует смысл и ценность из минимального языкового ввода.
Технологии пространственной транскриптомики (СТ) позволяют изучать экспрессию генов в контексте пространственной организации тканей, предоставляя идеи о структуре тканей, клеточных взаимодействиях и прогрессии заболеваний. Однако существующие методы уменьшения размерности часто игнорируют пространственную информацию или не могут отличить пространственные генетические паттерны от паттернов, вызванных различиями в клеточных типах, что ограничивает биологическую интерпретацию, сворачивая различия в паттернах экспрессии генов с различиями в пропорциях клеточных типов. Чтобы решить эти проблемы, мы представляем масштабируемую много групповую ненегативную пространственную факторизацию (smNSF) — вычислительно удобную вероятностную модель, которая интегрирует пространственные координаты и метки клеточных типов в единую модель матричной факторизации. Используя много групповые гауссовские процессы (MGGP) в качестве априорных значений, наша модель захватывает сложные пространственные вариации специфическим для клеточного типа образом, при этом обеспечивая ненегативность для улучшения интерпретируемости. Мы разрабатываем вариационную инференцию для MGGP, которая поддерживает масштабируемую оптимизацию и улучшает численную стабильность smNSF. На семи наборах данных пространственной транскриптомики, охватывающих разнообразные технологии и ткани, smNSF восстанавливает разреженные, интерпретируемые пространственные факторы и, через свои умовные постериоры для клеточных типов, организует их в пространственные программы, обогащенные клеточными типами, специфичные для клеточных типов и универсальные, которые не очевидны из маргинальных факторов. Учитывая метки клеточных типов в данных СТ, smNSF дает возможность проводить пространственные декомпозиции с учетом клеточных типов и поддерживает умовные постериоры для in silico исследования взаимосвязей между пространственными паттернами и клеточной идентичностью.
Резюме автора: Большинство современных методов анализа пространственной транскриптомики либо игнорируют пространственную структуру, либо не могут отделить пространственные паттерны, обусловленные геном, от различий, вызванных клеточными типами. В данной работе мы разрабатываем метод, который использует пространственные координаты и метки клеточных типов вместе, чтобы лучше выявить паттерны экспрессии генов. Наш подход, масштабируемая много групповая ненегативная пространственная факторизация (smNSF), использует гауссовские процессы для моделирования пространственной структуры, которые мы расширяем, чтобы захватить как пространственную структуру, так и клеточный тип в единой рамке, называемой много групповыми гауссовскими процессами.
Применяя smNSF к наборам данных пространственной транскриптомики из мозга мыши и тканей человека, мы обнаруживаем, что условие на разные клеточные типы выявляет пространственные паттерны, которые невидимы в стандартных анализах: некоторые клеточные типы подавляют паттерн, другие усиливают его, а некоторые раскрывают структуру, которая проявляется только после условия. Это помогает нам понять, как специфические для клеточных типов пространственные программы способствуют организации тканей.
Чтобы сделать этот анализ выполнимым на масштабе современных пространственных экспериментов, мы также вводим новую вычислительную аппроксимацию для гауссовских процессов, которая в принципе может быть прямо применена к другим моделям латентных переменных GP. Вместе эти инструменты помогают разбирать биологические источники вариации и поддерживают in silico исследование того, как может изменяться экспрессия генов при различных композициях тканей или клеточных типов.
Функции внимания позволяют нервной системе регулировать поступающую информацию, выбирая то, что имеет поведенческое значение, и фильтруя отвлекающие факторы. Чтобы исследовать внимательный контроль у крыс, мы разработали парадигму, в которой животным необходимо игнорировать несущественный тактильный стимул (вибрацию) и классифицировать соответствующий как слабый или сильный. Стимулы были разделены по времени, но подавались на один и тот же набор вибрис, что делало эту задачу задачей временного, а не пространственного внимания. В первой версии задания несущественный стимул был представлен первым, а соответствующий - вторым. У различных животных мы наблюдали значительную вариабельность в том, как эта задача усваивалась и выполнялась, что согласуется с новыми работами, показывающими, что обучение происходит по индивидуальным траекториям, а не конвергирует к единственному поведенческому решению. Хотя несущественный стимул обычно оказывал привлекательное влияние на суждения, некоторые крысы постепенно уменьшали это влияние и достигали почти полного подавления, переходя от стадии усовершенствованного до экспертного выполнения. Другие животные, однако, приняли альтернативные стабильные стратегии и не проявили сопоставимого уровня фильтрации внимания.
Чтобы проверить поведенческую гибкость, мы разработали версию задачи, в которой соответствующий стимул мог появляться в любой временной позиции. В этих условиях крысам обычно было сложно гибко распределять внимание во времени, при этом наблюдалась значительная вариабельность между индивидуумами. Важно, что поведенческие анализы указывают на то, что эта вариабельность не случайна, а отражает небольшое число воспроизводимых классов стратегий, характеризуемых различными паттернами чувствительности к порядку стимулов. Эти результаты предполагают, что контроль внимания в данной задаче не зависит от единого канонического алгоритма, а вместо этого возникает из ограниченного набора альтернативных решений.
Электрофизиологические записи у ограниченного числа животных показали нейронные корреляты, соответствующие этим поведенческим различиям. У опытных животных, выполняющих оригинальное задание, нейронные популяции в моторной коре продемонстрировали дифференциальное кодирование несущественных и релевантных стимулов. У успешного животного с имплантами в vS1 и M1/M2 модуляция, зависящая от результата, была выражена в vS1, тогда как M1/M2 преобразовывал сенсорные входы в категориальные представления с частичным подавлением несущественного стимула. Анализ локальных потенциалов поля дополнительно показал, что эффективное выполнение задачи связано с повышенной синхронизацией высокой гамма-частоты между vS1 и M1/M2, наряду с модуляцией низкой бета-частоты, характерной для top-down взаимодействий.
Таким образом, эти результаты предполагают, что обучение игнорированию несущественной информации перестраивает взаимодействия между сенсорными и моторными корковыми структурами, но этот процесс происходит гетерогенно среди индивидуумов. Вместо того чтобы отражать единственный механизм контроля внимания, данные поддерживают концепцию, согласно которой несколько идентифицируемых стратегий сосуществуют внутри общей структуры задачи, подчеркивая важность индивидуальных различий для понимания нейронных основ внимания.
В данной статье рассматривается робастное оптимальное управление в реальном времени для неопределенных нелинейных систем, где линейные временные приближения (LTV) упрощают планирование, но требуют достоверных оценок ошибок линейзации (LEBs) для обеспечения соблюдения устойчивых ограничений. Мы разработали строгие, дифференцируемые оценки ошибок линейзации на GPU для LTV-аппроксимаций нелинейной динамики и динамики нейронных сетей (NN). Для аналитической динамики мы вводим оценки Гессиана на основе пути, которые являются более строгими, чем стандартные интервальные методы. Для динамики NN мы выводим сертифицированные LEB, используя аффинные релаксации, сгенерированные верификатором NN, и локальные коррекции Якобиана. Мы адаптировали парный LTV-составляющий решатель для робастного управления на уровне систем, чтобы он соответствовал этим LEB, расширив его на обработку правообратимых матриц возмущений и нецентрицированных наборов возмущений для строгого зонотопного распространения неопределенности. Наш метод, GPUSLS-LEO, позволяет онлайн-оптимизацию робастных обратных стратегий, учитывающих ошибку линейзации, обеспечивая надежные, формально проверенные достигнутые трубки. На комплексных нелинейных и NN динамиках с размерностями до 168 состояний наш метод может вычислять робастные стратегии управления на GPU со скоростью до 67 Гц, снижая время решения и консервативность по сравнению с базовыми решениями, сохраняя при этом формальные гарантии и производительность в реальном времени.
Задачи комбинаторной оптимизации (ЗКО) сложны, поскольку сертифицируемая дискретная структура порождает экспоненциальный поиск. Необходимо исследовать множество экспоненциально больших кандидатов для сертификации оптимальности; однако структурную состоятельность пути, упаковки или покрытия можно проверить за полиномиальное время, если она уже задана. В этом исследовании мы представляем Ценообразование Нейронных Сертификатов (ЦНС), которое использует эту асимметрию в рамках обучения без учителя. Нейронная сеть обучается предсказывать двойственные цены на уровне сертификата, в то время как структурный слой восстановления строит индуктивные первичные маржи. ЦНС можно рассматривать как амортизированное отделение: вместо перечисления нарушенных неравенств она обучается остаточным ценам, через которые их суммарный эффект входит в восстановление. Когда выполняется условие согласованности сертификата, восстановленная маржа является глобально состоятельной, а локальная теория показывает, что ошибки первого порядка в предсказанной цене вызывают только потери второго порядка в целевой функции. В трех классах ЗКО ЦНС либо значительно превосходит современные нейронные базовые модели, либо сопоставима с ними при меньших вычислительных затратах и показывает более сильную обобщаемость вне распределения.