Искусственный интеллектarXivScience Morning3 мин чтенияpreprint
Радиальное подавление ускоряет алгоритмическую генерализацию: геометрический анализ задержки генерализации
Radial Suppression Accelerates Algorithmic Generalization: A Geometric Analysis of Delayed Generalization
Карточка статьи
Рубрика
Искусственный интеллект
Источник
arXiv
Дата
30.06.2026
Автор
Science Morning
Время чтения
3 мин
Это предварительная публикация, она не прошла научное рецензирование.
Аннотация
Почему нейронные сети запоминают алгоритмические данные для обучения задолго до того, как начинают обобщать? Мы представляем геометрическое исследование, показывающее, что в задачах, где для общего результата необходимо открыть структурированные низкоразмерные цепи, задержка запоминания-обобщения управляется радиальной инфляцией скрытых представлений при оптимизации кросс-энтропии. Мы формализуем радиально-угловую декомпозицию динамики пространства активаций и выводим три тестируемые гипотезы: (i) что штраф за радиальную инфляцию вызывает анизотропную, зависимую от данных регуляризацию весов; (ii) что это подавляет радиальную градиентную энергию ниже изотропного случайного базиса, заставляя происходить преимущественно угловые обновления; и (iii) что это смещает сходимость к более плоским минимума. Для эмпирической проверки этих предложений мы изучаем норму с одним гиперпараметром, которая мягко ограничивает активации гиперсферы радиусом sqrt(d). При использовании модульной арифметики этот штраф ускоряет усвоение до 6 раз для MLP и Transformer, и сокращает число шагов обучения на половину для nanoGPT с 10 миллионами параметров при решении задачи сложения трехзначных чисел.
Краткое резюме
Исследование рассматривает задержку в работе нейронных сетей между запоминанием алгоритмических данных и их обобщением. Авторы показывают, что радиальная инфляция скрытых представлений тормозит процесс обобщения. Они предлагают подход, ограничивающий активации в пространстве низкого размера, что значительно ускоряет обучение нейронных сетей.
Практический вывод
Исследование демонстрирует, что применение штрафа за радиальную инфляцию активаций может значительно повысить скорость обобщения нейронных сетей.
Ограничения
Это предварительная публикация, она не прошла научное рецензирование. Результаты касаются только нейронных сетей и задач, связанных с модульной арифметикой, что может ограничивать их применимость в других областях.
В данном исследовании рассматривается применение методов глубокого обучения для автоматизации процесса ультразвукового исследования бедер у младенцев. Основное внимание уделяется достижению надежной генерализации модели на различных устройствах и в условиях различных заболеваний, что является критически важным для повышения точности диагностики.
В данной статье рассматривается робастное оптимальное управление в реальном времени для неопределенных нелинейных систем, где линейные временные приближения (LTV) упрощают планирование, но требуют достоверных оценок ошибок линейзации (LEBs) для обеспечения соблюдения устойчивых ограничений. Мы разработали строгие, дифференцируемые оценки ошибок линейзации на GPU для LTV-аппроксимаций нелинейной динамики и динамики нейронных сетей (NN). Для аналитической динамики мы вводим оценки Гессиана на основе пути, которые являются более строгими, чем стандартные интервальные методы. Для динамики NN мы выводим сертифицированные LEB, используя аффинные релаксации, сгенерированные верификатором NN, и локальные коррекции Якобиана. Мы адаптировали парный LTV-составляющий решатель для робастного управления на уровне систем, чтобы он соответствовал этим LEB, расширив его на обработку правообратимых матриц возмущений и нецентрицированных наборов возмущений для строгого зонотопного распространения неопределенности. Наш метод, GPUSLS-LEO, позволяет онлайн-оптимизацию робастных обратных стратегий, учитывающих ошибку линейзации, обеспечивая надежные, формально проверенные достигнутые трубки. На комплексных нелинейных и NN динамиках с размерностями до 168 состояний наш метод может вычислять робастные стратегии управления на GPU со скоростью до 67 Гц, снижая время решения и консервативность по сравнению с базовыми решениями, сохраняя при этом формальные гарантии и производительность в реальном времени.
Понимание речи в шумных условиях сильно зависит от бинауральных подсказок, таких как межушные временные и уровеньные различия (ITDs и ILDs), которые поддерживают пространственное слуховое восприятие и сегрегацию конкурирующих звуковых источников. Когда эти подсказки ухудшаются, слушатели испытывают значительные трудности в сложных акустических условиях.
Поведенческие меры бинауральной выгоды, такие как различия уровней маскировки и различия уровня разборчивости, а также пространственное освобождение от маскировки (SRM), хорошо изучены у слушателей с нормальным слухом (NH), однако они требуют активного поведенческого ответа. Нейронное отслеживание речи с использованием электроэнцефалографии (ЭЭГ) стало многообещающим подходом для количественной оценки нейронной обработки непрерывной речи, однако его чувствительность к пространственным слуховым подсказкам остается недостаточно охарактеризованной.
Мы исследовали нейронные корреляты пространственного освобождения от маскировки у слушателей с нормальным слухом с использованием нейронного отслеживания речи на основе ЭЭГ. Девятнадцать участников слушали непрерывные голландские речевые истории, представлены с маскирующим шумом в двух пространственных конфигурациях: совмещенные (S0N0) и пространственно разделенные (S0N90) при различных соотношениях сигнал-шум (SNR). Нейронное отслеживание огибающей волны речи было количественно оценено с помощью анализа реконструкции огибающей волны и анализа временной реакции (TRF).
Пространственное разделение усилило нейронное отслеживание огибающей волны целевой речи, особенно при сложных соотношениях SNR, где также наблюдалось поведенческое SRM. Анализ TRF дополнительно показал, что увеличились амплитуды и уменьшились задержки поздних корковых компонентов, что соответствует эффектам пространственного раскрепощения.
Эти результаты демонстрируют, что нейронное отслеживание речи фиксирует корковые сигнатуры пространственного раскрепощения и closely отображает поведенческие улучшения в понимании речи. Установление этих взаимосвязей у слушателей с нормальным слухом поддерживает разработку объективных нейронных мер для оценки бинауральной выгоды у трудно тестируемых групп.
Функции внимания позволяют нервной системе регулировать поступающую информацию, выбирая то, что имеет поведенческое значение, и фильтруя отвлекающие факторы. Чтобы исследовать внимательный контроль у крыс, мы разработали парадигму, в которой животным необходимо игнорировать несущественный тактильный стимул (вибрацию) и классифицировать соответствующий как слабый или сильный. Стимулы были разделены по времени, но подавались на один и тот же набор вибрис, что делало эту задачу задачей временного, а не пространственного внимания. В первой версии задания несущественный стимул был представлен первым, а соответствующий - вторым. У различных животных мы наблюдали значительную вариабельность в том, как эта задача усваивалась и выполнялась, что согласуется с новыми работами, показывающими, что обучение происходит по индивидуальным траекториям, а не конвергирует к единственному поведенческому решению. Хотя несущественный стимул обычно оказывал привлекательное влияние на суждения, некоторые крысы постепенно уменьшали это влияние и достигали почти полного подавления, переходя от стадии усовершенствованного до экспертного выполнения. Другие животные, однако, приняли альтернативные стабильные стратегии и не проявили сопоставимого уровня фильтрации внимания.
Чтобы проверить поведенческую гибкость, мы разработали версию задачи, в которой соответствующий стимул мог появляться в любой временной позиции. В этих условиях крысам обычно было сложно гибко распределять внимание во времени, при этом наблюдалась значительная вариабельность между индивидуумами. Важно, что поведенческие анализы указывают на то, что эта вариабельность не случайна, а отражает небольшое число воспроизводимых классов стратегий, характеризуемых различными паттернами чувствительности к порядку стимулов. Эти результаты предполагают, что контроль внимания в данной задаче не зависит от единого канонического алгоритма, а вместо этого возникает из ограниченного набора альтернативных решений.
Электрофизиологические записи у ограниченного числа животных показали нейронные корреляты, соответствующие этим поведенческим различиям. У опытных животных, выполняющих оригинальное задание, нейронные популяции в моторной коре продемонстрировали дифференциальное кодирование несущественных и релевантных стимулов. У успешного животного с имплантами в vS1 и M1/M2 модуляция, зависящая от результата, была выражена в vS1, тогда как M1/M2 преобразовывал сенсорные входы в категориальные представления с частичным подавлением несущественного стимула. Анализ локальных потенциалов поля дополнительно показал, что эффективное выполнение задачи связано с повышенной синхронизацией высокой гамма-частоты между vS1 и M1/M2, наряду с модуляцией низкой бета-частоты, характерной для top-down взаимодействий.
Таким образом, эти результаты предполагают, что обучение игнорированию несущественной информации перестраивает взаимодействия между сенсорными и моторными корковыми структурами, но этот процесс происходит гетерогенно среди индивидуумов. Вместо того чтобы отражать единственный механизм контроля внимания, данные поддерживают концепцию, согласно которой несколько идентифицируемых стратегий сосуществуют внутри общей структуры задачи, подчеркивая важность индивидуальных различий для понимания нейронных основ внимания.
Гипермасштабируемые микросервисные системы стали стандартной инфраструктурой для крупных интернет-компаний. Эти системы состоят из множества слабо связанных микросервисов, которые развиваются независимо через постоянную разработку и развертывание. Такая сложность делает сбои неизбежными, что требует эффективного анализа коренных причин (RCA), чтобы помочь инженерам по надежности сайтов (SRE) быстро локализовать корневые сервисы и классифицировать типы сбоев. Однако существующие методы RCA часто сталкиваются с трудностями в адаптации к экстремальной динамичности и масштабам этих систем. В этой работе мы представляем KRCA, сквозную систему RCA, разработанную для гипермасштабируемых микросервисных систем. Для управления обширным пространством поиска KRCA использует многоступенчатый конвейер, который начинается с досконального анализа на уровне API для изоляции подозрительных сервисов. Затем он создает граф причинно-следственных связей на основе аномальных метрик, чтобы служить высокореколлным структурным приоритетом, прежде чем использовать память-расширенную многоагентную структуру для проверки причинности и генерации окончательного отчета о сбое. Объединив структурированные причинно-следственные ограничения с многоагентным рассуждением, KRCA обеспечивает баланс между диагностической точностью и требованиями к эффективности для использования в реальном времени. Экспериментальные результаты показывают, что KRCA достигает оценок AC@1 0.88 и 0.79 для локализации корневых сервисов и классификации типов сбоев, превосходя самые сильные базовые показатели по крайней мере на 31% в абсолютных приростах. KRCA была внедрена в производственной среде Kuaishou на протяжении более шести месяцев, что позволило сократить среднее время диагностики на 77.3%.
Языковые модели (ЯМ) все чаще используются для генерации идей для исследований, но существующие оценки в основном судят о каждой идее по таким критериям, как новизна, осуществимость или предпочтения экспертов. Вместо этого мы задаем вопрос: насколько далеко находятся текущие идеи, сгенерированные ЯМ, от идей человеческих исследователей? Чтобы охарактеризовать этот разрыв, мы разрабатываем рамки крупномасштабной оценки идей на основе высококачественных научных статей. Для каждой статьи мы проводим обратную разработку небольшого набора тесно связанных предыдущих работ, которые, вероятно, вдохновили ее основную идею. Затем ЯМ получают задание сгенерировать новую идею на основе набора заголовков и аннотаций статей. Мы представляем таксономию вкусов в исследованиях по двум осям, чтобы охарактеризовать каждую идею по ее паттерну возможностей и исследовательской парадигме, и используем ее для количественной оценки различий между человеческими и ЯМ-генерированными идеями. В различных наборах идей, сгенерированных разными ЯМ, мы наблюдаем постоянный распределительный разрыв: идеи ЯМ непропорционально сосредоточены вокруг возможностей синтеза и аналогий, в то время как распределение ссылок на человеческие работы намного шире и охватывает более разнообразные способы формирования разрывов и конструкций вкладов. Этот результат указывает на то, что мощные ЯМ могут производить ряд разумных идей, но этот диапазон остается уже и систематически смещенным по сравнению с исследовательским вкусом человека.