Искусственный интеллектarXivScience Morning3 мин чтенияpreprint

Случайная перестановка преобладает в стохастическом градиентном спуске

Random Reshuffling Dominates Stochastic Gradient Descent

Рубрика
Искусственный интеллект
Источник
arXiv
Дата
30.06.2026
Автор
Science Morning
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Искусственный интеллект

Краткое резюме

В данной работе рассматривается случайная перестановка как стратегия в стохастическом градиентном спуске, которая доказала свою эффективность в гладкой выпуклой оптимизации. Исследование показывает, что даже при любых разумных размерах шага и конечном числе эпох RR превосходит традиционный SGD, что подтверждает ее практическую ценность и решает вопросы, оставшиеся без ответа в предыдущих исследованиях.

Практический вывод

Случайная перестановка (RR) в стохастическом градиентном спуске может обеспечить превосходные результаты в гладкой выпуклой оптимизации, даже когда применяются разумные размеры шага, что делает ее более предпочтительным методом по сравнению с традиционным SGD.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. Исследование ограничено гладкой выпуклой оптимизацией и может не охватывать другие типы оптимизационных задач, что требует дальнейших исследований для проверки полученных результатов в других условиях.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Искусственный интеллект
Искусственный интеллект
67%

Датчики тактильной чувствительности из волокон на основе жидкого металла с двойным механизмом усиления градиентной пористости и межфазной поляризации для текстильно-интегрированного взаимодействия человека и машины.

Гибкие волоконные ёмкостные тактильные датчики представляют собой обещающее решение для носимого взаимодействия человека и машины. Однако достижение баланса между чувствительностью и надежностью при сохранении мягкости текстиля остается сложной задачей. Для смягчения этого компромисса был разработан ёмкостный тактильный волокно, основанное на двойном механизме усиления градиентно-пористой компрессии и межфазной поляризации Максвелла-Вагнера. Волокно с радиальной градиентной пористой архитектурой, включающее в себя проводящее ядро из жидкого металла (LM)/термопластичного полиуретана (TPU) и диэлектрическую оболочку из диоксида титана (TiO)/TPU, было изготовлено методом коаксиального мокрого прядения через фазовое разделение, вызванное несолюбимым растворителем. На поверхность волокна затем была добавлена сеть углеродных нанотрубок/оксидов графена (CNT/GO) для повышения эффективной диэлектрической проницаемости за счет накопления межфазного заряда. Достигнута чувствительность 18,32 кПа, время отклика 170 мс, гистерезисная ошибка 4,47% и стабильное сохранение сигнала более 1000 циклов. Была построена беспроводная тактильная платформа из текстиля, которая постепенно проходила валидацию от временного нажатия мыши до мониторинга почти статичной позы сидя (точность распознавания 99,6%), а также до текстильной клавиатуры на 64 клавиши, где перекрестная помеха сигнала была эффективно декомпозирована с помощью топологического дизайна ткани и алгоритма одномерной свёрточной нейронной сети, что обеспечивало точность распознавания символов 96,36% и позволяло проводить осознанное взаимодействие с генеративным искусственным интеллектом через интеграцию с крупной языковой моделью. Эта работа демонстрирует значительный потенциал волоконных тактильных датчиков для сложных многосценарных взаимодействий человека и машины и предоставляет новую информацию для разработки платформ для взаимодействия с текстилем следующего поколения.

Искусственный интеллект
Искусственный интеллект
62%

Идентификация и ранжирование предикторов смертности после операции по поводу перелома бедра на основе машинного обучения: анализ регистра переломов бедра Австралии и Новой Зеландии.

Переломы бедра являются серьезной глобальной проблемой здравоохранения с высокой смертностью и заболеваемостью, особенно среди пожилых людей. Смертность в течение года после операции варьирует от 22% до 36%, при этом многие пациенты никогда не восстанавливают исходный уровень подвижности. Хотя определены несколько предикторов смертности, их относительное значение для риска смертности в единой модели прогнозирования выживания остается неясным. Это исследование использовало машинное обучение для ранжирования ключевых пероперативных предикторов смертности после операции по поводу перелома бедра. Были проанализированы данные более чем 11 000 пациентов из регистра переломов бедра Австралии и Новой Зеландии. Оценивались двадцать демографических, клинических и пероперативных переменных с использованием модели Random Survival Forest (RSF). Эффективность модели была оценена с помощью индекса согласия и оценок Брайера. Важность признаков на основе перестановок определила предикторы в соответствии с их вкладом в прогнозирование риска смертности. В течение периода наблюдения (медиана 630 дней) 31% пациентов скончались. Модель RSF продемонстрировала хорошую эффективность (индекс C на тесте: 0.7305). Четыре наиболее важных предиктора смертности включали степень по классификации Американского общества анестезиологов (ASA) (вес: 0.051), наличие ранее существовавшей деменции (0.036), возраст (0.019) и способность передвигаться до госпитализации (0.016). Другие факторы, такие как мужской пол (0.009) и осталась госпитализация (0.006), имели более слабые связи с предсказанием смертности в этой модели. Машинное обучение идентифицировало степень ASA, деменцию, возраст и подвижность как основные предикторы смертности после операции по поводу перелома бедра. Моделирование RSF продемонстрировало высокую эффективность и лучшую интерпретируемость по сравнению с традиционными методами. Эти результаты поддерживают индивидуализированную стратификацию для информирования пероперативных обсуждений и планирования целей ухода в этой группе с высоким риском.

Искусственный интеллект
Искусственный интеллект
62%

Оценка нейронной настройки для значения слов на основе пассивно записанной естественной речи

Способность разрабатывать модели языкового кодирования на нейронном уровне имеет огромный научный и клинический потенциал. Текущие подходы ограничены масштабом и этологической валидностью входных данных; приложения, требующие больших, редких или естественных образцов, в частности, выиграли бы от возможности выводить нейронное кодирование из случайной повседневной речи. В данной работе мы представляем новый конвейер, разработанный для использования спонтанной и случайной естественной речи. Этот конвейер выполняет транскрипцию, сегментацию и диаризацию с помощью видео, а также выравнивание и обнаружение спайков нейронных данных. Мы применяем этот конвейер к набору данных, полученному от 21 пациента (по 6+ дней на каждого, более 800 часов и в общей сложности 5 миллионов слов). Мы тестировали как модели кодирования, так и декодирования на обширных и редких контрольных наборах данных с истинными значениями, состоящих из временного выравнивания на уровне слов, отобранного человеком, и вручную отсортированных спайков. Мы дополнительно проверяем наш подход, количественно оценивая представительное дрейфование, эффект размера набора данных и различия между шестю областями мозга. В совокупности эти результаты демонстрируют, что случайная естественная речь достаточно обрабатывается в мозге, чтобы дать возможность оценить нейронные уровневые эмбеддинги.

Искусственный интеллект
Искусственный интеллект
56%

KRCA: Эффективная система анализа коренных причин в гипермасштабируемых микросервисных системах с использованием агентного ИИ

Гипермасштабируемые микросервисные системы стали стандартной инфраструктурой для крупных интернет-компаний. Эти системы состоят из множества слабо связанных микросервисов, которые развиваются независимо через постоянную разработку и развертывание. Такая сложность делает сбои неизбежными, что требует эффективного анализа коренных причин (RCA), чтобы помочь инженерам по надежности сайтов (SRE) быстро локализовать корневые сервисы и классифицировать типы сбоев. Однако существующие методы RCA часто сталкиваются с трудностями в адаптации к экстремальной динамичности и масштабам этих систем. В этой работе мы представляем KRCA, сквозную систему RCA, разработанную для гипермасштабируемых микросервисных систем. Для управления обширным пространством поиска KRCA использует многоступенчатый конвейер, который начинается с досконального анализа на уровне API для изоляции подозрительных сервисов. Затем он создает граф причинно-следственных связей на основе аномальных метрик, чтобы служить высокореколлным структурным приоритетом, прежде чем использовать память-расширенную многоагентную структуру для проверки причинности и генерации окончательного отчета о сбое. Объединив структурированные причинно-следственные ограничения с многоагентным рассуждением, KRCA обеспечивает баланс между диагностической точностью и требованиями к эффективности для использования в реальном времени. Экспериментальные результаты показывают, что KRCA достигает оценок AC@1 0.88 и 0.79 для локализации корневых сервисов и классификации типов сбоев, превосходя самые сильные базовые показатели по крайней мере на 31% в абсолютных приростах. KRCA была внедрена в производственной среде Kuaishou на протяжении более шести месяцев, что позволило сократить среднее время диагностики на 77.3%.

Искусственный интеллект
Искусственный интеллект
56%

Измерение разрыва между идеями исследований человека и языковых моделей

Языковые модели (ЯМ) все чаще используются для генерации идей для исследований, но существующие оценки в основном судят о каждой идее по таким критериям, как новизна, осуществимость или предпочтения экспертов. Вместо этого мы задаем вопрос: насколько далеко находятся текущие идеи, сгенерированные ЯМ, от идей человеческих исследователей? Чтобы охарактеризовать этот разрыв, мы разрабатываем рамки крупномасштабной оценки идей на основе высококачественных научных статей. Для каждой статьи мы проводим обратную разработку небольшого набора тесно связанных предыдущих работ, которые, вероятно, вдохновили ее основную идею. Затем ЯМ получают задание сгенерировать новую идею на основе набора заголовков и аннотаций статей. Мы представляем таксономию вкусов в исследованиях по двум осям, чтобы охарактеризовать каждую идею по ее паттерну возможностей и исследовательской парадигме, и используем ее для количественной оценки различий между человеческими и ЯМ-генерированными идеями. В различных наборах идей, сгенерированных разными ЯМ, мы наблюдаем постоянный распределительный разрыв: идеи ЯМ непропорционально сосредоточены вокруг возможностей синтеза и аналогий, в то время как распределение ссылок на человеческие работы намного шире и охватывает более разнообразные способы формирования разрывов и конструкций вкладов. Этот результат указывает на то, что мощные ЯМ могут производить ряд разумных идей, но этот диапазон остается уже и систематически смещенным по сравнению с исследовательским вкусом человека.

Искусственный интеллект
Искусственный интеллект
56%

Хватает ли одного слоя? Обучение одного слоя трансформера может сопоставиться с полным обучением с подкреплением

Обучение с подкреплением (RL) стало центральным компонентом постобучения крупных языковых моделей (LLMs), однако мало что известно о том, как адаптация RL распределена по слоям трансформера. Существующие подходы обычно обновляют все параметры модели равномерно, подразумевая, что каждый слой вносит схожий вклад в приросты, достигнутые в процессе постобучения с использованием RL. В данной работе мы ставим под сомнение это предположение через систематическое изучение обучения RL по слоям. Удивительно, но мы обнаружили, что обучение одного слоя трансформера может воспроизвести большую часть приростов, достигнутых при полном обучении с RL, а в некоторых случаях даже превзойти его. Чтобы количественно оценить это явление, мы вводим величину "вклад слоя", которая измеряет долю полного улучшения RL, достигнутого благодаря обучению слоя в изоляции. В рамках семи моделей, охватывающих две семейства моделей (Qwen3, Qwen2.5), три алгоритма RL (GRPO, GiGPO, Dr. GRPO) и несколько областей задач, включая математическое рассуждение, генерацию кода и агентное принятие решений, мы наблюдаем замечательно стабильный паттерн: приросты RL сосредоточены в небольшом подмножестве, а в большинстве случаев даже в одном слое трансформера. Более того, тот же структурный паттерн последовательно возникает: слои с высоким вкладом сосредоточены в середине стека трансформера, тогда как слои ближе к входу и выходу вносят значительно меньший вклад. Ранжирование слоев при этом остается сильно коррелированным между датасетами, задачами, семействами моделей и алгоритмами RL.