Искусственный интеллектarXivScience Morning3 мин чтенияpreprint

Diffusion-GR2: Рекурсивный перестановщик генеративного вывода с диффузией

Diffusion-GR2: Diffusion Generative Reasoning Re-ranker

Рубрика
Искусственный интеллект
Источник
arXiv
Дата
01.07.2026
Автор
Science Morning
Время чтения
3 мин

Это предварительная публикация, она не прошла научное рецензирование.

Искусственный интеллект

Аннотация

Генеративные рекурсивные перестановщики достигают высокой точности рекомендаций, испуская последовательность рассуждений перед перестановкой списка кандидатов, но они медленны при выводе: авторегрессионный (AR) декодер выполняет один последовательный проход для каждого токена рассуждения, а след рассуждения значительно превышает ту выборку, которую он производит. Для снижения этой стоимости языковые модели с блочной диффузией декодируют многие позиции параллельно на протяжении нескольких этапов денойзинга и работают существенно быстрее, однако наивное преобразование AR-рекурсивного перестановщика в блочный открывает два пробела в точности: (1) структурная разница: позиции ответов денойзятся параллельно и оцениваются независимо, в результате чего декодер выдает недействительные ранжирования (дубликаты, упущенные или вышедшие за пределы идентификаторы), которых AR избегает с помощью маскирования слева направо; (2) распределительная разница: тонкая настройка преобразованной модели по фиксированным траекториям учителя является внеполитической относительно собственного декодирования при выводе, оставляя остаточный пробел в точности. Чтобы устранить оба пробела, сохраняя ускорение, мы предлагаем \textbf{Diffusion-GR2}, метод, который преобразует наш AR-рекурсивный перестановщик (GR2) в блочный рекурсивный перестановщик с диффузией. Сначала тонкая настройка преобразования (CFT) адаптирует AR-инициализированную модель диффузии для денойзинга ответа в допустимую перестановку самостоятельно, без внешнего ограниченного декодера. Затем дистилляция на политике (OPD) контролирует модель по собственным декодированным траекториям с плотными целями на уровне токенов от AR-учителя. Наконец, мы применяем этап обучения с подкреплением (RL) в соответствии с вознаграждением за повторное ранжирование на основе политики OPD. Эксперименты на Amazon Beauty демонстрируют, что Diffusion-GR2 восстанавливается до близкого уровня с AR-рекурсивным перестановщиком, в то время как блочно-параллельное декодирование увеличивает объем вывода в $2.4$--$3.5\times$ при длине вывода модели рассуждения. Абляции показывают, что CFT восстанавливает большую часть пробела преобразования, и что дистилляция на политике дополнительно сокращает его до AR-референса.

Краткое резюме

Diffusion-GR2 - это новый подход к переработке генеративных рекурсивных перестановщиков, который использует блочную диффузию для повышения скорости вывода и улучшения точности. Испытывая на данных Amazon Beauty, модель показала близкие результаты к традиционным методам при значительном ускорении процесса.

Практический вывод

Метод Diffusion-GR2 позволяет существенно ускорить процессы ранжирования, сохраняя при этом высокую точность рекомендаций, что может быть полезно в задачах, требующих быстрого анализа данных.

Ограничения

Это предварительная публикация, она не прошла научное рецензирование. Исследование может иметь ограничения, связанные с общими результатами на ограниченных данных и потенциальной невозможностью обобщения модели на другие домены или типы данных.

Похожие исследования

Подборка учитывает рубрику, ключевые слова, аннотацию, резюме, практические выводы и источник.

Искусственный интеллект
Искусственный интеллект
72%

Теория: Проверка приемлемости переработанных выводов на основе неформальных рассуждений

Когда можно доверять ответу системы ИИ? Формальные помощники в доказательствах предлагают определенность, но не могут охватить большинство распределений задач; линейные LLM-судьи обеспечивают покрытие, но выдают непрозрачные оценки, которые не могут быть проверены после факта и подвержены тем же проблемам согласованности, что и любые LLM. Мы представляем Теорию — архитектуру верификации, которая заполняет этот пробел. Кандидатское решение переписывается в последовательность типизированных переходов состояний, каждый из которых оправдан явным обоснованием — будь то цитата, вычисление или заданный факт, и каждый переход может быть проверен независимо. Основное инвариантное требование состоит в полноте изменений: каждое отличие между последовательными состояниями доказательства должно быть учтено, чтобы скрытые предпосылки обнажались как несанкционированные мутации, а не проходили молча. На HLE-Verified Gold (185 задач для экспертов только с текстом) Теория сертифицирует 105 задач с 91.4% строгой точностью (доверительный интервал Уилсона 95% [84.5%, 95.4%]). Каждая сертификация приводит к читабельному следу доказательства, в котором каждый шаг может быть оспорен независимо. Холистические LLM-судьи достигают сопоставимой точности при аналогичном покрытии, но не справляются с разными задачами (Jaccard 0.14-0.36), что делает эти подходы дополнителями. Из 95 атакованных поврежденных доказательств в 15 областях структурированные судьи находят 94.7%, по сравнению с 83.2% для холистического судейства (p= 0.0017). В целом 11.5 процентных пункта разница сосредоточена на скрытых предпосылках (90.6% против 62.5%, разница в 28 процентных пунктов) и сфабрикованных цитатах (100% против 90%), что является классами ошибок, где формальный анализ предсказывает преимущество; производительность идентична в случаях арифметических и ошибочных применений теорем, где преимущество не предсказывается. На GPQA Diamond (n= 65) сертифицированная точность составила 97.1% (доверительный интервал Уилсона [85.1%, 99.5%]).

Искусственный интеллект
Искусственный интеллект
72%

Мир в движении: Генеративная динамическая гауссовская реконструкция из монокулярного видео

Мы представляем метод «Мир в движении», который позволяет создавать динамические 3D гауссовские представления из монокулярных видео, пригодные для произвольного рендеринга. Наш подход основывается на условной модели видео, которая использует плотные, пиксельно согласованные рендеры, кодирующие внешний вид, геометрию и движение 3D-сцены вдоль траекторий ввода и целевой камеры, чтобы исправить артефакты рендеринга и заполнить отсутствующие области исходной реконструкции. Для обучения этой модели мы создали набор данных, состоящий из выровненных пар многовидовых видео и динамических 3D гауссовских представлений, с имитированными артефактами, характерными для монокулярной реконструкции. На этапе тестирования мы извлекаем генерации модели, включая вновь наблюдаемые области и движения, обратно в единое согласованное, высококачественное динамическое 3D гауссовское представление, что улучшает как синтез новых видов, так и основное 3D движение. Наш метод устанавливает новый эталон в 4D реконструкции и беспесдно обобщается на видео с больших изменений ракурсов и динамическими движениями.

Искусственный интеллект
Искусственный интеллект
72%

Обучение с учетом принятия решений для генеративных моделей на основе выборок

Генеративные модели на основе выборок все чаще используются для вероятностного прогнозирования в условиях высоких ставок, однако их цели обучения не обращают внимания на структуру затрат принятием решений. Обычно эти модели обучают с использованием строго корректных оценивательных правил, таких как энергетический рейтинг, которые распределяют сигнал обучения пропорционально плотности данных, не учитывая, где ошибки прогнозов наиболее затратны для последующих решений. Поэтому мы предлагаем обучение с учетом принятия решений для генеративных моделей на основе выборок, дополняя цель энергетического рейтинга дифференцируемой функцией потерь, которая непосредственно штрафует за затраты, понесенные при принятии решения на основе прогноза модели. Эта комбинированная функция потерь имеет теоретическую основу, поскольку функция потерь по решению сама по себе является корректным оценивательным правилом. Мы проверяем наш метод на одной синтетической и двух реальных задачах, демонстрируя целевые улучшения в чувствительных к затратам областях, при этом сохраняя полные вероятностные прогнозы.

Искусственный интеллект
Искусственный интеллект
67%

FurnitureVLA: Обучение долгосрочной бимануальной сборке мебели с помощью модели видение-язык-действие

Текущие исследования в области роботизированной сборки мебели в основном сосредоточены на игрушечных масштабах или манипуляциях с одной рукой. Мы представляем FurnitureVLA, первое систематическое исследование бимануальной сборки мебели в реальном масштабе с использованием моделей видения-языка-действия (VLA). Мы формализуем задачу, разрабатываем масштабируемый симуляционный конвейер для генерации и оценки экспертных данных и создаем систему телеприсутствия в виртуальной реальности для управления бимануально одним оператором с целью сбора качественных демонстраций из реального мира. Чтобы справиться с экстремально долгосрочной сборкой, которая включает до 7 подсостояний и 1550 контрольных шагов, мы предлагаем улучшенную модель VLA, донастроенную на семантически обоснованные подсостояния, которая совместно предсказывает действия и непрерывный сигнал прогресса, позволяя автоматически переходить между подсостояниями и снижая накопление ошибок во время вывода. Мы также исследуем факторы проектирования восприятия и управления, которые критически влияют на точность в сборке в реальном масштабе. FurnitureVLA улучшает средний уровень успеха симуляции с 48% до 80% по сравнению с базовыми показателями для трех типов мебели, с дополнительным приростом в 21% благодаря изучению факторов проектирования. Мы валидируем на реальной платформе Kinova Gen3 с только 16% снижением на наиболее сложной задаче.

Искусственный интеллект
Искусственный интеллект
67%

QuasiMoTTo: Масштабирование тестового времени с использованием квази-Монте-Карло

Масштабирование вычислений при выводе, генерируя множество параллельных попыток для каждой задачи, является дорогостоящим, но надежным способом повышения возможностей языковой модели. По умолчанию эти попытки генерируются независимо, что приводит к бесполезным затратам на дублирующие решения. Эти потери кажутся неизбежными, ведь независимость делает параллельную выборку тривиальной для масштабирования. Однако этот компромисс не является фундаментальным: существует богатое пространство дизайна выборщиков, которые генерируют скоррелированные, но точные выборки целиком параллельно. Мы исследуем это пространство дизайна как способ повышения эффективности выборок при масштабировании вычислений и в обучении с подкреплением. Конкретно, мы представляем QuasiMoTTo, который использует скоррелированные выборки в качестве замены выборкам, которые являются независимыми и одинаково распределёнными. Для генерации этих выборок QuasiMoTTo использует репараметризацию авторегрессивной выборки в качестве выборки из обратной функции распределения и извлекает основные равномерные распределения с помощью квази-Монте-Карло; поскольку квази-Монте-Карло распределяет равномерные значения более равномерно, чем независимые и одинаково распределённые, полученные выборки охватывают пространство вывода с гораздо меньшими избыточностями. Даже несмотря на то, что пакет скоррелирован, каждая выборка распределена по краевой модели, поэтому мы можем использовать пакет для обучения с использованием градиентов стратегии. Наш эмпирический анализ сосредоточен на том, насколько эффективно QuasiMoTTo может преобразовывать вычисления в производительность. Чтобы оценить скоррелированные выборщики, зависимость которых нарушает стандартные оценки, мы сначала разрабатываем необbiased.bootstrap-оценщик. На четырех бенчмарках рассуждений QuasiMoTTo достигает точности i.i.d. в pass@k с 25-47% меньшим числом выборок. Удивительно, что QuasiMoTTo часто достигает верхней границы по pass@k, которая актуальна для любого сохранения маргинального распределения выборщика. Мы также применяем QuasiMoTTo к RL на основе градиентов стратегии, где он соответствует производительности i.i.d. при 50% меньшем числе шагов обучения. Эти преимущества связаны с более высоким охватом, что приводит к более сильному сигналу обучения на пакет.

Искусственный интеллект
Искусственный интеллект
62%

Адаптивное многоуровневое графовое представление с оптимизационно-ориентированным вниманием для надежной ассоциации ячеек в сетях V2X 5G.

Эффективная ассоциация ячеек остается фундаментальной задачей в системах пятого поколения (5G) «автомобиль-все» (V2X) из-за быстрых изменений топологии, гетерогенных развертываний и строгих требований к задержке. Конвенциональные подходы на основе обучения часто опираются на мелкие представления или независимые стратегии оптимизации, что ограничивает их адаптивность в густых и быстро меняющихся условиях. В данной работе предлагается структура многоуровневого графового представления, которая моделирует взаимодействия между автомобилями и базовыми станциями в иерархических пространственных структурах. Предложенный подход интегрирует контекстное встраивание узлов с графовым обучением, основанным на внимании, для выявления паттернов мобильности, характеристик сигналов и зависимостей нагрузки сети. Кроме того, в механизм обучения на стадии подготовки включен оптимизационный механизм для уточнения параметров внимания, что улучшает сходимость без увеличения сложности вывода. Структура была оценена на реальном наборе данных мобильности автомобилей, что продемонстрировало постоянные улучшения в стабильности ассоциации, надежности переключения и общей производительности сети по сравнению с существующими методами глубокого обучения и графами. Экспериментальные результаты показывают приросты точности (94,17%) и F1-меры (93,93%), что указывает на повышение устойчивости решений в динамических условиях. Хотя валидация проводилась на городском наборе данных, предложенная архитектура обеспечивает масштабируемую основу для адаптивного выбора ячеек в системах интеллектуального транспорта следующего поколения.