Компания Huawei Computing объявила о реализации полной согласованности операторов обучения с подкреплением и вывода (RL train-inference consistency) на платформе Ascend. Набор операторов для задач RL разработан на языке программирования Ascend C и проходит тестирование на модели Qwen3-30B MoE. Достигнут нулевой показатель Logdiff, а в eager-режиме зафиксирован прирост производительности от 20 до 60 процентов.
Понятие RL train-inference consistency подразумевает идентичность арифметических результатов, которые формируются на этапе обучения и на этапе инференса при одинаковых входных данных. В контексте обучения с подкреплением с обратной связью от человека (RLHF), широко применяемого для настройки больших языковых моделей, расхождение в вычислениях даже на уровне единичных операций с плавающей запятой способно накапливаться. Это приводит к смещению оценок ценности состояний, искажению вероятностных распределений политики модели и в конечном счёте к нестабильности обучения либо к падению качества финальной модели. Особенно критично несоответствие проявляется в ключевых компонентах RL‑стека: в операторах обобщённой оценки преимущества (Generalized Advantage Estimation, GAE), маскированного softmax, алгоритмах семплирования вроде top‑p и top‑k, а также в процедурах поиска луча (beam search) при генерации ответов политикой.
Инженеры Huawei реализовали согласованность через системные ограничения и выравнивание порядка накопления результатов на нижнем уровне вычислений. Набор операторов, написанный на диалекте C‑подобного языка Ascend C, гарантирует, что при переносе с этапа обучения на этап инференса распределение аккумуляции чисел с плавающей запятой остаётся неизменным. Достижение Logdiff, равного нулю, подтверждает отсутствие логарифмической разницы в выходных сигналах соответствующих узлов графа вычислений. Тестирование проводилось на архитектуре Qwen3-30B MoE — модели со смесью экспертов общим объёмом 30 миллиардов параметров, разработанной Alibaba Cloud. Нулевой Logdiff зафиксирован на полной RL‑конвейерной последовательности, включающей GAE, операции с масками и выборку из распределений.
Переход на детерминированные операторы не только устранил расхождение, но и обеспечил рост быстродействия. В eager-режиме фреймворка, где операции исполняются непосредственно без построения статического графа, прирост составил от 20 до 60 процентов в сравнении с предыдущей реализацией, не гарантировавшей полной согласованности. Ускорение стало возможным за счёт отказа от избыточных синхронизаций, которые обычно требуются для эмуляции детерминизма в динамическом окружении, а также за счёт оптимизации под вычислительные блоки Ascend.
Серия процессоров Ascend, включая ускорители 910B и следующие модификации, использует собственную архитектуру Da Vinci и конкурирует с решениями на базе CUDA. В экосистеме NVIDIA достижение детерминированности при работе с операциями, чувствительными к порядку суммирования, требует активации специальных флагов и часто приводит к падению производительности, поскольку накладывает ограничения на параллелизм и блокирует часть оптимизаций библиотек cuBLAS и cuDNN. Подход, избранный в Ascend C, встраивает детерминизм непосредственно в реализацию операторов, позволяя сохранить побитовую воспроизводимость результатов при переходе от обучения к инференсу без потерь в скорости, а в рассматриваемом случае — с заметным выигрышем.
Для разработчиков, использующих PyTorch и собственные средства адаптации моделей на платформе Ascend, появление готового набора согласованных RL‑операторов упрощает перенос RLHF‑пайплайнов и снижает порог входа для индустриального обучения больших языковых моделей. Возможность опереться на гарантированный Logdiff, равный нулю, позволяет исключить из цикла отладки проверки на расхождение метрик между стадиями тюнинга и развёртывания. Анонсированный комплект операторов расширяет инструментарий, доступный в рамках экосистемы CANN (Compute Architecture for Neural Networks), и закладывает основу для переноса на китайские чипы современных методов посттренировочного улучшения моделей.
1 день назад 7 августа 2026 в 13:30 7507
