По данным отраслевых источников из цепочки поставок, NVIDIA скорректировала технические характеристики специализированного ускорителя Rubin CPX. Вместо ранее предполагавшейся графической памяти стандарта GDDR7 чип получит 168 ГБ высокоскоростной памяти HBM4. Устройство ориентировано на выполнение этапа префилла (prefill) в конвейере обработки больших языковых моделей и будет развёртываться в составе выделенных стоечных систем.
Архитектура Rubin представляет собой следующее после Blackwell поколение ускорителей NVIDIA для центров обработки данных. В её основе лежит чиплетная компоновка и техпроцесс уровня 3 нм, а Rubin CPX позиционируется как решение, оптимизированное для инференса, а не для тренировки нейросетей. Этап префилла, на котором модель вычисляет ключи и значения для всего входного контекста, предъявляет экстремальные требования к пропускной способности памяти. Отказ от GDDR7 в пользу HBM4 напрямую связан с необходимостью кратного увеличения этого показателя.
GDDR7, применяемая в потребительских видеокартах поколения GeForce RTX 50, на 384-битной шине способна обеспечить поток порядка 1,5–2,0 ТБ/с. Для сравнения, текущий флагманский ускоритель H200 использует 141 ГБ памяти HBM3e с пропускной способностью 4,8 ТБ/с, а B200 располагает 192 ГБ HBM3e и 8 ТБ/с. Ожидается, что HBM4 позволит поднять пропускную способность одного стека до 1,5–2,0 ТБ/с. При конфигурации из восьми стеков, которая может дать суммарный объём 168 ГБ (восемь стеков по 21 ГБ или шесть по 28 ГБ), общая полоса пропускания способна превысить 12 ТБ/с. Такой ресурс критически важен для обработки длинных контекстных окон без деградации задержки на стадии префилла.
Выделенные стойки на базе Rubin CPX указывают на реализацию концепции дезагрегированного инференса. В такой архитектуре пул ускорителей разделяется на два функциональных кластера: один обслуживает ресурсоёмкий префилл, другой — менее требовательный к полосе памяти этап генерации токенов (decode). Это позволяет динамически масштабировать каждый тип нагрузки независимо и повышает общую утилизацию оборудования. Стойки, вероятно, будут включать прямое жидкостное охлаждение и высокоскоростные интерконнекты NVLink следующего поколения для объединения нескольких чипов в единый домен памяти.
Стандарт HBM4, массовое производство которого запланировано на 2025 год, приносит удвоенное число независимых каналов на стек и поддержку логических базовых кристаллов на более совершенных техпроцессах. NVIDIA выступает одним из крупнейших заказчиков этой памяти, а её решение применить HBM4 в продукте, изначально нацеленном на более бюджетный сегмент GDDR7, свидетельствует о переоценке требований рабочих нагрузок. Аналогичный переход от памяти типа GDDR к HBM ранее совершили ускорители AMD Instinct и Intel Gaudi, которые также используют стеки HBM2e и HBM3e для задач искусственного интеллекта.
Корректировка планов по Rubin CPX подчёркивает, что даже специализированные инференс-чипы больше не могут опираться на компромиссные решения по подсистеме памяти при работе с моделями, размер контекста которых измеряется сотнями тысяч токенов. Ожидается, что первые инженерные образцы Rubin CPX появятся в распоряжении ключевых партнёров во второй половине 2025 года, а серийные поставки выделенных стоек начнутся в 2026 году одновременно с развёртыванием платформы Vera Rubin.
2 недели назад 2 сентября 2026 в 16:04 103953
