Разработчик Niko1221 представил открытый движок инференса Strata, который позволяет запускать квантованную модель Qwen3.8-Flash-Next со 125 миллиардами параметров на потребительской видеокарте с 12 гигабайтами видеопамяти. По данным публикации, на видеокарте NVIDIA GeForce RTX 5070 скорость генерации токенов достигает 94 единиц в секунду.
Strata использует архитектурную особенность модели класса mixture of experts. Полная квантованная модель размещается в системной оперативной памяти, а в видеопамять загружаются только высокочастотные эксперты, к которым инференс обращается чаще всего. Остальные эксперты подгружаются из оперативной памяти по мере необходимости. Такой подход снижает требования к объёму видеопамяти без разделения модели на несколько GPU. Дополнительно движок применяет спекулятивное декодирование, при котором вспомогательная модель формирует предварительные токены, а основная модель проверяет их пакетно. Это позволяет увеличить пропускную способность даже при обмене данными между системной памятью и графическим процессором.
GeForce RTX 5070 построена на архитектуре NVIDIA Blackwell. Она имеет 6144 ядра CUDA, 12 гигабайт памяти GDDR7, 192-битную шину и пропускную способность памяти 672 гигабайта в секунду. Заявленный показатель мощности составляет 250 ватт. Для стандартного запуска моделей уровня 125 миллиардов параметров в форматах 4 бита обычно требуется значительно больше 12 гигабайт видеопамяти, поэтому такие модели чаще разворачивают на нескольких ускорителях или используют сильное квантование с оффлоадом. Strata смещает нагрузку на оперативную память и выборочно держит в ускорителе только активную часть весов.
Модель Qwen3.8-Flash-Next относится к линейке Qwen. Она использует mixture of experts, поэтому полный объём параметров не означает, что для каждого токена задействуются все 125 миллиардов. Количество активных параметров при обработке одного токена ограничено выбранными экспертами. Это позволяет инференсу хранить общую таблицу параметров в медленной памяти, а быстрый доступ обеспечивается только для активных экспертов.
Техника Strata сравнима с гибридными оффлоад-схемами llama.cpp и Ollama, но отличается акцентом на выборочное кэширование экспертов MoE в видеопамяти. В типичных локальных запусках больших моделей инференс распределяет слои между оперативной памятью и GPU, при этом скорость генерации обычно ограничена пропускной способностью PCIe и оперативной памяти. Результат 94 токенов в секунду на RTX 5070 в однокарточном режиме делает проект заметным для локальных экспериментов с большими MoE-моделями.
Исходный код Strata открыт. Пока не раскрыты точный формат квантования модели, параметры числа экспертов и объём оперативной памяти, который использовали при тесте. ITHome не приводит сведений о задержке первого токена и стабильности скорости при длинной генерации. Тем не менее заявленный подход показывает, что запуск 125-миллиардной MoE-модели на видеокарте с 12 гигабайтами видеопамяти возможен без кластера ускорителей.
