Компания SenseTime опубликовала исходный код и веса предварительной версии мультимодальной модели SenseNova U1.5-Lite-Preview. Релиз размещён на GitHub и Hugging Face под лицензией Apache 2.0. Модель выполнена в масштабе 8B-MoT, нативно поддерживает генерацию изображений с разрешением 4K, обеспечивает повышенную детализацию локальных текстур и улучшенный межъязыковой рендеринг текста.
Архитектура модели базируется на концепции смеси трансформеров (Mixture of Transformers, MoT), что является развитием распространённого подхода Mixture of Experts. По данным опубликованной технической документации, полный объём параметров составляет 8 миллиардов, при этом для обработки каждого токена активируется лишь часть из них — приблизительно 2 миллиарда. Такая схема позволяет сохранить точность генерации и понимания, одновременно снижая требования к вычислительным ресурсам. SenseNova U1.5-Lite-Preview представляет собой унифицированную архитектуру, способную решать задачи как генерации изображений по текстовому описанию, так и мультимодального понимания. Входной контекст поддерживает длину до 32 тысяч токенов.
Генеративная подсистема опирается на диффузионный процесс, интегрированный непосредственно в трансформерный стек без внешних апскейлеров. Это обеспечивает нативное формирование изображений вплоть до 4096 на 4096 пикселей в один проход. Результаты тестов на бенчмарках GenEval и DPG-Bench демонстрируют, что модель сохраняет структурную связность объектов и анатомическую корректность в сложных сценах. Специально доработанный модуль рендеринга текста исправляет традиционную для генеративных систем проблему искажения символов. SenseNova U1.5-Lite-Preview корректно отображает китайские иероглифы, а также латиницу в комбинированных композициях, включая вывески, надписи на одежде и элементы интерфейсов. Улучшенная детализация локальных текстур проявляется в проработке фактур кожи, шерсти животных, тканей и природных ландшафтов.
Для запуска инференса рекомендуется графический ускоритель с объёмом видеопамяти не менее 24 гигабайт, например потребительская NVIDIA GeForce RTX 4090. Разработчики предоставили готовые скрипты, веса в формате safetensors и интеграцию с популярным фреймворком diffusers. В репозитории также выложены скрипты для тонкой настройки с применением LoRA, что открывает возможность адаптации модели под узкие доменные задачи без переобучения всех параметров.
В сравнении с сопоставимыми по вычислительной эффективности открытыми разработками SenseNova U1.5-Lite-Preview показывает конкурентные метрики. Модель опережает MiniCPM-V 2.6 по качеству межъязыкового рендеринга и приближается к проприетарным системам в задачах генерации реалистичных текстур. В то же время она уступает по универсальности старшей версии SenseNova U1.5 и некоторым крупным зарубежным аналогам класса 20B при создании изображений в абстрактных художественных стилях.
Линейка SenseNova ведёт историю с 2023 года и является флагманским семейством фундаментальных моделей SenseTime. Ранние версии фокусировались исключительно на обработке естественного языка. В начале 2024 года было представлено поколение SenseNova 5.0 с мультимодальным пониманием. Архитектура Unified, реализованная в ветке U1, впервые объединила функции генерации и распознавания изображений, видео и текста в рамках одной модели. Текущий релиз SenseNova U1.5-Lite-Preview выступает предварительным срезом более крупной системы и предназначен для исследовательских целей и коммерческих прототипов. Сообщество ожидает, что финальная версия получит расширенную поддержку видеогенерации и управления движением камеры.
2 недели назад 3 августа 2026 в 18:21 21981
