14 часов назад 6 октября 2026 в 10:20 1812

Компания Black Forest Labs официально представила генеративную модель FLUX 3 Image. Разработка ориентирована на создание изображений в разрешении до 4K и предлагает новые инструменты для точного позиционирования объектов и работы с множественными референсами.
Техническая реализация модели опирается на гибридную архитектуру, сочетающую механизмы диффузии и трансформеров. Ключевым нововведением стала встроенная система координатной сетки. Она позволяет задавать пространственные координаты для элементов сцены непосредственно через текстовый промпт или интерфейс, что дает контроль над компоновкой кадра без необходимости грубого инпейнтинга или внешних инструментов структурного контроля наподобие ControlNet. Модель поддерживает одновременную обработку до десяти эталонных изображений для переноса стиля, текстур или сохранения идентичности персонажа. Заявлена пиксельная точность при многопроходном редактировании, когда итеративное изменение одной детали не приводит к деградации или изменению остальных частей изображения.
FLUX 3 Image работает с нативным разрешением 4K, что соответствует сетке 3840×2160 пикселей. Это значительный шаг относительно предыдущего поколения FLUX.1, которое генерировало изображения с максимальным разрешением около 1440p без использования каскадных методов апскейлинга. Переход на высокие разрешения без потери структурной целостности достигается за счет переработанного вариационного автокодировщика и механизмов внимания, оптимизированных для обработки протяженных последовательностей патчей. Такой подход позволяет прорабатывать мелкие детали, включая текстуры кожи, ворс ткани и типографику, непосредственно на этапе генерации, а не в ходе постобработки.
По сравнению с актуальными конкурентами модель занимает нишу профессионального инструмента для препродакшена. Stable Diffusion 3 Medium от Stability AI предлагает разрешение до 2K и фокусируется на фотографическом реализме, используя архитектуру Multimodal Diffusion Transformer. Midjourney V6 демонстрирует высокую эстетику и когерентность сцен, но не предоставляет прямого доступа к координатному позиционированию объектов. DALL-E 3 от OpenAI решает задачу точного следования промпту, однако ограничен разрешением 1792×1024 и не имеет встроенных средств для загрузки множественных референсов. Таким образом, FLUX 3 Image предлагает комбинацию высокого разрешения и структурного контроля, которая ранее была распределена между разными платформами.
История Black Forest Labs связана с командой исследователей, стоявших за созданием технологии стабильной диффузии. После ухода из Stability AI в 2024 году группа инженеров основала новую студию и выпустила семейство FLUX.1, быстро занявшее заметные позиции в рейтингах бенчмарков по качеству генерации. Релиз третьего поколения демонстрирует эволюцию от универсальной генерации к решению узких производственных задач, где критически важны точность и повторяемость результата.
Модель доступна через API и облачный интерфейс компании. Для работы с нативным 4K-разрешением требуется значительный объем видеопамяти, что пока ограничивает локальное развертывание на потребительских видеокартах без применения техник квантизации и оффлоадинга. Разработчики не раскрыли точное количество параметров модели, но, согласно косвенным данным из репозиториев, архитектура включает несколько десятков миллиардов обучаемых весов. Обучающая выборка охватывает синтетические данные, высококачественные фотографии и отсканированные произведения искусства, прошедшие процедуру очистки от дубликатов и артефактов сжатия.

Никто не прокомментировал материал. Есть мысли?