1 день назад 24 августа 2026 в 10:56 9775

Компания DeepSeek запустила через платформу API модель визуального понимания DeepSeek-V4-Flash-Vision-Exp. Она принимает изображения в форматах JPEG, PNG, GIF и WebP вместе с текстовыми запросами. Разработчики заявляют, что возможности модели в задачах Agent приблизились к показателям лидирующих аналогов.
Новинка продолжает линейку мультимодальных решений компании. В январе 2024 года DeepSeek выпустила версию DeepSeek-VL с семью миллиардами параметров, a в декабре того же года представила DeepSeek-VL2 на архитектуре смеси экспертов с активными 4,5 миллиарда параметров в облегчённом варианте и до 27 миллиардов в более тяжёлых конфигурациях. Параллельно развивалось текстовое семейство V-серии. DeepSeek-V3 от декабря 2024 года насчитывает 671 миллиард параметров при 37 миллиардах активных и опирается на архитектуру MoE с механизмом Multi-head Latent Attention. Релиз V4-Flash-Vision-Exp указывает на появление четвёртого поколения с акцентом на визуальную модальность и низкую задержку. Обозначение Flash традиционно подразумевает уменьшенные время отклика и затраты вычислительных ресурсов, а приставка Exp свидетельствует об экспериментальном статусе поставки.
Модель ориентирована на сценарии, в которых агенту требуется интерпретация экранных интерфейсов, навигация по графическим элементам, анализ скриншотов и выполнение цепочек действий от имени пользователя. Для таких агентных задач критичны не только точность распознавания, но и скорость отклика, поэтому инженеры DeepSeek, вероятно, балансировали между глубиной понимания и вычислительной эффективностью. Официальные бенчмарки компания пока не публикует, но позиционирование «на уровне передовых конкурентов» отсылает к решениям вроде GPT-4o, Gemini 2.0 Flash и Claude 3.5 Sonnet с визуальным входом. Эти модели также стремятся объединить зрение и текст в потоковых агентных фреймворках.
DeepSeek за последний год демонстрирует агрессивное снижение стоимости токенов. Текстовая V3 предлагала около 0,27 доллара за миллион входных токенов, а в периоды льготного доступа цена опускалась ещё ниже. Можно ожидать, что V4-Flash-Vision-Exp продолжит эту политику, делая мультимодальную обработку доступной для массовых интеграций. Для сравнения: у GPT-4o стоимость миллиона входных токенов составляет 2,5 доллара, у Gemini 2.0 Flash при вводе изображений цена зависит от размера и количества кадров, но всё ещё остаётся заметно выше тарифов DeepSeek при текстовых запросах среднего объёма. Конкурентное давление уже вынудило ряд вендоров пересмотреть прайс-листы на лёгкие мультимодальные модели.
Поддерживаемые форматы JPEG, PNG, GIF и WebP закрывают основные типы статичных и анимированных изображений. Модель не принимает на вход видео как отдельную модальность, однако анимации в GIF и WebP позволяют передавать короткие визуальные последовательности. Текстовый контекст, согласно документации DeepSeek к предыдущим версиям, достигает десятков тысяч токенов, что даёт возможность совмещать детальные инструкции с несколькими снимками экрана в одном запросе.
Анонс V4-Flash-Vision-Exp совпадает с расширением API-платформы DeepSeek, которая теперь предоставляет отдельные эндпоинты для мультимодального ввода. Экспериментальный статус предполагает сбор обратной связи, быстрое итерационное обновление и возможное изменение архитектуры перед финальной стабилизацией. Компания традиционно открывает исследовательские наработки, поэтому появление технического отчёта или чекпоинта модели нельзя исключать. Рынок мультимодальных агентов входит в фазу интенсивного соперничества, и выход DeepSeek-V4-Flash-Vision-Exp укрепляет позиции компании в этом сегменте за счёт сочетания низкой стоимости, быстрого отклика и широкого охвата визуальных форматов.

Никто не прокомментировал материал. Есть мысли?