Исследователи из НИУ ВШЭ и московского университета МИСиС разработали новую методику обобщения видеоконтента с помощью нейронных сетей. Их метод направлен на автоматическое определение и извлечение наиболее важных элементов из длинных видеозаписей.
Потребление видео в интернете с каждым годом значительно увеличивается. Согласно статистике, к 2022 году видеоформаты будут составлять более 80 % всего онлайн-трафика. Поскольку видео загружается все больше, необходимы инструменты для эффективного анализа этих неструктурированных данных.
Разработанная исследователями технология использует архитектуру нейронной сети с механизмом внимания для одновременной обработки входных кадров во времени. Она включает позиционное кодирование для сохранения информации о порядке следования. Это помогает улучшить обобщение обученной модели на новые наборы данных.
Подход определяет значимые фрагменты видео и сшивает их вместе в хронологической последовательности для создания компактного ролика. Это позволяет сохранить основные элементы и значительно сократить общую продолжительность воспроизведения.
Оценка на эталонных данных показала, что новая модель обобщения показала конкурентоспособную производительность по сравнению с существующими методами. Она также превзошла некоторые альтернативные подходы. Исследователи считают, что эта работа может способствовать более быстрому анализу видеоконтента в различных областях, таких как наблюдение, образование и спорт.
Исследование проводилось в рамках проекта «Технологии цифровой трансформации» по программе Министерства образования и науки РФ «Национальное развитие до 2030 года». Полученные результаты открывают возможности для эффективного доступа к большему количеству видеоданных.
