Відстеження облич за допомогою AI та розумне перекадрування для конвертації відео у вертикальний формат
Платформі для перепрофілювання контенту потрібно було автоматично конвертувати горизонтальні (16:9) довгі відео у вертикальні (9:16) короткі кліпи, зберігаючи спікерів та об'єкти ідеально центрованими — без ручного обрізання чи ключових кадрів.
Обговоріть Ваш ПроєктВиклик
Перетворення горизонтального відео у вертикальний формат було одним з найвиснажливіших етапів у виробництві короткого контенту:
- Ручне обрізання та перепозиціонування кадру для кожного кліпу займало багато часу
- Розмови за участю кількох осіб вимагали динамічного перекадрування при зміні спікерів
- Статичне центральне кадрування обрізало спікерів, які рухалися або сиділи не по центру
- Традиційні методи виявлення облич були занадто повільними для прийняття рішень щодо перекадрування в реальному часі для тисяч кліпів
- Різні типи контенту (інтерв'ю, сольні влоги, презентації) вимагали різних стратегій кадрування
Наше Рішення
Ми створили систему відстеження облич за допомогою AI та розумного перекадрування, яка виявляє обличчя у відеокадрах, відстежує їх рух та динамічно регулює область вертикального кадрування, щоб тримати активний об'єкт у центрі.
Архітектура
- Виявлення облич (Face Detection): Модель виявлення облич на основі YOLO, оптимізована для швидкості
- Відстеження облич (Face Tracking): Покадрове відстеження на основі IoU зі стійкими ідентифікаторами суб'єктів
- Двигун перекадрування (Reframing Engine): Динамічний розрахунок області кадрування на основі позицій та руху облич
- Зв'язування з активним спікером (Active Speaker Coupling): Інтеграція з виявленням спікерів для пріоритизації особи, яка говорить
- Рендеринг (Rendering): Ланцюжок фільтрів кадрування FFmpeg з плавними переходами панорамування
Конвеєр перекадрування
- Виявлення облич (Face Detection) – Запуск виявлення облич за допомогою YOLO по вибраних кадрах
- Відстеження об'єктів (Subject Tracking) – Зв'язування виявлених облич між кадрами за допомогою відстеження на основі IoU
- Пріоритет спікера (Speaker Priority) – При поєднанні з виявленням активного спікера, пріоритизація особи, яка говорить
- Розрахунок кадрування (Crop Calculation) – Визначення оптимальної області кадрування 9:16 на основі позиції основного об'єкта
- Згладжування (Smoothing) – Застосування згладжування до руху кадру, щоб уникнути різких стрибків
- Рендеринг (Rendering) – FFmpeg застосовує динамічне кадрування з плавними переходами панорамування
Ключові особливості
- Обробка кількох об'єктів (Multi-Subject Handling) – Відстежує кілька облич та визначає основний об'єкт для кожного сегмента
- Кадрування з урахуванням спікера (Speaker-Aware Framing) – Пріоритизує активного спікера при інтеграції з виявленням спікера
- Плавні переходи (Smooth Transitions) – Згладжене панорамування між об'єктами усуває різкі обрізки
- Адаптація до типу контенту (Content-Type Adaptation) – Різні стратегії кадрування для сольного, інтерв'ю та групового контенту
- Пакетна обробка (Batch Processing) – Перекадровує сотні кліпів з одного довгого відео
- Без ручного втручання (No Manual Intervention) – Повністю автоматизовано від виявлення до остаточного рендерингу
Результати
Технологічний Стек
caseStudyDetail.more Кейси
Ознайомтесь з іншими нашими технічними впровадженнями
Кросплатформне планування публікацій у соціальних мережах та аналітика продуктивності
Творцям контенту, які щотижня створюють десятки коротких відеороликів, потрібна була єдина система планування та аналітики для розповсюдження контенту в TikTok, YouTube Shorts та Instagram Reels з єдиної панелі керування — з аналітичними даними для оптимізації стратегії публікацій.
Багатомовний переклад субтитрів для глобального розповсюдження контенту
Творці контенту з міжнародною аудиторією потребували розширення охоплення шляхом перекладу відеосубтитрів на понад 30 мов, зберігаючи при цьому оригінальний звук, що дозволяє глядачам по всьому світу споживати контент рідною мовою.
Часті запитання
MicrocosmWorks реалізувала гібридний підхід до відстеження, який поєднує легкий детектор облич, що працює кожні 5 кадрів, з трекером оптичного потоку KCF для міжкадрових передбачень. Коли виявляється оклюзія через падіння показників довіри, система підтримує останню відому траєкторію за допомогою фільтрації Калмана та повторно захоплює обличчя протягом 200 мс після того, як воно знову стає видимим.
MicrocosmWorks розробила алгоритм обрізки з урахуванням помітності, який пріоритизує виявлені обличчя, потім текстові області, потім зони руху при визначенні положення вікна обрізки 9:16. Для сцен з кількома особами система використовує налаштовуваний рейтинг пріоритетів, за замовчуванням вибираючи активного доповідача або найбільше обличчя, з плавною інтерполяцією між позиціями обрізки, щоб уникнути різких зсувів.
Так, MicrocosmWorks реалізувала резервний режим виявлення значущості, який активується, коли облич немає, використовуючи комбінацію виявлення руху, моделювання візуальної уваги та відстеження курсора миші для записів екрану. Система інтелектуально відстежує найбільш релевантну область вмісту навіть у виключно візуальних або текстових матеріалах.
MicrocosmWorks оптимізувала конвеєр для пакетних робочих процесів, досягнувши 8-кратної швидкості обробки в реальному часі на одному NVIDIA T4 GPU, що означає, що 10-хвилинне відео перекадровується приблизно за 75 секунд. Система підтримує паралельну обробку на кількох GPU, масштабуючись лінійно для операцій з великим обсягом контенту.
MicrocosmWorks розробляє системи перекадрування відео на основі AI за ціною $25-$45 за годину, при цьому повне рішення для відстеження обличчя та інтелектуального перекадрування, що включає оптимізацію моделі, підтримку пакетної обробки та інтеграцію API, зазвичай потребує 350-550 годин розробки. Ця інвестиція усуває потребу в ручних редакторах перекадрування, які зазвичай коштують $5-$15 за відео.
Готові Трансформувати Свій Бізнес?
Давайте обговоримо, як ми можемо застосувати подібні рішення для ваших завдань.