MicrocosmWorksІнновації та архітектура цифрового космосу
Про насКонтакт
MicrocosmWorksІнновації та архітектура цифрового космосу

Надаємо IT-рішення, які мають значення. Ми захоплені технологіями, безпекою та допомогою бізнесу зростати завдяки надійній, інноваційній IT-інфраструктурі.

[email protected]
+91 7011868196
New Delhi, India

Центр зростання AI

AI HubІнновації для стартапівПрискорювач для підприємств

Рішення

Всі рішенняДодатки для здоров'я та фітнесуAI відео платформаРозробка AI агентів

Ресурси

ІнсайтиГалузеві ПосібникиШаблони ВикористанняАрхітектурні ШаблониКейси

Компанія

Про НасКонтактНаша Робота

Послуги

Цифровий КонсалтингХмарна ІнфраструктураРозробка SaaSРозробка AIВідео Технології
Розробка ERPНалаштування ZohoРозробка OdooІнтеграція SalesforceРозробка Користувацьких CRM
Інтеграція QuickBooksРішення IoTРозробка Блокчейну
Консалтинг з КібербезпекиІТ Підтримка - L3

© 2026 MicrocosmWorks. Усі права захищено.

Політика КонфіденційностіУмови Обслуговування
Назад до Кейсів
Video CreationОпубліковано September 12, 2026 · Оновлено September 12, 2026

Відстеження облич за допомогою AI та розумне перекадрування для конвертації відео у вертикальний формат

Платформі для перепрофілювання контенту потрібно було автоматично конвертувати горизонтальні (16:9) довгі відео у вертикальні (9:16) короткі кліпи, зберігаючи спікерів та об'єкти ідеально центрованими — без ручного обрізання чи ключових кадрів.

Обговоріть Ваш Проєкт
ai-face-tracking-vertical-reframing.webp
Video Creation
Domain
7
Technologies
4
Key Results
Delivered
Status

Виклик

Перетворення горизонтального відео у вертикальний формат було одним з найвиснажливіших етапів у виробництві короткого контенту:

  • Ручне обрізання та перепозиціонування кадру для кожного кліпу займало багато часу
  • Розмови за участю кількох осіб вимагали динамічного перекадрування при зміні спікерів
  • Статичне центральне кадрування обрізало спікерів, які рухалися або сиділи не по центру
  • Традиційні методи виявлення облич були занадто повільними для прийняття рішень щодо перекадрування в реальному часі для тисяч кліпів
  • Різні типи контенту (інтерв'ю, сольні влоги, презентації) вимагали різних стратегій кадрування

Наше Рішення

Ми створили систему відстеження облич за допомогою AI та розумного перекадрування, яка виявляє обличчя у відеокадрах, відстежує їх рух та динамічно регулює область вертикального кадрування, щоб тримати активний об'єкт у центрі.

Архітектура

  • Виявлення облич (Face Detection): Модель виявлення облич на основі YOLO, оптимізована для швидкості
  • Відстеження облич (Face Tracking): Покадрове відстеження на основі IoU зі стійкими ідентифікаторами суб'єктів
  • Двигун перекадрування (Reframing Engine): Динамічний розрахунок області кадрування на основі позицій та руху облич
  • Зв'язування з активним спікером (Active Speaker Coupling): Інтеграція з виявленням спікерів для пріоритизації особи, яка говорить
  • Рендеринг (Rendering): Ланцюжок фільтрів кадрування FFmpeg з плавними переходами панорамування

Конвеєр перекадрування

  1. Виявлення облич (Face Detection) – Запуск виявлення облич за допомогою YOLO по вибраних кадрах
  2. Відстеження об'єктів (Subject Tracking) – Зв'язування виявлених облич між кадрами за допомогою відстеження на основі IoU
  3. Пріоритет спікера (Speaker Priority) – При поєднанні з виявленням активного спікера, пріоритизація особи, яка говорить
  4. Розрахунок кадрування (Crop Calculation) – Визначення оптимальної області кадрування 9:16 на основі позиції основного об'єкта
  5. Згладжування (Smoothing) – Застосування згладжування до руху кадру, щоб уникнути різких стрибків
  6. Рендеринг (Rendering) – FFmpeg застосовує динамічне кадрування з плавними переходами панорамування

Ключові особливості

  1. Обробка кількох об'єктів (Multi-Subject Handling) – Відстежує кілька облич та визначає основний об'єкт для кожного сегмента
  2. Кадрування з урахуванням спікера (Speaker-Aware Framing) – Пріоритизує активного спікера при інтеграції з виявленням спікера
  3. Плавні переходи (Smooth Transitions) – Згладжене панорамування між об'єктами усуває різкі обрізки
  4. Адаптація до типу контенту (Content-Type Adaptation) – Різні стратегії кадрування для сольного, інтерв'ю та групового контенту
  5. Пакетна обробка (Batch Processing) – Перекадровує сотні кліпів з одного довгого відео
  6. Без ручного втручання (No Manual Intervention) – Повністю автоматизовано від виявлення до остаточного рендерингу

Результати

Економія часу: Усунуто 2-5 хвилин ручного обрізання на кожен кліп
Якість: Об'єкти залишалися центрованими у 95%+ випадків у всьому протестованому контенті
Масштаб: Щоденно оброблялися тисячі кліпів без втручання людини

Технологічний Стек

YOLOPythonFFmpegOpenCVIoU TrackingNode.jsGPU-Accelerated Inference

caseStudyDetail.more Кейси

Ознайомтесь з іншими нашими технічними впровадженнями

Video Creation

Кросплатформне планування публікацій у соціальних мережах та аналітика продуктивності

Творцям контенту, які щотижня створюють десятки коротких відеороликів, потрібна була єдина система планування та аналітики для розповсюдження контенту в TikTok, YouTube Shorts та Instagram Reels з єдиної панелі керування — з аналітичними даними для оптимізації стратегії публікацій.

Читати Кейс
Video Creation

Багатомовний переклад субтитрів для глобального розповсюдження контенту

Творці контенту з міжнародною аудиторією потребували розширення охоплення шляхом перекладу відеосубтитрів на понад 30 мов, зберігаючи при цьому оригінальний звук, що дозволяє глядачам по всьому світу споживати контент рідною мовою.

Читати Кейс

Часті запитання

MicrocosmWorks реалізувала гібридний підхід до відстеження, який поєднує легкий детектор облич, що працює кожні 5 кадрів, з трекером оптичного потоку KCF для міжкадрових передбачень. Коли виявляється оклюзія через падіння показників довіри, система підтримує останню відому траєкторію за допомогою фільтрації Калмана та повторно захоплює обличчя протягом 200 мс після того, як воно знову стає видимим.

MicrocosmWorks розробила алгоритм обрізки з урахуванням помітності, який пріоритизує виявлені обличчя, потім текстові області, потім зони руху при визначенні положення вікна обрізки 9:16. Для сцен з кількома особами система використовує налаштовуваний рейтинг пріоритетів, за замовчуванням вибираючи активного доповідача або найбільше обличчя, з плавною інтерполяцією між позиціями обрізки, щоб уникнути різких зсувів.

Так, MicrocosmWorks реалізувала резервний режим виявлення значущості, який активується, коли облич немає, використовуючи комбінацію виявлення руху, моделювання візуальної уваги та відстеження курсора миші для записів екрану. Система інтелектуально відстежує найбільш релевантну область вмісту навіть у виключно візуальних або текстових матеріалах.

MicrocosmWorks оптимізувала конвеєр для пакетних робочих процесів, досягнувши 8-кратної швидкості обробки в реальному часі на одному NVIDIA T4 GPU, що означає, що 10-хвилинне відео перекадровується приблизно за 75 секунд. Система підтримує паралельну обробку на кількох GPU, масштабуючись лінійно для операцій з великим обсягом контенту.

MicrocosmWorks розробляє системи перекадрування відео на основі AI за ціною $25-$45 за годину, при цьому повне рішення для відстеження обличчя та інтелектуального перекадрування, що включає оптимізацію моделі, підтримку пакетної обробки та інтеграцію API, зазвичай потребує 350-550 годин розробки. Ця інвестиція усуває потребу в ручних редакторах перекадрування, які зазвичай коштують $5-$15 за відео.

Готові Трансформувати Свій Бізнес?

Давайте обговоримо, як ми можемо застосувати подібні рішення для ваших завдань.

Зв'язатися з НамиcaseStudyDetail.viewAllCaseStudies
Задоволеність творців: Вертикальні кліпи виглядали професійно оформленими без ручного редагування
Video Creation

Автоматизований механізм стилізації субтитрів та експорту відео

Відеокреаторам була потрібна швидка, надійна система для застосування професійних анімованих субтитрів до коротких відео з ідеальною візуалізацією на різних стилях і платформах.

Читати Кейс