MicrocosmWorksІнновації та архітектура цифрового космосу
Про насКонтакт
MicrocosmWorksІнновації та архітектура цифрового космосу

Надаємо IT-рішення, які мають значення. Ми захоплені технологіями, безпекою та допомогою бізнесу зростати завдяки надійній, інноваційній IT-інфраструктурі.

[email protected]
+91 7011868196
New Delhi, India

Центр зростання AI

AI HubІнновації для стартапівПрискорювач для підприємств

Рішення

Всі рішенняДодатки для здоров'я та фітнесуAI відео платформаРозробка AI агентів

Ресурси

ІнсайтиГалузеві ПосібникиШаблони ВикористанняАрхітектурні ШаблониКейси

Компанія

Про НасКонтактНаша Робота

Послуги

Цифровий КонсалтингХмарна ІнфраструктураРозробка SaaSРозробка AIВідео Технології
Розробка ERPНалаштування ZohoРозробка OdooІнтеграція SalesforceРозробка Користувацьких CRM
Інтеграція QuickBooksРішення IoTРозробка Блокчейну
Консалтинг з КібербезпекиІТ Підтримка - L3

© 2026 MicrocosmWorks. Усі права захищено.

Політика КонфіденційностіУмови Обслуговування
Назад до Кейсів
Video AnalysisОпубліковано September 12, 2026 · Оновлено September 12, 2026

Виявлення активного доповідача на основі ШІ для багатокамерного відеовиробництва

Компанії з медіапродакшну, яка займається зйомками багатокамерних інтерв'ю та панельних дискусій, потрібен був автоматизований спосіб ідентифікації того, хто говорить у будь-який момент у складному відеоматеріалі.

Обговоріть Ваш Проєкт
ai-active-speaker-detection.webp
Video Analysis
Domain
11
Technologies
4
Key Results
Delivered
Status

Виклик

Виробництво багатокамерного контенту (інтерв'ю, подкасти, панельні дискусії) вимагало від редакторів вручну переглядати години матеріалу, щоб ідентифікувати активних доповідачів та створювати монтажні склейки. Цей процес був:

  • Надзвичайно трудомістким (у 10-15 разів довше реального часу для ручного перегляду)
  • Схильним до людських помилок у визначенні доповідача
  • Вузьким місцем, що перешкоджає швидкому створенню контенту

Наше Рішення

Ми створили платформу для аналізу відео на основі ШІ з конвеєром глибокого навчання, яка автоматично виявляє активних доповідачів, об'єднуючи аудіо- та візуальні сигнали.

Архітектура

  • Бекенд: Python/Flask REST API з MongoDB та Redis
  • Конвеєр ML: Модель TalkNet для аудіовізуального злиття, YOLOv8 Nano для виявлення облич, OpenAI Whisper для транскрипції
  • Оптимізація GPU: PyTorch з CUDA, децимація кадрів для 3-кратного прискорення, пакетна обробка
  • Інфраструктура: Багатоекземплярне розгортання з розподіленим блокуванням на основі MongoDB

Конвеєр обробки

  1. Вилучення медіа - Завантаження відео та розділення аудіо/відео
  2. Виявлення сцен - Виявлення меж на основі контенту за допомогою PySceneDetect
  3. Виявлення облич - Виявлення облич YOLOv8 Nano з децимацією кадрів
  4. Відстеження облич - Зв'язування кадрів на основі IoU
  5. Висновок TalkNet - Аудіовізуальне злиття з оцінкою різної тривалості (вікна 1с, 2с, 4с, 6с)
  6. Транскрипція - Перетворення мови в текст на основі Whisper з часовими мітками на рівні слів

Ключові особливості

  • Виявлення активного доповідача з крос-модальною увагою (рухи губ + аудіо)
  • Оцінка довіри з різною тривалістю для надійного визначення доповідача
  • Автоматична транскрипція з часовими мітками на рівні слів
  • Планування фонових завдань з підтримкою скасування
  • Моніторинг продуктивності та управління пам'яттю GPU

Результати

Швидкість обробки: 30-хвилинне відео проаналізовано за 10-15 хвилин на GPU з 12 ГБ+ пам'яті
Точність: Визначення доповідача з високим рівнем довіри за допомогою оцінки різної тривалості
Масштабованість: Розподілена архітектура, що підтримує горизонтальне масштабування по серверах

Технологічний Стек

PythonFlaskPyTorchTalkNetYOLOv8OpenAI WhisperMongoDBRedisFFmpegPySceneDetectCUDA

caseStudyDetail.more Кейси

Ознайомтесь з іншими нашими технічними впровадженнями

Video Analysis

Відстеження об'єктів на відео в реальному часі з автоматичним центруванням та відновленням

Команді з виробництва відео потрібен був інструмент, який міг би відстежувати вибраний об'єкт у відеозаписі та автоматично утримувати його в центрі кадру під час руху — з плавними переходами, кількома варіантами алгоритмів відстеження та автоматичним відновленням, коли трекер втрачав ціль.

Читати Кейс
Video Analysis

Кросплатформне мобільне редагування відео з аналізом на основі AI

Творці контенту та медіа-професіонали потребували мобільного рішення для редагування відео, яке могло б використовувати результати аналізу на основі AI для розумніших робочих процесів редагування в дорозі.

Читати Кейс

Часті запитання

MicrocosmWorks розробила мультимодальну модель злиття, яка корелює візуальні характеристики руху губ, вилучені з кожного відеопотоку камери, з аудіосигналом, використовуючи cross-attention layers. Модель виводить показники ймовірності спікера для кожного кадру для кожного видимого обличчя, досягаючи 94% точності навіть коли кілька учасників говорять одночасно.

MicrocosmWorks оптимізувала конвеєр висновків для роботи на NVIDIA T4 GPU з прискоренням TensorRT, досягнувши менше 150 мс наскрізної затримки від захоплення кадру до ідентифікації спікера. Ця затримка знаходиться в межах допустимого діапазону для перемикання під час прямої трансляції, де типові затримки перемикання становлять 300-500 мс.

MicrocosmWorks навчила модель на різноманітних сценаріях оклюзії та впровадила алгоритм часового згладжування, який підтримує відстеження доповідача через короткочасні оклюзії, використовуючи показники впевненості, засновані лише на аудіо. Коли візуальна впевненість падає нижче порогу, система переходить до локалізації джерела звуку, використовуючи дані beamforming від багатомікрофонних масивів.

MicrocosmWorks розробила супутній модуль управління, який перетворює вихідні дані виявлення мовця у стандартні сигнали таллі/управління, сумісні з Blackmagic ATEM через ATEM SDK та NewTek NDI для систем TriCaster. Режисери постановки можуть налаштувати систему на режим автоматичного перемикання або консультативний режим, де вона пропонує перемикання кадрів, не виконуючи їх.

MicrocosmWorks створює індивідуальні системи відеоаналізу на основі AI за тарифами $30-$50/год, причому система виявлення активного доповідача для багатокамерного виробництва, включаючи навчання моделі, оптимізацію TensorRT та інтеграцію зі світчером, зазвичай вимагає 500-750 годин розробки. Фаза навчання моделі вимагає обчислювальних ресурсів GPU, що зазвичай додає $2,000-$5,000 до вартості проєкту.

Готові Трансформувати Свій Бізнес?

Давайте обговоримо, як ми можемо застосувати подібні рішення для ваших завдань.

Зв'язатися з НамиcaseStudyDetail.viewAllCaseStudies
Ефективність: 3-кратне прискорення завдяки оптимізації децимації кадрів
HR Management Software

Платформа Catant для управління персоналом та робочою силою

Catant — це модульна платформа для управління персоналом та робочою силою, яка допомагає підприємствам керувати співробітниками, заробітною платою, відвідуваністю та відповідністю нормативним вимогам з однієї панелі керування.

Читати Кейс