Détection de locuteur actif assistée par AI pour la production vidéo multi-caméras
Une société de production média gérant des tournages d'interviews et de tables rondes multi-caméras avait besoin d'un moyen automatisé pour identifier qui parle à tout moment dans des séquences vidéo complexes.
Discutez de Votre Projet
Le Défi
La production de contenu multi-caméras (interviews, podcasts, tables rondes) exigeait que les monteurs parcourent manuellement des heures de séquences pour identifier les locuteurs actifs et créer des coupes. Ce processus était :
- Extrêmement chronophage (10 à 15 fois le temps réel pour une révision manuelle)
- Sujet aux erreurs humaines dans l'attribution des locuteurs
- Un goulot d'étranglement empêchant un traitement rapide du contenu
Notre Solution
Nous avons construit une plateforme d'analyse vidéo assistée par AI avec un pipeline de deep learning qui détecte automatiquement les locuteurs actifs en fusionnant les signaux audio et visuels.
Architecture
- Backend : API REST Python/Flask avec MongoDB et Redis
- Pipeline ML : Modèle de fusion audio-visuelle TalkNet, YOLOv8 Nano pour la détection de visages, OpenAI Whisper pour la transcription
- Optimisation GPU : PyTorch avec CUDA, décimation d'images pour un gain de vitesse de 3x, traitement par lots
- Infrastructure : Déploiement multi-instance avec verrouillage distribué basé sur MongoDB
Pipeline de traitement
- Extraction Média - Téléchargement vidéo et séparation audio/vidéo
- Détection de Scène - Détection de limites basée sur le contenu via PySceneDetect
- Détection de Visages - Détection de visages YOLOv8 Nano avec décimation d'images
- Suivi de Visages - Liaison basée sur l'IoU entre les images
- Inférence TalkNet - Fusion audio-visuelle avec score multi-durée (fenêtres de 1s, 2s, 4s, 6s)
- Transcription - Synthèse vocale basée sur Whisper avec horodatage au niveau du mot
Fonctionnalités clés
- Détection de locuteur actif avec attention cross-modale (mouvements des lèvres + audio)
- Score de confiance multi-durée pour une identification robuste du locuteur
- Transcription automatique avec horodatage au niveau du mot
- Planification de tâches en arrière-plan avec support d'annulation
- Surveillance des performances et gestion de la mémoire GPU
Résultats
Stack Technologique
caseStudyDetail.more Études de Cas
Découvrez plus de nos implémentations techniques
Suivi d'objet vidéo en temps réel avec centrage et récupération automatiques
Une équipe de production vidéo avait besoin d'un outil capable de suivre un objet sélectionné dans des séquences vidéo et de le maintenir automatiquement centré dans le cadre lorsqu'il se déplaçait — avec des transitions fluides, plusieurs options d'algorithmes de suivi, et une récupération automatique lorsque le traceur perdait la cible.
Montage vidéo mobile multiplateforme avec analyse assistée par AI
Les créateurs de contenu et les professionnels des médias avaient besoin d'une solution de montage vidéo axée sur le mobile, capable d'exploiter les résultats d'analyse basés sur l'AI pour des flux de travail d'édition plus intelligents en déplacement.
Plateforme de gestion des RH et du personnel Catant
Catant est une plateforme modulaire de gestion des RH et du personnel qui aide les entreprises à gérer les employés, la paie, les présences et la conformité depuis un tableau de bord unique.
Questions fréquemment posées
MicrocosmWorks a développé un modèle de fusion multimodale qui met en corrélation les caractéristiques visuelles du mouvement des lèvres extraites de chaque flux de caméra avec le signal audio en utilisant des couches d'attention croisée. Le modèle produit des scores de probabilité d'orateur par image pour chaque visage visible, atteignant une précision de 94 % même lorsque plusieurs participants parlent simultanément.
MicrocosmWorks a optimisé le pipeline d'inférence pour fonctionner sur des NVIDIA T4 GPUs avec accélération TensorRT, atteignant une latence de bout en bout inférieure à 150ms, de la capture d'image à l'identification de l'orateur. Cette latence est bien dans la plage acceptable pour la commutation de production en direct, où les délais de coupe typiques sont de 300 à 500ms.
MicrocosmWorks a entraîné le modèle sur divers scénarios d'occlusion et a mis en œuvre un algorithme de lissage temporel qui maintient le suivi de l'orateur à travers de brèves occlusions en utilisant des scores de confiance audio uniquement. Lorsque la confiance visuelle descend en dessous d'un seuil, le système se rabat sur la localisation de la source audio en utilisant des données de beamforming provenant de réseaux multi-micros.
MicrocosmWorks a développé un module de contrôle compagnon qui traduit les sorties de détection des intervenants en signaux de tally/contrôle standard compatibles avec Blackmagic ATEM via l'ATEM SDK et NewTek NDI pour les systèmes TriCaster. Les directeurs de production peuvent configurer le système en mode de commutation automatique ou en mode consultatif où il suggère des coupes sans les exécuter.
MicrocosmWorks conçoit des systèmes personnalisés d'analyse vidéo basés sur l'IA à des tarifs de 30 à 50 $/heure, un système de détection de locuteur actif multi-caméras incluant l'entraînement de modèle, l'optimisation TensorRT et l'intégration de switcher nécessitant généralement 500 à 750 heures de développement. La phase d'entraînement de modèle requiert des ressources de calcul GPU qui ajoutent généralement 2 000 à 5 000 $ au coût du projet.
PrĂŞt Ă Transformer Votre Entreprise ?
Discutons de la façon dont nous pouvons appliquer des solutions similaires à vos défis.