Programmierbares Video-Annotation-Framework für ML & Content-Erstellung
ML-Forscher und Video-Content-Ersteller benötigten ein flexibles, codegesteuertes Video-Annotation-Tool, das annotierte Videos in großem Maßstab produzieren konnte, von der Vorbereitung von Trainingsdaten bis hin zu Bildungseinblendungen.
Ihr Projekt besprechen
Die Herausforderung
Bestehende Video-Annotation-Tools waren entweder GUI-lastig ohne programmatische API oder Kommandozeilen-Tools mit schlechter Visualisierung:
- ML-Teams benötigten Begrenzungsrahmen, Polygone und Labels für Trainingsdaten in großem Maßstab
- Pädagogen benötigten animierte Overlays (Pfeile, Spotlights, Text) für Lehrvideos
- Traditionelle Annotation-Tools konnten keine Keyframe-Interpolation oder Easing-Animationen verarbeiten
- Keine Desktop-native Lösung kombinierte OpenCV-Verarbeitung mit professionellem Video-Output
Unsere Lösung
Wir entwickelten ein React/Remotion-basiertes Video-Annotation-Framework mit einem typsicheren Annotation-System, Keyframe-Interpolation und einem Tauri-Desktop-Editor.
Architektur
- Video-Engine: Remotion 4.0 für programmatische Frame-für-Frame-Rendering
- Frontend: React 18 + TypeScript mit Vite
- Desktop-App: Tauri 2 mit OpenCV.js und ONNX Runtime
- Export: FFmpeg für hochwertigen Video-Output
Annotationstypen
- Begrenzungsrahmen - Rechteckige Bereiche mit Labels und Vertrauensscores
- Kreise - Punktanmerkungen mit konfigurierbarem Radius
- Polygone - Komplexe Umrisse für unregelmäßige Formen
- Text-Labels - Gestylte Text-Overlays mit Positionierung
- Pfeile - Richtungsindikatoren für Fluss oder Aufmerksamkeit
- Freihandpfade - Benutzerdefinierte gezeichnete Anmerkungen
- Spotlights - Hervorhebung von Bereichen mit abgedunkeltem Hintergrund
Animationssystem
- Keyframe-Interpolation - Sanfte Übergänge zwischen Annotationszuständen
- Easing-Funktionen - Feder, Ease-In-Out, Bounce und benutzerdefinierte Kurven
- Szenenkomposition - Intro, Annotationsschichten, kombinierte Zeitleiste, Outro
- Überblendeffekte - Ein-/Ausblenden mit konfigurierbarer Dauer
Hauptmerkmale
- Typsichere API - Umfassende TypeScript-Typen für alle Annotationsprimitiven
- Szenensystem - Komplexe Videos aus Szenenbausteinen zusammensetzen
- Keyframe-Animation - Animieren Sie jede Annotations-Eigenschaft über die Zeit
- Desktop-Editor - Tauri-basierte GUI mit Echtzeitvorschau
- Batch-Export - Annotierte Videos über FFmpeg rendern
- OpenCV-Integration - Computer Vision-Verarbeitung in der Desktop-App
Ergebnisse
Technologie-Stack
caseStudyDetail.more Fallstudien
Entdecken Sie mehr unserer technischen Implementierungen
KI-gestützte Pipeline zur Generierung von Spielfilmen
Ein ambitioniertes Projekt zur Inhaltserstellung, das darauf abzielt, die Spielfilmproduktion zu demokratisieren, indem eine End-to-End-AI-Pipeline aufgebaut wird, die eine einfache Texteingabeaufforderung in einen 15-90-minütigen Film verwandelt.
Catant HR- und Workforce-Management-Plattform
Catant ist eine modulare HR- und Workforce-Management-Plattform, die Unternehmen dabei unterstützt, Mitarbeiter, Gehaltsabrechnung, Anwesenheit und Compliance von einem einzigen Dashboard aus zu verwalten.
Häufig gestellte Fragen
MicrocosmWorks hat dieses Framework für Teams entwickelt, die Annotationen in großem Maßstab mithilfe code-gesteuerter Regeln statt durch manuelles Klicken generieren müssen. Es unterstützt das Schreiben von Annotations-Pipelines als Python-Skripte, die vortrainierte Detektoren, temporale Logik und räumliche Regeln anwenden, um Trainingsdaten automatisch zu generieren, und exportiert diese dann in COCO-, Pascal VOC- oder YOLO-Formaten.
Ja, MicrocosmWorks hat ein Modell für temporale Annotationen implementiert, das Frame-Bereiche, Keyframe-Interpolation und ereignisbasierte Labels mit Start-/Endzeitstempeln unterstützt. Annotatoren können temporale Regeln definieren, wie 'als Laufen labeln, wenn die Pose Estimation mehr als 3 aufeinanderfolgende Frames lang beide Füße vom Boden erkennt', um das Aktions-Labeling zu automatisieren.
MicrocosmWorks hat eine Validierungspipeline entwickelt, die Übereinstimmungswerte zwischen programmatischen Annotationen und einem von Menschen überprüften Golden Set berechnet und alle Annotationen kennzeichnet, die unter einen konfigurierbaren IoU- oder zeitlichen Überlappungsschwellenwert fallen. Das Framework unterstützt auch Active-Learning-Workflows, die Annotationen mit geringem Vertrauen an menschliche Prüfer weiterleiten.
MicrocosmWorks hat das Framework auf FFmpeg und OpenCV aufgebaut und unterstützt alle gängigen Containerformate, einschließlich MP4, MKV, AVI und MOV, mit Codecs von H.264 bis ProRes. Das Framework verarbeitet Videos in ihrer nativen Auflösung, unterstützt aber konfigurierbares Downscaling für den Annotationsdurchlauf, um den Durchsatz bei großen Datensätzen zu beschleunigen.
MicrocosmWorks liefert ML-Infrastrukturprojekte zu Preisen von $25-$45/Stunde, wobei ein programmatisches Video-Annotierungs-Framework, einschließlich des rule engine, format exporters und der quality validation pipeline, typischerweise 300-500 Entwicklungsstunden erfordert. Das Framework amortisiert sich schnell durch die Reduzierung manueller Annotierungskosten, die $5-$15 pro Videominute betragen können.
Bereit, Ihr Unternehmen zu transformieren?
Lassen Sie uns besprechen, wie wir ähnliche Lösungen für Ihre Herausforderungen anwenden können.