MicrocosmWorksInnovation und Architektur digitaler Kosmen
Über unsKontakt
MicrocosmWorksInnovieren und Gestalten digitaler Kosmen

Bereitstellung von IT-Lösungen, die zählen. Wir sind leidenschaftlich für Technologie, Sicherheit und helfen Unternehmen, durch zuverlässige, innovative IT-Infrastruktur zu wachsen.

[email protected]
+91 7011868196
New Delhi, India

AI Wachstumszentrum

AI HubStartup-InnovationUnternehmensbeschleuniger

Lösungen

Alle LösungenWellness- & Fitness-AppsAI Video PlattformAI Agent Entwicklung

Ressourcen

EinblickeBranchenleitfädenAnwendungsfall-BlaupausenArchitektur-MusterFallstudien

Unternehmen

Über unsKontaktUnsere Arbeit

Dienstleistungen

Digitale BeratungCloud-InfrastrukturSaaS-EntwicklungKI-EntwicklungVideotechnologie
ERP-EntwicklungZoho-AnpassungOdoo-EntwicklungSalesforce-IntegrationBenutzerdefinierte CRM-Entwicklung
QuickBooks-IntegrationIoT-LösungenBlockchain-Entwicklung
Cybersecurity-BeratungIT-Support - L3

© 2026 MicrocosmWorks. Alle Rechte vorbehalten.

DatenschutzrichtlinieNutzungsbedingungen
Zurück zu Fallstudien
Video CreationVeröffentlicht June 22, 2026 · Aktualisiert June 22, 2026

KI-Gesichtsverfolgung & Intelligentes Re-Framing für die Konvertierung von vertikalen Videos

Eine Content-Repurposing-Plattform benötigte eine automatische Konvertierung von horizontalen (16:9) Langform-Videos in vertikale (9:16) Kurzform-Clips, wobei Sprecher und Motive perfekt zentriert bleiben sollten — ohne manuelles Zuschneiden oder Keyframing.

Ihr Projekt besprechen
ai-face-tracking-vertical-reframing.webp
Video Creation
Domain
7
Technologies
4
Key Results
Delivered
Status

Die Herausforderung

Die Konvertierung von horizontalen Videos in das vertikale Format war einer der mühsamsten Schritte bei der Produktion von Kurzform-Inhalten:

  • Das manuelle Zuschneiden und Neupositionieren des Rahmens für jeden Clip war zeitaufwendig
  • Gespräche mit mehreren Personen erforderten ein dynamisches Re-Framing, wenn sich die Sprecher änderten
  • Ein statischer Center-Crop schnitt Sprecher ab, die sich bewegten oder außermittig saßen
  • Herkömmliche Gesichtserkennung war zu langsam für Echtzeit-Re-Framing-Entscheidungen bei Tausenden von Clips
  • Verschiedene Inhaltstypen (Interviews, Solo-Vlogs, Präsentationen) erforderten unterschiedliche Framing-Strategien

Unsere Lösung

Wir haben eine KI-gestützte Gesichtserkennungs- und intelligente Re-Framing-Engine entwickelt, die Gesichter in Videobildern erkennt, ihre Bewegung verfolgt und den vertikalen Zuschneidebereich dynamisch anpasst, um das aktive Motiv zentriert zu halten.

Architektur

  • Gesichtserkennung: YOLO-basiertes Gesichtserkennungsmodell, optimiert für Geschwindigkeit
  • Gesichtsverfolgung: IoU-basiertes Frame-zu-Frame-Tracking mit persistenten Subjekt-IDs
  • Re-Framing-Engine: Dynamische Berechnung des Zuschneidebereichs basierend auf Gesichtspositionen und -bewegungen
  • Kopplung aktiver Sprecher: Integration mit Sprechererkennung, um die sprechende Person zu priorisieren
  • Rendering: FFmpeg-Zuschneidefilterkette mit sanften Schwenkübergängen

Re-Framing-Pipeline

  1. Gesichtserkennung – Führen Sie die YOLO-Gesichtserkennung über abgetastete Frames aus
  2. Subjekt-Tracking – Verknüpfen Sie Gesichtserkennungen über Frames hinweg mithilfe von IoU-basiertem Tracking
  3. Sprecherpriorität – Bei Kopplung mit aktiver Sprechererkennung wird das sprechende Subjekt priorisiert
  4. Zuschneideberechnung – Bestimmen Sie den optimalen 9:16-Zuschneidebereich basierend auf der Position des primären Subjekts
  5. Glättung – Wenden Sie Easing auf die Zuschneidebewegung an, um ruckartige Sprünge zu vermeiden
  6. Rendering – FFmpeg wendet den dynamischen Zuschnitt mit sanften Schwenkübergängen an

Hauptfunktionen

  1. Multi-Subjekt-Verarbeitung – Verfolgt mehrere Gesichter und bestimmt das primäre Subjekt pro Segment
  2. Sprecherbewusstes Framing – Priorisiert den aktiven Sprecher bei Integration mit Sprechererkennung
  3. Sanfte Übergänge – Eased Panning zwischen Subjekten eliminiert ruckartige Schnitte
  4. Anpassung an Inhaltstypen – Verschiedene Framing-Strategien für Solo-, Interview- und Gruppeninhalte
  5. Stapelverarbeitung – Re-Framing hunderter Clips aus einem einzigen Langform-Video
  6. Keine manuelle Intervention – Vollautomatisch von der Erkennung bis zum finalen Render

Ergebnisse

Zeitersparnis: Eliminierte 2-5 Minuten manuellen Zuschneidens pro Clip
Qualität: Subjekte blieben bei getesteten Inhalten über 95% der Zeit zentriert
Skalierung: Tausende von Clips täglich ohne menschliches Eingreifen verarbeitet

Technologie-Stack

YOLOPythonFFmpegOpenCVIoU TrackingNode.jsGPU-Accelerated Inference

caseStudyDetail.more Fallstudien

Entdecken Sie mehr unserer technischen Implementierungen

Video Creation

Plattformübergreifende Social-Media-Planung & Performance-Analyse

Content-Ersteller, die wöchentlich Dutzende von Kurzclips produzierten, benötigten ein einheitliches Planungs- und Analysesystem, um Inhalte über TikTok, YouTube Shorts und Instagram Reels von einem einzigen Dashboard aus zu verbreiten — mit Einblicken zur Optimierung der Posting-Strategie.

Fallstudie lesen
Video Creation

Mehrsprachige Untertitel-Übersetzung für die globale Inhaltsverteilung

Content-Ersteller mit internationalem Publikum mussten ihre Reichweite erweitern, indem sie Video-Untertitel in über 30 Sprachen übersetzten, während das Original-Audio erhalten blieb, sodass Zuschauer weltweit Inhalte in ihrer Muttersprache konsumieren konnten.

Fallstudie lesen

Bereit, Ihr Unternehmen zu transformieren?

Lassen Sie uns besprechen, wie wir ähnliche Lösungen für Ihre Herausforderungen anwenden können.

Kontakt aufnehmencaseStudyDetail.viewAllCaseStudies
Zufriedenheit der Ersteller: Vertikale Clips sahen professionell gerahmt aus, ohne manuelle Bearbeitung
Video Creation

Automatisierte Untertitel-Gestaltung & Video-Export-Engine

Videokreatoren benötigten ein schnelles, zuverlässiges System, um professionelle animierte Untertitel auf Kurzvideos mit pixelgenauer Darstellung über verschiedene Stile und Plattformen hinweg anzuwenden.

Fallstudie lesen

Häufig gestellte Fragen

MicrocosmWorks implementierte einen hybriden Tracking-Ansatz, der einen leichtgewichtigen Gesichts-Detector, der alle 5 Frames läuft, mit einem KCF Optical Flow Tracker für Vorhersagen zwischen den Frames kombiniert. Wenn Okklusion durch das Absinken des Confidence Score erkannt wird, hält das System die zuletzt bekannte Trajectory mit Kalman Filtering und erfasst das Gesicht innerhalb von 200ms erneut, sobald es wieder sichtbar wird.

MicrocosmWorks hat einen salienzgewichteten Zuschneidealgorithmus entwickelt, der bei der Bestimmung der 9:16-Zuschneidefensterposition erkannte Gesichter, dann Textbereiche und dann Bewegungsbereiche priorisiert. Bei Szenen mit mehreren Personen verwendet das System eine konfigurierbare Prioritätenrangfolge, die standardmäßig auf den aktiven Sprecher oder das größte Gesicht eingestellt ist, mit einer sanften Interpolation zwischen den Zuschneidepositionen, um ruckartige Übergänge zu vermeiden.

Ja, MicrocosmWorks hat einen Fallback-Modus zur Auffälligkeitserkennung implementiert, der aktiviert wird, wenn keine Gesichter vorhanden sind. Dieser Modus nutzt eine Kombination aus Bewegungserkennung, visueller Aufmerksamkeitsmodellierung und Mauszeigerverfolgung für Bildschirmaufnahmen. Das System folgt intelligent dem relevantesten Inhaltsbereich, selbst in rein visuellen oder textbasierten Aufnahmen.

MicrocosmWorks optimierte die Pipeline für Stapel-Workflows und erreichte damit die 8-fache Echtzeit-Verarbeitungsgeschwindigkeit auf einer einzelnen NVIDIA T4 GPU, was bedeutet, dass ein 10-minütiges Video in etwa 75 Sekunden neu ausgerichtet wird. Das System unterstützt die parallele Verarbeitung über mehrere GPUs hinweg und skaliert linear für hochvolumige Content-Operationen.

MicrocosmWorks entwickelt AI-Video-Neukadrierungssysteme zu Preisen von 25-45 $/Stunde, wobei eine vollständige Gesichtserkennungs- und intelligente Neukadrierungslösung, einschließlich Modelloptimierung, Unterstützung für die Stapelverarbeitung und API-Integration, typischerweise 350-550 Entwicklungsstunden erfordert. Diese Investition macht manuelle Neukadrierungs-Editoren überflüssig, die typischerweise 5-15 $ pro Video kosten.