Wenn ein Benutzer ein Video auf Adstacker hochlädt, erwartet er eines: Seine Clips sollen sich in ausgefeilte Anzeigenvarianten verwandeln, ohne verwirrende Wartezeiten, fehlerhaften Export oder Untertitel, die aus dem Takt geraten. Hinter diesem einfachen Workflow verbirgt sich eine bewusst gestufte AI-powered video pipeline. Wir validieren jedes Asset, bevor es in ein Projekt gelangt, wandeln Sprache in bildgenaue Untertiteldaten um und rendern dann wiederverwendbare kreative Komponenten, bevor wir die endgültigen Varianten zusammenstellen.
So verarbeitet Adstacker Benutzervideos – vom Upload bis zum Export – und darum ist die Architektur für zuverlässiges kreatives Volumen ausgelegt.
Die Herausforderung: Video-Inputs sind selten standardmäßig produktionsbereit
Videodateien können in einem Dateiauswahldialog ähnlich aussehen, sich aber in einer render pipeline sehr unterschiedlich verhalten. Ein Clip kann eine unerwartete Dauer, eine niedrige Auflösung, ein Rotationsflag einer Handykamera oder überhaupt keinen nutzbaren Videostream haben. Wenn wir diese Probleme entdecken, nachdem ein Projekt mit dem Rendering begonnen hat, verlieren Benutzer Zeit und Rechenleistung wird verschwendet.
Untertitel stellen eine zweite Herausforderung dar. Ein Transkript allein reicht nicht für eine Social Ad. Text benötigt ein wortgenaues Timing, damit er mit dem Sprecher erscheint, lesbar bleibt und niemals die nächste Zeile überlappt.
Schließlich ist Adstacker darauf ausgelegt, viele Kombinationen aus einer kleinen Menge von Assets zu erstellen. Das erneute Rendern identischer untertitelter Clips für jede Hook-, Body-, CTA- und Untertitel-Stil-Kombination wäre unnötig langsam und teuer.
Unsere Lösung: Eine gestufte Pipeline mit klaren Verantwortlichkeiten
Wir trennen Validierung, Transkription, Overlay-Rendering und die Endmontage. Jede Stufe erzeugt ein dauerhaftes Ergebnis, das die nächste Stufe nutzen kann, wodurch das System einen fehlgeschlagenen Schritt wiederholen kann, ohne das gesamte Projekt neu starten zu müssen.
Architektur

1. FFprobe fängt schlechte Inputs ab, bevor ein Projekt beginnt
Bevor Adstacker hochgeladene Clips einem Projekt zuweist, führt es FFprobe – ein leichtgewichtiges Medieninspektionstool – für jede Datei aus. Wir lesen die Details aus, die für eine zuverlässige Ausgabe wichtig sind:
- Ein echter Videostream ist vorhanden.
- Die Dauer liegt im zulässigen Bereich des Projekts.
- Die effektive Auflösung erfüllt unsere Mindestanforderungen an die Qualität und überschreitet das konfigurierte Maximum nicht.
- Die Bildrate ist fĂĽr Zeitberechnungen verfĂĽgbar.
- Die Bildschirmausrichtung ist korrekt, einschlieĂźlich Handyvideos, deren Rotation in den Metadaten statt in den Pixelabmessungen liegt.
Dies ist ein Fail-Fast-Gate. Wenn ein Asset keine zuverlässige Anzeige produziert, erhält der Ersteller eine nützliche Meldung, bevor das Rendering beginnt. Es ermöglicht uns auch, eine begrenzte Basisauflösung für das Projekt zu wählen, sodass nachgeschaltete Worker auf einer vorhersehbaren Leinwand arbeiten, anstatt jede Rohquellgröße unabhängig voneinander zu behandeln.
2. AssemblyAI wandelt Sprache in nutzbares Untertitel-Timing um
Für Projekte, die Untertitel verwenden, senden wir den Quellaudio durch AssemblyAI und erhalten mehr als einen Textblock: Wir erhalten einzelne Wörter mit Start- und Endzeitstempeln. Diese Zeitstempel sind die Brücke zwischen gesprochener Sprache und visueller Zeitsteuerung.
Wir normalisieren das Timing in Sekunden, wandeln es in Bilder mit der Zielframe-Rate des Projekts um und gruppieren Wörter in kurze Untertitel-Chunks. Die Gruppierung ist beabsichtigt: Eine neue Untertitelzeile beginnt nach einer bedeutungsvollen Pause oder sobald die aktuelle Zeile eine lesbare Länge erreicht. Wir begrenzen auch benachbarte Chunks, sodass in jedem Frame nur einer sichtbar ist, selbst wenn die Timing-Werte der Quellwörter überlappen.
Das Ergebnis sind Untertiteldaten, die prägnant, frame-bewusst und bereit für einen ausgewählten visuellen Stil sind – kein generisches Transkript, das auf ein Video geklebt wird.
3. Geteilte Overlays einmal rendern und dann wiederverwenden
Der SchlĂĽssel zu kreativer Skalierung ist die Vermeidung doppelter Arbeit. Ein Adstacker Projekt kann denselben Hook-Clip mit vielen Body-Clips, CTAs, Textebenen und Untertitelstilen kombinieren. Wir rendern ein untertiteltes oder textĂĽberlagertes Segment einmal fĂĽr jedes einzigartige Rezept, anstatt einmal fĂĽr jede Endkombination, die es verwendet. Dies spiegelt den automatisierten Untertitelungsansatz wider, den wir fĂĽr Ssemble, eine Plattform zur Erstellung von Kurzvideos in unserem Portfolio, entwickelt haben.
Ein Overlay-Worker empfängt das vorbereitete Quellvideo, das Zielseitenverhältnis, benutzerdefinierte Textebenen und die Untertitel-Chunks. Er rendert die visuelle Bearbeitung auf einer konsistenten Leinwand und speichert das fertige Overlay als wiederverwendbares Asset. Die abschließende Zusammenführungsphase wählt dann die richtigen Hook-, Body- und CTA-Overlays aus und stellt die fertige Variante zusammen.
Diese Aufteilung bietet uns zwei praktische Vorteile:
- Wiederverwendung reduziert den Rendering-Aufwand, wenn viele Kombinationen dieselben Bausteine teilen.
- Unabhängige Wiederholungsversuche ermöglichen es, einen Fehler in einem Overlay oder einer finalen Zusammenführung zu beheben, ohne bereits abgeschlossene Arbeit zu verwerfen.
Praxisbeispiel: Ein Produkt-Shoot, Dutzende von testbaren Anzeigen
Stellen Sie sich vor, eine Hautpflegemarke lädt drei Hooks, zwei Produktdemonstrationen und zwei CTAs hoch. Sie wählt auch zwei Untertitelstile aus. Die kreativen Möglichkeiten vervielfachen sich schnell, aber mehrere endgültige Videos verwenden dasselbe Quellsegment und dieselbe Untertitelbehandlung wieder.
Adstacker validiert alle sieben Clips im Voraus, berücksichtigt alle Metadaten zur Hochformat-Ausrichtung und erstellt zeitgesteuerte Untertitel-Chunks aus jedem gesprochenen Segment. Anschließend erstellt es jedes benötigte Overlay einmal. Wenn die endgültigen Kombinationen zusammengestellt werden, verwendet das System diese vorbereiteten Teile wieder, anstatt sie wiederholt neu zu erstellen.
Die Marke erhält einen konsistenten Satz von testbereiten Anzeigen, während die Pipeline die minimal notwendige Arbeit leistet, um sie zu erstellen.
Gebaut für zuverlässiges kreatives Volumen
Bei Adstacker ist die Videoverarbeitung kein undurchsichtiger „Render“-Button. Es ist eine Abfolge fokussierter Schritte: Quelle validieren, Sprache verstehen, wiederverwendbare Ebenen rendern und das endgültige Kreativmaterial zusammenstellen. Diese Struktur hilft uns, die Qualität beim Upload zu schützen, Untertitel synchron zu halten und Variationen zu skalieren, ohne Verschwendung zu skalieren, und läuft auf cloud infrastructure, die für elastische, containerisierte Workloads gebaut ist.
Laden Sie Ihre Video-Assets hoch, wählen Sie die kreativen Bausteine aus, die Sie testen möchten, und lassen Sie Adstacker die Produktionspipeline im Hintergrund handhaben.
Technologie-Stack: NestJS · FFprobe · AssemblyAI · AWS S3 · AWS ECS Fargate · Remotion · FFmpeg · MongoDB
Lesen Sie mehr von unserem Team
1. Export Service vs. Video Editor Pipeline

