Lorsqu'un utilisateur télécharge une vidéo sur Adstacker, il n'attend qu'une chose : que ses clips se transforment en variations publicitaires soignées, sans attente confuse, exportation ratée ou sous-titres désynchronisés. Derrière ce flux de travail simple se cache une pipeline vidéo basée sur l'AI délibérément étagée. Nous validons chaque actif avant qu'il n'entre dans un projet, transformons la parole en données de sous-titres précises à la trame près, puis rendons des composants créatifs réutilisables avant d'assembler les variations finales.
Voici comment Adstacker traite les vidéos des utilisateurs – du téléchargement à l'exportation – et pourquoi l'architecture est conçue pour un volume créatif fiable.
Le défi : les entrées vidéo sont rarement prêtes pour la production par défaut
Les fichiers vidéo peuvent sembler similaires dans un sélecteur de fichiers tout en se comportant très différemment dans une pipeline de rendu. Un clip peut avoir une durée inattendue, une faible résolution, un drapeau de rotation provenant d'un appareil photo de téléphone, ou aucun flux vidéo utilisable du tout. Si nous découvrons ces problèmes après le début du rendu d'un projet, les utilisateurs perdent du temps et le calcul est gaspillé.
Les sous-titres ajoutent un deuxième défi. Une transcription seule ne suffit pas pour une publicité sociale. Le texte a besoin d'une synchronisation au niveau du mot pour qu'il apparaisse avec l'orateur, reste lisible et ne chevauche jamais la ligne suivante.
Enfin, Adstacker est conçu pour créer de nombreuses combinaisons à partir d'un petit ensemble d'actifs. Re-rendre des clips sous-titrés identiques pour chaque combinaison de hook, body, CTA et style de sous-titre serait inutilement lent et coûteux.
Notre solution : une pipeline étagée avec des responsabilités claires
Nous séparons la validation, la transcription, le rendu des superpositions et l'assemblage final. Chaque étape produit un résultat durable que l'étape suivante peut utiliser, permettant au système de réessayer une étape échouée sans redémarrer le projet entier.
Architecture

1. FFprobe détecte les mauvaises entrées avant le début d'un projet
Avant qu'Adstacker ne valide les clips téléchargés dans un projet, il exécute FFprobe – un outil léger d'inspection média – sur chaque fichier. Nous lisons les détails qui sont importants pour un résultat fiable :
- Un véritable flux vidéo est présent.
- La durée est dans la plage autorisée du projet.
- La résolution effective atteint notre barre de qualité minimale et ne dépasse pas le maximum configuré.
- La fréquence d'images est disponible pour les calculs de synchronisation.
- L'orientation d'affichage est correcte, y compris pour les vidéos de téléphone dont la rotation se trouve dans les métadonnées plutôt que dans les dimensions en pixels.
C'est une barrière d'échec rapide. Si un actif ne produira pas une publicité fiable, le créateur reçoit un message utile avant que le rendu ne commence. Cela nous permet également de choisir une résolution de base bornée pour le projet, de sorte que les workers en aval opèrent sur un canevas prévisible au lieu de gérer chaque taille de source brute indépendamment.
2. AssemblyAI transforme la parole en synchronisation de sous-titres utilisable
Pour les projets utilisant des sous-titres, nous envoyons l'audio source via AssemblyAI et recevons plus qu'un bloc de texte : nous recevons des mots individuels avec des horodatages de début et de fin. Ces horodatages sont le pont entre le langage parlé et la synchronisation visuelle.
Nous normalisons la synchronisation en secondes, la convertissons en images à la fréquence d'images cible du projet, et groupons les mots en courts morceaux de sous-titres. Le regroupement est intentionnel : une nouvelle légende commence après une pause significative ou une fois que la ligne actuelle atteint une longueur lisible. Nous fixons également les morceaux adjacents afin qu'un seul soit visible dans n'importe quelle image, même lorsque les synchronisations des mots sources se chevauchent.
Le résultat est des données de sous-titres concises, sensibles à la trame et prêtes pour un style visuel choisi – et non une transcription générique collée sur une vidéo.
3. Rendez les superpositions partagées une fois, puis réutilisez-les
La clé de l'échelle créative est d'éviter le travail en double. Un projet Adstacker peut associer le même clip hook à de nombreux clips body, CTAs, couches de texte et styles de sous-titres. Nous rendons un segment sous-titré ou avec couches de texte une seule fois pour chaque recette unique, plutôt qu'une fois pour chaque combinaison finale qui l'utilise. Ceci reflète l'approche de sous-titrage automatisé que nous avons développée pour Ssemble, une plateforme de création vidéo courte de notre portfolio.
Un worker de superposition reçoit la vidéo source préparée, le ratio d'aspect cible, les couches de texte personnalisées et les morceaux de sous-titres. Il rend le traitement visuel sur un canevas cohérent et stocke la superposition terminée comme un actif réutilisable. L'étape de fusion finale sélectionne ensuite les superpositions hook, body et CTA correctes et assemble la variation terminée.
Cette division nous offre deux avantages pratiques :
- La réutilisation réduit le travail de rendu lorsque de nombreuses combinaisons partagent les mêmes éléments constitutifs.
- Les nouvelles tentatives indépendantes permettent de corriger un échec dans une superposition ou une fusion finale sans rejeter le travail terminé.
Exemple concret : une séance photo de produit, des dizaines de publicités testables
Imaginez qu'une marque de soins de la peau télécharge trois hooks, deux démonstrations de produits et deux CTAs. Elle sélectionne également deux styles de sous-titres. Les possibilités créatives se multiplient rapidement, mais plusieurs vidéos finales réutilisent le même segment source et le même traitement de légendes.
Adstacker valide les sept clips en amont, tient compte de toute métadonnée d'orientation portrait, et construit des morceaux de sous-titres synchronisés à partir de chaque segment parlé. Il crée ensuite chaque superposition nécessaire une seule fois. Lorsque les combinaisons finales sont assemblées, le système réutilise ces éléments préparés au lieu de les recréer à plusieurs reprises.
La marque obtient un ensemble cohérent de publicités prêtes à être testées, tandis que la pipeline effectue le travail minimum nécessaire pour les créer.
Conçu pour un volume créatif fiable
Chez Adstacker, le traitement vidéo n'est pas un bouton de "rendu" opaque. C'est une séquence d'étapes ciblées : valider la source, comprendre la parole, rendre les couches réutilisables et assembler la création finale. Cette structure nous aide à protéger la qualité lors du téléchargement, à garder les légendes synchronisées et à mettre à l'échelle les variations sans gaspillage, en s'exécutant sur une cloud infrastructure conçue pour des charges de travail élastiques et conteneurisées.
Téléchargez vos actifs vidéo, choisissez les éléments constitutifs créatifs que vous souhaitez tester, et laissez Adstacker gérer la pipeline de production en coulisses.
Pile technologique : NestJS · FFprobe · AssemblyAI · AWS S3 · AWS ECS Fargate · Remotion · FFmpeg · MongoDB
En savoir plus de notre équipe
1. Service d'exportation vs. pipeline d'éditeur vidéo
2. Construire un éditeur vidéo normal
3. Optimisation du logo de chaîne pour différentes résolutions vidéo

