Cuando un usuario sube un video a Adstacker, espera una cosa: que sus clips se conviertan en variaciones de anuncios pulidas sin una espera confusa, una exportación fallida o subtítulos que se desincronicen. Detrás de ese flujo de trabajo simple hay un pipeline de video impulsado por AI deliberadamente diseñado. Validamos cada activo antes de que ingrese a un proyecto, convertimos el habla en datos de subtítulos precisos al fotograma y luego renderizamos componentes creativos reutilizables antes de ensamblar las variaciones finales.
Así es como Adstacker procesa los videos de los usuarios, desde la carga hasta la exportación, y por qué la arquitectura está diseñada para un volumen creativo confiable.
El desafío: las entradas de video rara vez están listas para producción por defecto
Los archivos de video pueden parecer similares en un selector de archivos, pero comportarse de manera muy diferente en un pipeline de renderizado. Un clip puede tener una duración inesperada, baja resolución, un indicador de rotación de una cámara de teléfono o ningún flujo de video utilizable en absoluto. Si descubrimos esos problemas después de que un proyecto ha comenzado a renderizarse, los usuarios pierden tiempo y se desperdicia capacidad de cómputo.
Los subtítulos añaden un segundo desafío. Una transcripción por sí sola no es suficiente para un anuncio social. El texto necesita una temporización a nivel de palabra para que aparezca con el orador, se mantenga legible y nunca se superponga con la siguiente línea.
Finalmente, Adstacker está diseñado para crear muchas combinaciones a partir de un pequeño conjunto de activos. Volver a renderizar clips subtitulados idénticos para cada gancho, cuerpo, CTA y combinación de estilo de subtítulos sería innecesariamente lento y costoso.
Nuestra solución: un pipeline por etapas con responsabilidades claras
Separamos la validación, la transcripción, el renderizado de superposiciones y el ensamblaje final. Cada etapa produce un resultado duradero que la siguiente etapa puede usar, lo que permite al sistema reintentar un paso fallido sin reiniciar el proyecto completo.
Arquitectura

1. FFprobe detecta entradas defectuosas antes de que comience un proyecto
Antes de que Adstacker confirme los clips cargados en un proyecto, ejecuta FFprobe, una herramienta ligera de inspección de medios, contra cada archivo. Leemos los detalles que importan para una salida confiable:
- Un flujo de video real está presente.
- La duración está dentro del rango permitido del proyecto.
- La resolución efectiva cumple con nuestro estándar mínimo de calidad y no excede el máximo configurado.
- La velocidad de fotogramas está disponible para los cálculos de temporización.
- La orientación de la pantalla es correcta, incluyendo videos de teléfono cuya rotación reside en los metadatos en lugar de las dimensiones de los píxeles.
Esta es una puerta de fallo rápido. Si un activo no producirá un anuncio confiable, el creador recibe un mensaje útil antes de que comience el renderizado. También nos permite elegir una resolución base acotada para el proyecto, de modo que los trabajadores posteriores operen en un lienzo predecible en lugar de manejar cada tamaño de fuente bruta de forma independiente.
2. AssemblyAI convierte el habla en una temporización de subtítulos utilizable
Para proyectos que usan subtítulos, enviamos el audio fuente a través de AssemblyAI y recibimos más que un bloque de texto: recibimos palabras individuales con marcas de tiempo de inicio y fin. Esas marcas de tiempo son el puente entre el lenguaje hablado y la temporización visual.
Normalizamos la temporización a segundos, la convertimos a fotogramas a la velocidad de fotogramas objetivo del proyecto y agrupamos las palabras en fragmentos cortos de subtítulos. La agrupación es intencional: un nuevo subtítulo comienza después de una pausa significativa o una vez que la línea actual alcanza una longitud legible. También restringimos los fragmentos adyacentes para que solo uno sea visible en cualquier fotograma, incluso cuando los tiempos de las palabras fuente se superponen.
El resultado son datos de subtítulos concisos, conscientes del fotograma y listos para un estilo visual elegido, no una transcripción genérica pegada a un video.
3. Renderice las superposiciones compartidas una vez, luego reutilícelas
La clave para la escala creativa es evitar el trabajo duplicado. Un proyecto de Adstacker puede emparejar el mismo clip de gancho con muchos clips de cuerpo, CTAs, capas de texto y estilos de subtítulos. Renderizamos un segmento subtitulado o con capas de texto una vez para cada receta única, en lugar de una vez para cada combinación final que lo utilice. Esto refleja el enfoque de subtitulado automatizado que construimos para Ssemble, una plataforma de creación de videos de formato corto en nuestro portafolio.
Un trabajador de superposiciones recibe el video fuente preparado, la relación de aspecto objetivo, las capas de texto personalizadas y los fragmentos de subtítulos. Renderiza el tratamiento visual en un lienzo consistente y almacena la superposición completa como un activo reutilizable. La etapa de fusión final selecciona las superposiciones correctas de gancho, cuerpo y CTA y ensambla la variación terminada.
Esta división nos ofrece dos beneficios prácticos:
- La reutilización reduce el trabajo de renderizado cuando muchas combinaciones comparten los mismos bloques de construcción.
- Los reintentos independientes permiten que un fallo en una superposición o una fusión final se corrija sin descartar el trabajo completado.
Ejemplo del mundo real: una sesión de fotos de producto, docenas de anuncios probables
Imagine que una marca de cuidado de la piel sube tres ganchos, dos demostraciones de productos y dos CTAs. También selecciona dos estilos de subtítulos. Las posibilidades creativas se multiplican rápidamente, pero varios videos finales reutilizan el mismo segmento fuente y tratamiento de subtítulos.
Adstacker valida los siete clips por adelantado, tiene en cuenta cualquier metadato de orientación vertical y construye fragmentos de subtítulos temporizados a partir de cada segmento hablado. Luego, crea cada superposición necesaria una vez. Cuando se ensamblan las combinaciones finales, el sistema reutiliza esas piezas preparadas en lugar de recrearlas repetidamente.
La marca obtiene un conjunto consistente de anuncios listos para probar, mientras que el pipeline realiza el trabajo mínimo necesario para crearlos.
Diseñado para un volumen creativo confiable
En Adstacker, el procesamiento de video no es un botón opaco de “render”. Es una secuencia de pasos enfocados: validar la fuente, comprender el habla, renderizar capas reutilizables y ensamblar la creatividad final. Esa estructura nos ayuda a proteger la calidad en la carga, mantener los subtítulos sincronizados y escalar variaciones sin escalar el desperdicio, ejecutándose en cloud infrastructure construida para cargas de trabajo elásticas y contenerizadas.
Suba sus activos de video, elija los bloques de construcción creativos que desea probar y deje que Adstacker maneje el pipeline de producción detrás de escena.
Pila de tecnología: NestJS · FFprobe · AssemblyAI · AWS S3 · AWS ECS Fargate · Remotion · FFmpeg · MongoDB
Lea más de nuestro equipo
1. Servicio de exportación vs. Pipeline de editor de video
2. Construyendo un editor de video normal
3. Optimizando el logotipo del canal para diferentes resoluciones de video

