Patrón de escalado On-Off para cargas de trabajo de AI y procesamiento de video
Una plataforma de procesamiento de video impulsada por AI necesitaba manejar cargas de trabajo altamente variables — desde cero trabajos durante las horas de menor actividad hasta cientos de tareas concurrentes de procesamiento de video e inferencia de AI durante los picos — sin pagar por recursos de GPU y computación inactivos.
Discuta Su Proyecto
El Desafío
Las cargas de trabajo de AI y procesamiento de video son inherentemente intermitentes y costosas:
- Las instancias de GPU son costosas ya sea que estén procesando trabajos o inactivas
- La codificación de video, la transcripción y la inferencia de AI demandan diferentes perfiles de recursos
- La relación pico-valle era de 50:1 — más de 200 trabajos durante el pico, casi cero durante la noche
- El auto-scaling tradicional era demasiado lento (arranque en frío de 5-10 min) para solicitudes de usuario sensibles al tiempo
- La infraestructura fija aprovisionada para el pico significaba más del 80% de desperdicio durante las horas de menor actividad
Nuestra Solución
Implementamos un patrón de escalado On-Off — una arquitectura híbrida donde los recursos de cómputo se aprovisionan justo a tiempo para cargas de trabajo activas y se desasignan completamente cuando están inactivos, con warm pools para tareas sensibles a la latencia y cold pools para trabajos por lotes.
Arquitectura
- Cola de Trabajos: Cola de trabajos respaldada por base de datos con clasificación de prioridad
- Orquestador: Servicio que gestiona el ciclo de vida de los recursos y el enrutamiento de trabajos
- Trabajadores GPU (AI): Pods de GPU en la Cloud para inferencia (detección de objetos, transcripción, detección de hablantes)
- Trabajadores CPU (Video): VMs en la Cloud para codificación y renderizado de video
- Warm Pool: Instancias preinicializadas para trabajos sensibles a la latencia (arranque < 30s)
- Cold Pool: Instancias bajo demanda para procesamiento por lotes/masivo (arranque de 2-5 min aceptable)
Implementación del Patrón On-Off
Estados del Ciclo de Vida de los Recursos
Los recursos pasan por un ciclo de vida definido: desde completamente desasignados (costo cero), a través del aprovisionamiento y calentamiento (carga de modelos, comprobaciones de estado), a estados listos y de procesamiento, luego a través de una cooldown window antes de volver a desasignarse.
Estrategia del Warm Pool
Para el procesamiento sensible a la latencia (iniciado por el usuario, espera resultados en minutos):
- Mantener un warm pool mínimo de instancias durante las horas de trabajo
- Precargar modelos de AI al iniciar el container
- Enrutar los trabajos entrantes primero a instancias cálidas
- Escalar instancias cálidas adicionales cuando la profundidad de la cola excede el umbral
- El cooldown timer configurable mantiene las instancias activas entre trabajos esporádicos
Estrategia del Cold Pool
Para el procesamiento por lotes (trabajos masivos nocturnos, recodificaciones no urgentes):
- Cero instancias en ejecución por defecto
- La cola de trabajos activa el aprovisionamiento cuando se envían trabajos por lotes
- Instancias optimizadas para volumen sobre latencia
- Terminar inmediatamente después de que el lote se complete
- Utilizar instancias spot/preemptible para ahorros significativos de costos
Clasificación y Enrutamiento de Trabajos
Los trabajos se clasifican automáticamente por prioridad y tipo, y luego se enrutan al pool apropiado:
- Las tareas de AI iniciadas por el usuario de alta prioridad se enrutan a warm GPU pools
- Las tareas en tiempo real críticas se enrutan a instancias dedicadas siempre activas
- Las tareas de codificación de prioridad media se enrutan a warm o cold CPU pools
- Las tareas por lotes de baja prioridad se enrutan a cold spot/preemptible instances
Lógica del Orquestador
Activadores de Escalado Vertical
- La profundidad de la cola excede el umbral configurable
- El tiempo de espera promedio excede el SLA para el nivel de prioridad
- Aumento programado antes de las horas pico conocidas
- Activador manual a través de la API de administración para picos de tráfico anticipados
Activadores de Escalado Horizontal
- Ningún trabajo procesado durante la duración de la cooldown window
- Reducción programada después de las horas pico
- Todos los trabajos en cola completados sin nuevas envíos
- Umbral de costo alcanzado para el período de facturación
Salud y Recuperación
- Sondas de salud regulares en todas las instancias activas
- Las instancias no saludables se reemplazan automáticamente
- Los trabajos fallidos se vuelven a poner en cola con un recuento de reintentos y se enrutan a una instancia diferente
- Dead letter queue para trabajos que exceden el número máximo de reintentos
Impacto en el Costo
El patrón On-Off logró aproximadamente una reducción del 70% en los costos frente a una infraestructura fija siempre activa, al eliminar el cómputo inactivo durante las horas de menor actividad, dimensionar correctamente los recursos por tipo de trabajo y aprovechar las instancias spot para cargas de trabajo por lotes.
Características Clave
- Costo Inactivo Cero — Recursos completamente desasignados cuando no procesan trabajos
- Warm Pools — Instancias preinicializadas para cargas de trabajo sensibles a la latencia
- Cold Pools — Aprovisionamiento bajo demanda para trabajos por lotes al menor costo
- Clasificación de Trabajos — Enrutamiento automático basado en prioridad, tipo y requisitos de latencia
- Cooldown Windows — Tiempo de inactividad configurable que evita el escalado descendente prematuro entre ráfagas
- Soporte Spot/Preemptible — Trabajos por lotes enrutados a instancias con descuento para ahorros significativos
- Salud y Recuperación — Reemplazo automático de instancias no saludables con reencolado de trabajos
- Escalado Programado — Anticipar patrones de tráfico conocidos con reglas de aprovisionamiento basadas en tiempo
Resultados
Stack Tecnológico
caseStudyDetail.more Casos de Estudio
Explore más de nuestras implementaciones técnicas
Aprovechando RunPod para una inferencia de IA escalable y rentable
Una plataforma de análisis de video impulsada por AI necesitaba computación GPU de alto rendimiento para la detección de objetos y la inferencia en tiempo real en múltiples transmisiones de video concurrentes, sin el costo prohibitivo de los servidores GPU dedicados que funcionan 24/7.
Catant Plataforma de Gestión de RRHH y Fuerza Laboral
Catant es una plataforma modular de gestión de RRHH y fuerza laboral que ayuda a las empresas a gestionar empleados, nóminas, asistencia y cumplimiento desde un único panel.
¿Listo para Transformar su Negocio?
Hablemos sobre cómo podemos aplicar soluciones similares a sus desafíos.