On-Off-Skalierungsmuster für KI- und Videobearbeitungs-Workloads
Eine KI-gestützte Videobearbeitungsplattform musste hochvariable Workloads bewältigen – von null Aufträgen während der Ruhezeiten bis hin zu Hunderten von gleichzeitigen Videobearbeitungs- und KI-Inferenzaufgaben während der Stoßzeiten – ohne für ungenutzte GPU- und Rechenressourcen zu zahlen.
Ihr Projekt besprechen
Die Herausforderung
KI- und Videobearbeitungs-Workloads sind von Natur aus sprunghaft und teuer:
- GPU-Instanzen sind kostspielig, egal ob sie Aufträge verarbeiten oder im Leerlauf sind
- Video-Codierung, Transkription und KI-Inferenz erfordern unterschiedliche Ressourcenprofile
- Das Verhältnis von Spitzen- zu Tiefstwerten betrug 50:1 – über 200 Aufträge während der Spitzenzeiten, nahezu null über Nacht
- Traditionelles Auto-Scaling war zu langsam (5-10 Minuten Kaltstart) für zeitkritische Benutzeranfragen
- Festgelegte Infrastruktur, die für Spitzenzeiten bereitgestellt wurde, bedeutete über 80% Verschwendung während der Nebenzeiten
Unsere Lösung
Wir implementierten ein On-Off-Skalierungsmuster – eine hybride Architektur, bei der Rechenressourcen just-in-time für aktive Workloads bereitgestellt und bei Leerlauf vollständig deallokiert werden, mit Warm-Pools für latenzempfindliche Aufgaben und Cold-Pools für Batch-Jobs.
Architektur
- Job Queue: Datenbankgestützte Job-Warteschlange mit Prioritätsklassifizierung
- Orchestrator: Dienst zur Verwaltung des Ressourcenlebenszyklus und der Job-Routing
- GPU-Arbeiter (KI): Cloud-GPU-Pods für Inferenz (Objekterkennung, Transkription, Sprechererkennung)
- CPU-Arbeiter (Video): Cloud-VMs für Video-Codierung und Rendering
- Warm Pool: Vorinitialisierte Instanzen für latenzempfindliche Jobs (< 30s Startzeit)
- Cold Pool: On-Demand-Instanzen für Batch-/Bulk-Verarbeitung (2-5 Minuten Startzeit akzeptabel)
Implementierung des On-Off-Musters
Ressourcenlebenszykluszustände
Ressourcen durchlaufen einen definierten Lebenszyklus: von vollständig deallokiert (null Kosten), über Bereitstellung und Erwärmung (Modell-Laden, Gesundheitschecks), bis hin zu bereit und verarbeitend, dann durch ein Abkühlfenster, bevor sie wieder deallokiert werden.
Warm-Pool-Strategie
Für latenzempfindliche Verarbeitung (benutzerinitiiert, erwartet Ergebnisse in Minuten):
- Ein Minimum an Warm-Pool-Instanzen während der Geschäftszeiten aufrechterhalten
- KI-Modelle beim Container-Start vorladen
- Eingehende Jobs zuerst an warme Instanzen weiterleiten
- Zusätzliche warme Instanzen skalieren, wenn die Warteschlangentiefe den Schwellenwert überschreitet
- Konfigurierbarer Abkühl-Timer hält Instanzen zwischen sporadischen Jobs am Leben
Cold-Pool-Strategie
Für Batch-Verarbeitung (nächtliche Bulk-Jobs, nicht dringende Re-Encodes):
- Standardmäßig keine laufenden Instanzen
- Job-Warteschlange löst Bereitstellung aus, wenn Batch-Jobs eingereicht werden
- Bulk-optimierte Instanzen für Durchsatz über Latenz
- Sofortige Beendigung nach Abschluss des Batches
- Nutzung von Spot-/Preemptible-Instanzen für erhebliche Kosteneinsparungen
Job-Klassifizierung & Routing
Jobs werden automatisch nach Priorität und Typ klassifiziert und dann an den entsprechenden Pool weitergeleitet:
- Hohe Priorität Benutzerinitiierte KI-Aufgaben werden an warme GPU-Pools weitergeleitet
- Kritische Echtzeit-Aufgaben werden an immer aktive dedizierte Instanzen weitergeleitet
- Mittlere Priorität Codierungsaufgaben werden an warme oder kalte CPU-Pools weitergeleitet
- Niedrige Priorität Batch-Aufgaben werden an kalte Spot-/Preemptible-Instanzen weitergeleitet
Orchestrator-Logik
Scale-Up-Auslöser
- Warteschlangentiefe überschreitet konfigurierbaren Schwellenwert
- Durchschnittliche Wartezeit überschreitet SLA für die Prioritätsstufe
- Geplante Hochskalierung vor bekannten Spitzenzeiten
- Manuelle Auslösung über Admin-API für erwartete Verkehrsspitzen
Scale-Down-Auslöser
- Keine Jobs verarbeitet für die Dauer des Abkühlfensters
- Geplante Herunterskalierung nach Spitzenzeiten
- Alle wartenden Jobs abgeschlossen ohne neue Einreichungen
- Kostenschwelle für den Abrechnungszeitraum erreicht
Gesundheit & Wiederherstellung
- Regelmäßige Gesundheitsprüfungen auf allen aktiven Instanzen
- Ungeheilte Instanzen werden automatisch ersetzt
- Fehlgeschlagene Jobs werden mit Wiederholungsanzahl erneut in die Warteschlange gestellt und an eine andere Instanz weitergeleitet
- Dead-Letter-Warteschlange für Jobs, die die maximale Anzahl von Wiederholungen überschreiten
Kostenauswirkung
Das On-Off-Muster lieferte eine ungefähre 70% Kostenreduktion im Vergleich zu einer immer aktiven festen Infrastruktur, indem es ungenutzte Rechenleistung während der Nebenzeiten eliminierte, Ressourcen pro Job-Typ richtig dimensionierte und Spot-Instanzen für Batch-Workloads nutzte.
Hauptmerkmale
- Null Leerlaufkosten — Ressourcen werden vollständig deallokiert, wenn keine Jobs verarbeitet werden
- Warme Pools — Vorinitialisierte Instanzen für latenzempfindliche Workloads
- Kalte Pools — On-Demand-Bereitstellung für Batch-Jobs zu den niedrigsten Kosten
- Job-Klassifizierung — Automatisches Routing basierend auf Priorität, Typ und Latenzanforderungen
- Abkühlfenster — Konfigurierbarer Leerlauf-Timeout verhindert vorzeitiges Herunterskalieren zwischen Spitzen
- Spot-/Preemptible-Unterstützung — Batch-Jobs werden an rabattierte Instanzen für erhebliche Einsparungen weitergeleitet
- Gesundheit & Wiederherstellung — Automatischer Ersatz von ungesunden Instanzen mit erneuter Job-Warteschlange
- Geplante Skalierung — Bekannte Verkehrsmuster mit zeitbasierten Bereitstellungsregeln antizipieren
Ergebnisse
Technologie-Stack
caseStudyDetail.more Fallstudien
Entdecken Sie mehr unserer technischen Implementierungen
Nutzung von RunPod für skalierbare, kosteneffiziente KI-Inferenz
Eine KI-gestützte Videoanalytik-Plattform benötigte leistungsstarke GPU-Rechenleistung für die Echtzeit-Objekterkennung und Inferenz über mehrere gleichzeitige Videostreams – ohne die hohen Kosten dedizierter GPU-Server, die rund um die Uhr laufen.
Catant HR- und Workforce-Management-Plattform
Catant ist eine modulare HR- und Workforce-Management-Plattform, die Unternehmen dabei unterstützt, Mitarbeiter, Gehaltsabrechnung, Anwesenheit und Compliance von einem einzigen Dashboard aus zu verwalten.
Bereit, Ihr Unternehmen zu transformieren?
Lassen Sie uns besprechen, wie wir ähnliche Lösungen für Ihre Herausforderungen anwenden können.