RunPod Kullanarak Ölçeklenebilir, Maliyet Etkin AI Çıkarımı
AI destekli bir video analitik platformu, birden fazla eşzamanlı video akışı üzerinde gerçek zamanlı nesne algılama ve çıkarım için yüksek performanslı GPU hesaplamasına ihtiyaç duyuyordu — 7/24 çalışan özel GPU sunucularının yasaklayıcı maliyeti olmadan.
Projenizi Tartışın
Zorluk
AI iş yükleri için GPU altyapısı bir maliyet ve performans ikilemi sundu:
- Büyük bulut sağlayıcılarından özel GPU sunucuları, ayda binlerce dolara mal oluyor
- İş yükleri değişkendi — yoğun saatlerde, yoğun olmayan saatlerin 4-8 katı GPU kapasitesi gerekiyordu
- Sunucusuz GPU sağlayıcılarındaki soğuk başlatma süreleri, gerçek zamanlı çıkarım için çok yavaştı (30-60 saniye)
- Model yükleme, önemli miktarda VRAM ve başlatma süresi gerektiriyordu
- Tek bir bulut sağlayıcısına bağımlılık, pazarlık gücünü ve yedekleme seçeneklerini sınırlıyordu
Çözümümüz
Geleneksel bulut GPU maliyetlerinin bir kısmına AI çıkarım iş yüklerini çalıştırmak için GPU hesaplama katmanı olarak RunPod'u benimsedik ve soğuk başlatmaları en aza indirmek için sıcak örnek mimarisi kullandık.
Mimari
- Hesaplama: Çıkarım iş yükleri için RunPod GPU podları, iş yüküne göre GPU seviyesi seçildi
- Orkestrasyon: RunPod podlarını yöneten birincil bulutta FastAPI orkestratörü
- Ağ: Birincil altyapı ile RunPod örnekleri arasında güvenli tüneller
- Model Depolama: Hızlı başlatma için modellerin yerleşik olduğu önceden oluşturulmuş Docker görüntüleri
- İzleme: Pod kullanılabilirliği için sağlık kontrolleri ve otomatik yeniden başlatma
Altyapı Tasarımı
Pod Yapılandırması
- GPU Seçimi: İş yüküne göre seçilen maliyet etkin GPU seviyeleri, büyük bulut sağlayıcılarının eşdeğer GPU örneklerine göre %85-90 maliyet tasarrufu sağladı
- Docker Şablonları: Çıkarım için önceden yüklenmiş AI modellerine sahip özel konteynerler
- Kalıcı Depolama: Model ağırlıkları ve yapılandırma dosyaları için ağ hacimleri
- Ortam Değişkenleri: Akış uç noktaları, API anahtarları ve özellik bayrakları için dinamik yapılandırma
Sıcak Örnek Stratejisi
Her istek için podları soğuk başlatmak yerine, operasyonel saatlerde sıcak örnekler koruyoruz:
- Zamanlanmış Ölçekleme — Yoğun saatlerden önce podlar başlatılır, yoğun olmayan saatlerde durdurulur
- Önceden Yüklenmiş Modeller — Konteyner başlatıldığında çıkarım motorları yüklenir, hemen hazır
- Sağlık Probları — Orkestratör, RunPod podlarını düzenli olarak izleyerek hazır olup olmadığını doğrular
- Otomatik Kurtarma — Sağlıksız podlar RunPod API aracılığıyla otomatik olarak değiştirilir
Bulutlar Arası İletişim
- Birincil Bulut: API sunucuları, veritabanları, kayıt çalışanları
- GPU Bulutu (RunPod): AI çıkarımı, nesne algılama, izleme
- Veri Akışı: Video kareleri, çıkarım için birincil buluttan RunPod'a gönderilir; algılama sonuçları WebSocket üzerinden geri döner
- Zaman Damgası Senkronizasyonu: Bulutlar arasındaki saat kaymasını yönetmek için PTS tabanlı senkronizasyon
Maliyet Optimizasyonu
RunPod'un fiyatlandırma modeli, büyük bulut sağlayıcılarının eşdeğer GPU örneklerine kıyasla önemli tasarruflar sağladı:
- Talep Üzerine: Saatlik GPU hesaplama maliyetinde %85-90 azalma
- Spot Fiyatlandırma: Topluluk bulutunda kritik olmayan toplu işlem için ek %50 tasarruf
- Zamanlanmış Kapatma: Operasyonel saatlere göre otomatik durdurma/başlatma, maliyetleri daha da azaltır
- Doğru Boyutlandırma: Aşırı tahsis yerine gerçek VRAM ihtiyaçlarına uygun GPU seviyesi seçimi
- Çoklu Pod Dağılımı: Akışlar, tek bir büyük örnek yerine daha küçük, daha ucuz GPU'lar arasında dağıtılır
Dağıtım İş Akışı
- Oluştur — Tüm modeller, bağımlılıklar ve uygulama kodu ile Docker görüntüsü
- Gönder — Görüntü, konteyner kaydına gönderilir
- Dağıt — RunPod API, belirtilen GPU, görüntü ve hacim montajları ile pod oluşturur
- Yapılandır — Belirli dağıtım için ortam değişkenleri ayarlanır
- İzle — Orkestratör, pod sağlığını doğrular ve çıkarım isteklerini yönlendirmeye başlar
- Ölçekle — Yük arttığında API aracılığıyla ek podlar başlatılır
Anahtar Özellikler
- Önemli Maliyet Azaltımı — Büyük bulut sağlayıcılarının eşdeğer GPU örneklerine kıyasla %85-90 tasarruf
- Önceden Oluşturulmuş Konteynerler — Modeller, 30 saniyenin altında başlatma için Docker görüntülerine yerleştirilmiştir
- API Tabanlı Ölçekleme — Talebe göre programatik pod oluşturma/yıkım
- Çoklu GPU Desteği — İş yükü gereksinimlerine bağlı olarak birden fazla GPU seviyesi mevcut
- Spot Örnek Yedekleme — Kritik olmayan iş yükleri, indirimli topluluk bulutunda çalışır
- Bulutlar Arası Mimari — GPU hesaplama, birincil altyapıdan ayrılmıştır
Sonuçlar
Teknoloji Yığını
caseStudyDetail.more Vaka Çalışmaları
Daha fazla teknik uygulamamızı keşfedin
AI ve Video İşleme İş Yükleri için Aç-Kapa Ölçekleme Deseni
AI destekli bir video işleme platformu, boşta olan GPU ve hesaplama kaynakları için ödeme yapmadan, boş saatlerde sıfır işten, yoğun saatlerde yüzlerce eşzamanlı video işleme ve AI çıkarım görevine kadar son derece değişken iş yüklerini yönetmek zorundaydı.
Catant HR ve İş Gücü Yönetim Platformu
Catant, işletmelerin çalışanları, bordroyu, katılımı ve uyumluluğu tek bir kontrol panelinden yönetmelerine yardımcı olan modüler bir HR ve iş gücü yönetim platformudur.
İşletmenizi Dönüştürmeye Hazır mısınız?
Zorluklarınıza benzer çözümler uygulamamızın yollarını konuşalım.