AI 및 비디오 처리 워크로드를 위한 온-오프 스케일링 패턴
AI 기반 비디오 처리 플랫폼은 유휴 GPU 및 컴퓨팅 리소스에 비용을 지불하지 않으면서, 비사용 시간대의 작업 제로부터 피크 시간대의 수백 가지 동시 비디오 처리 및 AI inference 작업에 이르기까지 매우 가변적인 워크로드를 처리해야 했습니다.
프로젝트 상담하기
과제
AI 및 비디오 처리 워크로드는 본질적으로 버스트가 발생하기 쉽고 비용이 많이 듭니다:
- GPU 인스턴스는 작업을 처리하든 유휴 상태로 있든 비용이 많이 듭니다.
- 비디오 인코딩, 트랜스크립션 및 AI inference는 각기 다른 리소스 프로필을 요구합니다.
- 피크-최저점 비율은 50:1이었습니다 — 피크 시 200개 이상의 작업, 밤새 거의 제로.
- 기존 auto-scaling은 시간 민감 사용자 요청에는 너무 느렸습니다 (5-10분 cold start).
- 피크를 위해 프로비저닝된 고정 인프라는 비피크 시간대에 80% 이상의 낭비를 의미했습니다.
우리의 솔루션
저희는 온-오프 스케일링 패턴을 구현했습니다 — 활성 워크로드에 맞춰 컴퓨팅 리소스가 Just-In-Time으로 프로비저닝되고 유휴 상태일 때는 완전히 할당 해제되며, 지연 시간에 민감한 작업을 위한 warm pools와 배치 작업을 위한 cold pools를 갖춘 하이브리드 아키텍처입니다.
아키텍처
- Job Queue (작업 큐): 우선순위 분류를 지원하는 데이터베이스 기반 작업 큐
- Orchestrator (오케스트레이터): 리소스 라이프사이클 및 작업 라우팅을 관리하는 서비스
- GPU Workers (AI): inference (객체 감지, 트랜스크립션, 화자 감지)를 위한 클라우드 GPU pods
- CPU Workers (Video): 비디오 인코딩 및 렌더링을 위한 클라우드 VMs
- Warm Pool (웜 풀): 지연 시간에 민감한 작업 (< 30초 시작)을 위한 사전 초기화된 인스턴스
- Cold Pool (콜드 풀): 배치/대량 처리를 위한 on-demand 인스턴스 (2-5분 시작 허용)
온-오프 패턴 구현
리소스 라이프사이클 상태
리소스는 정의된 라이프사이클을 거칩니다: 완전히 할당 해제된 상태 (제로 비용)부터 provisioning 및 warming (모델 로딩, health checks), 준비 및 처리 상태를 거쳐, 다시 할당 해제 상태로 돌아가기 전에 cooldown window를 거칩니다.
웜 풀 전략
지연 시간에 민감한 처리 (사용자 시작, 몇 분 안에 결과 예상)의 경우:
- 영업 시간 동안 최소한의 warm pool 인스턴스를 유지합니다.
- 컨테이너 시작 시 AI 모델을 사전 로드합니다.
- 들어오는 작업을 먼저 warm instances로 라우팅합니다.
- 큐 길이가 임계값을 초과하면 추가 warm instances를 scale out합니다.
- 구성 가능한 cooldown timer는 산발적인 작업 사이에 인스턴스를 활성 상태로 유지합니다.
콜드 풀 전략
배치 처리 (밤샘 대량 작업, 긴급하지 않은 재인코딩)의 경우:
- 기본적으로 실행 중인 인스턴스는 없습니다.
- Job queue가 provisioning을 트리거합니다.
- 지연 시간보다 throughput을 위한 대량 최적화 인스턴스.
- 배치 완료 즉시 종료합니다.
- 상당한 비용 절감을 위해 spot/preemptible instances를 사용합니다.
작업 분류 및 라우팅
작업은 우선순위와 유형에 따라 자동으로 분류된 후 적절한 풀로 라우팅됩니다:
- 고우선순위 사용자 시작 AI 작업은 warm GPU pools로 라우팅됩니다.
- 중요 real-time 작업은 always-on dedicated instances로 라우팅됩니다.
- 중간 우선순위 인코딩 작업은 warm 또는 cold CPU pools로 라우팅됩니다.
- 저우선순위 배치 작업은 cold spot/preemptible instances로 라우팅됩니다.
오케스트레이터 로직
스케일업 트리거
- 큐 길이가 구성 가능한 임계값을 초과합니다.
- 평균 대기 시간이 우선순위 수준의 SLA를 초과합니다.
- 알려진 peak hours 전의 예정된 ramp-up.
- 예상되는 traffic spikes를 위한 admin API를 통한 수동 트리거.
스케일다운 트리거
- cooldown window 기간 동안 처리된 작업이 없습니다.
- peak hours 이후 예정된 wind-down.
- 모든 대기 중인 작업이 완료되었고 새 제출이 없습니다.
- billing period 동안 비용 임계값에 도달했습니다.
상태 및 복구
- 모든 활성 인스턴스에 대한 정기적인 health probes.
- 비정상 인스턴스는 자동으로 교체됩니다.
- 실패한 작업은 retry count와 함께 재큐에 들어가고 다른 인스턴스로 라우팅됩니다.
- 최대 retries를 초과하는 작업을 위한 Dead letter queue.
비용 영향
온-오프 패턴은 비피크 시간대의 유휴 compute를 제거하고, 작업 유형별로 리소스 크기를 조정하며, 배치 워크로드에 spot instances를 활용함으로써 always-on fixed infrastructure 대비 약 70%의 비용 절감을 달성했습니다.
주요 기능
- 유휴 비용 제로 — 작업을 처리하지 않을 때 리소스가 완전히 할당 해제됩니다.
- 웜 풀 — 지연 시간에 민감한 워크로드를 위한 사전 초기화된 인스턴스.
- 콜드 풀 — 최저 비용으로 배치 작업을 위한 on-demand provisioning.
- 작업 분류 — 우선순위, 유형 및 지연 시간 요구 사항에 따른 자동 라우팅.
- 쿨다운 기간 — 구성 가능한 idle timeout으로 버스트 사이에 조기 scale-down을 방지합니다.
- Spot/Preemptible 지원 — 배치 작업은 할인된 인스턴스로 라우팅되어 상당한 비용 절감 효과를 얻습니다.
- 상태 및 복구 — 비정상 인스턴스의 자동 교체 및 작업 re-queuing.
- 예약된 스케일링 — 시간 기반 provisioning 규칙으로 알려진 traffic patterns를 예측합니다.
결과
기술 스택
caseStudyDetail.more 사례 연구
더 많은 기술 구현 사례를 살펴보세요
자주 묻는 질문
MicrocosmWorks는 예측 가능한 GPU 집중 처리 버스트(폭증) 후 긴 유휴 기간이 이어지는 워크로드를 위해 on-off 스케일링 패턴을 개발했습니다. 기존의 auto-scaling은 유휴 시간 동안 최소 용량을 유지하는 데 비용을 낭비하는 문제가 있었습니다. 웜 인스턴스를 계속 실행하는 대신, 이 패턴은 처리 작업이 도착하면 GPU 인프라를 주문형으로 프로비저닝하고, 워크로드를 실행하며, 작업이 완료되면 인프라를 완전히 종료하여 유휴 기간 동안 거의 0에 가까운 비용을 달성합니다.
MicrocosmWorks는 모든 AI 모델 가중치와 종속성을 내장하고 컴퓨팅 리전에 지리적으로 가까운 레지스트리에 저장된 최적화된 컨테이너 이미지를 미리 구축하여 콜드 스타트 시간을 60초 미만으로 단축했습니다. 오케스트레이션 계층은 예정된 워크로드의 경우 예상 수요보다 2-3분 일찍 인프라를 시작하는 예측 프로비저닝을 사용하며, 예측 불가능한 워크로드의 경우 시스템은 작업을 대기열에 넣고 처리 시작 알림을 보내 사용자들이 요청이 처리되고 있음을 알 수 있도록 합니다.
MicrocosmWorks는 매일 2-6시간 동안 AI 비디오 처리 워크로드를 실행하는 고객들을 위해 24/7 GPU 인스턴스를 유지하는 것과 비교했을 때 70-90%의 비용 절감을 기록했습니다. 이러한 절감 효과는 실제 처리 시간에 대해서만 비용을 지불하고 여기에 몇 분간의 시작 및 종료 오버헤드가 추가되는 방식에서 비롯됩니다. 이 패턴은 야간 일괄 비디오 처리, 온디맨드 트랜스코딩, 또는 사용률이 본질적으로 간헐적인 이벤트 기반 AI 분석과 같은 워크플로에 특히 효과적입니다.
네, MicrocosmWorks는 대규모 batch job이 도착하면 on-off 패턴 내에서 fan-out 아키텍처를 구현하여 여러 GPU worker를 병렬로 프로비저닝하고, job queue를 사용하여 비디오 파일을 worker들에게 분배하며, batch가 완료되면 모든 worker를 해제합니다. 이 시스템은 개별 비디오 진행 상황을 추적하고, 나머지 batch를 차단하지 않으면서 retry logic으로 개별 비디오 오류를 처리하며, downstream consumption을 위해 결과를 단일 출력 위치로 통합합니다.
MicrocosmWorks는 시간당 $25-$45의 개발 요율로 온-오프 스케일링 아키텍처를 구현하며, 작업 오케스트레이션, 인프라 프로비저닝, 모니터링 및 장애 처리를 포함하는 프로덕션 준비 완료 구현은 일반적으로 3-5주 이내에 제공됩니다. 개발 투자는 특히 하루 중 50% 이상 유휴 상태로 있는 상시 가동(always-on) GPU 인스턴스를 현재 실행 중인 조직의 경우, GPU 비용 절감만으로도 일반적으로 1-2개월 이내에 자체적으로 비용을 회수합니다.