확장 가능하고 비용 효율적인 AI 추론을 위한 RunPod 활용
AI 기반 비디오 분석 플랫폼은 24시간 내내 운영되는 전용 GPU 서버의 엄청난 비용 없이, 여러 동시 비디오 스트림에 걸쳐 실시간 객체 감지 및 추론을 위한 고성능 GPU 컴퓨팅이 필요했습니다.
프로젝트 상담하기
과제
AI 워크로드를 위한 GPU 인프라는 비용 대비 성능이라는 딜레마를 안고 있었습니다:
- 주요 클라우드 제공업체의 전용 GPU 서버는 인스턴스당 월 수천 달러의 비용이 들었습니다.
- 워크로드는 가변적이었습니다 — 피크 시간에는 비피크 시간 대비 4-8배의 GPU 용량이 필요했습니다.
- 서버리스 GPU 제공업체의 콜드 스타트 시간은 실시간 추론에 너무 느렸습니다 (30-60초).
- 모델 로딩에 상당한 VRAM과 시작 시간이 필요했습니다.
- 단일 클라우드 제공업체에 대한 벤더 종속은 협상력과 장애 조치 옵션을 제한했습니다.
우리의 솔루션
저희는 GPU 컴퓨팅 계층으로 RunPod를 채택하여, 온디맨드 및 Spot GPU 인스턴스를 사용하여 기존 클라우드 GPU 비용의 일부로 AI 추론 워크로드를 실행하고, 콜드 스타트를 최소화하기 위한 웜 인스턴스 아키텍처를 사용했습니다.
아키텍처
- 컴퓨팅: 추론 워크로드를 위한 RunPod GPU pod, 워크로드별로 GPU 티어 선택
- 오케스트레이션: 기본 클라우드의 FastAPI 오케스트레이터가 RunPod pod 관리
- 네트워킹: 기본 인프라와 RunPod 인스턴스 간의 보안 터널
- 모델 스토리지: 빠른 시작을 위해 모델이 포함된 사전 구축된 Docker 이미지
- 모니터링: pod 가용성을 위한 상태 확인 및 자동 재시작
인프라 설계
Pod 구성
- GPU 선택: 워크로드별로 비용 효율적인 GPU 티어 선택, 동급 주요 클라우드 제공업체 GPU 인스턴스 대비 약 85-90% 비용 절감 달성
- Docker 템플릿: 추론을 위해 AI 모델이 사전 로드된 사용자 지정 컨테이너
- 영구 스토리지: 모델 가중치 및 구성 파일을 위한 네트워크 볼륨
- 환경 변수: 스트림 엔드포인트, API 키 및 기능 플래그를 위한 동적 구성
웜 인스턴스 전략
요청당 pod를 콜드 스타트하는 대신, 운영 시간 동안 웜 인스턴스를 유지합니다:
- 예정된 스케일링 — 피크 시간 전에 pod 시작, 비피크 시간 동안 중지
- 사전 로드된 모델 — 컨테이너 시작 시 추론 엔진 로드, 즉시 준비
- 상태 프로브 — 오케스트레이터가 RunPod pod의 준비 상태를 정기적으로 모니터링
- 자동 복구 — 비정상적인 pod는 RunPod API를 통해 자동으로 교체
크로스 클라우드 통신
- 기본 클라우드: API 서버, 데이터베이스, 녹화 워커
- GPU 클라우드 (RunPod): AI 추론, 객체 감지, 추적
- 데이터 흐름: 비디오 프레임은 기본 클라우드에서 RunPod로 추론을 위해 전송; 감지 결과는 WebSocket을 통해 반환
- 타임스탬프 동기화: 클라우드 간 클럭 스큐를 처리하기 위한 PTS 기반 동기화
비용 최적화
RunPod의 가격 모델은 주요 클라우드 제공업체의 동급 GPU 인스턴스와 비교하여 상당한 비용 절감을 제공했습니다:
- On-Demand: 시간당 GPU 컴퓨팅 비용 약 85-90% 절감
- Spot Pricing: 커뮤니티 클라우드에서 중요하지 않은 배치 처리에 대해 추가 50% 절감
- 예정된 종료: 운영 시간에 따른 자동 중지/시작으로 비용 추가 절감
- 적정 크기 조정: 과도한 프로비저닝 대신 실제 VRAM 요구 사항에 맞는 GPU 티어 선택
- 멀티 Pod 분산: 하나의 큰 인스턴스 대신 더 작고 저렴한 GPU에 스트림 분산
배포 워크플로우
- 빌드 — 모든 모델, 종속성 및 애플리케이션 코드를 포함한 Docker 이미지
- 푸시 — 컨테이너 레지스트리로 이미지 푸시
- 배포 — RunPod API는 지정된 GPU, 이미지 및 볼륨 마운트를 사용하여 pod 생성
- 구성 — 특정 배포를 위한 환경 변수 설정
- 모니터링 — 오케스트레이터는 pod 상태를 확인하고 추론 요청 라우팅 시작
- 스케일 — 로드 증가 시 API를 통해 추가 pod 시작
주요 특징
- 상당한 비용 절감 — 동급 주요 클라우드 GPU 인스턴스 대비 85-90% 절감
- 사전 구축된 컨테이너 — 30초 미만 시작을 위해 Docker 이미지에 모델 포함
- API 기반 스케일링 — 수요에 따른 프로그래밍 방식의 pod 생성/삭제
- 멀티 GPU 지원 — 워크로드 요구 사항에 따라 여러 GPU 티어 사용 가능
- Spot 인스턴스 대체 — 중요하지 않은 워크로드는 할인된 커뮤니티 클라우드에서 실행
- 크로스 클라우드 아키텍처 — GPU 컴퓨팅이 기본 인프라와 분리됨
결과
기술 스택
caseStudyDetail.more 사례 연구
더 많은 기술 구현 사례를 살펴보세요
AI 및 비디오 처리 워크로드를 위한 온-오프 스케일링 패턴
AI 기반 비디오 처리 플랫폼은 유휴 GPU 및 컴퓨팅 리소스에 비용을 지불하지 않으면서, 비사용 시간대의 작업 제로부터 피크 시간대의 수백 가지 동시 비디오 처리 및 AI inference 작업에 이르기까지 매우 가변적인 워크로드를 처리해야 했습니다.
Catant HR 및 인력 관리 플랫폼
Catant는 기업이 단일 대시보드에서 직원, 급여, 근태 및 규정 준수를 관리하도록 돕는 모듈형 HR 및 인력 관리 플랫폼입니다.
자주 묻는 질문
MicrocosmWorks는 RunPod가 AI inference workloads 실행 시 동등한 AWS 또는 GCP 인스턴스보다 50-70% 더 낮은 비용으로 GPU compute를 제공한다는 사실을 확인했습니다. 이는 주로 RunPod가 일반적인 cloud compute 대신 GPU workloads에 특화되어 최적화된 serverless 및 spot-like pricing model로 운영되기 때문입니다. 그에 대한 trade-off는 더 적은 infrastructure management tooling과 더 적은 지리적 리전이지만, MicrocosmWorks는 job queuing, health monitoring, 및 automatic failover를 처리하는 사용자 정의 orchestration layer를 구축함으로써 이를 보완했습니다.
MicrocosmWorks는 RunPod에 서버리스 엔드포인트 아키텍처를 구현하여 수신되는 작업 큐 깊이에 따라 GPU 워커를 0에서 구성된 최댓값까지 자동으로 확장합니다. 이는 처리 수요가 없을 때 비용을 전혀 지불하지 않는다는 것을 의미합니다. 이 시스템은 예열된 컨테이너 이미지를 활용한 RunPod의 cold-start optimization을 사용하여 0에서 확장할 때의 지연을 최소화하며, 유휴 기간 후 첫 추론(first-inference) 지연 시간을 15-30초로 달성하여 기존 클라우드 GPU 인스턴스의 2-5분과 비교됩니다.
MicrocosmWorks는 단일 A4000 GPU에서 실행되는 경량 컴퓨터 비전 분류기부터 RunPod의 인프라에서 A100 80GB 인스턴스를 사용한 다중 GPU 설정이 필요한 대규모 언어 모델에 이르기까지 다양한 모델을 배포했습니다. 이 플랫폼은 PyTorch, TensorFlow, ONNX, 그리고 TensorRT에 최적화된 모델을 포함하여 Docker 컨테이너에서 실행되는 모든 모델을 지원하며, MicrocosmWorks는 콜드 스타트 시간을 최소화하기 위해 모든 종속성이 사전 설치된 맞춤형 Docker 이미지를 구축합니다.
MicrocosmWorks는 RunPod 워커로 전송되기 전에 민감한 입력 데이터를 암호화하고, 각 작업 후 파기되는 임시 컨테이너에서 처리하며, 클라이언트로 반환되기 전에 결과도 암호화되는 보안 아키텍처를 구현합니다. RunPod 인스턴스에서는 영구 스토리지를 사용하지 않으며, 전송 중인 모든 데이터는 TLS 1.3을 사용하고, RunPod 시스템에 저장된 작업 메타데이터는 작업 ID 및 상태 정보만 포함하며 민감한 내용은 포함하지 않습니다.
MicrocosmWorks는 RunPod 추론 파이프라인을 시간당 $25-$40의 개발 요율로 설정해 드립니다. 맞춤형 Docker 이미지, 오토 스케일링 구성, 모니터링 및 API 통합을 포함하는 프로덕션 준비 완료 배포는 일반적으로 2-4주 내에 제공됩니다. 지속적인 RunPod 컴퓨팅 비용은 워크로드에 따라 달라지지만, 동등한 AWS SageMaker 또는 GCP Vertex AI 배포보다 일반적으로 50-70% 저렴하여, AI 인프라 비용을 최적화하려는 스타트업 및 중견 기업에게 RunPod가 특히 매력적입니다.