대규모 학습 및 추론을 위한 지능형 오케스트레이션으로 GPU 활용도를 극대화하고 실험당 비용을 최소화합니다.

대규모 모델을 학습시키는 AI 팀은 심각한 인프라 문제에 직면합니다. GPU 컴퓨팅은 비싸고, 부족하며, 활용도가 낮습니다. 데이터 과학자들은 공유 클러스터에서 GPU 접근을 기다리며 몇 시간을 대기하고, 할당된 인스턴스는 데이터 전처리나 하이퍼파라미터 분석 중에 유휴 상태로 있습니다. 적절한 체크포인팅이 없는 멀티데이 학습 실행은 Spot instance 중단으로 인해 파괴될 수 있으며, 수천 달러를 낭비하게 됩니다. 실험당 비용에 대한 가시성이 없어 다양한 연구 방향의 ROI를 비교하는 것이 불가능합니다. 모델 아티팩트는 버전 관리나 계보 추적 없이 개인 머신과 S3 버킷에 분산되어 있습니다. 조직이 단일 GPU 실험에서 분산 멀티노드 학습으로 확장됨에 따라 소규모 팀에서 작동했던 임시 도구는 무너지고, 연구원들은 모델을 발전시키는 것보다 인프라 관리에 더 많은 시간을 할애하게 됩니다.
다음 프로젝트를 위한 더 많은 구현 청사진을 발견하세요
MicrocosmWorks는 A100/H100 GPU의 MIG (Multi-Instance GPU) 파티셔닝을 활용하는 워크로드 인식 GPU 스케줄링을 구현합니다. 이는 추론 워크로드를 더 작은 GPU 슬라이스로 분리하는 동시에 전체 GPU 또는 다중 GPU 할당을 훈련 작업에 예약하여, 혼합 워크로드 간섭으로 인한 메모리 단편화를 방지합니다. 오케스트레이터는 다양한 워크로드 유형의 메모리 프로파일을 이해하고, 단편화된 할당으로 인한 메모리 부족(out-of-memory) 실패를 유발하지 않으면서 GPU 활용률을 최대화하도록 스케줄링합니다. 추론 및 훈련을 모두 실행하는 클러스터의 경우, 이 접근 방식은 일반적으로 단순하게 스케줄링된 혼합 클러스터에서 흔히 볼 수 있는 30-40%에 비해 70-85%의 GPU 활용률을 달성합니다.
MicrocosmWorks는 일반적으로 NVIDIA GPU Operator 및 사용자 정의 스케줄링 플러그인을 갖춘 Kubernetes를 사용하여 GPU 오케스트레이션을 배포하며, 바닐라 Kubernetes가 기본적으로 지원하지 않는 갱 스케줄링, 공정 공유 큐잉, 분할 GPU 할당을 위해 Run:ai 또는 Volcano와 같은 프레임워크로 강화됩니다. 표준 Kubernetes는 GPU를 불투명한 정수 리소스로 처리하는 반면, 당사의 향상된 스택은 GPU 토폴로지(NVLink 인터커넥트, PCIe 대 NVSwitch), 메모리 용량 및 컴퓨팅 성능을 이해하여 학습 성능에 크게 영향을 미치는 배치 결정을 내립니다. 대규모 클러스터(50개 이상의 GPU)의 경우, 스케줄링 인텔리전스만으로도 기본 Kubernetes GPU 스케줄링과 비교하여 실질적인 처리량을 20-40% 향상시킬 수 있습니다.
MicrocosmWorks는 버스트 용량을 위한 온디맨드 클라우드 GPU, 기준의 안정적인 워크로드를 위한 예약 인스턴스, 그리고 체크포인트 설정을 통해 내결함성 훈련 작업을 위한 스팟/선점형 인스턴스를 결합한 다단계 GPU 조달 전략을 구현합니다. 이는 온디맨드 전용 가격 책정 대비 40-60%의 비용 절감을 달성합니다. 오케스트레이션 계층은 구성 가능한 간격으로 훈련 작업을 자동으로 체크포인트 설정하여, 스팟 인스턴스가 회수될 때 원활한 선점 복구를 가능하게 하며, 시간에 민감한 추론 워크로드를 예약된 용량으로 라우팅하여 가용성을 보장합니다. 지속적인 GPU 수요가 있는 조직의 경우, 자사 NVIDIA 하드웨어와의 코로케이션과 클라우드 전용 접근 방식을 비교 평가하는데, 이는 자사 하드웨어의 손익분기점이 일반적으로 12-18개월의 연속 활용이기 때문입니다.
MicrocosmWorks는 InfiniBand (400Gbps NDR) 또는 RoCE v2 (100-400Gbps) 패브릭과 NCCL에 최적화된 네트워크 토폴로지를 사용하여 고대역폭, 저지연 인터커넥트를 배포합니다. 이는 노드 간의 gradient synchronization이 통신 병목 현상을 생성할 때, 분산 학습 성능이 compute-bound보다는 network-bound인 경우가 많기 때문입니다. 네트워크 아키텍처는 동일한 네트워크 스위치(leaf-spine topology awareness)를 통해 연결된 노드에 분산 학습 pods를 공동 배치하는 topology-aware job placement를 포함하여 cross-switch traffic을 최소화합니다. cloud deployments의 경우, 우리는 near-bare-metal network performance를 제공하는 placement groups 및 cluster networking options (AWS EFA, GCP GPUDirect-TCPX, Azure InfiniBand)을 활용하며, 네트워크 아키텍처 컨설팅은 시간당 $35-$50입니다.
MicrocosmWorks는 네임스페이스 기반 다중 테넌시를 구현하며, 각 팀별 보장된 최소 GPU 할당량(quota), 클러스터에 유휴 리소스가 있을 때 할당량(quota)을 초과하는 버스트 용량, 그리고 높은 우선순위의 프로덕션 추론(inference) 워크로드가 대규모 학습 기간에도 항상 리소스를 확보하도록 보장하는 우선순위 기반 선점 정책을 제공합니다. 이 플랫폼은 셀프 서비스 포털을 포함하며, 여기서 팀 리더는 플랫폼 엔지니어링 개입 없이도 학습 작업 제출, 큐 대기 순서 확인, GPU 활용도 모니터링, 그리고 팀의 작업 우선순위를 관리할 수 있습니다. Chargeback reporting은 각 팀 및 프로젝트가 소비한 GPU-시간을 추적하여 재무팀이 AI 인프라 비용을 사업부별로 정확하게 할당할 수 있도록 합니다.
MicrocosmWorks는 지능형 큐잉, 선점 정책 및 비용 추적을 통해 컴퓨팅을 공유 가능하고 스케줄링 가능한 리소스로 취급하는 엔드투엔드 GPU 오케스트레이션 플랫폼을 구축할 수 있습니다. 이 플랫폼은 별개의 스케줄링 프로필을 가진 학습 및 추론 워크로드를 모두 지원합니다. 학습 작업은 자동 체크포인팅을 통해 Spot 및 on-demand 인스턴스에 걸쳐 배치 스케줄링되며, 추론 엔드포인트는 요청 패턴에 따라 자동 스케일됩니다. 통합 모델 레지스트리는 각 실험의 코드, 데이터, 하이퍼파라미터 및 결과 아티팩트를 전체 계보와 함께 추적합니다. 연구원들은 셀프 서비스 포털을 통해 리소스 요구 사항을 정의하고, 플랫폼은 배치, 스케일링, Fault tolerance 및 비용 할당을 자동으로 처리합니다.
이 플랫폼은 GPU-aware 스케줄링을 사용하는 Kubernetes에서 실행되며, 큐 깊이에 따라 자동 스케일되는 on-demand 및 Spot instance 노드 풀을 혼합하여 사용합니다. 맞춤형 스케줄러는 팀 예산, 마감일 및 리소스 효율성에 따라 작업의 우선순위를 정합니다. 분산 스토리지 계층은 학습 작업에 고처리량 데이터 액세스를 제공하며, 모델 레지스트리 및 Experiment tracker는 재현성 및 거버넌스를 위한 메타데이터 기반을 제공합니다.
| 계층 | 기술 |
|---|---|
| Backend | Python, Go, FastAPI, gRPC, Ray |
| AI / ML | PyTorch, DeepSpeed, Hugging Face Transformers, NVIDIA NCCL, TensorRT, vLLM |
| Frontend | React, Grafana, MLflow UI, 맞춤형 Jupyter Hub 포털 |
| Database | PostgreSQL (메타데이터), MinIO (아티팩트 스토리지), Redis (작업 큐), TimescaleDB (메트릭) |
| Infrastructure | Kubernetes (GPU 노드를 포함한 EKS), Karpenter, NVIDIA GPU Operator, Terraform, ArgoCD, Prometheus, DCGM Exporter |
이 플랫폼은 12-16주에 걸쳐 네 가지 단계로 구축됩니다. 1-3주는 요구 사항 발견, GPU 워크로드 프로파일링, Karpenter 및 NVIDIA GPU Operator를 활용한 Kubernetes 기반 스케줄링 및 auto-scaling 인프라 아키텍처 설계에 중점을 둡니다. 4-8주는 bin-packing 및 gang scheduling을 갖춘 GPU-aware 스케줄러, Spot instance 입찰 전략을 포함한 elastic node pool manager, DVC 통합 MLflow 기반 모델 레지스트리를 구현합니다. 9-12주는 셀프 서비스 연구원 포털, Cost attribution engine 및 팀별 예산 집행 대시보드를 구축합니다. 13-16주는 대표적인 학습 작업을 통한 부하 테스트를 수행하고, Spot 중단에 대비한 checkpoint-and-resume 워크플로를 조정하며, ML 플랫폼 및 연구 팀에 운영 교육을 제공합니다.
| 지표 | 개선 사항 | 세부 정보 |
|---|---|---|
| GPU 활용률 | 평균 70-85% | bin-packing 및 큐 기반 스케줄링으로 유휴 예약 인스턴스 제거 |
| 컴퓨팅 비용 | 45-60% 절감 | 체크포인팅을 통한 Spot instance 관리로 작업 손실 위험 없이 비용 절감 |
| 연구원 대기 시간 | 80% 단축 | fair-share 스케줄링 및 elastic scaling으로 선착순 GPU 독점 방지 |
| 실험 재현성 | 100% | 데이터 버전에서 모델 아티팩트까지의 완벽한 계보 추적으로 모든 결과 재현 보장 |
| 모델 배포 시간 | 70% 단축 | 통합 모델 레지스트리에서 서빙 파이프라인으로 연결하여 연구와 엔지니어링 간의 수동 인계 대체 |
자동화되고 안전하며 반복 가능한 배포 파이프라인으로 배포 시간을 몇 시간에서 몇 분으로 단축합니다.