GPU 가속 AI를 활용한 실시간 다중 스트림 비디오 분석
한 기업 보안 공급업체는 AI 기반 탐지를 통해 여러 라이브 비디오 스트림을 동시에 처리하고, 분산된 인프라 전반에 걸쳐 정확한 타임스탬프 동기화와 함께 실시간 알림을 제공해야 했습니다.
프로젝트 상담하기
과제
AI를 이용한 여러 RTSP 스트림 처리에는 몇 가지 복잡한 문제 해결이 필요했습니다.
- GPU 메모리 제약으로 동시 스트림 처리가 제한되었습니다.
- 기록 머신과 추론 머신 간의 클럭 불균형은 타임스탬프 드리프트를 유발했습니다.
- 기존 탐지 모델은 실시간 다중 스트림 시나리오에 너무 느렸습니다.
- 이벤트는 검토를 위해 비디오 재생 위치에 정확하게 매핑되어야 했습니다.
우리의 솔루션
우리는 PTS 기반 타임스탬프 동기화를 통해 다중 스트림 실시간 처리에 최적화된 분산 AI 추론 플랫폼을 설계했습니다.
아키텍처
- 추론 엔진: NVIDIA RTX 4000 Ada에서 TensorRT 가속을 이용한 YOLO11
- 추적: 영구 ID 할당 기능을 갖춘 ByteTrack 다중 객체 추적
- 스트리밍: RTSP/HLS/RTMP 프로토콜 변환을 위한 MediaMTX
- 통신: 이중 WebSocket 채널 (실시간 탐지 오버레이 + 이벤트 알림)
- 인프라: DigitalOcean (기록) + RunPod (GPU 추론)
최적화 기법
- TensorRT 가속 - 약 15ms 배치 추론을 위해 모델을 TensorRT로 컴파일
- 마이크로 배치 처리 - GPU 효율성을 위해 여러 스트림의 프레임을 배치 처리
- 메모리 관리 - 10-12개의 동시 스트림에 4-6GB VRAM 사용
- PTS 타임스탬프 동기화 - 머신 간 클럭 불균형을 해결하는 프레젠테이션 타임스탬프 기반 동기화
- 머신 간 오프셋 보정 - 분산 노드 간의 자동 시간 오프셋 계산
탐지 파이프라인
- 신뢰도 점수 부여를 통한 사람/차량 탐지
- EasyOCR을 통한 번호판 인식 및 텍스트 추출
- 구성 가능한 민감도를 갖춘 화재 및 연기 탐지
- 행동 분석 (배회 시간, 침입 구역, 점유 임계값)
주요 기능
- 이중 WebSocket 채널 - 비디오 오버레이 데이터 및 알림 이벤트를 위한 별도의 스트림
- PTS 동기화 - 이벤트 타임스탬프가 정확한 비디오 재생 위치와 일치
- 영구 객체 추적 - ByteTrack은 일관된 추적을 위해 프레임 전반에 걸쳐 ID를 유지합니다.
- 구성 가능한 탐지 구역 - 카메라별 침입/배회 구역 정의
- 자동 스케일링 - GPU 가용성에 따른 동적 스트림 할당
결과
기술 스택
caseStudyDetail.more 사례 연구
더 많은 기술 구현 사례를 살펴보세요
자주 묻는 질문
MicrocosmWorks는 여러 스트림의 프레임을 NVIDIA TensorRT를 사용하여 단일 GPU 추론 호출로 일괄 처리함으로써 파이프라인을 최적화했으며, 이를 통해 GPU 활용도를 극대화하고 노드당 20개 이상의 동시 스트림을 처리할 때도 프레임당 100ms 미만의 지연 시간(latency)을 달성합니다. 이 아키텍처는 CUDA 가속 비디오 디코딩을 사용하여 CPU에서 프레임 추출 작업을 오프로드함으로써, 일반적으로 다중 스트림 성능을 제한하는 디코딩 병목 현상을 방지합니다.
MicrocosmWorks는 카메라별 상태 머신을 유지하는 내결함성 스트림 핸들러를 구축하여, 지수 백오프(exponential backoff)를 사용하여 끊긴 스트림을 자동으로 재연결하면서 모든 정상 피드를 중단 없이 계속 처리합니다. 손상된 프레임은 체크섬 유효성 검사를 통해 감지되고 원활하게 건너뛰어지며, 시스템은 카메라의 안정성이 구성 가능한 임계값 아래로 떨어질 때 알림을 트리거하는 스트림 상태 지표를 추적합니다.
네, MicrocosmWorks는 맞춤형 모델 훈련 파이프라인을 제공합니다. 고객은 이 파이프라인을 통해 특정 감지 대상의 레이블이 지정된 예시를 제공하며, 저희 팀은 산업별 객체, 행동 또는 이상 징후를 인식하도록 기본 감지 모델을 미세 조정합니다. 이 플랫폼은 가동 중단 없이 프로덕션 환경에서 모델 핫스왑을 지원하므로, 배포된 카메라에서 더 많은 훈련 데이터를 수집함에 따라 감지 정확도를 반복적으로 향상시킬 수 있습니다.
MicrocosmWorks는 분석 플랫폼을 Kubernetes 기반 아키텍처로 설계했습니다. 여기서 GPU 워커 파드는 스트림 수와 처리 로드에 따라 수평적으로 확장됩니다. 용량 추가는 추가 GPU 노드를 프로비저닝하는 것만큼 간단하며, 오케스트레이션 계층은 사용 가능한 워커에 스트림을 자동으로 재분배하여 전체 배포 크기에 관계없이 일관된 지연 시간과 탐지 정확도를 유지합니다.
MicrocosmWorks는 초기 프레임 추출 및 선택적 경량 추론이 카메라 가까이에서 이루어지는 엣지 전처리 옵션을 구현하여, 키 프레임 또는 이벤트 트리거 클립만 전송함으로써 중앙 분석 클러스터에 필요한 대역폭을 줄입니다. 완전 중앙 집중식 배포의 경우, 이 플랫폼은 구성 가능한 해상도로 H.265 스트림을 지원하며, 일반적인 대역폭은 15fps 분석 샘플링 속도에서 1080p 스트림당 2-4 Mbps입니다.