AI 얼굴 추적 및 세로 비디오 변환을 위한 스마트 리프레이밍
콘텐츠 재활용 플랫폼은 발표자와 피사체를 완벽하게 중앙에 유지하면서, 수동 자르기나 키프레이밍 없이 가로형(16:9) 롱폼 비디오를 세로형(9:16) 숏폼 클립으로 자동으로 변환해야 했습니다.
프로젝트 상담하기과제
가로 비디오를 세로 형식으로 변환하는 것은 숏폼 콘텐츠 제작에서 가장 번거로운 단계 중 하나였습니다:
- 클립마다 프레임을 수동으로 자르고 재배치하는 것은 시간이 많이 소요되었습니다.
- 다인 대화에서는 발표자가 바뀔 때마다 동적인 리프레이밍이 필요했습니다.
- 정적인 중앙 자르기는 움직이거나 중앙에서 벗어나 앉은 발표자를 잘라냈습니다.
- 기존의 얼굴 감지는 수천 개의 클립에 대한 실시간 리프레이밍 결정을 내리기에는 너무 느렸습니다.
- 다양한 콘텐츠 유형(인터뷰, 솔로 브이로그, 프레젠테이션)에는 다른 프레이밍 전략이 필요했습니다.
우리의 솔루션
우리는 비디오 프레임에서 얼굴을 감지하고, 움직임을 추적하며, 활성 피사체를 중앙에 유지하기 위해 세로 자르기 영역을 동적으로 조정하는 AI 기반 얼굴 추적 및 스마트 리프레이밍 엔진을 구축했습니다.
아키텍처
- 얼굴 감지: 속도에 최적화된 YOLO 기반 얼굴 감지 모델
- 얼굴 추적: 영구적인 피사체 ID를 사용한 IoU 기반 프레임-투-프레임 추적
- 리프레이밍 엔진: 얼굴 위치 및 움직임을 기반으로 한 동적 자르기 영역 계산
- 활성 발표자 연동: 발표자 감지 기능과 통합하여 말하는 사람을 우선시합니다.
- 렌더링: 부드러운 팬 전환 기능이 있는 FFmpeg 자르기 필터 체인
리프레이밍 파이프라인
- 얼굴 감지 - 샘플링된 프레인에 대해 YOLO 얼굴 감지 실행
- 피사체 추적 - IoU 기반 추적을 사용하여 프레임 전체에 걸쳐 얼굴 감지를 연결
- 발표자 우선순위 - 활성 발표자 감지와 연동될 경우, 말하는 피사체에 우선순위 부여
- 자르기 계산 - 기본 피사체 위치를 기반으로 최적의 9:16 자르기 영역 결정
- 스무딩 - 어색한 점프를 피하기 위해 자르기 움직임에 이징 적용
- 렌더링 - FFmpeg이 부드러운 팬 전환과 함께 동적 자르기 적용
주요 기능
- 다중 피사체 처리 - 여러 얼굴을 추적하고 각 세그먼트별로 기본 피사체 결정
- 발표자 인식 프레이밍 - 발표자 감지 기능과 통합될 때 활성 발표자에게 우선순위 부여
- 부드러운 전환 - 피사체 간의 이징 팬 기능으로 어색한 컷 제거
- 콘텐츠 유형 적응 - 솔로, 인터뷰, 그룹 콘텐츠에 대한 다양한 프레이밍 전략
- 일괄 처리 - 단일 롱폼 비디오에서 수백 개의 클립을 리프레이밍
- 수동 개입 없음 - 감지부터 최종 렌더링까지 완전 자동화
결과
기술 스택
caseStudyDetail.more 사례 연구
더 많은 기술 구현 사례를 살펴보세요
크로스 플랫폼 소셜 미디어 스케줄링 & 성과 분석
매주 수십 개의 숏폼 클립을 제작하는 콘텐츠 크리에이터들은 단일 대시보드에서 TikTok, YouTube Shorts, Instagram Reels에 콘텐츠를 배포하고 게시 전략을 최적화할 통찰력을 얻기 위한 통합 스케줄링 및 분석 시스템이 필요했습니다.
글로벌 콘텐츠 배포를 위한 다국어 자막 번역
국제적인 청중을 가진 콘텐츠 제작자들은 원본 오디오를 유지하면서 비디오 자막을 30개 이상의 언어로 번역하여 전 세계 시청자들이 모국어로 콘텐츠를 소비할 수 있도록 하여 그들의 도달 범위를 확장해야 했습니다.
자주 묻는 질문
MicrocosmWorks는 5프레임마다 실행되는 경량 얼굴 감지기와 프레임 간 예측을 위한 KCF optical flow tracker를 결합한 하이브리드 추적 접근 방식을 구현했습니다. 신뢰도 점수 하락을 통해 가려짐이 감지되면, 시스템은 Kalman filtering을 사용하여 마지막으로 알려진 궤적을 유지하고 다시 보이게 된 후 200ms 이내에 얼굴을 재감지합니다.
MicrocosmWorks는 9:16 크롭 창 위치를 결정할 때 감지된 얼굴, 그 다음 텍스트 영역, 그 다음 움직이는 영역 순으로 우선순위를 부여하는 중요도 가중치 크롭핑 알고리즘을 개발했습니다. 여러 사람이 등장하는 장면의 경우, 시스템은 구성 가능한 우선순위 순위를 사용하며, 기본적으로 활성 발화자 또는 가장 큰 얼굴을 선택하고, 크롭 위치 간의 부드러운 보간을 통해 갑작스러운 전환을 방지합니다.
네, MicrocosmWorks는 얼굴이 없을 때 활성화되는 대체 현저성 감지 모드를 구현했습니다. 이 모드는 움직임 감지, 시각적 주의 모델링, 그리고 화면 녹화의 경우 마우스 커서 추적의 조합을 사용합니다. 시스템은 순수한 시각적 또는 텍스트 기반 푸티지에서도 가장 관련성이 높은 콘텐츠 영역을 지능적으로 따릅니다.
MicrocosmWorks는 배치 워크플로우를 위해 파이프라인을 최적화하여, 단일 NVIDIA T4 GPU에서 8배 실시간 처리 속도를 달성했습니다. 이는 10분짜리 비디오가 약 75초 만에 리프레이밍됨을 의미합니다. 이 시스템은 여러 GPU에 걸쳐 병렬 처리를 지원하며, 대용량 콘텐츠 작업을 위해 선형적으로 확장됩니다.
MicrocosmWorks는 AI 비디오 리프레이밍 시스템을 시간당 $25~$45의 요율로 개발합니다. 모델 최적화, 일괄 처리 지원 및 API 통합을 포함하는 전체 얼굴 추적 및 스마트 리프레이밍 솔루션은 일반적으로 350~550시간의 개발 시간을 필요로 합니다. 이 투자는 수동 리프레이밍 편집자의 필요성을 없애주며, 이는 일반적으로 비디오당 $5~$15의 비용이 듭니다.