프로젝트를 상담하세요
MicrocosmWorks디지털 코스모스 혁신 및 설계
소개연락처
MicrocosmWorks디지털 코스모스를 혁신하고 설계합니다

중요한 IT 솔루션을 제공합니다. 기술, 보안에 열정적이며 신뢰할 수 있는 혁신적인 IT 인프라를 통해 비즈니스 성장을 돕습니다.

[email protected]
+91 7011868196
New Delhi, India

솔루션

구축AI 제품 엔지니어링SaaS 제품 엔지니어링맞춤형 소프트웨어 개발
현대화소프트웨어 현대화AI 현대화클라우드 앱 현대화
확장백엔드 및 분산 시스템클라우드 성능 엔지니어링신뢰성 및 성능 엔지니어링AI 인프라
확대제품 엔지니어링 팀
모든 솔루션AI 에이전트 개발AI 비디오 플랫폼웰니스 및 피트니스 앱

서비스

디지털 컨설팅클라우드 인프라SaaS 개발AI 개발비디오 기술
ERP 개발Zoho 맞춤화Odoo 개발Salesforce 통합맞춤형 CRM 개발
QuickBooks 통합IoT 솔루션블록체인 개발
사이버 보안 컨설팅IT 지원 - L3

AI 성장 허브

AI 허브스타트업 혁신기업 가속기

자원

통찰력산업 가이드사용 사례 청사진아키텍처 패턴사례 연구

회사

회사 소개연락처프로젝트를 상담하세요우리의 작업

© 2026 MicrocosmWorks. 모든 권리 보유.

개인정보 처리방침서비스 약관
사례 연구 목록으로 돌아가기
Video Creation게시일 June 22, 2026 · 수정일 September 17, 2026

AI 얼굴 추적 및 세로 비디오 변환을 위한 스마트 리프레이밍

콘텐츠 재활용 플랫폼은 발표자와 피사체를 완벽하게 중앙에 유지하면서, 수동 자르기나 키프레이밍 없이 가로형(16:9) 롱폼 비디오를 세로형(9:16) 숏폼 클립으로 자동으로 변환해야 했습니다.

프로젝트 상담하기
ai-face-tracking-vertical-reframing.webp
Video Creation
Domain
7
Technologies
4
Key Results
Delivered
Status

과제

가로 비디오를 세로 형식으로 변환하는 것은 숏폼 콘텐츠 제작에서 가장 번거로운 단계 중 하나였습니다:

  • 클립마다 프레임을 수동으로 자르고 재배치하는 것은 시간이 많이 소요되었습니다.
  • 다인 대화에서는 발표자가 바뀔 때마다 동적인 리프레이밍이 필요했습니다.
  • 정적인 중앙 자르기는 움직이거나 중앙에서 벗어나 앉은 발표자를 잘라냈습니다.
  • 기존의 얼굴 감지는 수천 개의 클립에 대한 실시간 리프레이밍 결정을 내리기에는 너무 느렸습니다.
  • 다양한 콘텐츠 유형(인터뷰, 솔로 브이로그, 프레젠테이션)에는 다른 프레이밍 전략이 필요했습니다.

우리의 솔루션

우리는 비디오 프레임에서 얼굴을 감지하고, 움직임을 추적하며, 활성 피사체를 중앙에 유지하기 위해 세로 자르기 영역을 동적으로 조정하는 AI 기반 얼굴 추적 및 스마트 리프레이밍 엔진을 구축했습니다.

아키텍처

  • 얼굴 감지: 속도에 최적화된 YOLO 기반 얼굴 감지 모델
  • 얼굴 추적: 영구적인 피사체 ID를 사용한 IoU 기반 프레임-투-프레임 추적
  • 리프레이밍 엔진: 얼굴 위치 및 움직임을 기반으로 한 동적 자르기 영역 계산
  • 활성 발표자 연동: 발표자 감지 기능과 통합하여 말하는 사람을 우선시합니다.
  • 렌더링: 부드러운 팬 전환 기능이 있는 FFmpeg 자르기 필터 체인

리프레이밍 파이프라인

  1. 얼굴 감지 - 샘플링된 프레인에 대해 YOLO 얼굴 감지 실행
  2. 피사체 추적 - IoU 기반 추적을 사용하여 프레임 전체에 걸쳐 얼굴 감지를 연결
  3. 발표자 우선순위 - 활성 발표자 감지와 연동될 경우, 말하는 피사체에 우선순위 부여
  4. 자르기 계산 - 기본 피사체 위치를 기반으로 최적의 9:16 자르기 영역 결정
  5. 스무딩 - 어색한 점프를 피하기 위해 자르기 움직임에 이징 적용
  6. 렌더링 - FFmpeg이 부드러운 팬 전환과 함께 동적 자르기 적용

주요 기능

  1. 다중 피사체 처리 - 여러 얼굴을 추적하고 각 세그먼트별로 기본 피사체 결정
  2. 발표자 인식 프레이밍 - 발표자 감지 기능과 통합될 때 활성 발표자에게 우선순위 부여
  3. 부드러운 전환 - 피사체 간의 이징 팬 기능으로 어색한 컷 제거
  4. 콘텐츠 유형 적응 - 솔로, 인터뷰, 그룹 콘텐츠에 대한 다양한 프레이밍 전략
  5. 일괄 처리 - 단일 롱폼 비디오에서 수백 개의 클립을 리프레이밍
  6. 수동 개입 없음 - 감지부터 최종 렌더링까지 완전 자동화

결과

시간 절약: 클립당 2-5분의 수동 자르기 작업 제거
품질: 테스트된 콘텐츠에서 피사체가 95% 이상 중앙에 유지
규모: 사람의 개입 없이 매일 수천 개의 클립 처리
크리에이터 만족도: 수동 편집 없이도 세로 클립이 전문적으로 프레이밍된 것처럼 보임

기술 스택

YOLOPythonFFmpegOpenCVIoU TrackingNode.jsGPU-Accelerated Inference

caseStudyDetail.more 사례 연구

더 많은 기술 구현 사례를 살펴보세요

Video Creation

크로스 플랫폼 소셜 미디어 스케줄링 & 성과 분석

매주 수십 개의 숏폼 클립을 제작하는 콘텐츠 크리에이터들은 단일 대시보드에서 TikTok, YouTube Shorts, Instagram Reels에 콘텐츠를 배포하고 게시 전략을 최적화할 통찰력을 얻기 위한 통합 스케줄링 및 분석 시스템이 필요했습니다.

사례 연구 읽기
Video Creation

글로벌 콘텐츠 배포를 위한 다국어 자막 번역

국제적인 청중을 가진 콘텐츠 제작자들은 원본 오디오를 유지하면서 비디오 자막을 30개 이상의 언어로 번역하여 전 세계 시청자들이 모국어로 콘텐츠를 소비할 수 있도록 하여 그들의 도달 범위를 확장해야 했습니다.

사례 연구 읽기

자주 묻는 질문

MicrocosmWorks는 5프레임마다 실행되는 경량 얼굴 감지기와 프레임 간 예측을 위한 KCF optical flow tracker를 결합한 하이브리드 추적 접근 방식을 구현했습니다. 신뢰도 점수 하락을 통해 가려짐이 감지되면, 시스템은 Kalman filtering을 사용하여 마지막으로 알려진 궤적을 유지하고 다시 보이게 된 후 200ms 이내에 얼굴을 재감지합니다.

MicrocosmWorks는 9:16 크롭 창 위치를 결정할 때 감지된 얼굴, 그 다음 텍스트 영역, 그 다음 움직이는 영역 순으로 우선순위를 부여하는 중요도 가중치 크롭핑 알고리즘을 개발했습니다. 여러 사람이 등장하는 장면의 경우, 시스템은 구성 가능한 우선순위 순위를 사용하며, 기본적으로 활성 발화자 또는 가장 큰 얼굴을 선택하고, 크롭 위치 간의 부드러운 보간을 통해 갑작스러운 전환을 방지합니다.

네, MicrocosmWorks는 얼굴이 없을 때 활성화되는 대체 현저성 감지 모드를 구현했습니다. 이 모드는 움직임 감지, 시각적 주의 모델링, 그리고 화면 녹화의 경우 마우스 커서 추적의 조합을 사용합니다. 시스템은 순수한 시각적 또는 텍스트 기반 푸티지에서도 가장 관련성이 높은 콘텐츠 영역을 지능적으로 따릅니다.

MicrocosmWorks는 배치 워크플로우를 위해 파이프라인을 최적화하여, 단일 NVIDIA T4 GPU에서 8배 실시간 처리 속도를 달성했습니다. 이는 10분짜리 비디오가 약 75초 만에 리프레이밍됨을 의미합니다. 이 시스템은 여러 GPU에 걸쳐 병렬 처리를 지원하며, 대용량 콘텐츠 작업을 위해 선형적으로 확장됩니다.

MicrocosmWorks는 AI 비디오 리프레이밍 시스템을 시간당 $25~$45의 요율로 개발합니다. 모델 최적화, 일괄 처리 지원 및 API 통합을 포함하는 전체 얼굴 추적 및 스마트 리프레이밍 솔루션은 일반적으로 350~550시간의 개발 시간을 필요로 합니다. 이 투자는 수동 리프레이밍 편집자의 필요성을 없애주며, 이는 일반적으로 비디오당 $5~$15의 비용이 듭니다.

비즈니스 혁신을 시작할 준비가 되셨나요?

귀하의 과제에 유사한 솔루션을 적용하는 방법에 대해 논의해 보겠습니다.

문의하기caseStudyDetail.viewAllCaseStudies
Video Creation

자동화된 캡션 스타일링 및 비디오 내보내기 엔진

비디오 제작자는 다양한 스타일과 플랫폼에서 픽셀 단위로 완벽하게 렌더링된 전문급 애니메이션 캡션을 단기 비디오에 적용할 수 있는 빠르고 신뢰할 수 있는 시스템이 필요했습니다.

사례 연구 읽기