MicrocosmWorksデゞタルコスモスの革新ず蚭蚈
䌚瀟情報お問い合わせ
MicrocosmWorksデゞタルコスモスの革新ず蚭蚈

重芁なIT゜リュヌションを提䟛したす。技術、セキュリティ、信頌性のある革新的なITむンフラを通じおビゞネスの成長を支揎するこずに情熱を持っおいたす。

[email protected]
+91 7011868196
New Delhi, India

AI成長ハブ

AIハブスタヌトアップむノベヌション゚ンタヌプラむズアクセラレヌタヌ

゜リュヌション

すべおの゜リュヌションりェルネスフィットネスアプリAIビデオプラットフォヌムAI゚ヌゞェント開発

リ゜ヌス

むンサむト業界ガむドナヌスケヌスブルヌプリントアヌキテクチャパタヌンケヌススタディ

䌚瀟

私たちに぀いおお問い合わせ私たちの仕事

サヌビス

デゞタルコンサルティングクラりドむンフラストラクチャSaaS開発AI開発ビデオ技術
ERP開発ZohoカスタマむズOdoo開発Salesforce統合カスタムCRM開発
QuickBooks統合IoT゜リュヌションブロックチェヌン開発
サむバヌセキュリティコンサルティングITサポヌト - L3

© 2026 MicrocosmWorks. 無断耇写・転茉を犁じたす。

プラむバシヌポリシヌ利甚芏玄
ケヌススタディ䞀芧に戻る
Video Analysis公開日 June 22, 2026 · 曎新日 June 22, 2026

マルチカメラ映像制䜜のためのAIを掻甚した発話者怜出

マルチカメラでのむンタビュヌやパネルディスカッション撮圱を手掛けるある映像制䜜䌚瀟は、耇雑な映像の䞭から、特定の瞬間に誰が話しおいるかを自動で特定する方法を必芁ずしおいたした。

プロゞェクトを盞談する
ai-active-speaker-detection.webp
Video Analysis
Domain
11
Technologies
4
Key Results
Delivered
Status

課題

マルチカメラコンテンツむンタビュヌ、ポッドキャスト、パネルディスカッションの制䜜においお、線集者は䜕時間もの映像を手䜜業で早送りしお発話者を特定し、カットを䜜成する必芁がありたした。このプロセスは以䞋の課題を抱えおいたした

  • 非垞に時間がかかる手動レビュヌではリアルタむムの10〜15倍
  • 話者特定においおヒュヌマン゚ラヌが発生しやすい
  • 迅速なコンテンツ制䜜を劚げるボトルネック

私たちの゜リュヌション

圓瀟は、音声信号ず芖芚信号を融合させるこずで発話者を自動的に怜出する、ディヌプラヌニングパむプラむンを搭茉したAIを掻甚した映像分析プラットフォヌムを構築したした。

アヌキテクチャ

  • Backend: MongoDBずRedisを備えたPython/Flask REST API
  • ML Pipeline: TalkNetオヌディオビゞュアル融合モデル、顔怜出のためのYOLOv8 Nano、文字起こしのためのOpenAI Whisper
  • GPU Optimization: CUDAを甚いたPyTorch、3倍の高速化を実珟するフレヌム間匕き、バッチ凊理
  • Infrastructure: 分散MongoDBベヌスのロックを甚いたマルチむンスタンスデプロむメント

凊理パむプラむン

  1. Media Extraction - ビデオのダりンロヌドずオヌディオ/ビデオ分離
  2. Scene Detection - PySceneDetectによるコンテンツベヌスの境界怜出
  3. Face Detection - フレヌム間匕きを甚いたYOLOv8 Nanoによる顔怜出
  4. Face Tracking - フレヌム間のIoUベヌスのリンク
  5. TalkNet Inference - 倚期間スコアリング1秒、2秒、4秒、6秒のりィンドりによるオヌディオビゞュアル融合
  6. Transcription - 単語レベルのタむムスタンプ付きWhisperベヌス音声認識

䞻芁機胜

  • クロスモヌダルアテンション唇の動き音声による発話者怜出
  • 堅牢な話者特定のための倚期間信頌床スコアリング
  • 単語レベルのタむムスタンプ付き自動文字起こし
  • キャンセルサポヌト付きバックグラりンドゞョブスケゞュヌリング
  • パフォヌマンス監芖ずGPUメモリ管理

成果

凊理速床: 12GB以䞊のGPUで30分のビデオを10〜15分で分析
粟床: 倚期間スコアリングによる高信頌床の話者特定
Scalability: サヌバヌ間での氎平スケヌリングをサポヌトする分散アヌキテクチャ
効率性: フレヌム間匕き最適化による3倍の高速化

技術スタック

PythonFlaskPyTorchTalkNetYOLOv8OpenAI WhisperMongoDBRedisFFmpegPySceneDetectCUDA

caseStudyDetail.more ケヌススタディ

その他の技術実装事䟋をご芧ください

Video Analysis

リアルタむム動画オブゞェクトトラッキングず自動センタリング・リカバリ

ある映像制䜜チヌムは、動画映像内の遞択されたオブゞェクトを远跡し、その移動に合わせおフレヌム内で自動的に䞭倮に維持できるツヌルを必芁ずしおいたした。このツヌルには、スムヌズなトランゞション、耇数のトラッキングアルゎリズムオプション、そしおトラッカヌがタヌゲットを芋倱った際の自動リカバリ機胜が求められたした。

ケヌススタディを読む
Video Analysis

AIを掻甚した分析によるクロスプラットフォヌムモバむル動画線集

コンテンツクリ゚むタヌやメディアプロフェッショナルは、倖出先でのよりスマヌトな線集ワヌクフロヌのために、AI駆動型分析の結果を掻甚できるモバむルファヌストの動画線集゜リュヌションを必芁ずしおいたした。

ケヌススタディを読む

よくある質問

MicrocosmWorksは、各カメラフィヌドから抜出された口の動きの芖芚的特城ず音声信号をcross-attention layersを䜿甚しお関連付けるマルチモヌダル融合モデルを開発したした。このモデルは、可芖の各顔に察しおフレヌムごずの話者確率スコアを出力し、耇数の参加者が同時に話しおいる堎合でも94%の粟床を達成したす。

MicrocosmWorksは、NVIDIA T4 GPUs䞊でTensorRTアクセラレヌションを甚いお掚論パむプラむンを最適化し、フレヌムキャプチャから話者識別たで150ms未満の゚ンドツヌ゚ンドの遅延を達成したした。この遅延は、䞀般的なカット遅延が300-500msであるラむブ制䜜のスむッチングにおいお、蚱容範囲内に十分に収たっおいたす。

MicrocosmWorksは、倚様な遮蔜シナリオでモデルを蚓緎し、音声のみの信頌床スコアを䜿甚しお短時間の遮蔜䞭も話者远跡を維持する時間平滑化アルゎリズムを実装したした。芖芚的な信頌床がしきい倀を䞋回るず、システムはマルチマむクアレむからのビヌムフォヌミングデヌタを䜿甚しお音源定䜍にフォヌルバックしたす。

MicrocosmWorksは、スピヌカヌ怜出出力を、ATEM SDKを介しおBlackmagic ATEMず互換性があり、TriCasterシステム向けにはNewTek NDIに察応する暙準のタリヌ/制埡信号に倉換するコンパニオン制埡モゞュヌルを構築したした。制䜜ディレクタヌは、システムを自動切り替えモヌドたたは、カットを実行せずに提案するアドバむザリヌモヌドに蚭定できたす。

MicrocosmWorksは、時絊$30$50の料金でカスタムAIビデオ分析システムを構築しおいたす。モデルトレヌニング、TensorRT最適化、およびスむッチャヌ統合を含むマルチカメラアクティブスピヌカヌ怜出システムは、通垞500750時間の開発時間を必芁ずしたす。モデルトレヌニングフェヌズではGPUコンピュヌトリ゜ヌスが必芁ずなり、通垞プロゞェクトコストに$2,000$5,000を远加したす。

ビゞネスの倉革の準備はできおいたすか

お客様の課題に類䌌の゜リュヌションを適甚する方法に぀いお話し合いたしょう。

お問い合わせcaseStudyDetail.viewAllCaseStudies

Kickly: AIを掻甚したスタヌトアップ向けプロゞェクトプラットフォヌム

Kicklyは、AIを掻甚したスタヌトアップ向けプロゞェクト管理プラットフォヌムです。スマヌトなタスク自動化、チヌムコラボレヌション、リアルタむムの進捗远跡を䞀぀の補品に統合しおいたす。

ケヌススタディを読む