AIを活用した分析によるクロスプラットフォームモバイル動画編集
コンテンツクリエイターやメディアプロフェッショナルは、外出先でのよりスマートな編集ワークフローのために、AI駆動型分析の結果を活用できるモバイルファーストの動画編集ソリューションを必要としていました。
プロジェクトを相談する
課題
既存のモバイル動画エディタは、バックエンドのAI分析との統合が不足していました。クリエイターはデスクトップ分析ツールとモバイルエディタを切り替える必要があり、その結果、以下の問題が生じていました。
- デバイス間での分断されたワークフロー
- モバイルで話者検出データを活用する方法がない
- モバイルでのオーディオトリミングと同期機能の制限
私たちのソリューション
私たちは、AI分析バックエンドとシームレスに接続するFlutterベースのクロスプラットフォームモバイルアプリケーションを開発しました。これにより、クリエイターはAIが提供するコンテキストに基づいて、スマートフォンで直接動画を編集できるようになりました。
アーキテクチャ
- フレームワーク: iOS, Android, macOS向けの Flutter 3.4.3+
- 状態管理: リアクティブUI更新のためのProviderパターン
- 動画処理: デバイス上でのレンダリングにはFFmpeg Kit、ネイティブのvideo_editor統合
- ネットワーキング: API統合を備えたDio HTTPクライアント
- ローカリゼーション: 英語と中国語の言語サポート
主な機能
- AI連携編集 - アクティブな話者タイムラインを表示し、それに応じてカット
- 動画のトリミングとクロップ - ジェスチャーコントロールによるフレーム単位の正確な編集
- 音声同期 - マルチトラックオーディオの整列とトリミング
- メディア管理 - ギャラリー、カメラ、またはファイルシステムからのインポート
- バイリンガル対応 - 英語と中国語の完全なローカリゼーション
成果
技術スタック
caseStudyDetail.more ケーススタディ
その他の技術実装事例をご覧ください
リアルタイム動画オブジェクトトラッキングと自動センタリング・リカバリ
ある映像制作チームは、動画映像内の選択されたオブジェクトを追跡し、その移動に合わせてフレーム内で自動的に中央に維持できるツールを必要としていました。このツールには、スムーズなトランジション、複数のトラッキングアルゴリズムオプション、そしてトラッカーがターゲットを見失った際の自動リカバリ機能が求められました。
マルチカメラ映像制作のためのAIを活用した発話者検出
マルチカメラでのインタビューやパネルディスカッション撮影を手掛けるある映像制作会社は、複雑な映像の中から、特定の瞬間に誰が話しているかを自動で特定する方法を必要としていました。
よくある質問
MicrocosmWorks は、共通の C++ コアとプラットフォーム固有の GPU バックエンド(iOS では Metal、Android では Vulkan を使用)を用いてレンダリングパイプラインを構築しました。これにより、プラットフォーム間で同一のフィルター適用、カラーグレーディング、および合成結果が保証され、参照デバイスでのフレームごとの出力パリティを検証するテストスイートを備えています。
MicrocosmWorksは、自動シーン検出、被写体追跡、音楽同期のためのオーディオビート検出、およびコンテンツに応じたクロップ提案のために、オンデバイスのMLモデルを統合しました。これらのモデルはCore MLとTensorFlow Liteを使用して完全にデバイス上で動作し、動画をクラウドにアップロードすることなく即座の分析を保証します。
MicrocosmWorksは、アプリがタイムライン編集用に軽量な720pプロキシファイルを生成し、最終エクスポート時に編集決定リストをオリジナルの4Kソースに適用する、プロキシベースの編集ワークフローを実装しました。メモリマップドファイルI/Oシステムにより、1時間にも及ぶ4K映像を編集する場合でも、RAMの最大使用量は300MB未満に抑えられます。
はい、MicrocosmWorksは、TikTok、Instagram Reels、YouTube Shorts、および標準のYouTube用にプリセットのエクスポートプロファイルを作成しました。これらは、正しいアスペクト比、解像度、ビットレート、およびコーデック設定を自動的に適用します。ユーザーは、エクスポートする前に、各プラットフォームのプレーヤーで自分の編集がどのように表示されるかをプレビューできます。
MicrocosmWorksが提供するモバイル動画編集プラットフォームは、C++ レンダリングコア、AI分析機能、ソーシャルエクスポート機能を含むフル機能のエディターを備え、1時間あたり$25〜$50のレートで、通常800〜1200時間の開発時間を必要とします。クロスプラットフォームアーキテクチャを採用することで、個別のネイティブiOSアプリとAndroidアプリを構築する場合と比較して、約40%のコスト削減が可能です。