本記事では、Media AI ソリューションで現在サポートされている機能ノードとその各特徴について主に紹介します。
ノード名 | 説明 |
顔認識 | 複数のアクターのイメージ、名前、ロール情報を入力として受け付け、ビデオストリームから顔を自動で検出して、対応する登場人物の出現タイムスタンプを特定します。 |
音声抽出 + ASR | オーディオ/ビデオから音声を分離し、高精度の自動音声認識 (ASR) を実行することで、正確なタイムスタンプと話者情報が付与された書き起こしテキストを生成します。 |
テキストコンテンツ抽出 | AI モデルの選択、カスタムプロンプトの設定、出力フォーマットの指定が可能です。ビデオフレームから画面上のテキストを抽出し、ASR の書き起こしテキストと組み合わせることで、包括的な意味理解を実現します。 |
ビデオ要約 (OTT) | 映像フレーム (間隔/類似度のしきい値は設定可能) の分析と、字幕/ASR コンテンツの統合を通じて、ビデオ (例:映画、テレビシリーズ、ショートビデオ) のインテリジェントな要約を生成します。 |
フレーム抽出 & 分析 (カスタム) | フレームサンプリング (間隔/類似度は設定可能)、モデル選択、カスタムプロンプト/出力定義を利用して、コンテンツ、品質、その他の視覚的属性についてビデオフレームを分析できます。 |