Application of Object Detection Algorithms in Video
背景
ビジネス背景
従来の動画ウェブサイトにおける広告は、主にプリロール広告(プレロール、ミッドロール、ポストロールなど)でした。現在、ほとんどの動画サイトでは会員を除くユーザーは広告をスキップできません。視聴体験に対するユーザーの要求が高まるにつれ、スキップできない長時間の広告体験はユーザーの離脱を招く恐れがあります。同時に、より多くのユーザーが高品質な視聴体験を求めて有料会員になる傾向が強まっています。会員の増加により、従来のフィルム広告の露出量は必然的に減少します。
コンテンツ広告はユーザーの視聴時間を占有せず、会員にも表示されます。広告の品質において、広告コンテンツ、動画コンテンツ、シーンの組み合わせは、ユーザーにこれまでにない広告体験をもたらします。そのため、動画コンテンツ広告は今後の動画広告の主流形態になると考えられます。下の図は「コカ・コーラ」のシーン広告の例で、広告主がターゲットにしたシーンは「家族の団らん」と「夕食」です。
コンテンツ識別の現状
現在、シーン広告の配置ポイントには主に 2 つのソースがあります。字幕テキストとシーン認識です。字幕は OCR ブロック認識と NLP を通じて理解され、字幕キーワードが抽出されます。広告主は広告コンテンツに応じて「携帯電話」「通話」「食事」などの関連キーワードを購入します。シーン認識は、動画クリップのコンテンツに基づいて夕食や結婚式などの動画シーンを識別します。
コンテンツ広告の配置プロセスで、字幕広告には以下の 2 つの問題があることが判明しました。
1. 広告コンテンツと字幕の意味が一致しない問題。たとえば、コカ・コーラが購入した「コーラ」というキーワードが会話内で使用される場面に表示されますが、両者の内容は無関係です。
2. 字幕キーワードが存在するシーンに関連コンテンツがない問題。たとえば、字幕に「携帯電話」が登場しても、映像に携帯電話が映っているとは限らず、その場合の携帯電話広告は唐突な印象を与えます。
もう 1 つの配置ポイントのソースであるシーン認識は、上記の字幕キーワードの 2 つの問題を解決できますが、シーン認識のモデリングは複雑で、シーンの定義は主観的になりがちで、手動ラベリングのコストが高く、トレーニングサンプルの収集も困難です。同時に、将来の広告主の業界や必要なシーンの特徴を予測するのが難しいため、新しいシーンに迅速に対応できません。そのため、シーン認識はスケーラビリティに乏しく、柔軟で変化に富む広告形態のニーズに対応することが困難です。
動画オブジェクト検出が解決する問題
動画オブジェクトは字幕とシーンの中間に位置するコンテンツです。映像には字幕情報が必ずしも表示されないシーンがあるため、コンテンツの記述力においてオブジェクトは字幕より優れています。同時に、オブジェクトはシーンの基本要素であるため、動画オブジェクトは動画シーンをある程度記述できます。全体的に、動画オブジェクト検出は以下の問題を解決します。
字幕のテキストと画像の不一致問題およびコンテンツの連続性問題を解決します。オブジェクト検出は映像に実際に映っているコンテンツに基づくため、コンテンツの正確性が保証されます。同時に、オブジェクトのコンテンツ連続性は字幕より強いため、フレーム間でのコンテンツ急変の確率が比較的低く、字幕が瞬間的に過ぎ去る問題を回避でき、コンテンツ広告に適しています。
シーン認識の限界に対処します。オブジェクト検出はシーン認識と比べてモデリングがシンプルで、トレーニングサンプルのラベリングコストが低く、オブジェクトカテゴリを迅速に拡張できます。同時に、オブジェクトのコンテンツはシーンに制約されません。たとえば、「ワイングラス」は飲食シーンに関連付けて飲料の広告を配置でき、さらに複数のシーンに関連付けて広告を配置することも可能です。「愛犬」はドッグフードだけでなく、アレルギー薬の広告も配置できます。これはシーン認識では実現できません。下の図は「フシューリャン」薬の広告です。このケースではシーンの定義が困難なため、「猫」や「犬」などのペットをオブジェクト検出で検出することに依存しています。テスト結果を示します。
配置ポイントの迅速な拡張。技術面では、現在の検出アルゴリズムは比較的成熟しており、モデルの反復効率が高く、数千種類のオブジェクトの検出に対応でき、短期間で大量の動画配置ポイントを迅速にバッチ生成できます。
検出技術の概要
オブジェクト検出はコンピュータビジョンにおける古典的な問題です。ディープラーニングが爆発的に普及する前は、Ross Girshick による DPM[1] が代表的な手法で、従来の特徴量をターゲット検出分野である程度のレベルまで向上させました。2012 年以降、深層畳み込みネットワークが普及し、ディープラーニング技術もオブジェクト検出に応用されるようになりました。その後 6 年間にわたり、さまざまな深層畳み込み検出モデルが次々と登場しました。これらのモデルは主に 2 つのアプローチに基づいています。1 つは Fast/Faster R-CNN に代表される 2 ステージ検出フレームワーク、もう 1 つは YOLO と SSD に代表される 1 ステージ検出フレームワークです。2 つの検出フレームワークにはそれぞれの長所と短所があります。2 ステージの利点は精度にあり、1 ステージは速度の面でより優れています。その後、トップダウン、特徴ピラミッドネットワーク、RetinaNet などの革新と最適化が登場しました。さらなる課題としては、小型オブジェクト、遮蔽されたオブジェクト、高速かつ高精度でコンパクトなネットワークの実現があります。オブジェクト検出技術の発展の経緯は以下の通りです。
アルゴリズムの選定
上記のビジネス背景とターゲット検出分野の現状を踏まえ、多数のアルゴリズムモデルからビジネスに適したものを選択することが急務でした。ビジネスニーズとマシンリソースを考慮し、(a) 高い精度、(b) 高速な処理速度の 2 点を重視しました。さまざまなターゲット検出手法を比較し、精度と速度のトレードオフのもと、最終的に YOLOv3[2] を選択しました。関連データは以下の通りです。
モデルの概要と最適化
YOLOv3
YOLO シリーズのアルゴリズムは現在までに 3 つのバージョンがあり、全体的なオブジェクト検出の考え方は基本的に変わっていません。主にバックボーン、検出、損失関数にアップグレードがあります。下の図は、inputsize=416、予測カテゴリ数=274 の場合の YOLOv3 のフレームワーク図です。
バックボーンは Darknet53 で、通常の畳み込みと 23 個の残差ユニットのセットで構成されています。
検出は 3 つのブランチで構成されます。下位特徴マップから上位特徴マップにかけて、それぞれ小、中、大オブジェクトの検出を担当します。注目すべき点として、上位特徴は下位層にフィードバックされて融合され、下位特徴のセマンティック情報を強化します。
特徴マップの出力ディメンションは [3*(4+1+274)]×N×N で、異なるアンカーの分類スコアは共有されません。
YOLOv3 の損失関数は以下の通りです。
第 1 部分はバウンディングボックスの座標と寸法の予測損失に対応し、第 2 部分はオブジェクトの有無の予測損失に対応し、第 3 部分はバウンディングボックスにオブジェクトが存在する場合の分類損失です。注目すべき点として、第 3 部分は各バウンディングボックスをロジスティック回帰で分類し、マルチラベル分類をサポートしています。
アルゴリズムの最適化
初期モデルのトレーニングセットは Open Images に由来し、元のカテゴリ数は 600 です。これに ImageNet データセットの一部を追加しました。実用的なアプリケーションでは、商用価値のある 274 カテゴリのオブジェクトを選択し、モデルを再トレーニングしました。新しいモデルでは、以下の最適化も実施しました。
■ データ最適化
主にデータの不均衡問題があります。下の図は 274 カテゴリおよび 30 カテゴリのデータ分布を示しており、X 軸がカテゴリ、Y 軸がバウンディングボックス数を表します。
データ不均衡の問題を解決するため、以下の 2 つの対策を講じました。
リサンプリング:トレーニングセットの一部のカテゴリは通常のサンプル数の 1/10000 しかなく、これらのサンプルをリサンプリングし、同時に回転、ガウシアンノイズ、画像スティッチングなどのデータ拡張を実施しました。
フォーカルロス[3] を使って損失関数の最適化を試みましたが、良好な効果は得られませんでした。トレーニングプロセスは完全に収束したものの、テスト結果は芳しくなく、これは YOLOv3 の損失関数に使用されているロジスティック回帰との関係、またはフォーカルロスのハイパーパラメータチューニングが不十分であったことが原因と考えられます。以下は実験で使用した損失関数です。
さらに、以下のデータおよびトレーニングの詳細による最適化を実施しています。
マルチスケールトレーニング:トレーニング中に [320, 416, 608] からランダムにサイズを選択してモデルの input_size とすることで、モデルのロバスト性を効果的に強化できます。
K-means クラスタリングによる候補ボックス生成:トレーニングセット内でスクリーニングした商用価値のあるオブジェクトのフレーム分布に対してクラスタリングを実施し、9 個の初期アンカーボックスを取得します。モデルの収束とトレーニングの高速化に寄与します。距離計算式は以下の通りです。
ラベル平滑化:ラベル平滑化は Inception-v2[4] で提案された手法で、主にモデルトレーニング時の過信によるオーバーフィッティングを防ぐためのものです。その計算式は以下の通りです。
■ モデル最適化
モデル最適化では、一般的に最適化目標に応じてバックボーンと損失関数を検討します。実験では以下の手法を試みました。
映像内の人物などの非剛体は変形確率が比較的高いため、Jifeng Dai らが提案した変形可能畳み込み[5, 6] を導入し、従来の畳み込みのモデリング能力を強化しました。下の図に示すように、変形可能畳み込みは従来の畳み込みの各ピクセルに水平方向と垂直方向の 2 つのオフセットを追加して変形を表現します。
ビジネスではできるだけ多くのオブジェクトを検出したい一方で、位置精度の要件はやや低いため、損失関数内の位置とカテゴリの重み比率を調整し、モデルがオブジェクトカテゴリの精度により注目するようにしました。
■ 後処理の最適化
テストセット内の同種ラベルボックスの重複を観察・計算した結果、IoU>0.5 のラベルボックスが多数存在することが判明しました。そのため、soft-NMS[7] を後処理に導入し、線形カーネルとガウシアンカーネルを使用して、より滑らかな方法で重複を処理しています。計算式は以下の通りです。
プラットフォーム
トレーニング済みモデルをインターフェイスでカプセル化し、Docker でパッケージ化して、オンラインスケジューリングプラットフォームに公開しました。現在、動画コンテンツ認識プラットフォームは 1 台のマシンで 1 日あたり約 600 本のフィーチャー動画を処理でき、クラスタ全体の処理能力は 1 日あたり 1 万本以上のフィーチャー動画に達します。モデルの検出結果はオフラインデータベースにエクスポートされ、選別と分類を経てオンライン管理プラットフォームにインポートされます。その後、RBI プラットフォームで承認された後に配信システムに登録されるという、一連の流れになっています。全体のプロセスは下の図の通りです。
効果
アルゴリズム最適化の結果
274 クラスおよび 93 クラスのオブジェクトモデルで、最適化前後の mAP-50 指標を比較しました。
下の図は 93 カテゴリモデルでの最適化経路を示しており、最終的に 0.596 の mAP を達成しました。
広告ビジネスへの適用
動画カテゴリにおいて、映画、テレビドラマ、バラエティ番組の 3 つの主要チャンネルでフィーチャー動画の検出を実施し、時代劇、スリラー、童話、宮廷ドラマ、アニメーションなどコンテンツ広告に適さないカテゴリを除外しました。これまでのところ、モデルは 5 万本以上の動画を処理し、9,000 万枚以上のフレーム画像を生成しています。ビジネスアプリケーションにおいて、商用価値のある 274 のオブジェクトを分類しました。実際のアプリケーションでは、ブランドのコンテンツ属性と広告のアイデアに基づいて、関連カテゴリのオブジェクトが関連付けられるシーンをマッチングさせました。各カテゴリのテスト結果の分布は以下の通りです。
携帯電話の広告で、字幕とオブジェクト検出の配置ポイントを比較しました。実際の表示効果は以下の通りです。
配信データを比較するため、「携帯電話」の配置ポイントが既に検出されている動画で、オブジェクト検出の配置ポイントと字幕キーワードの配置ポイントのクリック率の差を比較しました。オブジェクト検出の配置ポイントの露出量は字幕の 3.5 倍であるにもかかわらず、クリック率はさらに 20% 向上しており、質と量の両面で大幅な改善が実現しました。
まとめと展望
まとめ
過去 6 年間、ディープラーニングの急速な発展により、オブジェクト検出技術は非常に成熟しました。本稿の取り組みでは、オブジェクト検出技術を動画コンテンツ広告に応用し、良好な結果を得ています。アルゴリズム面では YOLOv3 を選択し、ビジネス背景を踏まえて商用価値の高いオブジェクトを重点的にモデリングした結果、検出速度と検出精度の両方が大幅に向上しました。
実際のビジネスシナリオへの適用において、オブジェクト検出の結果は既存のシーン広告ビジネスに大量の配置ポイントを追加しました。広告コンテンツと動画コンテンツの関連性を確保しながら、露出量とクリック率に大幅な改善をもたらしています。
展望
現在は技術的に静的画像検出手法を使用しています。今後はフレーム抽出戦略の最適化や、LSTM と Optical Flow を活用した動画の文脈情報の融合[8, 9, 10]により、オブジェクト検出の高速化と、モーションブラーや小型オブジェクトの面積による検出難易度の低減を図り、検出精度と速度の向上を目指します。将来的には、オブジェクト検出アルゴリズムを動画内の衣装検出など、他のシナリオにも応用していく予定です。
ビジネス背景
従来の動画ウェブサイトにおける広告は、主にプリロール広告(プレロール、ミッドロール、ポストロールなど)でした。現在、ほとんどの動画サイトでは会員を除くユーザーは広告をスキップできません。視聴体験に対するユーザーの要求が高まるにつれ、スキップできない長時間の広告体験はユーザーの離脱を招く恐れがあります。同時に、より多くのユーザーが高品質な視聴体験を求めて有料会員になる傾向が強まっています。会員の増加により、従来のフィルム広告の露出量は必然的に減少します。
コンテンツ広告はユーザーの視聴時間を占有せず、会員にも表示されます。広告の品質において、広告コンテンツ、動画コンテンツ、シーンの組み合わせは、ユーザーにこれまでにない広告体験をもたらします。そのため、動画コンテンツ広告は今後の動画広告の主流形態になると考えられます。下の図は「コカ・コーラ」のシーン広告の例で、広告主がターゲットにしたシーンは「家族の団らん」と「夕食」です。
コンテンツ識別の現状
現在、シーン広告の配置ポイントには主に 2 つのソースがあります。字幕テキストとシーン認識です。字幕は OCR ブロック認識と NLP を通じて理解され、字幕キーワードが抽出されます。広告主は広告コンテンツに応じて「携帯電話」「通話」「食事」などの関連キーワードを購入します。シーン認識は、動画クリップのコンテンツに基づいて夕食や結婚式などの動画シーンを識別します。
コンテンツ広告の配置プロセスで、字幕広告には以下の 2 つの問題があることが判明しました。
1. 広告コンテンツと字幕の意味が一致しない問題。たとえば、コカ・コーラが購入した「コーラ」というキーワードが会話内で使用される場面に表示されますが、両者の内容は無関係です。
2. 字幕キーワードが存在するシーンに関連コンテンツがない問題。たとえば、字幕に「携帯電話」が登場しても、映像に携帯電話が映っているとは限らず、その場合の携帯電話広告は唐突な印象を与えます。
もう 1 つの配置ポイントのソースであるシーン認識は、上記の字幕キーワードの 2 つの問題を解決できますが、シーン認識のモデリングは複雑で、シーンの定義は主観的になりがちで、手動ラベリングのコストが高く、トレーニングサンプルの収集も困難です。同時に、将来の広告主の業界や必要なシーンの特徴を予測するのが難しいため、新しいシーンに迅速に対応できません。そのため、シーン認識はスケーラビリティに乏しく、柔軟で変化に富む広告形態のニーズに対応することが困難です。
動画オブジェクト検出が解決する問題
動画オブジェクトは字幕とシーンの中間に位置するコンテンツです。映像には字幕情報が必ずしも表示されないシーンがあるため、コンテンツの記述力においてオブジェクトは字幕より優れています。同時に、オブジェクトはシーンの基本要素であるため、動画オブジェクトは動画シーンをある程度記述できます。全体的に、動画オブジェクト検出は以下の問題を解決します。
字幕のテキストと画像の不一致問題およびコンテンツの連続性問題を解決します。オブジェクト検出は映像に実際に映っているコンテンツに基づくため、コンテンツの正確性が保証されます。同時に、オブジェクトのコンテンツ連続性は字幕より強いため、フレーム間でのコンテンツ急変の確率が比較的低く、字幕が瞬間的に過ぎ去る問題を回避でき、コンテンツ広告に適しています。
シーン認識の限界に対処します。オブジェクト検出はシーン認識と比べてモデリングがシンプルで、トレーニングサンプルのラベリングコストが低く、オブジェクトカテゴリを迅速に拡張できます。同時に、オブジェクトのコンテンツはシーンに制約されません。たとえば、「ワイングラス」は飲食シーンに関連付けて飲料の広告を配置でき、さらに複数のシーンに関連付けて広告を配置することも可能です。「愛犬」はドッグフードだけでなく、アレルギー薬の広告も配置できます。これはシーン認識では実現できません。下の図は「フシューリャン」薬の広告です。このケースではシーンの定義が困難なため、「猫」や「犬」などのペットをオブジェクト検出で検出することに依存しています。テスト結果を示します。
配置ポイントの迅速な拡張。技術面では、現在の検出アルゴリズムは比較的成熟しており、モデルの反復効率が高く、数千種類のオブジェクトの検出に対応でき、短期間で大量の動画配置ポイントを迅速にバッチ生成できます。
検出技術の概要
オブジェクト検出はコンピュータビジョンにおける古典的な問題です。ディープラーニングが爆発的に普及する前は、Ross Girshick による DPM[1] が代表的な手法で、従来の特徴量をターゲット検出分野である程度のレベルまで向上させました。2012 年以降、深層畳み込みネットワークが普及し、ディープラーニング技術もオブジェクト検出に応用されるようになりました。その後 6 年間にわたり、さまざまな深層畳み込み検出モデルが次々と登場しました。これらのモデルは主に 2 つのアプローチに基づいています。1 つは Fast/Faster R-CNN に代表される 2 ステージ検出フレームワーク、もう 1 つは YOLO と SSD に代表される 1 ステージ検出フレームワークです。2 つの検出フレームワークにはそれぞれの長所と短所があります。2 ステージの利点は精度にあり、1 ステージは速度の面でより優れています。その後、トップダウン、特徴ピラミッドネットワーク、RetinaNet などの革新と最適化が登場しました。さらなる課題としては、小型オブジェクト、遮蔽されたオブジェクト、高速かつ高精度でコンパクトなネットワークの実現があります。オブジェクト検出技術の発展の経緯は以下の通りです。
アルゴリズムの選定
上記のビジネス背景とターゲット検出分野の現状を踏まえ、多数のアルゴリズムモデルからビジネスに適したものを選択することが急務でした。ビジネスニーズとマシンリソースを考慮し、(a) 高い精度、(b) 高速な処理速度の 2 点を重視しました。さまざまなターゲット検出手法を比較し、精度と速度のトレードオフのもと、最終的に YOLOv3[2] を選択しました。関連データは以下の通りです。
モデルの概要と最適化
YOLOv3
YOLO シリーズのアルゴリズムは現在までに 3 つのバージョンがあり、全体的なオブジェクト検出の考え方は基本的に変わっていません。主にバックボーン、検出、損失関数にアップグレードがあります。下の図は、inputsize=416、予測カテゴリ数=274 の場合の YOLOv3 のフレームワーク図です。
バックボーンは Darknet53 で、通常の畳み込みと 23 個の残差ユニットのセットで構成されています。
検出は 3 つのブランチで構成されます。下位特徴マップから上位特徴マップにかけて、それぞれ小、中、大オブジェクトの検出を担当します。注目すべき点として、上位特徴は下位層にフィードバックされて融合され、下位特徴のセマンティック情報を強化します。
特徴マップの出力ディメンションは [3*(4+1+274)]×N×N で、異なるアンカーの分類スコアは共有されません。
YOLOv3 の損失関数は以下の通りです。
第 1 部分はバウンディングボックスの座標と寸法の予測損失に対応し、第 2 部分はオブジェクトの有無の予測損失に対応し、第 3 部分はバウンディングボックスにオブジェクトが存在する場合の分類損失です。注目すべき点として、第 3 部分は各バウンディングボックスをロジスティック回帰で分類し、マルチラベル分類をサポートしています。
アルゴリズムの最適化
初期モデルのトレーニングセットは Open Images に由来し、元のカテゴリ数は 600 です。これに ImageNet データセットの一部を追加しました。実用的なアプリケーションでは、商用価値のある 274 カテゴリのオブジェクトを選択し、モデルを再トレーニングしました。新しいモデルでは、以下の最適化も実施しました。
■ データ最適化
主にデータの不均衡問題があります。下の図は 274 カテゴリおよび 30 カテゴリのデータ分布を示しており、X 軸がカテゴリ、Y 軸がバウンディングボックス数を表します。
データ不均衡の問題を解決するため、以下の 2 つの対策を講じました。
リサンプリング:トレーニングセットの一部のカテゴリは通常のサンプル数の 1/10000 しかなく、これらのサンプルをリサンプリングし、同時に回転、ガウシアンノイズ、画像スティッチングなどのデータ拡張を実施しました。
フォーカルロス[3] を使って損失関数の最適化を試みましたが、良好な効果は得られませんでした。トレーニングプロセスは完全に収束したものの、テスト結果は芳しくなく、これは YOLOv3 の損失関数に使用されているロジスティック回帰との関係、またはフォーカルロスのハイパーパラメータチューニングが不十分であったことが原因と考えられます。以下は実験で使用した損失関数です。
さらに、以下のデータおよびトレーニングの詳細による最適化を実施しています。
マルチスケールトレーニング:トレーニング中に [320, 416, 608] からランダムにサイズを選択してモデルの input_size とすることで、モデルのロバスト性を効果的に強化できます。
K-means クラスタリングによる候補ボックス生成:トレーニングセット内でスクリーニングした商用価値のあるオブジェクトのフレーム分布に対してクラスタリングを実施し、9 個の初期アンカーボックスを取得します。モデルの収束とトレーニングの高速化に寄与します。距離計算式は以下の通りです。
ラベル平滑化:ラベル平滑化は Inception-v2[4] で提案された手法で、主にモデルトレーニング時の過信によるオーバーフィッティングを防ぐためのものです。その計算式は以下の通りです。
■ モデル最適化
モデル最適化では、一般的に最適化目標に応じてバックボーンと損失関数を検討します。実験では以下の手法を試みました。
映像内の人物などの非剛体は変形確率が比較的高いため、Jifeng Dai らが提案した変形可能畳み込み[5, 6] を導入し、従来の畳み込みのモデリング能力を強化しました。下の図に示すように、変形可能畳み込みは従来の畳み込みの各ピクセルに水平方向と垂直方向の 2 つのオフセットを追加して変形を表現します。
ビジネスではできるだけ多くのオブジェクトを検出したい一方で、位置精度の要件はやや低いため、損失関数内の位置とカテゴリの重み比率を調整し、モデルがオブジェクトカテゴリの精度により注目するようにしました。
■ 後処理の最適化
テストセット内の同種ラベルボックスの重複を観察・計算した結果、IoU>0.5 のラベルボックスが多数存在することが判明しました。そのため、soft-NMS[7] を後処理に導入し、線形カーネルとガウシアンカーネルを使用して、より滑らかな方法で重複を処理しています。計算式は以下の通りです。
プラットフォーム
トレーニング済みモデルをインターフェイスでカプセル化し、Docker でパッケージ化して、オンラインスケジューリングプラットフォームに公開しました。現在、動画コンテンツ認識プラットフォームは 1 台のマシンで 1 日あたり約 600 本のフィーチャー動画を処理でき、クラスタ全体の処理能力は 1 日あたり 1 万本以上のフィーチャー動画に達します。モデルの検出結果はオフラインデータベースにエクスポートされ、選別と分類を経てオンライン管理プラットフォームにインポートされます。その後、RBI プラットフォームで承認された後に配信システムに登録されるという、一連の流れになっています。全体のプロセスは下の図の通りです。
効果
アルゴリズム最適化の結果
274 クラスおよび 93 クラスのオブジェクトモデルで、最適化前後の mAP-50 指標を比較しました。
下の図は 93 カテゴリモデルでの最適化経路を示しており、最終的に 0.596 の mAP を達成しました。
広告ビジネスへの適用
動画カテゴリにおいて、映画、テレビドラマ、バラエティ番組の 3 つの主要チャンネルでフィーチャー動画の検出を実施し、時代劇、スリラー、童話、宮廷ドラマ、アニメーションなどコンテンツ広告に適さないカテゴリを除外しました。これまでのところ、モデルは 5 万本以上の動画を処理し、9,000 万枚以上のフレーム画像を生成しています。ビジネスアプリケーションにおいて、商用価値のある 274 のオブジェクトを分類しました。実際のアプリケーションでは、ブランドのコンテンツ属性と広告のアイデアに基づいて、関連カテゴリのオブジェクトが関連付けられるシーンをマッチングさせました。各カテゴリのテスト結果の分布は以下の通りです。
携帯電話の広告で、字幕とオブジェクト検出の配置ポイントを比較しました。実際の表示効果は以下の通りです。
配信データを比較するため、「携帯電話」の配置ポイントが既に検出されている動画で、オブジェクト検出の配置ポイントと字幕キーワードの配置ポイントのクリック率の差を比較しました。オブジェクト検出の配置ポイントの露出量は字幕の 3.5 倍であるにもかかわらず、クリック率はさらに 20% 向上しており、質と量の両面で大幅な改善が実現しました。
まとめと展望
まとめ
過去 6 年間、ディープラーニングの急速な発展により、オブジェクト検出技術は非常に成熟しました。本稿の取り組みでは、オブジェクト検出技術を動画コンテンツ広告に応用し、良好な結果を得ています。アルゴリズム面では YOLOv3 を選択し、ビジネス背景を踏まえて商用価値の高いオブジェクトを重点的にモデリングした結果、検出速度と検出精度の両方が大幅に向上しました。
実際のビジネスシナリオへの適用において、オブジェクト検出の結果は既存のシーン広告ビジネスに大量の配置ポイントを追加しました。広告コンテンツと動画コンテンツの関連性を確保しながら、露出量とクリック率に大幅な改善をもたらしています。
展望
現在は技術的に静的画像検出手法を使用しています。今後はフレーム抽出戦略の最適化や、LSTM と Optical Flow を活用した動画の文脈情報の融合[8, 9, 10]により、オブジェクト検出の高速化と、モーションブラーや小型オブジェクトの面積による検出難易度の低減を図り、検出精度と速度の向上を目指します。将来的には、オブジェクト検出アルゴリズムを動画内の衣装検出など、他のシナリオにも応用していく予定です。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
