Da Mo Academy Daniel learns to cut
Dharma Academy の設立発表以来、Alibaba の「謎の機関」は外部からの注目を集めてきました。ハイエンドで神秘的というイメージは、Dharma Academy の技術エキスパートたちへの好奇心もかき立てます。
他者の目には、Dharma Academy のメンバーの多くは風変わりな人々に映ります。神秘的でハイエンドな研究する、さながら武俠小説の掃地僧のような存在です。しかしある日、その神秘的なエキスパートたちが神秘のベールを脱ぎ捨て、切り抜き作業に没頭し始めたら——すべてが予測不能な方向へ進み始めます。いったい彼らは切り抜きで何ができるというのでしょう。
ご覧ください、あらゆるものが切り抜けます。
一部の画像は Taobao の商品マップから引用
なぜマッティング研究を始めたのか
これは Alibaba Intelligent Design Lab が独自に開発したデザインプロダクト、Luban に端を発します。Luban の初衷は従来のデザインモードを変革し、短時間で大量のバナー画像、ポスター画像、会場画像のデザインを可能にし、業務効率を向上させることでした。マーチャントがアップロードする商品画像は品質にばらつきがあり、そのまま使用すると見栄えが良くありません。Luban の画像処理により、会場全体の統一されたスタイルと高品質な視覚効果を確保でき、商品の魅力と購入者の視覚体験を向上させ、ひいては商品のコンバージョン率向上を実現します。デザイン作業の過程で、商品マッティングは避けて通れない煩雑な作業であることがわかりました。精密なポートレートマッティングにはデザイナー 1 人あたり平均 2 時間以上かかります。創造性を必要としない純粋な作業は AI で代替する必要があります。こうしてマッティングアルゴリズムが誕生しました。
近年、画像マッティングアルゴリズムは徐々に人々の視野に入るようになりました。その背後に潜む業界——パンエンターテインメント、E コマース、オンラインフードデリバリー、メディア、教育などのバーティカル業界の商業的価値は軽視できません。画像制作の需要は拡大を続けています。市場に出回っているマッティングアルゴリズムの一部は、ポートレートの髪際の細部処理が不十分で、E コマースなどの汎用シーンにも十分に対応できていません。これら 2 つの課題に対し、より高い汎化能力を持つシステムを設計するとともに、髪際処理と高精度切り抜き関連アルゴリズムを深化させ、より優れた結果を得ています。
直面した課題とソリューション
Luban の「バッチ切り抜き」要件に取り組み始めた当初、ユーザーがアップロードする画像の品質、ソース、内容は多種多様で、単一のモデルで一度にビジネス効果を実現することは困難だと気づきました。広範なシナリオとデータの分析を経て、カスタマイズのための全体フレームワークを以下のように構築しました。
主にフィルタリング、分類、検出、セグメンテーションの 4 つのモジュールをカバーします。
フィルタリング:暗すぎる、露出オーバー、ぼやけ、遮蔽などの不良画像を除去します。主に分類モデルと基本的な画像アルゴリズムを使用します。
分類:ボトル入り飲料や化粧品などの製品は接続性が比較的良好ですが、3C 製品、日用品、おもちゃなどのカテゴリは逆です。さらに、頭部、ポートレート、動物などシーンの要件も異なるため、異なるセグメンテーションモデルを設計して効果を向上させています。
検出:Luban シーンでは、ユーザーデータは主に商品画像から来ており、多くの画像はデザインの施されたものです。1 枚の画像に複数の製品、複数のカテゴリが含まれ、被写体の占める割合が小さく、コピーライティング、装飾、ロゴなどの余分な情報も含まれています。検出ステップを追加してクロッピングを行ってからセグメンテーションすることで、より正確な効果が得られます。
セグメンテーション:まず粗いセグメンテーションで大まかなマスクを取得し、次に精密なセグメンテーションで正確なマスクを得ます。これにより速度を向上させつつ、髪際レベルの精度を実現できます。
効果をより正確にするには
現在、分類モデルと検出モデルは比較的成熟していますが、評価モデルはシナリオ(E コマース用デザイン画像、自然な撮影画像など)に応じてカスタマイズする必要があり、セグメンテーション精度が不十分ですべてのモジュールの中で最も弱い部分となっているため、主戦場となりました。詳細は以下の通りです。
分類モデル:分類タスクは多くの場合、データ準備、モデル最適化、データクレンジングを複数ラウンド重ねてから使用可能になります。これに基づき、最新の最適化技術を取り入れ、AutoML のアプローチを参考に自動分類ツールを設計しました。限られた GPU リソースのもとでパラメータとモデルの探索を行い、分類タスクにおける人の関与を簡素化し、分類タスクの実装を加速します。
評価モデル:回帰を直接使ってスコアフィッティングを行うと、トレーニング効果が芳しくありません。このシナリオでは、事前フィルタリングタスクとして分類問題として扱う方が合理的です。実際、暗すぎや露出オーバーの判定には従来のアルゴリズムも併用しています。
検出モデル:主に FPN 検出アーキテクチャを参考にしています。
特徴ピラミッドの各特徴マップについて、上下の隣接層の特徴を融合させることで、出力特徴により強力な潜在表現能力を持たせます。
特徴ピラミッドの異なる層の特徴に対してそれぞれ予測し、候補アンカーを用いることでスケール変化への頑健性を高め、小スケール領域の再現率を向上させます。
候補アンカーの設定に予測可能なスケールを追加し、製品サイズの極端な比率における汎用性を大幅に向上させます。
セグメンテーション融合モデル:
従来の画像セグメンテーションが前景と背景を分離するだけでよいのとは異なり、高精度マッティングアルゴリズムは特定のピクセルの具体的な透明度を求め、離散的な 0-1 の分類問題を [0, 1] の間の回帰問題に変換します。
私たちの作業では、画像内の特定のピクセル p に対して、次のような数式で透明度予測を行います。
右図の赤い部分は、前景と背景の確率に囲まれたピクセルです。
融合ネットワーク:連続する複数の畳み込み層で構成され、混合重みの予測を担当します。画像のソリッド領域では、そのピクセルの前景と背景の予測は容易にこの条件を満たします。このとき微分は常に 0 になります。この優れた性質により、融合ネットワークはトレーニング中に自動的に半透明領域に「フォーカス」します。
応用プロダクト化公開
商業応用の基盤は、ポートレート/頭部/顔/髪の切り抜き、製品切り抜き、動物切り抜きといったアプリケーション層での単一ポイント機能にあります。今後はアニメーションシーンの切り抜き、衣服の切り抜き、パノラマ切り抜きなども順次サポートしていく予定です。これに基づき、Luban のバッチ白背景マップ機能、E アプリケーションの証明写真/バトルレポート/キャラクター背景変更(DingTalk -> My -> 発見 -> ミニプログラム -> Drawing Butterfly)など、プロダクト化も進めています。
他者の目には、Dharma Academy のメンバーの多くは風変わりな人々に映ります。神秘的でハイエンドな研究する、さながら武俠小説の掃地僧のような存在です。しかしある日、その神秘的なエキスパートたちが神秘のベールを脱ぎ捨て、切り抜き作業に没頭し始めたら——すべてが予測不能な方向へ進み始めます。いったい彼らは切り抜きで何ができるというのでしょう。
ご覧ください、あらゆるものが切り抜けます。
一部の画像は Taobao の商品マップから引用
なぜマッティング研究を始めたのか
これは Alibaba Intelligent Design Lab が独自に開発したデザインプロダクト、Luban に端を発します。Luban の初衷は従来のデザインモードを変革し、短時間で大量のバナー画像、ポスター画像、会場画像のデザインを可能にし、業務効率を向上させることでした。マーチャントがアップロードする商品画像は品質にばらつきがあり、そのまま使用すると見栄えが良くありません。Luban の画像処理により、会場全体の統一されたスタイルと高品質な視覚効果を確保でき、商品の魅力と購入者の視覚体験を向上させ、ひいては商品のコンバージョン率向上を実現します。デザイン作業の過程で、商品マッティングは避けて通れない煩雑な作業であることがわかりました。精密なポートレートマッティングにはデザイナー 1 人あたり平均 2 時間以上かかります。創造性を必要としない純粋な作業は AI で代替する必要があります。こうしてマッティングアルゴリズムが誕生しました。
近年、画像マッティングアルゴリズムは徐々に人々の視野に入るようになりました。その背後に潜む業界——パンエンターテインメント、E コマース、オンラインフードデリバリー、メディア、教育などのバーティカル業界の商業的価値は軽視できません。画像制作の需要は拡大を続けています。市場に出回っているマッティングアルゴリズムの一部は、ポートレートの髪際の細部処理が不十分で、E コマースなどの汎用シーンにも十分に対応できていません。これら 2 つの課題に対し、より高い汎化能力を持つシステムを設計するとともに、髪際処理と高精度切り抜き関連アルゴリズムを深化させ、より優れた結果を得ています。
直面した課題とソリューション
Luban の「バッチ切り抜き」要件に取り組み始めた当初、ユーザーがアップロードする画像の品質、ソース、内容は多種多様で、単一のモデルで一度にビジネス効果を実現することは困難だと気づきました。広範なシナリオとデータの分析を経て、カスタマイズのための全体フレームワークを以下のように構築しました。
主にフィルタリング、分類、検出、セグメンテーションの 4 つのモジュールをカバーします。
フィルタリング:暗すぎる、露出オーバー、ぼやけ、遮蔽などの不良画像を除去します。主に分類モデルと基本的な画像アルゴリズムを使用します。
分類:ボトル入り飲料や化粧品などの製品は接続性が比較的良好ですが、3C 製品、日用品、おもちゃなどのカテゴリは逆です。さらに、頭部、ポートレート、動物などシーンの要件も異なるため、異なるセグメンテーションモデルを設計して効果を向上させています。
検出:Luban シーンでは、ユーザーデータは主に商品画像から来ており、多くの画像はデザインの施されたものです。1 枚の画像に複数の製品、複数のカテゴリが含まれ、被写体の占める割合が小さく、コピーライティング、装飾、ロゴなどの余分な情報も含まれています。検出ステップを追加してクロッピングを行ってからセグメンテーションすることで、より正確な効果が得られます。
セグメンテーション:まず粗いセグメンテーションで大まかなマスクを取得し、次に精密なセグメンテーションで正確なマスクを得ます。これにより速度を向上させつつ、髪際レベルの精度を実現できます。
効果をより正確にするには
現在、分類モデルと検出モデルは比較的成熟していますが、評価モデルはシナリオ(E コマース用デザイン画像、自然な撮影画像など)に応じてカスタマイズする必要があり、セグメンテーション精度が不十分ですべてのモジュールの中で最も弱い部分となっているため、主戦場となりました。詳細は以下の通りです。
分類モデル:分類タスクは多くの場合、データ準備、モデル最適化、データクレンジングを複数ラウンド重ねてから使用可能になります。これに基づき、最新の最適化技術を取り入れ、AutoML のアプローチを参考に自動分類ツールを設計しました。限られた GPU リソースのもとでパラメータとモデルの探索を行い、分類タスクにおける人の関与を簡素化し、分類タスクの実装を加速します。
評価モデル:回帰を直接使ってスコアフィッティングを行うと、トレーニング効果が芳しくありません。このシナリオでは、事前フィルタリングタスクとして分類問題として扱う方が合理的です。実際、暗すぎや露出オーバーの判定には従来のアルゴリズムも併用しています。
検出モデル:主に FPN 検出アーキテクチャを参考にしています。
特徴ピラミッドの各特徴マップについて、上下の隣接層の特徴を融合させることで、出力特徴により強力な潜在表現能力を持たせます。
特徴ピラミッドの異なる層の特徴に対してそれぞれ予測し、候補アンカーを用いることでスケール変化への頑健性を高め、小スケール領域の再現率を向上させます。
候補アンカーの設定に予測可能なスケールを追加し、製品サイズの極端な比率における汎用性を大幅に向上させます。
セグメンテーション融合モデル:
従来の画像セグメンテーションが前景と背景を分離するだけでよいのとは異なり、高精度マッティングアルゴリズムは特定のピクセルの具体的な透明度を求め、離散的な 0-1 の分類問題を [0, 1] の間の回帰問題に変換します。
私たちの作業では、画像内の特定のピクセル p に対して、次のような数式で透明度予測を行います。
右図の赤い部分は、前景と背景の確率に囲まれたピクセルです。
融合ネットワーク:連続する複数の畳み込み層で構成され、混合重みの予測を担当します。画像のソリッド領域では、そのピクセルの前景と背景の予測は容易にこの条件を満たします。このとき微分は常に 0 になります。この優れた性質により、融合ネットワークはトレーニング中に自動的に半透明領域に「フォーカス」します。
応用プロダクト化公開
商業応用の基盤は、ポートレート/頭部/顔/髪の切り抜き、製品切り抜き、動物切り抜きといったアプリケーション層での単一ポイント機能にあります。今後はアニメーションシーンの切り抜き、衣服の切り抜き、パノラマ切り抜きなども順次サポートしていく予定です。これに基づき、Luban のバッチ白背景マップ機能、E アプリケーションの証明写真/バトルレポート/キャラクター背景変更(DingTalk -> My -> 発見 -> ミニプログラム -> Drawing Butterfly)など、プロダクト化も進めています。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
