AutoML Application Exploration
すべてはよりスムースな体験のために
五福は 5 周年を迎えました。初年度に xiuyixiu 方式で福の収集を完了したことを除き、画像による福の方式は導入されていません。今年は福スキャンの AR が福の入口として使われてから 4 年目になります。一部のメンバーからは、昨年の時点で既に福のスキャンは非常にスムーズで認識も正確だったのに、なぜ今年もモデルをアップグレードする必要があるのかという声が上がります。これは独身の日の戦場での逍遥子の言葉を思い出させます。「今年の独身の日で私が最も気にしているのは売上数字ではなく、テクノロジーのピークだ」と。福スキャンのシーンに対応し、ユーザーの AR 福認識体験をよりスムーズにする方法、極めて低スペックのモバイル端末でもスムーズに福をスキャンできる方法、そして端末計算によるカバー率をさらに向上させ、より多くのユーザーにリーチし、100% に近づけることが、毎年刷新し突破しなければならない方向性です。
過去の蓄積
過去 3 年間の福スキャンの視覚アルゴリズム側は、2 つのブレークスルーに集約できます。1 つ目のブレークスルーは、2018 年に xNN ディープラーニングエンジンを導入し、福認識ディープラーニングネットワークを端末上で動作可能にしたことで、クラウドサービスの負荷を大幅に削減すると同時に認識アルゴリズムの精度を大きく向上させました。2 つ目のブレークスルーは 2019 年から始まり、クラウドサービスが xNN-x86 バージョンのアップグレードを完了し、端末とクラウドの連携を背景にした真のデバイス・クラウド統合を実現可能にし、端末とクラウドのモデルを完全に統一しました。技術のブレークスルーはよりスムーズな体感インタラクションとより正確な認識結果をもたらしました。下のアニメーションのように、2017 年にはまだ「脆弱性発掘の専門家」だったかもしれませんが、2018 年以降に「奇襲」を仕掛けようとしても、おそらく難しいでしょう。
今年度のブレークスルー
今年はユーザー体験と開発プロセスをよりスムーズにするため、AutoML を導入しました。これはトレーニング用のハイパーパラメータやネットワーク構造の検索だけでなく、モデル開発プロセス全体の自動化です。その理由は以下の 2 点に集約できます。
ネットワーク性能の段階的改善と高い人件費
今年は昨年の基礎上、エンドツーエンド計算でより多くのユーザーにリーチし、端末でのリソース消費を低減し、より正確な認識結果を得るため、ネットワークモデル性能のさらなる段階的改善を完了させる必要があります。しかし、長年のモデルが既に良好なベンチマークレベルに達している場合、手動設計のみに依存してモデルの性能と精度を大幅に向上させるには、より多くのエネルギーと人件費が必要になります。
KA マーチャントのニーズと世論へのより迅速な対応
AR スキャンの商業化が充実するにつれ、福の文字認識リンクのモデル結果は、KA マーチャントの定向認識の個別ニーズにも迅速に対応し、適合する必要があります。さらに、福スキャンのような全民参加型の活動では、世論を迅速に識別しモデルを反復する緊急対応能力は必須能力です。モデル反復サイクルをできる限り短縮し、すべての操作、遅延、トレーニング時間を標準化して制御可能にし、モデル反復の緊急対応能力を強化する必要があります。
ネットワーク構造設計の自動化
AutoML 機能の特徴
xNN-Cloud プラットフォームが提供する AutoML 機能を利用して、今年の福の文字モデルの構造検索を完了させました。これには以下の特徴が必要です。
1) すぐに使えること。既存のネットワーク構造コードに対して、大きな修正なしでネットワークの検索をサポートできること。
2) 端末側の指標を考慮できること。異なる検索実験の結果を比較する際、精度だけでなく、計算量、パラメータ量、推論時間などの要素も考慮すること。
3) ユーザーインタラクションがフレンドリであること。ユーザーは検索プロセスが期待通りかと検索結果の指標を素早く比較できるかのみを気にすればよく、リソーススケジューリングや GPU の使用状況などの詳細を気にする必要がないこと。
下の図は xNN-Cloud 上の AutoML タスク検索プロセスのフローチャート例と、検索プロセス中の指標結果の動的な変化過程を示しています。
ネットワークとスペースの設計
認識リンク
検出モデルがまず候補対象領域を特定し、その後認識モデルがその領域が福の文字かどうかを判定します。検出ネットワークと認識ネットワークは分離されているため、カスタマイズされた認識ニーズ(馬先生の福の認識など)で迅速なモデルマイグレーションが必要な場合、検出モデルは安定したまま、認識モデルに対してのみ移行トレーニングを行えばよく、検出ネットワークを更新する必要はありません。したがって、通常は検出と認識の 2 つのモデルがあり、両方とも AutoML 構造検索が必要です。
事前知識の導入
AutoML 検索において、十分なトレーニングリソースと十分な時間があれば、できるだけ機械に自由を与え、より複雑な空間で検索させたいところです。しかし、福スキャンのビジネスシーンでは、毎年多くの部門からメンバーをかき集めて臨時チームを結成してから、モデルがテストや統合デバッグに参加するまで、わずか約 1 か月しかありません。この短期間で両ネットワークの構造検索を完了する必要があります。さらに、パラメータ量と計算量が以前のモデルより小さく、精度が昨年より高いことを確保する必要があります。そのため、他の類似ビジネスで蓄積した経験に基づいて、ネットワークフレームワークに事前選択を行いました。
検出モデル
シングルステージ検出器(SSD)構造を起点に、ピラミッドプーリングネットワーク(PPN)の構造を追加して、追加パラメータなしで異なるスケール空間の特徴を迅速に取得できるようにしました。また、バウンディングボックス位置とカテゴリの回帰ブランチでは、重み共有畳み込みを使用して異なるスケールの情報特徴を同じ重みで学習させ、ネットワークが異なるスケールの対象に対してより良い性能を発揮できるようにしました。この基礎上で、MobileNet V1 構造を初期ベースネットワークとして、各層のチャネル幅と畳み込みカーネルサイズを検索し、予測ヘッドがベースネットワークの特徴とより適合するよう、共有タワー回帰層のチャネル幅も検索空間に組み込みました。その結果、ネットワークの特徴抽出と予測ヘッドが、福の文字検出のシーンで最適な適合を達成できます。
認識モデル
MobileNet V2 構造を起点に、EfficientNet の方法を参照してより小さいネットワークで検索を行い、その後ネットワークの幅、深さ、入力サイズのスケーリングを使用して、小規模モデルに基づいて検索された優れた構造のモデル容量を迅速に拡張します。Google の Searching for MobileNetV3 も MobileNet V2 をベースに検索方式を採用しており、モバイル端末の認識モデルをより極致にしています。当社の AutoML の結果は、MobileNet V3 構造を直接使用した結果とも比較しています。下の図は最終的な構造検索で得られた検出ネットワークと認識ネットワークの構造を示しています。
検索目標
AutoML の検索プロセスに伴い、各試行の結果の比較が伴います。相対的により良い構造を選択し、さらに検索またはトレーニングを行うためには、比較用の目標ベンチマークが必要です。福スキャンのタスクでは、精度だけでなく、モデルが最終的にクライアント側で実行されるため、モデルの計算量(FLOPS)とモデルサイズも注目すべき指標となります。そのため、ベンチマークの指定時に複数の要素を考慮してAutoML プロセス中の異なる試行を比較する方法を設計しました。ここで T_f と T_s は目標値、w_f と w_s は FLOPS、モデルサイズ、精度のトレードオフを制御します。
検索戦略
検索リソースは限られているため、リソース消費と検索効率の点で相対的に優れた Hyperband アルゴリズムを選択しました。このアルゴリズムは、前の順位の検索の試行をまず少ないステップ数でトレーニングして目的関数を比較し、段階的により良い構造を選択してからより多くのステップ数でトレーニングすることで、トレーニングステップ数と全体リソースのバランスを取ります。同時に、一定確率で局所最適解に陥ることを防ぐため、最初のランダムパラメータ空間の選択時に多レベルランダム選択も使用しています。したがって、全体としてランダム性を確保しつつ、より良い構造により多くのトレーニングステップを確保し、最終的に最適な収束のモデルを得ます。
検索アルゴリズムの実装面では、xNN-Cloud がアントグループ人工知能部門の ALPS チームと協力し、ALPS-AutoML フレームワーク Python SDK の統合を完了しました。ハイパーパラメータ検索アルゴリズム部分はグリッドサーチ、ランダムサーチ、ベイズ最適化、RACOS などのハイパーパラメータ検索をサポートし、ハイパーバンドやメディアンストップなどの早期停止機構もサポートし、ハイパーパラメータ組み合わせの柔軟な設定をサポートします。同時に、他の機械学習シーンでは、ALPS-AutoML は XGBoost モデルのメタ学習や効率的な自動特徴量エンジニアリングなど、非常に豊富な自動機械学習機能もサポートしています。
モデル性能
より速く、より小さく、より正確に
2019 年の Android クライアントのトップ 50 モデルと iOS クライアントのトップ 20 モデルを、2 年間の推論時間を比較するベンチマークとして使用します。昨年と今年の実際のオンライン環境データから、Android プラットフォームは前年比 50% 以上削減し、平均所要時間は 100 ミリ秒未満、iOS は 30% 以上削減し、平均所要時間は 40 ミリ秒未満です。モデルサイズは昨年と比べてさらに 80K 削減されました。昨年より低い所要時間とパラメータサイズでありながら、精度は前年比でさらに 1.6% 向上しました。これらはすべて AutoML 検索プロセス中に精度、パラメータ量、計算量を総合的に考慮した結果であり、最終的に検索で得られたモデル構造が 3 つの側面すべてで考慮されています。
認識モデル vs MobileNet-v3
検索された認識ネットワーク構造と MobileNet-v3 構造を福の文字認識シーンで比較しました。計算量があまり変わらない場合(mnv3-small-065)、当社の NAS で得られたパラメータサイズは mn-v3 構造のわずか 1/10 であることがわかります。しかし、端末側リソースサイズも非常に厳しく制限されるビジネスシーンである五福にとって、オリジナルの mn-v3 のモデルサイズは明らかに不適切です。モデルサイズを最小化するために一部の高度なブロックを削除し、幅倍率をさらに下げた場合(mnv3-small-minimalistic-025)、モデルの計算量は確かにさらに削減されますが、精度が非常に顕著に低下します。したがって、これは福の文字認識向け AutoML 検索結果の、精度、計算量、パラメータサイズの総合的な考慮における有効性、およびビジネスシーンに対するネットワークのより高い適応性をさらに証明しています。
P.S. 上記の表の認識精度は、しきい値 = 0.9 でのオフラインテストケース 9 万件の画像レベル精度です。実際のビジネスシーンで呼び出される際は、ビデオストリームベースの認識方式であり、マルチフレーム結果の融合と検証があるため、全体のオンライン認識精度はほぼ 1 に近づきます。福スキャンキャンペーン全体で、福の文字認識に関する大規模な世論は発生しませんでした。
アルゴリズム研究開発プロセスの自動化
プラットフォーム基盤
xNN-Cloud はワンストップのコンピュータビジョンアルゴリズム開発機能を提供し、豊富な機能とアルゴリズム開発機能を提供しており(上図参照)、福スキャンモデル開発プロセスの自動化にも大きな利便性とサポートを提供しています。
アルゴリズム開発
標準的な分類、検出、OCR などのアルゴリズムパッケージテンプレートが組み込まれており、パラメータ設定により、タスク用の追加コードなしで高品質なモデルをトレーニングできます。カスタマイズ最適化が必要な場合は、Common API のいくつかの抽象インターフェースを開発するだけで、カスタマイズされたネットワーク構造、損失関数、最適化方法などをモデルトレーニングに適用できます。
モデル圧縮
設定可能なモデル圧縮機能により、ユーザーがモデル圧縮機能を利用する際のコストを大幅に削減します。統合された xQueeze モデル圧縮ツールチェーンは、強力な自動プルーニング、モデル量子化、固定小数点変換機能を提供します。
データプレビュー
アノテーション結果の閲覧に限定されず、データセットでのモデルの評価結果を組み合わせて多次元の表示を実現できます。分類タスクでは、予測カテゴリと GroundTruth カテゴリの交差結果を迅速に確認でき、検出タスクでは、複数の予測結果セットと GroundTruth の IoU を視覚的に表示できます。
マルチマシンマルチ GPU
マルチマシンマルチ GPU 機能の利用複雑性を最小化します。Kubeflow MPI Operator に接続することで、ユーザーが簡単に分散トレーニングを実行できるようにサポートします。アルゴリズムシーナリオの種類に関わらず、ユーザーは GPU 数を選択するだけでマルチマシンマルチ GPU のトレーニング機能を利用でき、コードが複数のマシンでどのように実行されるか、各 GPU の勾配がどのように集約されて更新されるかを気にする必要はありません。
モデル評価
福スキャン期間全体で、自動化されたトレーニングを通じて数千のモデルが生産されました。これらのモデルからより優れたものを迅速に選択できれば、時間コストを大幅に削減できます。評価を通じて、独立テストセットでの精度結果や PR 曲線などを観察でき、複数のモデルの結果を同じパネルに配置して比較できます。
実機テスト
クライアント側でモデルを実行するには、モデルサイズだけでなく、所要時間や CPU/メモリ使用量などの指標も、モデルがクライアント上での実行性能要件を満たしているかを判断するために必要です。EdgePerf とクラウド計測プラットフォームに接続することで、実機でのモデル計測を迅速に実現し、実環境の直感的な動作性能指標を提供できます。
モデルの迅速反転
五福イベント期間中、モデルが公開された後、ユーザーの福スキャン状況に基づいて、ターゲットカテゴリの認識を追加する必要があることが判明した場合、プロダクト側は 1 時間以内のモデル公開を希望します。データ準備からモデルトレーニング、フォーマット変換、モデル評価に至るまで、手動操作で不注意があれば、モデルの更新と公開を遅延させる大きなリスクがあります。しかし、プラットフォーム上でデータ準備、トレーニング、評価の全プロセスのプラットフォーム化と自動化が実現されているため、考えられる人為的ミスは手動オフライントレーニングと比較して大幅に削減されます。
福スキャンモデルの公開前に、xNN-Cloud 上でターゲットタイプの画像に基づく迅速反転モデルのトレーニングプロセスをシミュレーションしました。ターゲット認識データセットをアップロードし、以前のシミュレーショントレーニングタスクをクローンして新しいデータセットを追加するだけで、プラットフォームが提供するマルチマシンマルチ GPU 機能により、最終的なモデルトレーニングプロセスを 15 分以内に制御できます。モデルの構造とサイズが期待と完全に一致していることを確保しつつ、他のカテゴリの認識結果に影響を与えない前提で、ターゲット画像の認識を追加しました。プロセス全体が制御されており、人為的ミスの可能性はなく、プラットフォームに任せるだけで済みます。この能力は干支の鼠年の馬先生の福の文字認識や、加盟店専用福の文字認識のマイグレーショントレーニングにも適用され、極めて短期間でベンチマークモデルの基礎上から最終オンライン版まで反復を完了し、モデルの迅速なレビューを完了しました。
結び
福スキャンモデルのトレーニングは xNN-Cloud プラットフォームに依存しています。今年は多くの手作業を省きながら、昨年より優れたモデルを生産しました。これは xNN-Cloud プラットフォームが提供する AutoML と自動化トレーニング機能のおかげです。現在、xNN-Cloud は実機テストと検索プロセスも直接連携しており、実際の環境に最も近い運用指標で AutoML の検索を導いています。
五福は 5 周年を迎えました。初年度に xiuyixiu 方式で福の収集を完了したことを除き、画像による福の方式は導入されていません。今年は福スキャンの AR が福の入口として使われてから 4 年目になります。一部のメンバーからは、昨年の時点で既に福のスキャンは非常にスムーズで認識も正確だったのに、なぜ今年もモデルをアップグレードする必要があるのかという声が上がります。これは独身の日の戦場での逍遥子の言葉を思い出させます。「今年の独身の日で私が最も気にしているのは売上数字ではなく、テクノロジーのピークだ」と。福スキャンのシーンに対応し、ユーザーの AR 福認識体験をよりスムーズにする方法、極めて低スペックのモバイル端末でもスムーズに福をスキャンできる方法、そして端末計算によるカバー率をさらに向上させ、より多くのユーザーにリーチし、100% に近づけることが、毎年刷新し突破しなければならない方向性です。
過去の蓄積
過去 3 年間の福スキャンの視覚アルゴリズム側は、2 つのブレークスルーに集約できます。1 つ目のブレークスルーは、2018 年に xNN ディープラーニングエンジンを導入し、福認識ディープラーニングネットワークを端末上で動作可能にしたことで、クラウドサービスの負荷を大幅に削減すると同時に認識アルゴリズムの精度を大きく向上させました。2 つ目のブレークスルーは 2019 年から始まり、クラウドサービスが xNN-x86 バージョンのアップグレードを完了し、端末とクラウドの連携を背景にした真のデバイス・クラウド統合を実現可能にし、端末とクラウドのモデルを完全に統一しました。技術のブレークスルーはよりスムーズな体感インタラクションとより正確な認識結果をもたらしました。下のアニメーションのように、2017 年にはまだ「脆弱性発掘の専門家」だったかもしれませんが、2018 年以降に「奇襲」を仕掛けようとしても、おそらく難しいでしょう。
今年度のブレークスルー
今年はユーザー体験と開発プロセスをよりスムーズにするため、AutoML を導入しました。これはトレーニング用のハイパーパラメータやネットワーク構造の検索だけでなく、モデル開発プロセス全体の自動化です。その理由は以下の 2 点に集約できます。
ネットワーク性能の段階的改善と高い人件費
今年は昨年の基礎上、エンドツーエンド計算でより多くのユーザーにリーチし、端末でのリソース消費を低減し、より正確な認識結果を得るため、ネットワークモデル性能のさらなる段階的改善を完了させる必要があります。しかし、長年のモデルが既に良好なベンチマークレベルに達している場合、手動設計のみに依存してモデルの性能と精度を大幅に向上させるには、より多くのエネルギーと人件費が必要になります。
KA マーチャントのニーズと世論へのより迅速な対応
AR スキャンの商業化が充実するにつれ、福の文字認識リンクのモデル結果は、KA マーチャントの定向認識の個別ニーズにも迅速に対応し、適合する必要があります。さらに、福スキャンのような全民参加型の活動では、世論を迅速に識別しモデルを反復する緊急対応能力は必須能力です。モデル反復サイクルをできる限り短縮し、すべての操作、遅延、トレーニング時間を標準化して制御可能にし、モデル反復の緊急対応能力を強化する必要があります。
ネットワーク構造設計の自動化
AutoML 機能の特徴
xNN-Cloud プラットフォームが提供する AutoML 機能を利用して、今年の福の文字モデルの構造検索を完了させました。これには以下の特徴が必要です。
1) すぐに使えること。既存のネットワーク構造コードに対して、大きな修正なしでネットワークの検索をサポートできること。
2) 端末側の指標を考慮できること。異なる検索実験の結果を比較する際、精度だけでなく、計算量、パラメータ量、推論時間などの要素も考慮すること。
3) ユーザーインタラクションがフレンドリであること。ユーザーは検索プロセスが期待通りかと検索結果の指標を素早く比較できるかのみを気にすればよく、リソーススケジューリングや GPU の使用状況などの詳細を気にする必要がないこと。
下の図は xNN-Cloud 上の AutoML タスク検索プロセスのフローチャート例と、検索プロセス中の指標結果の動的な変化過程を示しています。
ネットワークとスペースの設計
認識リンク
検出モデルがまず候補対象領域を特定し、その後認識モデルがその領域が福の文字かどうかを判定します。検出ネットワークと認識ネットワークは分離されているため、カスタマイズされた認識ニーズ(馬先生の福の認識など)で迅速なモデルマイグレーションが必要な場合、検出モデルは安定したまま、認識モデルに対してのみ移行トレーニングを行えばよく、検出ネットワークを更新する必要はありません。したがって、通常は検出と認識の 2 つのモデルがあり、両方とも AutoML 構造検索が必要です。
事前知識の導入
AutoML 検索において、十分なトレーニングリソースと十分な時間があれば、できるだけ機械に自由を与え、より複雑な空間で検索させたいところです。しかし、福スキャンのビジネスシーンでは、毎年多くの部門からメンバーをかき集めて臨時チームを結成してから、モデルがテストや統合デバッグに参加するまで、わずか約 1 か月しかありません。この短期間で両ネットワークの構造検索を完了する必要があります。さらに、パラメータ量と計算量が以前のモデルより小さく、精度が昨年より高いことを確保する必要があります。そのため、他の類似ビジネスで蓄積した経験に基づいて、ネットワークフレームワークに事前選択を行いました。
検出モデル
シングルステージ検出器(SSD)構造を起点に、ピラミッドプーリングネットワーク(PPN)の構造を追加して、追加パラメータなしで異なるスケール空間の特徴を迅速に取得できるようにしました。また、バウンディングボックス位置とカテゴリの回帰ブランチでは、重み共有畳み込みを使用して異なるスケールの情報特徴を同じ重みで学習させ、ネットワークが異なるスケールの対象に対してより良い性能を発揮できるようにしました。この基礎上で、MobileNet V1 構造を初期ベースネットワークとして、各層のチャネル幅と畳み込みカーネルサイズを検索し、予測ヘッドがベースネットワークの特徴とより適合するよう、共有タワー回帰層のチャネル幅も検索空間に組み込みました。その結果、ネットワークの特徴抽出と予測ヘッドが、福の文字検出のシーンで最適な適合を達成できます。
認識モデル
MobileNet V2 構造を起点に、EfficientNet の方法を参照してより小さいネットワークで検索を行い、その後ネットワークの幅、深さ、入力サイズのスケーリングを使用して、小規模モデルに基づいて検索された優れた構造のモデル容量を迅速に拡張します。Google の Searching for MobileNetV3 も MobileNet V2 をベースに検索方式を採用しており、モバイル端末の認識モデルをより極致にしています。当社の AutoML の結果は、MobileNet V3 構造を直接使用した結果とも比較しています。下の図は最終的な構造検索で得られた検出ネットワークと認識ネットワークの構造を示しています。
検索目標
AutoML の検索プロセスに伴い、各試行の結果の比較が伴います。相対的により良い構造を選択し、さらに検索またはトレーニングを行うためには、比較用の目標ベンチマークが必要です。福スキャンのタスクでは、精度だけでなく、モデルが最終的にクライアント側で実行されるため、モデルの計算量(FLOPS)とモデルサイズも注目すべき指標となります。そのため、ベンチマークの指定時に複数の要素を考慮してAutoML プロセス中の異なる試行を比較する方法を設計しました。ここで T_f と T_s は目標値、w_f と w_s は FLOPS、モデルサイズ、精度のトレードオフを制御します。
検索戦略
検索リソースは限られているため、リソース消費と検索効率の点で相対的に優れた Hyperband アルゴリズムを選択しました。このアルゴリズムは、前の順位の検索の試行をまず少ないステップ数でトレーニングして目的関数を比較し、段階的により良い構造を選択してからより多くのステップ数でトレーニングすることで、トレーニングステップ数と全体リソースのバランスを取ります。同時に、一定確率で局所最適解に陥ることを防ぐため、最初のランダムパラメータ空間の選択時に多レベルランダム選択も使用しています。したがって、全体としてランダム性を確保しつつ、より良い構造により多くのトレーニングステップを確保し、最終的に最適な収束のモデルを得ます。
検索アルゴリズムの実装面では、xNN-Cloud がアントグループ人工知能部門の ALPS チームと協力し、ALPS-AutoML フレームワーク Python SDK の統合を完了しました。ハイパーパラメータ検索アルゴリズム部分はグリッドサーチ、ランダムサーチ、ベイズ最適化、RACOS などのハイパーパラメータ検索をサポートし、ハイパーバンドやメディアンストップなどの早期停止機構もサポートし、ハイパーパラメータ組み合わせの柔軟な設定をサポートします。同時に、他の機械学習シーンでは、ALPS-AutoML は XGBoost モデルのメタ学習や効率的な自動特徴量エンジニアリングなど、非常に豊富な自動機械学習機能もサポートしています。
モデル性能
より速く、より小さく、より正確に
2019 年の Android クライアントのトップ 50 モデルと iOS クライアントのトップ 20 モデルを、2 年間の推論時間を比較するベンチマークとして使用します。昨年と今年の実際のオンライン環境データから、Android プラットフォームは前年比 50% 以上削減し、平均所要時間は 100 ミリ秒未満、iOS は 30% 以上削減し、平均所要時間は 40 ミリ秒未満です。モデルサイズは昨年と比べてさらに 80K 削減されました。昨年より低い所要時間とパラメータサイズでありながら、精度は前年比でさらに 1.6% 向上しました。これらはすべて AutoML 検索プロセス中に精度、パラメータ量、計算量を総合的に考慮した結果であり、最終的に検索で得られたモデル構造が 3 つの側面すべてで考慮されています。
認識モデル vs MobileNet-v3
検索された認識ネットワーク構造と MobileNet-v3 構造を福の文字認識シーンで比較しました。計算量があまり変わらない場合(mnv3-small-065)、当社の NAS で得られたパラメータサイズは mn-v3 構造のわずか 1/10 であることがわかります。しかし、端末側リソースサイズも非常に厳しく制限されるビジネスシーンである五福にとって、オリジナルの mn-v3 のモデルサイズは明らかに不適切です。モデルサイズを最小化するために一部の高度なブロックを削除し、幅倍率をさらに下げた場合(mnv3-small-minimalistic-025)、モデルの計算量は確かにさらに削減されますが、精度が非常に顕著に低下します。したがって、これは福の文字認識向け AutoML 検索結果の、精度、計算量、パラメータサイズの総合的な考慮における有効性、およびビジネスシーンに対するネットワークのより高い適応性をさらに証明しています。
P.S. 上記の表の認識精度は、しきい値 = 0.9 でのオフラインテストケース 9 万件の画像レベル精度です。実際のビジネスシーンで呼び出される際は、ビデオストリームベースの認識方式であり、マルチフレーム結果の融合と検証があるため、全体のオンライン認識精度はほぼ 1 に近づきます。福スキャンキャンペーン全体で、福の文字認識に関する大規模な世論は発生しませんでした。
アルゴリズム研究開発プロセスの自動化
プラットフォーム基盤
xNN-Cloud はワンストップのコンピュータビジョンアルゴリズム開発機能を提供し、豊富な機能とアルゴリズム開発機能を提供しており(上図参照)、福スキャンモデル開発プロセスの自動化にも大きな利便性とサポートを提供しています。
アルゴリズム開発
標準的な分類、検出、OCR などのアルゴリズムパッケージテンプレートが組み込まれており、パラメータ設定により、タスク用の追加コードなしで高品質なモデルをトレーニングできます。カスタマイズ最適化が必要な場合は、Common API のいくつかの抽象インターフェースを開発するだけで、カスタマイズされたネットワーク構造、損失関数、最適化方法などをモデルトレーニングに適用できます。
モデル圧縮
設定可能なモデル圧縮機能により、ユーザーがモデル圧縮機能を利用する際のコストを大幅に削減します。統合された xQueeze モデル圧縮ツールチェーンは、強力な自動プルーニング、モデル量子化、固定小数点変換機能を提供します。
データプレビュー
アノテーション結果の閲覧に限定されず、データセットでのモデルの評価結果を組み合わせて多次元の表示を実現できます。分類タスクでは、予測カテゴリと GroundTruth カテゴリの交差結果を迅速に確認でき、検出タスクでは、複数の予測結果セットと GroundTruth の IoU を視覚的に表示できます。
マルチマシンマルチ GPU
マルチマシンマルチ GPU 機能の利用複雑性を最小化します。Kubeflow MPI Operator に接続することで、ユーザーが簡単に分散トレーニングを実行できるようにサポートします。アルゴリズムシーナリオの種類に関わらず、ユーザーは GPU 数を選択するだけでマルチマシンマルチ GPU のトレーニング機能を利用でき、コードが複数のマシンでどのように実行されるか、各 GPU の勾配がどのように集約されて更新されるかを気にする必要はありません。
モデル評価
福スキャン期間全体で、自動化されたトレーニングを通じて数千のモデルが生産されました。これらのモデルからより優れたものを迅速に選択できれば、時間コストを大幅に削減できます。評価を通じて、独立テストセットでの精度結果や PR 曲線などを観察でき、複数のモデルの結果を同じパネルに配置して比較できます。
実機テスト
クライアント側でモデルを実行するには、モデルサイズだけでなく、所要時間や CPU/メモリ使用量などの指標も、モデルがクライアント上での実行性能要件を満たしているかを判断するために必要です。EdgePerf とクラウド計測プラットフォームに接続することで、実機でのモデル計測を迅速に実現し、実環境の直感的な動作性能指標を提供できます。
モデルの迅速反転
五福イベント期間中、モデルが公開された後、ユーザーの福スキャン状況に基づいて、ターゲットカテゴリの認識を追加する必要があることが判明した場合、プロダクト側は 1 時間以内のモデル公開を希望します。データ準備からモデルトレーニング、フォーマット変換、モデル評価に至るまで、手動操作で不注意があれば、モデルの更新と公開を遅延させる大きなリスクがあります。しかし、プラットフォーム上でデータ準備、トレーニング、評価の全プロセスのプラットフォーム化と自動化が実現されているため、考えられる人為的ミスは手動オフライントレーニングと比較して大幅に削減されます。
福スキャンモデルの公開前に、xNN-Cloud 上でターゲットタイプの画像に基づく迅速反転モデルのトレーニングプロセスをシミュレーションしました。ターゲット認識データセットをアップロードし、以前のシミュレーショントレーニングタスクをクローンして新しいデータセットを追加するだけで、プラットフォームが提供するマルチマシンマルチ GPU 機能により、最終的なモデルトレーニングプロセスを 15 分以内に制御できます。モデルの構造とサイズが期待と完全に一致していることを確保しつつ、他のカテゴリの認識結果に影響を与えない前提で、ターゲット画像の認識を追加しました。プロセス全体が制御されており、人為的ミスの可能性はなく、プラットフォームに任せるだけで済みます。この能力は干支の鼠年の馬先生の福の文字認識や、加盟店専用福の文字認識のマイグレーショントレーニングにも適用され、極めて短期間でベンチマークモデルの基礎上から最終オンライン版まで反復を完了し、モデルの迅速なレビューを完了しました。
結び
福スキャンモデルのトレーニングは xNN-Cloud プラットフォームに依存しています。今年は多くの手作業を省きながら、昨年より優れたモデルを生産しました。これは xNN-Cloud プラットフォームが提供する AutoML と自動化トレーニング機能のおかげです。現在、xNN-Cloud は実機テストと検索プロセスも直接連携しており、実際の環境に最も近い運用指標で AutoML の検索を導いています。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
