How to digitize human and goods movements

ビジネス分析

「いつ、どこで、誰がどの商品に関心を示したか」という課題において、時間と場所については、顧客の行動がいつ発生し、店舗内のどの陳列台で起きたかを正確に特定する必要があります。また、顧客を正確に関連付け、年齢、性別、新規顧客とリピーターといった属性まで関連付けることが求められます。さらに、どの SKU の商品が手に取られたかを正確に判定する必要があります。自動販売機やオフライン大型スクリーンなどのシーンとは異なり、監視カメラの映像では商品との距離が遠く、画像が鮮明ではありません。同時に、商業施設やスーパーマーケットでは商品が密集して陳列されており、画像が不完全になります。そのため、監視カメラでは顧客が商品を手に取る動作の有無を大まかに判定することしかできず、「人・モノ・場」における商品情報を直接取得することはできません。図に示す通りです。

この課題を解決するため、ニューリテールシーンで広く使用されている無線周波電子タグ (RFID) を活用して、顧客が手に取った商品を検出します。パッシブ RFID タグは低コストで、衣料品などの商品に広く装着できます。アルゴリズムは現在、「いつ、どこで、誰が、どの商品とインタラクションしたか」のデータを提供しており、全体の実装プロセスは図に示す通りです。

その中で、店舗には監視カメラ機器と RFID リーダー機器が設置されており、リアルタイム映像と RFID タグの励磁反射のタイミング信号をそれぞれ記録します。監視映像は、店舗にデプロイされたサーバーで顧客検出アルゴリズムを実行して取得されます。歩行者が写っている画像のみが検出され、歩行者が検出された画像のみがバックエンドに送信されます。RFID のタイミング信号は信号量が小さいため、すべてバックエンドに送信されます。商品が手に取られた後、店員が RFID タグの EPC 番号を商品の SKU 番号と関連付けているため、タグが検出された EPC 番号に基づいて対応する商品の SKU を取得できます。同時に、送信された顧客画像は MobileNet 分類器に送られ、商品を手に取った疑いのある顧客を分類し、顧客の画像座標に基づいて座標変換を行い、顧客の実空間座標を取得します。最後に、手に取られた疑いのある商品と、商品を手に取った疑いのある顧客を、時間と動作の不審度に基づいて関連付け、商品と歩行者の最適なマッチングを取得し、「いつ、どこで、誰が、どの商品とインタラクションしたか」を検出します。

本稿では、3 つの重要な技術ポイントについて論じます。

画像ベースの顧客動作検出アルゴリズム

無線周波信号ベースの商品反転検出アルゴリズム

二部グラフマッチングに基づく人・モノ関連付けアルゴリズム

1. 画像ベースの顧客動作検出アルゴリズム
画像ベースの顧客動作検出アルゴリズムは、ビジネスとデプロイメントの要件に伴い、動画ベースの検出から単一フレーム画像検出への進化を経てきました。

1.1 動画画像の動き検出

1.1.1 問題分析

歩行者検出や顔検出などの問題とは異なり、顧客と商品のインタラクションは時系列的なプロセスです。「商品を手に取る」「試着する」などは、いずれも一定の時間長さを持つ時系列プロセスであり、ユーザーの行動理解は典型的な動画動作分類問題です。動画レベルの動作理解は、主に動画全体に基づくモデルの学習と予測を研究します。深層ニューラルネットワークの広範な応用に伴い、動画動作理解技術は近年大きく発展しています。代表的なものとして、2014 年の CNN モデル [1]、2015 年の LRCN モデル [2]、2017 年の I3D モデル [3] があります。その中で、LRCN は単一フレーム画像上で 2D 畳み込みを使用して特徴抽出を行い、RNN でフレーム間の時間関係を抽出します。良好な結果を達成しますが、学習に多くの時間を要します。I3D モデルは 3D 畳み込みに基づき、動画全体に対して真に特徴抽出を実現し、学習がより高速です。

ただし、UCF101、HMDB51、Kinetics などのオープンソースデータセットは、一般的なスポーツや楽器演奏などの動作に限られた数のデータしかなく、スーパーマーケットシーンのデータは含まれていません。そのため、スーパーマーケットシーンでの動作動画を独自に構築し、アノテーション用に外部委託しました。スーパーマーケットシーンでの顧客と商品のインタラクションプロセスは極めて短く、終日の動画の中で顧客の行動が発生する時間は約 0.4% に過ぎず、正例が特に疎らです。正例を可能な限り発見し、アノテーションの効率を向上させるため、Lucas-Kanade オプティカルフローアルゴリズムを使用して動画を前処理し、動画内のアクティブなオブジェクトの有無を暫定的に判定することで動画をスクリーニングしました。これにより、正例の比率は 5% に引き上げられました。サンプルの信頼性を向上させるため、サンプル内の正例に対してキャリブレーションも実施し、正例の正確性を確保しました。

1.1.2 動作検出モデルとその最適化

動画内で発生する動作を検出するため、本研究では以下を試みました。

人体キーポイント検出アルゴリズム (Pose) と追跡アルゴリズム (Track) に基づき、各顧客の各手のリアルタイム短视频を自動的に切り出す。

Inception-V1 C3D (I3D) モデルに基づいて手の動き分類器をトレーニングし、I3D モデルの裁剪と最適化を行う。

各顧客の手の短视频を切り出すことは、動作の位置を正確に特定するのに役立ちます。同時に、顧客の商品に対する反転動作は必ず手を通じて行われるため、顧客の身体の他の部分は検出結果に直接的な影響を与えず、手首部分にフォーカスすることはモデルの計算量を削減し、モデルの収束を加速するのに有益です。アルゴリズムに含まれる Pose モデルは Open Pose [4] に基づき、Track アルゴリズムは Deep Sort [5] に基づいています。いずれも成熟したモデルがあり、直接使用できます。

本研究では主に、Inception-V1 C3D モデルを手の動きの動画理解に応用する研究について論じます。画像ベースの学習タスクは通常、2D 畳み込みカーネルを使用して画像上でスライドとプーリングを行い、特徴抽出を実現します。一方、動画ベースの学習タスクでは、従来の 2D 畳み込みを 3D に拡張し、動画内でスライドとプーリングを行って特徴抽出を実現する必要があります。図に示すように、3D 畳み込みは 2D 畳み込みよりも時間次元が 1 つ多い構造です。

本研究では、新たに提案された Inception-V1 C3D (I3D) モデルを使用します。このモデルは従来の Inception-V1 モデルを 3D 次元に拡張し、Kinetics、HMDB51、UCF101 データセットでこれまでで最高の結果を達成しています。I3D モデルのブロック図を図に示します。模式図のすべての畳み込みとプーリング操作は 3D レベルで実行されます。Mix モジュールは Inception V1 モデルの Inception パーセプトロンサブモジュールで、右図に示すように 4 つの分岐で構成されます。

スーパーマーケットでの顧客行動理解のタスクに実際に適用したところ、3D 畳み込みがモデルパラメータを過度に増加させ、オーバーフィッティングが非常に起きやすいことが分かりました。同時に、ネットワークが深くなりすぎることで、モデルの汎化性能の低下やドロップアウト効果の弱化などの問題も生じます。そこで、Inception-V1 モデルを簡略化し、不要な多層 Inception モジュール (Mix_4c、Mix_4d、Mix_4e、Mix_4f、Mix_5c) を削除し、各 Inception モジュールの畳み込みカーネル数 (depth) を元の 1/2 に削減しました。簡略化されたモデルを図に示します。

この簡略化操作により、モデルの分類精度 (Accuracy) は 80.5% から 87.0% に向上し、ハイパーパラメータをさらに調整した結果、最終的な分類精度は 92% に達しました。

1.1.3 結論と分析

tfrecords で処理したサンプルをグループデータストレージセンターにアップロードし、PAI を使用して分散環境 (30 GPU カード) でモデルトレーニングを行い、トレーニング済みモデルを顧客行動の理解に応用しました。アルゴリズムの現在の実装による実際の予測効果は、動画動作検出結果.mp4 に示されています。現在、サーバー環境で単一チャンネル動画の顧客動作のリアルタイム検出を実現できていますが、従来の画像分類タスクと比較して、動画動作分類検出の主な問題は以下の通りです。

モデルの複雑性が高く、3D 畳み込み (C3D、Convolutional 3D) を時間と空間の両方で実行する必要がある。

データ規模が巨大で、トレーニングが困難である。画像と比較して、動画データの規模は数百倍から数万倍に増加している。

モデルの実デプロイは課題が多く、動画動作モデルは予測の時間効率、時系列サンプルの整理、ローリングウィンドウ予測の面で実用化プロセスにおいて大きな課題を抱えている。

1.2 単一フレーム画像の動き検出

1.2.1 問題分析

動画畳み込みベースの顧客動作検出アルゴリズムは高精度 (92%) を達成し、正確な動作位置 (手首位置まで正確) を提供できます。ただし、動画 3D 畳み込みモデルと Pose モデルのパラメータの複雑性が高いため、1 台のサーバーで 1 つの検出アルゴリズムしか実行できず、計算性能に大きな負荷がかかります。同時に、3D 畳み込みアルゴリズムは一定期間内の連続した手の動画を正確に関連付ける必要があり、Tracking アルゴリズムにも大きな課題をもたらします。複数の監視信号を持つ複数店舗のシーンに動作検出アルゴリズムを適応させるため、単一画像ベースの不審動作検出アルゴリズムをさらに開発し、単一画像上で直接不審動作の分類と検出を行いました。単一画像の不審動作検出は、情報の不足により、動画ベースの動作検出アルゴリズムより精度が低くなります。ただし、精度の低さは RFID 検出結果との融合と補正で補うことができます。

1.2.2 モデルとその最適化

単一画像ベースの不審動作検出は古典的な二項分類問題です。計算能力の需要を削減するため、MobileNet [6] を分類モデルとして使用します。MobileNet は Microsoft が提案した効率的で軽量なネットワークモデルで、主に depth-wise 畳み込みと point-wise 畳み込みに基づいて従来の畳み込み層の計算を最適化します。従来の畳み込みネットワークと比較して、MobileNet は精度をほぼ維持したまま、計算量とパラメータ数を約 10% から 20% に削減できます。本稿では、MobileNet_V1 バージョンモデルを使用し、畳み込みチャネル数係数 Depth multiplier を 0.5 に設定して、モデルサイズをさらに削減しました。外部委託を通じて画像動作データセットをアノテーションし、サンプルのバランスを調整して、トレーニングプロセスで正例と負例の数が一致するようにしました。同時に、ビジネスシナリオでユーザーの動作がある瞬間を可能な限り捉えたいという要望を考慮し、モデルの Logits 出力に基づいてパラメータを最適化し、正例のリコール率 (recall) を 90% に向上させ、正例を可能な限り召回できるようにしました。下図に示す通りです。

1.2.3 結論と拡張

画像ベースの動き検出アルゴリズムは、89% の精度で動作を分類でき (動画ベースの動作検出アルゴリズムよりわずかに低く、手首位置まで正確ではありません)、リコール率は 90% です。下図は、モデルが歩行者が衣料品を手に取る動作を行ったかを予測する様子を示しています。画像下部の灰白色のストライプはモデル検出動作が正例であることを示し、画像下部の黒色のストライプはモデル検出動作が負例であることを示します。

画像ベースの動き検出アルゴリズムはポータブルな MobileNet モデルに基づいているため、計算量が大幅に削減され、店舗の 1 日分の疑わしい画像数万枚を予測するのに約 10 分しかかかりません。同時に、アルゴリズムはバックエンドに送信された画像のみを処理すればよく、現場デバイスとサーバーの負荷を大幅に軽減します。ただし、画像ベースの動き検出アルゴリズムは歩行者の位置までしか正確ではなく、動作の正確な位置を与えることができません。同時に、同じ動作の前後数秒以内の画像が正例として検出される可能性があり、時間相関の精度にも一定の影響を与えます。

2. 無線周波信号ベースの商品反転検出アルゴリズム

2.1 問題分析

顧客が衣料品を手に取ると、衣料品に付けられた RFID タグが微かに振動し、RFID リーダーデバイスがタグの反射信号の RSSI、Phase などの特性値の変化を記録し、バックエンドに送信します。アルゴリズムは各アンテナから返される信号値を分析して、商品が反転されたかを判定します。RFID 信号に基づく商品反転の判定には、信号ノイズ、環境のマルチパス効果、偶発的な電磁ノイズ、陳列台の信号遮蔽への影響など、多くの問題があります。同時に、RFID 反射信号の大きさと受信機とタグの距離の間には非線形関係があります [7]。

ここで、d は RFID タグと受信機の距離を表し、l = d mod λ、γ はマルチパスと現在の環境の影響を受け、μ は各種静的機器エラーによるオフセットを表します。式から分かるように、受信機の設置場所と店舗環境は RFID 信号に大きな影響を与えます。異なる店舗や異なる位置の受信機に適用できる統一された反転判定アルゴリズムを見つけることは大きな課題です。

2.2 反転検出アルゴリズムとその最適化

まず、商品が反転されたかを検出する教師ありモデルを構築しようと試みました。店舗に実際に配置された 2 つの異なる RFID アンテナで収集されたタグの RSSI と Phase のタイミング信号を収集し、以下の特徴を手動で組み合わせました。

ここで、Ant1 と Ant2 は同じタグに対して 2 つの異なるアンテナで収集された信号を表し、Diff は信号の差分演算を表し、Avg は信号の平均値処理を表します。最終的に、毎秒 50 フレームで、各サンプルは 8 秒間の連続信号を収集し、400×10 の二次元特徴を構成します。そして、自作データセットを使用して以下のモデルに基づいてトレーニングを行い、最終的な実際の分類精度は 91.9% です。

教師ありモデルベースの検出アルゴリズムを使用すると、商品反転の高い検出精度を得られます。ただし、実際の応用プロセスで、モデルの汎化性能が非常に低いことが分かりました。店舗の陳列台が移動したり、アンテナ位置が移動したりすると、信号が急激に変化します。元のデータセットでトレーニングされたモデルを新しいシナリオに汎化することは困難です。そこで、教師なしモデルベースのアルゴリズムをさらに試し、検出アルゴリズムの汎化性能の向上を試みました。特に、位相情報は空間位置とは無関係だが相対変位と関係があること (位相情報の周波数分布図)、周波数情報は空間位置とは無関係だが動作の速度と関係があること (周波数ドメイン情報の周波数分布図) に注目しました。

厳密に言えば、周波数情報内の振幅情報は空間位置と関係がありますが、周波数分布 (異なる周波数成分の比率) のみに注目する場合、周波数情報も空間位置情報とは無関係な特徴と見なすことができます。周波数情報の取得には、RSSI 信号と Phase 信号に離散フーリエ変換を適用する必要があります。

次に、周波数信号と位相信号の分布図を統計します。得られた分布図について、現在の分布と以前の時刻の分布の間の JS 散度を計算します (KL 散度に対して、JS 散度は加法対称性を持つため、複数の分布間の相対距離を測定できます)。

隣接する時刻の 2 つのサンプルの JS 散度差分に基づいて、商品の反転動作を検出し、最終的な JS 散度差分のしきい値をシーンに応じて調整することで、教師ありモデルベースと同等の動作検出精度を得られます。

2.3 結論と分析

教師ありモデルと教師なしモデルの両方に基づいて、商品の反転を検出し、アルゴリズムは反転された商品 (SKU) を正確に与えます。教師ありモデルの検出精度は 91.9% に達し、教師なしモデルの検出精度は 94% に達します (教師ありモデルより高い)。同時に、JS 散度尺度を使用してアルゴリズムの汎化性能を向上させ、異なるシナリオに応じてしきい値をわずかに修正することで、検出アルゴリズムを異なるシナリオに適用できます。

3. 二部グラフマッチングに基づく人・モノ関連付けアルゴリズム

3.1 問題分析

明らかに、画像ベースの顧客行動検出と RFID ベースの商品反転検出は 2 つの独立したプロセスです。

RFID ベースの検出は商品が反転された状況を与えますが、反転動作に対応する顧客を与えることはできません。

画像ベースの動き検出は商品を手に取った疑いのある顧客を与えますが、どの商品が反転されたかを伝えることはできません。

実際のシナリオでは、通常、同じ場所で同時に発生する動作は少数のため、RFID で検出された商品が反転された時間と、画像で検出された顧客が商品を反転した時間をマッチングし、商品を反転した顧客を反転された商品と関連付けることができます。しかし、問題があります。

画像で検出された動作時間と RFID で検出された動作時間の間の累積誤差は 5〜15 秒に達することがあります。RFID 信号と監視映像信号のサーバーへの伝達時間差、現場機器のクロック非同期による時間差、アルゴリズムの不正確な推定動作時間は、2 つの検出アルゴリズムの時間差を不一致にします。

隣接する時刻と隣接する場所で、複数の不審な顧客と複数の不審に反転された商品が存在する可能性があります。

3.2 人・モノ関連付けアルゴリズムとその最適化

同じ陳列台付近で RFID 機器が検出した動作と画像が検出した動作を関連付け、動作を関連付ける際に、時間の一貫性と動作の不審度のマッチングも考慮します。同じ時間帯に同じ陳列台で実際に商品を手に取った顧客と、実際に手に取られた商品が関連付けられるようにします。複数の顧客が同じエリアで不審な動作を示したり、複数の商品が同じエリアで不審に反転されたりした場合、二部グラフマッチングアルゴリズムをさらに使用して、複数の商品と複数の顧客の最適な関係を見つけます。本研究では、顧客と商品のマッチング度 (辺重み) を以下のように定義します。

そこで、マッチングアルゴリズムの前に二部グラフを複数の非接続部分グラフに分割し、各部分グラフに対して個別にマッチングを行い、計算量とストレージの複雑さを削減します。隣接行列を使用して辺重みの関係を保存する場合、部分グラフのマッチングはアルゴリズムの効率を大幅に向上させ、1 日を通じた数百から数千の顧客と商品のマッチングにかかる時間を数時間から数分に短縮します。

3.3 結論と分析

二部グラフマッチングに基づく人・モノ関連付けアルゴリズムは、1 日を通じた商品と顧客の最適なマッチングを得られます。改良されたアルゴリズムは計算効率を大幅に向上させ、1 日を通じた顧客と歩行者のマッチングの計算時間を数時間から数分以内に短縮しました。同時に、人・モノ関連付けアルゴリズムは全体の人・モノ関連付けの最終段階です。人・モノ関連付けの精度は、顧客検出の精度、単一フレーム画像検出ベースの顧客動作の精度 (89%)、RFID ベースの商品反転動作検出の精度 (94%)、および人・モノ関連付けのマッチング度の精度など、各上流アルゴリズムモデルの精度に影響されます。

4. 結論と分析

上記の 3 つのアルゴリズムを統合します。

画像ベースの顧客動作検出アルゴリズム
無線周波信号ベースの商品反転検出アルゴリズム
二部グラフマッチングに基づく人・モノ関連付けアルゴリズム
そして、実際の店舗で予測を行います。理解しやすいよう、アルゴリズムが検出した結果の例をいくつか示します。「いつ (時刻)、どこで (画像座標)、誰が (歩行者 ID)、どの商品 (商品 SKU) とインタラクションしたか」。

ここで、歩行者 ID は顧客検出アルゴリズムが店舗に入店したユーザーに割り当てた番号です。ここで与えられる座標は画像内の座標で、下流プロセスで店舗内の物理位置に変換できます。商品を反転した時刻です。

単一フレーム画像ベースの動き検出の精度は低いものの、顧客と商品の関連付け精度の向上に顕著な効果があります。単一フレーム画像の動き検出関連付けを使用せずに得られた人・モノデータと、単一フレーム画像の動き検出関連付けに基づいて得られた人・モノデータを比較分析した結果、単一フレーム画像ベースの動き検出アルゴリズムは最終的なマッチング精度を 40.6% から 85.8% に向上させました。

人・モノ関連付けアルゴリズムは全体の人・モノ関連付けの最終段階であるため、人・モノ関連付けの精度は各上流アルゴリズムモデルの精度に影響されます。時間相関と動作の不審度の 2 つの次元を同時に使用してマッチングを行うことで、歩行者と反転商品の最終マッチング精度は 85.8% に達します。以下を説明します。

人・モノ・場において、商品 SKU を歩行者の動作と秒単位で関連付けることは実用的かつ実現可能である。

教師なし RFID 検出アルゴリズムは、商品反転検出アルゴリズムの大規模デプロイの難しさを低減できる。

単一フレーム画像ベースの歩行者動作検出アルゴリズムは有効であり、バックエンドサーバー環境で直接大規模にデプロイできる。

同時に、アルゴリズムはまだ初期段階にあり、以下の方向でさらに拡張する必要があります。

1. 単一フレーム画像ベースの歩行者動作検出アルゴリズムには、まだ最適化の大きな余地があります。正例のデータセットを数千から数万に増やすことで、顕著な性能向上が期待でき、サーバーがより多くの計算負荷に耐えられる場合、分類モデルは VGG、ResNet、Inception などのより優れたモデルを試すことができます。

2. 現在の単一フレーム画像の動き検出アルゴリズムは歩行者の位置までしか正確ではありません。動作位置検出モデルを試して、動作の正確な位置を特定することができます。

3. 現在、RFID リーダーは付近 1〜3 メートル以内の数十から数百の商品の信号しか検出できません。同時に、RFID リーダーの収集周波数とアンテナポーリングメカニズムは、RFID 検出の容量と範囲を大幅に制限しています。ハードウェア層から RFID 検出アルゴリズムを最適化することで、コストを大幅に削減し、検出能力、範囲、精度を向上させることができます。

4. 教師なし RFID 商品反転検出アルゴリズムはしきい値のデバッグに依存しており、異なる店舗に汎化できる教師なし検出アルゴリズムを見つけるため、まだ最適化の大きな余地があります。

5. 人・モノの関連付けは現在、時間と動作の不審度に基づいています。さらに、大まかな商品位置と歩行者位置に基づいて関連付けることで、関連付け精度の向上に大きな効果が期待できます。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.