Vision is a bridge connecting the real world

本日は、ビジョンおよび関連技術が AutoNavi でどのように実装され、現実世界とのつながりをどう支えているかについて、主に紹介します。「現実世界とつながる」というのは、単なる個人の考えではなく、AutoNavi のミッションそのものです。私たちのミッションは「現実世界とつながり、より良い移動を実現する」ことです。

まず、AutoNavi Maps について簡単に紹介します。1 日あたり 1 億人以上のデイリーアクティブユーザーと、4 億人以上の月間アクティブユーザーを抱えています。AutoNavi Maps はナビゲーションだけでなく、移動に関連するさまざまなサービスを提供しており、情報サービス、運転ナビゲーション、シェアードモビリティ、スマート公共交通、スマート観光地、サイクリング、ウォーキング、長距離旅行などのアプリケーションシナリオをカバーしています。

AutoNavi Maps が行っているのは、人と現実世界の関係を築くことです。人は現実世界とのつながりを築く必要があり、地図はその基盤となるものであり、地図上にはさらに多くの情報が存在します。

ビジョンは現実世界への架け橋

ビジョンは現実世界への架け橋です。なぜでしょうか。人間の情報取得の観点から見ると、80% のコンテンツは視覚を通じて取得されます。人間の情報処理の観点から見ると、脳の 30% から 60% は視覚知覚に使われています。機械の観点から見ると、ビジョンは汎用的な知覚の非常に重要な手段です。

人間が現実世界を知覚する方法は他にもたくさんあります。たとえばセンサーやその他の手段があります。しかし、汎用的な手法として、私は常にビジョンが最優先の選択肢だと考えています。リアルタイムで処理できるからです。

もう一つの理由は、現実世界の 80% 以上(さまざまな要素)が視覚向けに設計されていることです。時として、私たちは現実世界にあまりにも慣れすぎて、あまり気に留めないことがあります。しかし、周囲の標識や情報を見渡してみてください。知っているものも含めて、視覚を前提に設計され、取得されているものです。

人間が情報を取得する主な手段は視覚であるため、現実世界の設計も視覚を基準にしています。想像してみてください。もし情報を取得する主な手段が嗅覚だったら、世界は全く異なるものになっていたでしょう。これらを踏まえて、私たちが行っていることに目を向けると、地図情報の取得と構築の大部分も視覚に由来することは驚くべきことではありません。

視覚技術 @ AutoNavi:地図制作
AutoNavi における視覚技術の応用は多岐にわたります。以下の図に示します。

左側は地図制作で、従来の地図と高精度地図を含みます。高精度地図は将来の自動運転に対応するものです。右側はナビゲーション体験に関連する部分で、位置決定に関連する作業も行われており、視覚技術を使ってナビゲーションをより便利にしています。時間の関係上、本日は通常の地図とナビゲーションに関連する部分のみ紹介します。
地図サービスはどこから生まれるのでしょうか。まず行うべきはデータ収集です。現在、情報の大部分はカメラと視覚を通じて収集されています。現実世界は広大で、全国に数百万キロメートルの道路があります。その他の情報も含め、人手だけでは現在処理しきれません。大幅にアルゴリズムによる自動認識に依存してデータを識別する必要があります。もちろん、アルゴリズムだけでは 100% を達成できない場合があり、手動補正によって地図データベースを構築し、地図データサービスを支えています。

地図制作のタスクは、従来の地図タスクでは通常二つのカテゴリに分けられます。一つは道路関連、もう一つは POI 看板認識です。どちらのタイプのタスクにも多くの視覚技術が必要です。たとえば、道路標識の認識では、アルゴリズムが道路上のすべての標識を一つずつ見つけ出し、同時に標識の種類と内容を識別する必要があります。

道路標識には 100 種類以上あります。これらの標識だけを処理するなら、それほど複雑ではありません。現実には、低コストでデータを収集する必要がある場合があり、その際に画像品質をどう確保するかが考慮すべき課題となります。
情報収集時には、画像に歪み、反射、遮蔽などが生じることがあります。解像度の圧縮の問題は言うまでもなく、撮影自体がレンズの品質やコスト、天候、照明などの要因に依存し、収集された画像には多くの不良画像が含まれることがあります。この場合、理想的なアルゴリズムの問題を解決するだけでなく、多くの実際の状況にも対応する必要があります。

いくつかの例を紹介します。下の左側の画像は実際に収集された画像で、さまざまな問題が発生します。カメラに詳しい方ならご存知の通り、カメラには内部パラメータと外部パラメータがあります。内部パラメータは焦点距離、中心、歪みです。外部パラメータは位置と角度で、これらが撮影結果に影響を与えます。

認識処理においては、これらのカメラパラメータは大きな問題を引き起こしませんが、幾何学や位置に関連する計算を行う必要がある場合、カメラの歪みや不正確な内部・外部パラメータが大きな問題となります。マルチソースデータを組み合わせてマッチングすることで、この問題を基本的に解決できます。右側は実際の例で、カメラの歪み補正により斜めの角度が補正され、後続のアルゴリズム処理が大幅に改善されています。

もう一つの例は画像品質です。画質の低い画像でも、捨てるわけにはいかず、依然として有用な情報が含まれています。元の画像を拡大すると非常にぼやけている場合、画像強調の手法を使用することで、この画像をより鮮明にできます。生データの品質を向上させるために利用できる方法は多くあります。たとえば、認識アルゴリズムの精度を向上させ、作業効率を改善し、ぼやけ検出にも活用できます。強調前後の比較により、どれがぼやけていてどれがそうでないかを確認できます。

今お話ししたのは道路標識の例に過ぎません。もう一つ興味深い問題は電子アイの検出です。電子アイは非常に小さく、小物体検出は挑戦的な問題であり、研究分野でも注目が高まっています。実感してみてください。写真を撮ってみると、小さすぎると拡大してもはっきり見えず、遠景の方がまだましです。では、どうすればこのような小さな電子アイをより正確に見つけられるのでしょうか。

通常の手法は、対象エリアを拡大することです。この物体は小さすぎてターゲットを見つけるのが難しいため、エリアを見つけて拡大し、周囲の情報を取り入れます。この情報が小さなターゲットをより良く見つけるのに役立ち、少し拡大して他の関連情報を見ることで、電子アイのスマート検出を支援します。
しかし、大きすぎると問題が生じます。大きくしすぎると、無関係な情報が大量に取り込まれます。技術的にはいくつかの解決策があります。現在最も広く使われている視覚技術にはアテンションメカニズムがあり、大きなフレームを設定すると、機械がどれが重要でどれが重要でないかを学習し、ターゲット自体に集中できるようになります。もちろん、分布、高さ、サイズといった事前情報も活用します。

光検出だけでは不十分です。現実世界は変化し続けています。何が変化し何が変化していないかを区別する必要がある場合が多くあります。以前に電子アイが検出され、新しいデータでも電子アイが検出された場合、両者が同じかどうかを知る必要があります。

どう判断するのでしょうか。画像の表現が異なるため、注意深く見れば、確かに背景の建物や設置タイプが似ていることが確認できます。アルゴリズムによる判定が必要で、これにはターゲット検出、車線帰属、設置タイプ分析、シーンマッチングが関わります。これらを通じて、どのようなシーンであるかを高い精度で判断し、2 枚の画像の要素が同じかどうかを判定できます。

先ほどは道路についてお話ししました。ここでは POI に関連する例をいくつか紹介します。POI の看板は、アーチ型、リスト型、ファサード型など、さまざまなタイプに分けられます。POI だけでなく、非 POI も多種多様です。テキスト検出だけを行うと、現実世界の多くのものが POI ではなく、単なる看板、スローガン、広告、対聯、交通標識などであることがわかります。したがって、POI と非 POI を区別する必要があります。

他にも多くの複雑なシーンがあり、ここでは一つずつ列挙しません。普段は思いもよらないものもあります。たとえば三次元看板です。平面の看板ではなく、街角の果物スーパーマーケットのように、街角に沿って曲がっている場合があります。このタイプの看板は 1 枚の画像では完全に検出するのが難しく、検出できたとしても、うっかりすると 2 つの看板に分割されてしまいます。現実世界の複雑さは依然として多くの問題を引き起こします。

これほどの複雑さに直面して、具体的なシーンの状況を分析する必要があります。多くの場合、最終的な結果は単一のアルゴリズムですべての問題を解決できるものではなく、さまざまなアルゴリズムの融合が必要です。たとえば、テキストであれば検出が必要で、テキスト自体にも検出と認識が必要です。位置に関しては、三次元的な推論を行う必要があります。多くの場合、データを取得した後でも、ぼやけや遮蔽が残っている部分があり、判断を下さなければなりません。

個々の判断は単一の手法では解決できません。1 つのモデルだけでは最適な結果を得ることはできません。必要なのは、2 つ以上のモデルが異なる角度から問題に取り組み、より良い結果を達成することで、これはデータの蓄積に基づいています。

先に挙げた問題には一定の複雑さがあります。すべての問題と同様に、難しいものほど困難です。私たちは引き続き取り組んでいます。これらのアルゴリズムは、地図制作の効率とユーザーに届く地図の品質を大きく左右します。これらは非常に重要なコア課題です。

POI は、前述の POI かどうかの判断やテキスト認識だけでなく、多くの場合に看板の内容を理解する必要があります。看板には、本店名がある場合、支店名がある場合、ない場合もあり、連絡先があるかどうか、営業範囲があるかどうか、これらすべてをアルゴリズムが処理する必要があります。

視覚技術 @ AutoNavi:ナビゲーション
以上の紹介は、地図制作には多くの複雑さがあり、視覚アルゴリズムやその他のアルゴリズムで処理する必要があるということでした。次にナビゲーションについて共有します。

まず私自身の経験をお話しします。先日スペインで休暇を過ごしましたが、ヨーロッパにはロータリーが非常に多く、Google マップのナビゲーションは曲がり角を曲がった後に 3 番目の出口を出るように指示することがよくありました。それが出口ではないこともあり、何度も道を間違えました。私は中国で運転したことがなく、国内の交通はより複雑です。たとえば北京の西直門では、そのまま右折できる場合もあれば、大きく旋回する必要がある場合もあります。

私たちは、ナビゲーションの方式に大きな変革をもたらし、WYSIWYG のシーンにしたいと考えています。どちらの方向に進むべきかを直接指示できるアルゴリズムがあれば、ユーザーにとってより有用で、運転がより簡単になり、ナビゲーションがより直感的になります。

現在の多くの車にはカメラが搭載されており、前端でも後端でも、多くの場合に動画データを取得できます。AI アルゴリズムで計算された効果を動画に重ね合わせ、どちらに進むべきかを指示します。

AutoNavi は今年 4 月に AR ナビゲーションプロダクトをリリースしました。その一つが拡張現実です。この車線を直進するか曲がるかを指示し、車線に沿った案内と矢印で前方の右折を知らせます。
このプロダクトには、案内以外にも他の機能があります。たとえば、前方車両の衝突警報機能も追加されており、前方車両との距離や速度を推定し、安全運転を支援します。その他の情報もより直感的な方法で表示できます。たとえば、速度制限、電子アイ、横断歩道に関連する情報などです。前方に歩者がいる場合は、警告も発します。

上記の機能は簡単そうに見えますが、実装は非常に困難です。なぜでしょうか。これは誰もがすぐに使える機能にしたいので、非常に低コストで実現する必要があるからです。これは自動運転システムとは異なります。センサーの観点からは、単一のセンサー、しかも低コストなカメラのみで対応する必要があります。コンピューティングの観点からは、自動運転システムは数百ワットの専用チップを使用する場合がありますが、私たちが必要とする計算能力は、通常のスマートフォンの約 5 分の 1 に過ぎません。

AR ナビゲーションの実際のアルゴリズム出力をお見せします。この例には、車両検出、車線セグメンテーション、ガイドライン計算が含まれています。先ほどお話ししたように、高性能(低計算能力)が大きな課題であるため、アルゴリズム開発時には計算効率を十分に考慮する必要があります。モデル圧縮、小規模モデルのトレーニング最適化、検出と追跡の組み合わせなど、さまざまな手段があります。マルチターゲットの共同モデル、従来の GPS ナビゲーションとの融合など、1 つのモデルで複数のことを行う必要があります。

現実世界は非常に複雑です。高品質で効率的な地図制作を実現するにしても、正確な位置決定とナビゲーションを実現するにしても、ビジョンの面で行うべきことはまだたくさんあります。以上の紹介を通じて、AutoNavi Maps における視覚技術の応用と移動分野での活用について、そして AutoNavi のミッションについて、より深く理解していただけたらと思います。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.