How do you view important issues in the direction of artificial intelligence?
人工知能アルゴリズム
現在、AI(人工知能)はテクノロジー産業の主要なトレンドとなっており、あらゆる業界が「AI」と密接に関わっています。AI に関連する分野は下図に示す通りで、AI と強く関連する分野と、AI によって間接的に支援される分野があります。人工知能とは何か、その応用、および人工知能システムについて、以下で順を追って説明します。
人工知能の 80 年にわたる発展の中で、チューリングテストから誰もが顔を変えられる技術まで実現してきました。マシンは人工知能を活用して、人間のように質問に答えたり、創造したり、計算や分析を行ったりします。一部の分野では、コンピュータは人間と同等の性能を発揮できるようになっています。たとえば、2019 年にインターネットで流行した「誰もが顔を変えられる」技術は、人工知能におけるディープラーニングやニューラルネットワークなどの技術が幅広く応用された成果です。
現在、人々の生活や産業の現場では、人間の作業を代替するために「AI」技術が数多く応用されています。たとえば、「ELON MUSK'S」は人間の脳の働きをシミュレートできます。しかし、人工知能の急速な発展に伴い、AI に対する反省や「偽 AI」といった問題も生じています。
人工知能 AI は発展の過程でいくつかの問題に直面しており、その中には偽装・粗悪な AI による 2 億の資金詐騙という深刻なインシデントもあります。人工知能とは何か、その主な用途は何かという点が、次に議論する課題です。
学術界においても、人工知能の定義はさまざまです。人工知能とは、入力情報を受け取り、その情報を整理・判断し、人間のように一連の合理的な行動と意思決定を行うものです。その主な特徴は「合理的な行動」です。
「知覚」から「意思決定」までのフィードバックにおいて、外部世界の情報をどのように知覚するかが、人工知能が行動できるかどうかの鍵となります。人間の脳をシミュレートする以上、人間の知覚プロセスは理解と学習のプロセスそのものです。これが人工知能における「ディープラーニング」で解決すべき課題です。
ディープラーニング
外部情報(動画、テキスト、パスワードなど)をマシン言語に変換して初めて、人工知能が受け入れて応答できます。この課題に対する取り組みは、人工知能の初期から科学者たちによって研究されてきました。
その後、視覚知覚を通じて情報の入力をどのように実現するかについての議論が始まり、数多くの研究が行われました。2012 年、カナダのトロント大学の ImageNet コンペティションで優勝した Hinton と、その弟子の Alex Krizhevsky が AlexNet を設計しました。それ以降、VGG や GoogLeNet など、より深く高度なニューラルネットワークが次々と提案されました。これらは従来の機械学習分類アルゴリズムと比較して既に非常に優れた性能を示しています。
AlexNet から始まったディープラーニングの歩み
わかりやすく言えば、大量の対象の中から指示された対象を正確に識別することです。このモデルの応用により、画像認識分野は急速に発展し、広く利用されるようになりました。
ニューラルネットワークの階層的学習モデルは、人間の脳と同じ仕組みです。学習を続けるにつれて、ニューラルネットワークはますます複雑になります。数百万の画像データの中から「猫」というラベル付き情報を見つけたいと仮定し、編集した視覚ネットワークモデルを非常に大規模なデータセットでトレーニングします。モデルの反復を通じて、さらに複雑なトレーニングを実現します。
現在、広く使用されている「ResNet モデル」は 100 層以上の深さを持ち、最新の科学研究成果も取り入れられています。たとえば、下図のアーチ橋部分のスキップ接続により、このような深いネットワークを効率的かつ迅速にトレーニングできます。最終的に視覚分野における「知覚」の課題を解決します。
Alibaba Cloud:スマート航空ランプ管理
人工知能を活用して航空機の機種、搭乗ゲート、空港車両を識別し、実際の地図と組み合わせて、飛行中の航空機の軌跡を把握します。これらすべてを入力情報として人工知能で管理し、空港運営をより迅速かつ効率的にします。
前述の通り、ディープラーニングは知覚の重要な形態と方法です。ディープラーニングアルゴリズムの主な構成要素は以下の通りです。
データラベリング
アルゴリズムモデル開発
高性能分散トレーニング
モデルチューニング
モデルデプロイ
「知覚」の後、人工知能が行うべきもう一つのことを「意思決定」と呼びます。ディープラーニングはブラックボックス型の処理であり、外部情報をよく学習・知覚できますが、知覚した問題の理由をフィードバックしたり説明したりすることはできません。そのためには「意思決定」による分析とフィードバックが必要です。
従来の機械学習の代表的なモデルは決定木アルゴリズムとロジスティック回帰です。たとえば、銀行の融資承認プロセスは、さまざまな要素を検討した上での意思決定プロセスです。決定木の形式では、「Yes」または「No」の判断を重ねて、最終的に融資を実行するかどうかを決定します。ロジスティック回帰とは、2 種類のデータ間の関係を指し、数学的手法で正確に解くことができます。
実際、ディープラーニングと機械学習は互補的な関係にあります。ディープラーニングは知覚の課題(コンピュータビジョン、音声など)を非常によく解決し、ニューラルネットワークアーキテクチャを活用して多くの「知覚」の課題を解決できますが、知覚した内容を説明する必要があります。従来の機械学習には人間のような知覚機能はありませんが、モデルが比較的小規模で、直接説明できます(金融、リスク管理など)。
人工知能は広告分野でも早くから応用されています。宋代には既に、商売を呼び込むための広告が存在していました。
現在、代表的な広告シーンは淘宝広告です。メーカーはまず消費者の閲覧情報を通じてユーザーの好みを把握し、次にインテリジェントレコメンデーションシステムを活用して消費者が検索する関連プロダクトをプッシュします。こうしたインテリジェントアルゴリズムの幅広い応用により、ユーザーの情報閲覧はより効率的かつ精緻になっています。
知覚と意思決定はいずれもアルゴリズムに関連しています。
知覚。ディープラーニングアルゴリズムに関連し、データラベリング、アルゴリズムモデル開発、高性能分散トレーニング、パフォーマンスチューニング、モデルデプロイなどが含まれます。
意思決定。従来の機械学習アルゴリズムとディープラーニングアルゴリズムの両方に関連し、業界の動作データ収集、構造化/非構造化データ処理、データとアルゴリズムの組み合わせモデリング、アルゴリズム開発トレーニングとチューニング、モデルデプロイとリアルタイムトレーニングフィードバックなどが含まれます。
人工知能システム
アルゴリズムが急速に発展する今日、対応するインフラ基盤のサポートも非常に重要であり、人工知能システムの支えが必要です。アルゴリズムとコンピューティング能力は、人工知能や機械学習システムを構築するために不可欠な 2 つの要素です。アルゴリズム革新の背景には、コンピューティング能力のブレークスルーがあります。
2019 年時点で、人工知能のコンピューティング能力需要は下図の通りです。AlphaGo Zero と比較して、AlexNet のコンピューティング能力需要は 30 万倍に増加しています。このような状況下で、アルゴリズム反復とアルゴリズム実装の課題を解決するには、システムに対するより高い要件が求められます。
2013 年時点の AlexNet のシステムは下図に示す通りです。シンプルなマシンに GPU を搭載した構成で、当時のトレーニングコストは約 500 ワットの消費電力で 7 日間、つまりビジネスモデルの反復サイクルは約 1 週間でした。
現在、広告レコメンデーションなどビジネスニーズの急速な発展に伴い、1 週間のモデル反復サイクルではニーズを満たせなくなっています。そのため、大規模クラスターやチップを通じて人工知能システムに優れたコンピューティング能力を提供する方法に、ますます注目が集まっています。MIT が 2014 年に行った比較によると、人間が 1 分間に処理できる画像は約 77 枚で、単一 GPU は同じ時間で 230 枚を処理できます。単一 GPU の処理速度は人間と大きな差はありませんが、GPU クラスターを通じで大規模かつ高速な計算を実現できます。たとえば、下図の 512 台の GPU からなるクラスターは、1 分間に 6 万枚の画像を処理できます。
人工知能システムの設計プロセスでは、高性能ストレージの実装方法、マシン間の高速通信の実現方法、分散クラスターの安定性維持方法に注意する必要があります。今日、Alibaba Cloud には Eflops プラットフォームがあり、3 分間で 10 の 18 乗回の計算を実行でき、1 分間あたり 128 キロワットを消費します。これは 2015 年以前には想像もできなかった能力です。この能力の実現は、主に大規模クラスターとシステムの基盤チップのスケーラビリティによるものです。
現在、国内の多くの企業がより高性能なチップの研究開発に取り組んでおり、Alibaba も例外ではありません。2019 年、Alibaba は世界最高性能の AI 推論チップ Hanguang 800 をリリースし、都市脳と航空脳の実テストシナリオで検証しました。ピーク性能は毎秒約 80 万枚に達し、前世代のチップと比較して約 40 倍の性能向上を達成しました。
システムの複雑化に伴い、ソフトウェアの複雑さ、ハードウェアの複雑さ、リソース管理の複雑さ、スケジューリング効率の複雑さ、システム全体の最適化の複雑さなど、一連の課題が生じます。これはシステム開発プロセスで比較的よく見られるチャレンジです。
強調すべき点は、AI クラスターは汎用クラスターとは異なるということです。AI ではトレーニング中にサブタスクの定期的な同期が必要であり、異なるマシン間の高性能通信は多くの場合、専用の GPU や NPU コンポーネントに基づいています。異なるコンピューティングモデルと異なるインタラクションモードが、AI トレーニングに比較的大きなチャレンジをもたらします。
AI は Alibaba のさまざまなビジネスシナリオで活用できるため、プラットフォーム設計は AI の実践を通じて磨き上げられます。たとえば、淘宝拍立淘の百万カテゴリモデル、淘宝の音声+NLP、阿里媽媽の広告レコメンデーションなどです。
磨き上げられた飛天 AI プラットフォームは 3 つの層に分かれています。最下層の基盤ハードウェアから、中間層のトレーニングと推論フレームワーク、そして最上層の開発プラットフォームです。AI プラットフォームには 3 つの重要なプラットフォームがあります。
軽量 AI 開発プラットフォーム:アルゴリズムとデータサイエンティストがワンクリックで開発、デバッグ、デプロイを実現する支援
AI・ビッグデータ協調開発プラットフォーム:データ指向ビジネス向けのシステムをより迅速に開発する支援
AI 推論サービスプラットフォーム:推論、モデルトレーニング、デプロイ、効果モニタリングに必要なコンピューティングリソースの課題を解決
上記 3 つのプラットフォームが、アルゴリズム API、垂直ドメインプラットフォーム、ブレインソリューションの出力をサポートします。
ディープラーニング分野において、Stanford University が DAWNBench というテストベンチマークを立ち上げました。従来の最高結果と比較して、Alibaba Cloud 機械学習は約 10% の性能最適化を達成しました。
今日、AI 技術能力は資産利用率の向上と異なるシナリオのニーズ解決において重要な意義を持っています。総合的な AI 技術能力は主に以下の側面に関わります。
基盤ハードウェア:汎用コンピューティング能力と AI に必要なコンピューティング能力を提供し、IaaS を通じてクラウド機能を提供
AI クラウドサービス:最も基本的な PaaS レイヤーとして、起動しやすいソフトウェアとハードウェア環境を通じて、ほとんどのユーザーに AI に適したコンピューティング能力を提供
高性能コンピューティング:コア AI コンピューティングエンジンの高速化を提供
AI システムフレームワーク:AI コンピューティングモデルの完全な抽象化と、クロスアーキテクチャのモデリング反復およびデプロイを提供
AI ホスティングプラットフォーム:アルゴリズム開発、共有デプロイと出力の効率を向上させ、ユーザースティッキネスを備えた開発プラットフォーム
インテリジェントコンピューティングとデータコンピューティング
AI はインテリジェントコンピューティング、ビッグデータ分野はデータコンピューティングであり、両者は互補的で不可欠です。
データが AI を支える
前述のアルゴリズムとコンピューティング能力には大量のデータの支えが必要であり、データはアルゴリズムとコンピューティング能力の価値を体現する重要な要素です。
下図は、それぞれ 2005 年と 2013 年のローマ教皇即位の風景です。モバイルインターネットの発展によりデータは指数関数的に増加しており、ディープラーニングの性能向上にも寄与しています。
1998 年の小規模システム MNIST のトレーニングデータはわずか 10 MB でしたが、2009 年の ImageNet は 200 GB、2017 年の WebVision は 3 TB、代表的なプロダクトビジョンシステムは 1 PB に達しています。大量のデータは Alibaba の性能をほぼ線形的に向上させています。
データ量が性能向上に与える効果を示す身近な例を挙げます。X 線医療識別分野の研究によると、医師が X 線画像で疾患を識別する精度は、これまで読影した X 線画像の数に比例することが示されています。多く読めば読むほど、正しく診断できる確率が上がります。同様に、現在の医療エンジンシステムは大規模コンピューターシステムを通じてより多くのデータをトレーニングし、より正確な医療識別を実現できます。
AI がビッグデータをインテリジェント化へ導く
下図は Forbes によるビッグデータ分野のトレンドまとめです。現在、ビッグデータ分野ではより多くの情報の抽出、リアルタイム計算の実現、AI プラットフォームとオンライン予測の実装などが求められており、いずれもビッグデータがインテリジェント化へ向かうトレンドを反映しています。
複数のデータソースからの構造化、半構造化、非構造化といった異なるタイプのデータが、データウェアハウスに蓄積された後にその価値をどう発揮するかという問いへの答えがインテリジェントコンピューティングです。広告レコメンデーションのシナリオを例に取ると、データソースは淘宝でのユーザーのクリック、閲覧、購入行動データであり、データ統合を通じてオフラインまたはリアルタイム同期、オフラインまたはリアルタイム ETL でデータウェアハウスに取り込まれ、データウェアハウスまたはデータレイクソリューションを通じてさまざまなデータモデルを生成してデータをトレーニングし、最終的にデータサービスを通じてトレーニング結果を出力します。このプロセスにおけるデータの理解と活用の方法がインテリジェント化されていることがわかります。
数年前の HTAP は OLTP と OLAP の 2 つの部分で構成されていました。OLAP はさらにビッグデータ分析、オフライン分析、リアルタイム分析に分解でき、データ量に応じて異なるエンジンを選択できます。現在、データサービスはますます重要になっており、一部のインテリジェントカスタマーサービスシナリオでは、データ抽出モデルに基づくリアルタイム人工知能推論サービスとアプリケーションが必要です。そのため、分析とサービスをどのように組み合わせるかも重要な課題です。これが現在検討されている HSAP です。人工知能を活用してデータウェアハウスからオフラインおよびリアルタイムでデータ価値を抽出し、データサービスを通じてユーザーにプッシュします。
Alibaba は自社アプリケーションで AI 強化ビッグデータの方法論とソリューションを蓄積してきました。たとえば、ダブル 11 プロモーション期間中のオフラインコンピューティング(バッチ処理)、リアルタイムコンピューティング(ストリームコンピューティング)、インタラクティブ分析、グラフコンピューティングなどです。飛天 AI プラットフォームと組み合わせ、AI が駆動する次世代飛天ビッグデータプロダクトをユーザーに提供しています。
ビッグデータも AI と同様にパフォーマンスを非常に重視します。2019 年、Alibaba Cloud のビッグデータプラットフォーム MaxCompute と E-MapReduce (EMR) は、TPC ベンチマークでコンピューティングパフォーマンスとコスト効率において明確な優位性を示しました。具体的なテスト結果は下図の通りです。
Alibaba は現在、インテリジェント音声カスタマーサービスインタラクションをユーザーに提供しており、ディープラーニングとインテリジェント知覚 AI 技術を適用しています。物流やユーザーデータなど、バックエンドのビッグデータ業務システムと緊密に連携することで、最終的なインテリジェント効果を実現しています。
では、企業はどのように AI を導入すべきでしょうか。端的に言えば、エジソンが電球を発明したように、人工知能を実装するにはアプリケーションのニーズから始め、段階的に技術革新を追求すべきです。クラウドを通じて低コスト、高性能、高安定性のインフラを提供しますが、重要なのはまずニーズを明確にすることです。
ここ数年、AI はアルゴリズム革新とデモ制作に取り組んできましたが、それだけでは到底十分ではありません。
AI アルゴリズムはシステムの一部に過ぎません。データの収集方法、有用な特徴の抽出方法、検証方法、プロセス管理、リソース管理などは、すべて企業が AI を導入する際に検討すべき課題です。
AI は万能ではありませんが、AI を無視することは絶対にできません。企業が AI を導入する際、最も重要なのはビジネスから始めることです。データ量の増加とアルゴリズムの充実が進む中、ビジネスを理解するデータエンジニアとアルゴリズムエンジニアのチームを構築することが、現在のインテリジェント企業の成功の鍵です。前述のアルゴリズム、コンピューティング能力、データはすべて、現在クラウド上で提供されているサービスとソリューションを活用して実現でき、企業の AI 実装をより迅速に推進できます。
現在、AI(人工知能)はテクノロジー産業の主要なトレンドとなっており、あらゆる業界が「AI」と密接に関わっています。AI に関連する分野は下図に示す通りで、AI と強く関連する分野と、AI によって間接的に支援される分野があります。人工知能とは何か、その応用、および人工知能システムについて、以下で順を追って説明します。
人工知能の 80 年にわたる発展の中で、チューリングテストから誰もが顔を変えられる技術まで実現してきました。マシンは人工知能を活用して、人間のように質問に答えたり、創造したり、計算や分析を行ったりします。一部の分野では、コンピュータは人間と同等の性能を発揮できるようになっています。たとえば、2019 年にインターネットで流行した「誰もが顔を変えられる」技術は、人工知能におけるディープラーニングやニューラルネットワークなどの技術が幅広く応用された成果です。
現在、人々の生活や産業の現場では、人間の作業を代替するために「AI」技術が数多く応用されています。たとえば、「ELON MUSK'S」は人間の脳の働きをシミュレートできます。しかし、人工知能の急速な発展に伴い、AI に対する反省や「偽 AI」といった問題も生じています。
人工知能 AI は発展の過程でいくつかの問題に直面しており、その中には偽装・粗悪な AI による 2 億の資金詐騙という深刻なインシデントもあります。人工知能とは何か、その主な用途は何かという点が、次に議論する課題です。
学術界においても、人工知能の定義はさまざまです。人工知能とは、入力情報を受け取り、その情報を整理・判断し、人間のように一連の合理的な行動と意思決定を行うものです。その主な特徴は「合理的な行動」です。
「知覚」から「意思決定」までのフィードバックにおいて、外部世界の情報をどのように知覚するかが、人工知能が行動できるかどうかの鍵となります。人間の脳をシミュレートする以上、人間の知覚プロセスは理解と学習のプロセスそのものです。これが人工知能における「ディープラーニング」で解決すべき課題です。
ディープラーニング
外部情報(動画、テキスト、パスワードなど)をマシン言語に変換して初めて、人工知能が受け入れて応答できます。この課題に対する取り組みは、人工知能の初期から科学者たちによって研究されてきました。
その後、視覚知覚を通じて情報の入力をどのように実現するかについての議論が始まり、数多くの研究が行われました。2012 年、カナダのトロント大学の ImageNet コンペティションで優勝した Hinton と、その弟子の Alex Krizhevsky が AlexNet を設計しました。それ以降、VGG や GoogLeNet など、より深く高度なニューラルネットワークが次々と提案されました。これらは従来の機械学習分類アルゴリズムと比較して既に非常に優れた性能を示しています。
AlexNet から始まったディープラーニングの歩み
わかりやすく言えば、大量の対象の中から指示された対象を正確に識別することです。このモデルの応用により、画像認識分野は急速に発展し、広く利用されるようになりました。
ニューラルネットワークの階層的学習モデルは、人間の脳と同じ仕組みです。学習を続けるにつれて、ニューラルネットワークはますます複雑になります。数百万の画像データの中から「猫」というラベル付き情報を見つけたいと仮定し、編集した視覚ネットワークモデルを非常に大規模なデータセットでトレーニングします。モデルの反復を通じて、さらに複雑なトレーニングを実現します。
現在、広く使用されている「ResNet モデル」は 100 層以上の深さを持ち、最新の科学研究成果も取り入れられています。たとえば、下図のアーチ橋部分のスキップ接続により、このような深いネットワークを効率的かつ迅速にトレーニングできます。最終的に視覚分野における「知覚」の課題を解決します。
Alibaba Cloud:スマート航空ランプ管理
人工知能を活用して航空機の機種、搭乗ゲート、空港車両を識別し、実際の地図と組み合わせて、飛行中の航空機の軌跡を把握します。これらすべてを入力情報として人工知能で管理し、空港運営をより迅速かつ効率的にします。
前述の通り、ディープラーニングは知覚の重要な形態と方法です。ディープラーニングアルゴリズムの主な構成要素は以下の通りです。
データラベリング
アルゴリズムモデル開発
高性能分散トレーニング
モデルチューニング
モデルデプロイ
「知覚」の後、人工知能が行うべきもう一つのことを「意思決定」と呼びます。ディープラーニングはブラックボックス型の処理であり、外部情報をよく学習・知覚できますが、知覚した問題の理由をフィードバックしたり説明したりすることはできません。そのためには「意思決定」による分析とフィードバックが必要です。
従来の機械学習の代表的なモデルは決定木アルゴリズムとロジスティック回帰です。たとえば、銀行の融資承認プロセスは、さまざまな要素を検討した上での意思決定プロセスです。決定木の形式では、「Yes」または「No」の判断を重ねて、最終的に融資を実行するかどうかを決定します。ロジスティック回帰とは、2 種類のデータ間の関係を指し、数学的手法で正確に解くことができます。
実際、ディープラーニングと機械学習は互補的な関係にあります。ディープラーニングは知覚の課題(コンピュータビジョン、音声など)を非常によく解決し、ニューラルネットワークアーキテクチャを活用して多くの「知覚」の課題を解決できますが、知覚した内容を説明する必要があります。従来の機械学習には人間のような知覚機能はありませんが、モデルが比較的小規模で、直接説明できます(金融、リスク管理など)。
人工知能は広告分野でも早くから応用されています。宋代には既に、商売を呼び込むための広告が存在していました。
現在、代表的な広告シーンは淘宝広告です。メーカーはまず消費者の閲覧情報を通じてユーザーの好みを把握し、次にインテリジェントレコメンデーションシステムを活用して消費者が検索する関連プロダクトをプッシュします。こうしたインテリジェントアルゴリズムの幅広い応用により、ユーザーの情報閲覧はより効率的かつ精緻になっています。
知覚と意思決定はいずれもアルゴリズムに関連しています。
知覚。ディープラーニングアルゴリズムに関連し、データラベリング、アルゴリズムモデル開発、高性能分散トレーニング、パフォーマンスチューニング、モデルデプロイなどが含まれます。
意思決定。従来の機械学習アルゴリズムとディープラーニングアルゴリズムの両方に関連し、業界の動作データ収集、構造化/非構造化データ処理、データとアルゴリズムの組み合わせモデリング、アルゴリズム開発トレーニングとチューニング、モデルデプロイとリアルタイムトレーニングフィードバックなどが含まれます。
人工知能システム
アルゴリズムが急速に発展する今日、対応するインフラ基盤のサポートも非常に重要であり、人工知能システムの支えが必要です。アルゴリズムとコンピューティング能力は、人工知能や機械学習システムを構築するために不可欠な 2 つの要素です。アルゴリズム革新の背景には、コンピューティング能力のブレークスルーがあります。
2019 年時点で、人工知能のコンピューティング能力需要は下図の通りです。AlphaGo Zero と比較して、AlexNet のコンピューティング能力需要は 30 万倍に増加しています。このような状況下で、アルゴリズム反復とアルゴリズム実装の課題を解決するには、システムに対するより高い要件が求められます。
2013 年時点の AlexNet のシステムは下図に示す通りです。シンプルなマシンに GPU を搭載した構成で、当時のトレーニングコストは約 500 ワットの消費電力で 7 日間、つまりビジネスモデルの反復サイクルは約 1 週間でした。
現在、広告レコメンデーションなどビジネスニーズの急速な発展に伴い、1 週間のモデル反復サイクルではニーズを満たせなくなっています。そのため、大規模クラスターやチップを通じて人工知能システムに優れたコンピューティング能力を提供する方法に、ますます注目が集まっています。MIT が 2014 年に行った比較によると、人間が 1 分間に処理できる画像は約 77 枚で、単一 GPU は同じ時間で 230 枚を処理できます。単一 GPU の処理速度は人間と大きな差はありませんが、GPU クラスターを通じで大規模かつ高速な計算を実現できます。たとえば、下図の 512 台の GPU からなるクラスターは、1 分間に 6 万枚の画像を処理できます。
人工知能システムの設計プロセスでは、高性能ストレージの実装方法、マシン間の高速通信の実現方法、分散クラスターの安定性維持方法に注意する必要があります。今日、Alibaba Cloud には Eflops プラットフォームがあり、3 分間で 10 の 18 乗回の計算を実行でき、1 分間あたり 128 キロワットを消費します。これは 2015 年以前には想像もできなかった能力です。この能力の実現は、主に大規模クラスターとシステムの基盤チップのスケーラビリティによるものです。
現在、国内の多くの企業がより高性能なチップの研究開発に取り組んでおり、Alibaba も例外ではありません。2019 年、Alibaba は世界最高性能の AI 推論チップ Hanguang 800 をリリースし、都市脳と航空脳の実テストシナリオで検証しました。ピーク性能は毎秒約 80 万枚に達し、前世代のチップと比較して約 40 倍の性能向上を達成しました。
システムの複雑化に伴い、ソフトウェアの複雑さ、ハードウェアの複雑さ、リソース管理の複雑さ、スケジューリング効率の複雑さ、システム全体の最適化の複雑さなど、一連の課題が生じます。これはシステム開発プロセスで比較的よく見られるチャレンジです。
強調すべき点は、AI クラスターは汎用クラスターとは異なるということです。AI ではトレーニング中にサブタスクの定期的な同期が必要であり、異なるマシン間の高性能通信は多くの場合、専用の GPU や NPU コンポーネントに基づいています。異なるコンピューティングモデルと異なるインタラクションモードが、AI トレーニングに比較的大きなチャレンジをもたらします。
AI は Alibaba のさまざまなビジネスシナリオで活用できるため、プラットフォーム設計は AI の実践を通じて磨き上げられます。たとえば、淘宝拍立淘の百万カテゴリモデル、淘宝の音声+NLP、阿里媽媽の広告レコメンデーションなどです。
磨き上げられた飛天 AI プラットフォームは 3 つの層に分かれています。最下層の基盤ハードウェアから、中間層のトレーニングと推論フレームワーク、そして最上層の開発プラットフォームです。AI プラットフォームには 3 つの重要なプラットフォームがあります。
軽量 AI 開発プラットフォーム:アルゴリズムとデータサイエンティストがワンクリックで開発、デバッグ、デプロイを実現する支援
AI・ビッグデータ協調開発プラットフォーム:データ指向ビジネス向けのシステムをより迅速に開発する支援
AI 推論サービスプラットフォーム:推論、モデルトレーニング、デプロイ、効果モニタリングに必要なコンピューティングリソースの課題を解決
上記 3 つのプラットフォームが、アルゴリズム API、垂直ドメインプラットフォーム、ブレインソリューションの出力をサポートします。
ディープラーニング分野において、Stanford University が DAWNBench というテストベンチマークを立ち上げました。従来の最高結果と比較して、Alibaba Cloud 機械学習は約 10% の性能最適化を達成しました。
今日、AI 技術能力は資産利用率の向上と異なるシナリオのニーズ解決において重要な意義を持っています。総合的な AI 技術能力は主に以下の側面に関わります。
基盤ハードウェア:汎用コンピューティング能力と AI に必要なコンピューティング能力を提供し、IaaS を通じてクラウド機能を提供
AI クラウドサービス:最も基本的な PaaS レイヤーとして、起動しやすいソフトウェアとハードウェア環境を通じて、ほとんどのユーザーに AI に適したコンピューティング能力を提供
高性能コンピューティング:コア AI コンピューティングエンジンの高速化を提供
AI システムフレームワーク:AI コンピューティングモデルの完全な抽象化と、クロスアーキテクチャのモデリング反復およびデプロイを提供
AI ホスティングプラットフォーム:アルゴリズム開発、共有デプロイと出力の効率を向上させ、ユーザースティッキネスを備えた開発プラットフォーム
インテリジェントコンピューティングとデータコンピューティング
AI はインテリジェントコンピューティング、ビッグデータ分野はデータコンピューティングであり、両者は互補的で不可欠です。
データが AI を支える
前述のアルゴリズムとコンピューティング能力には大量のデータの支えが必要であり、データはアルゴリズムとコンピューティング能力の価値を体現する重要な要素です。
下図は、それぞれ 2005 年と 2013 年のローマ教皇即位の風景です。モバイルインターネットの発展によりデータは指数関数的に増加しており、ディープラーニングの性能向上にも寄与しています。
1998 年の小規模システム MNIST のトレーニングデータはわずか 10 MB でしたが、2009 年の ImageNet は 200 GB、2017 年の WebVision は 3 TB、代表的なプロダクトビジョンシステムは 1 PB に達しています。大量のデータは Alibaba の性能をほぼ線形的に向上させています。
データ量が性能向上に与える効果を示す身近な例を挙げます。X 線医療識別分野の研究によると、医師が X 線画像で疾患を識別する精度は、これまで読影した X 線画像の数に比例することが示されています。多く読めば読むほど、正しく診断できる確率が上がります。同様に、現在の医療エンジンシステムは大規模コンピューターシステムを通じてより多くのデータをトレーニングし、より正確な医療識別を実現できます。
AI がビッグデータをインテリジェント化へ導く
下図は Forbes によるビッグデータ分野のトレンドまとめです。現在、ビッグデータ分野ではより多くの情報の抽出、リアルタイム計算の実現、AI プラットフォームとオンライン予測の実装などが求められており、いずれもビッグデータがインテリジェント化へ向かうトレンドを反映しています。
複数のデータソースからの構造化、半構造化、非構造化といった異なるタイプのデータが、データウェアハウスに蓄積された後にその価値をどう発揮するかという問いへの答えがインテリジェントコンピューティングです。広告レコメンデーションのシナリオを例に取ると、データソースは淘宝でのユーザーのクリック、閲覧、購入行動データであり、データ統合を通じてオフラインまたはリアルタイム同期、オフラインまたはリアルタイム ETL でデータウェアハウスに取り込まれ、データウェアハウスまたはデータレイクソリューションを通じてさまざまなデータモデルを生成してデータをトレーニングし、最終的にデータサービスを通じてトレーニング結果を出力します。このプロセスにおけるデータの理解と活用の方法がインテリジェント化されていることがわかります。
数年前の HTAP は OLTP と OLAP の 2 つの部分で構成されていました。OLAP はさらにビッグデータ分析、オフライン分析、リアルタイム分析に分解でき、データ量に応じて異なるエンジンを選択できます。現在、データサービスはますます重要になっており、一部のインテリジェントカスタマーサービスシナリオでは、データ抽出モデルに基づくリアルタイム人工知能推論サービスとアプリケーションが必要です。そのため、分析とサービスをどのように組み合わせるかも重要な課題です。これが現在検討されている HSAP です。人工知能を活用してデータウェアハウスからオフラインおよびリアルタイムでデータ価値を抽出し、データサービスを通じてユーザーにプッシュします。
Alibaba は自社アプリケーションで AI 強化ビッグデータの方法論とソリューションを蓄積してきました。たとえば、ダブル 11 プロモーション期間中のオフラインコンピューティング(バッチ処理)、リアルタイムコンピューティング(ストリームコンピューティング)、インタラクティブ分析、グラフコンピューティングなどです。飛天 AI プラットフォームと組み合わせ、AI が駆動する次世代飛天ビッグデータプロダクトをユーザーに提供しています。
ビッグデータも AI と同様にパフォーマンスを非常に重視します。2019 年、Alibaba Cloud のビッグデータプラットフォーム MaxCompute と E-MapReduce (EMR) は、TPC ベンチマークでコンピューティングパフォーマンスとコスト効率において明確な優位性を示しました。具体的なテスト結果は下図の通りです。
Alibaba は現在、インテリジェント音声カスタマーサービスインタラクションをユーザーに提供しており、ディープラーニングとインテリジェント知覚 AI 技術を適用しています。物流やユーザーデータなど、バックエンドのビッグデータ業務システムと緊密に連携することで、最終的なインテリジェント効果を実現しています。
では、企業はどのように AI を導入すべきでしょうか。端的に言えば、エジソンが電球を発明したように、人工知能を実装するにはアプリケーションのニーズから始め、段階的に技術革新を追求すべきです。クラウドを通じて低コスト、高性能、高安定性のインフラを提供しますが、重要なのはまずニーズを明確にすることです。
ここ数年、AI はアルゴリズム革新とデモ制作に取り組んできましたが、それだけでは到底十分ではありません。
AI アルゴリズムはシステムの一部に過ぎません。データの収集方法、有用な特徴の抽出方法、検証方法、プロセス管理、リソース管理などは、すべて企業が AI を導入する際に検討すべき課題です。
AI は万能ではありませんが、AI を無視することは絶対にできません。企業が AI を導入する際、最も重要なのはビジネスから始めることです。データ量の増加とアルゴリズムの充実が進む中、ビジネスを理解するデータエンジニアとアルゴリズムエンジニアのチームを構築することが、現在のインテリジェント企業の成功の鍵です。前述のアルゴリズム、コンピューティング能力、データはすべて、現在クラウド上で提供されているサービスとソリューションを活用して実現でき、企業の AI 実装をより迅速に推進できます。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
