Build an elastic big data cloud analysis platform with zero threshold
ビッグデータとビッグデータ分析は、現代の企業にとって注目の的となっている。ビッグデータ分析プラットフォームは、ハイエンドな設定から標準的な設定へと移行しつつあり、企業が「すべての業務をデータ化し、すべてのデータをビジネスに活かす」という目標を実現するための基盤となっている。
Alibaba Cloud Intelligence のシニアソリューションアーキテクトである Bao Yuansong 氏が「ゼロから構築するエラスティックなビッグデータクラウド分析プラットフォーム」について講演し、ビッグデータ分析プラットフォームの構築プロセスを段階に分け、各段階について詳しく解説した。
下図はビッグデータ分析プラットフォーム構築の 4 つの段階を示しており、自作、Cloud Hosting、クラウドサービス、クラウドネイティブの順で構成されている。
ビッグデータ分析プラットフォームの自作構築
なぜ自社でビッグデータ分析プラットフォームを構築する必要があるのか。主な理由は 3 つある。
1. 従来のビッグデータ分析技術では現在のニーズに対応できなくなり、新技術の導入による改善が必要である。
2. 初期のビッグデータ技術は未成熟で信頼性も低く、専門技術者による研究が必要であった。
3. 市場には効果的なビッグデータ分析の成功事例が乏しく、企業は試行錯誤しながら手探りで進まなければならなかった。
自作のビッグデータ分析プラットフォームは資産集約型モデルであり、以下のような多くの課題がある。
1. 長期化する構築サイクル:データセンターの選定、ハードウェア調達、クラスターデプロイ、テストチューニング、データサービス、運用保守管理など、多くの工程を経る必要があり、構築サイクルは非常に長い。
2. 高コスト:コストは明示的コストと暗黙的コストに分かれる。前者はサーバー、ストレージ、ネットワーク、運用保守、データセンターなどの直接的な費用であり、後者はビジネスへの影響、アイドルリソース、エラスティックスケーリング、初期一括投資などである。これらの投資額は確定しているが、リターンは不透明である。
3. 高い技術ハードル:近年、ビッグデータ技術は急速に発展しており、データ統合、データストレージ、分析計算、データ運用の各ディメンションで細分化された技術が多く存在する。いずれの技術も専門人材による深い研究を要し、一般企業にとって人材確保のハードルは高い。
4. 成果までの時間:データ品質が期待水準に達し、分析結果の信頼性が確保されるまで、プラットフォームを継続的に改善する必要があり、最終的なエラスティックな性能、高い信頼性、マルチシナリオ適用の効果を実現するには時間がかかる。
ビッグデータ分析プラットフォームの Cloud Hosting 構築
自作ビッグデータ分析プラットフォームのさまざまな課題を背景に、Cloud Hosting は以下の 3 つのニーズに対応する形で誕生した。
1. 企業が資産集約型の負担から解放される。
2. ビッグデータ技術が成熟し、企業は技術そのものではなく、ビッグデータスキルを持つ人材によるデータ開発を必要とするようになった。
3. クラウドベンダーが自社の強みを活かし、クラウド上のビッグデータホスティングプラットフォームを提供するようになった。
自作のビッグデータ分析プラットフォームは通常オープンソースの Hadoop プラットフォームを基盤とするが、Cloud Hosting はこれをエンタープライズ向けの標準ビッグデータ分析プラットフォームへと進化させたもので、統一されたクラスター管理、包括的な監視とアラーム、コンピューティングとストレージの分離、エラスティックスケーリング、オンデマンド構築、データセキュリティ、低い運用ハードル、豊富なクラウドエコシステムとの連携などの利点を備えている。
E-MapReduce (EMR) は、基盤リソース、プラットフォーム管理、データストレージ、データ統合、計算エンジン、データ活用、ジョブ管理などの基盤機能を提供する。すべてのコンポーネントに対して包括的な監視とアラームを備え、コンポーネントの異常を即座に検知して通知できる。同時に、プラットフォームを基盤としたインテリジェントな運用保守管理やスケジューリングなどの機能も提供する。
次に、インフラストラクチャ、運用保守管理、クラウドエコシステムの観点から、Cloud Hosting の利点について詳しく見ていこう。
Cloud Hosting のインフラストラクチャ
まず、クラウド上には豊富なプロダクト仕様カテゴリがある。Alibaba Cloud の仮想マシンは、汎用コンピューティング、ヘテロジニアスコンピューティング、ベアメタルと高性能コンピューティングの 3 つのカテゴリに分かれており、それぞれ異なるシナリオに対応し、さまざまなビッグデータ分析プラットフォームを迅速に構築できる。
次に、クラウドのエラスティシティを活用することで、コンピューティングリソースとストレージリソースを独立して拡張でき、ビジネスのピーク時や极致のパフォーマンス追求に対応できるほか、オンデマンドで柔軟に構築できる。
さらに、クラウド上でのビッグデータ分析プラットフォーム構築のコストを大幅に最適化でき、ビジネスの特性に応じて購入方法を柔軟に選択できる。たとえば、スポットインスタンスを活用することで計算ノードのコストを大幅に削減できる。
Cloud Hosting の運用保守管理
ビッグデータ分析プラットフォーム全体の運用保守は非常に複雑で、専門人材と多大な投資を必要とする。基礎運用保守から管理運用保守、そしてコンポーネント運用保守に至るまで、クラウドベンダーは多次元な運用保守機能を提供している。
基礎運用保守:クラウドベンダーは自らの大規模サーバー運用保守の経験を活用して AIOps システムを構築し、ハードウェアを事前に検出・分析して、障害発見後に迅速なアクティブ運用保守を実行し、ビジネスへの影響を軽減する。
管理運用保守:EMR はワンクリックデプロイメントですぐに使える状態を実現し、統一された設定管理、プラットフォーム状態監視、障害アラーム機能も提供する。
コンポーネント運用保守:コンポーネント運用保守はビッグデータ分析プラットフォームの中で最も複雑な部分である。バージョンアップ時、コンポーネント間の密接な関係を考慮し、互換性の確保が最優先事項となる。
コンポーネント運用保守のもう一つの重要な側面はパフォーマンス最適化である。クラウドベンダーは自社のクラウドコンピューティングの強みを活かし、インフラストラクチャの最適化、カーネルエンジンの最適化を行い、オープンソースコンポーネントのパフォーマンス向上を支援する。
Cloud Hosting のクラウドエコシステム
クラウド上には豊富なエコシステムが存在し、後発企業が車輪の再発明やゼロからのスタートを避けることができる。下図に示す通りである。
基盤ストレージとしては、クラウド上の Object Storage Service (OSS) と Apsara File Storage for HDFS が提供される。HDFS は OSS とシームレスに連携でき、HDFS ファイルへのアクセスと変わらない。これにより、データアーカイブとコスト最適化を柔軟に行える。
データソースとしては、OSS、Simple Log Service (SLS)、ApsaraDB RDS、メッセージキューなどのサービスに対応している。計算エンジンとしては、クラウド上の EMR プラットフォームは MaxCompute、Realtime Compute for Apache Flink、TensorFlow の各エンジンと連携できる。
統合管理方面では、クラウド上に DataWorks サービスが提供されており、DataWorks を通じて Hadoop エコシステム全体の上位レイヤーのメタデータ管理とデータ品質管理を一元化できる。
さらに、クラウド上では DataV や QuickBI などの分析・可視化機能も提供されている。
Alibaba Cloud Intelligence のシニアソリューションアーキテクトである Bao Yuansong 氏が「ゼロから構築するエラスティックなビッグデータクラウド分析プラットフォーム」について講演し、ビッグデータ分析プラットフォームの構築プロセスを段階に分け、各段階について詳しく解説した。
下図はビッグデータ分析プラットフォーム構築の 4 つの段階を示しており、自作、Cloud Hosting、クラウドサービス、クラウドネイティブの順で構成されている。
ビッグデータ分析プラットフォームの自作構築
なぜ自社でビッグデータ分析プラットフォームを構築する必要があるのか。主な理由は 3 つある。
1. 従来のビッグデータ分析技術では現在のニーズに対応できなくなり、新技術の導入による改善が必要である。
2. 初期のビッグデータ技術は未成熟で信頼性も低く、専門技術者による研究が必要であった。
3. 市場には効果的なビッグデータ分析の成功事例が乏しく、企業は試行錯誤しながら手探りで進まなければならなかった。
自作のビッグデータ分析プラットフォームは資産集約型モデルであり、以下のような多くの課題がある。
1. 長期化する構築サイクル:データセンターの選定、ハードウェア調達、クラスターデプロイ、テストチューニング、データサービス、運用保守管理など、多くの工程を経る必要があり、構築サイクルは非常に長い。
2. 高コスト:コストは明示的コストと暗黙的コストに分かれる。前者はサーバー、ストレージ、ネットワーク、運用保守、データセンターなどの直接的な費用であり、後者はビジネスへの影響、アイドルリソース、エラスティックスケーリング、初期一括投資などである。これらの投資額は確定しているが、リターンは不透明である。
3. 高い技術ハードル:近年、ビッグデータ技術は急速に発展しており、データ統合、データストレージ、分析計算、データ運用の各ディメンションで細分化された技術が多く存在する。いずれの技術も専門人材による深い研究を要し、一般企業にとって人材確保のハードルは高い。
4. 成果までの時間:データ品質が期待水準に達し、分析結果の信頼性が確保されるまで、プラットフォームを継続的に改善する必要があり、最終的なエラスティックな性能、高い信頼性、マルチシナリオ適用の効果を実現するには時間がかかる。
ビッグデータ分析プラットフォームの Cloud Hosting 構築
自作ビッグデータ分析プラットフォームのさまざまな課題を背景に、Cloud Hosting は以下の 3 つのニーズに対応する形で誕生した。
1. 企業が資産集約型の負担から解放される。
2. ビッグデータ技術が成熟し、企業は技術そのものではなく、ビッグデータスキルを持つ人材によるデータ開発を必要とするようになった。
3. クラウドベンダーが自社の強みを活かし、クラウド上のビッグデータホスティングプラットフォームを提供するようになった。
自作のビッグデータ分析プラットフォームは通常オープンソースの Hadoop プラットフォームを基盤とするが、Cloud Hosting はこれをエンタープライズ向けの標準ビッグデータ分析プラットフォームへと進化させたもので、統一されたクラスター管理、包括的な監視とアラーム、コンピューティングとストレージの分離、エラスティックスケーリング、オンデマンド構築、データセキュリティ、低い運用ハードル、豊富なクラウドエコシステムとの連携などの利点を備えている。
E-MapReduce (EMR) は、基盤リソース、プラットフォーム管理、データストレージ、データ統合、計算エンジン、データ活用、ジョブ管理などの基盤機能を提供する。すべてのコンポーネントに対して包括的な監視とアラームを備え、コンポーネントの異常を即座に検知して通知できる。同時に、プラットフォームを基盤としたインテリジェントな運用保守管理やスケジューリングなどの機能も提供する。
次に、インフラストラクチャ、運用保守管理、クラウドエコシステムの観点から、Cloud Hosting の利点について詳しく見ていこう。
Cloud Hosting のインフラストラクチャ
まず、クラウド上には豊富なプロダクト仕様カテゴリがある。Alibaba Cloud の仮想マシンは、汎用コンピューティング、ヘテロジニアスコンピューティング、ベアメタルと高性能コンピューティングの 3 つのカテゴリに分かれており、それぞれ異なるシナリオに対応し、さまざまなビッグデータ分析プラットフォームを迅速に構築できる。
次に、クラウドのエラスティシティを活用することで、コンピューティングリソースとストレージリソースを独立して拡張でき、ビジネスのピーク時や极致のパフォーマンス追求に対応できるほか、オンデマンドで柔軟に構築できる。
さらに、クラウド上でのビッグデータ分析プラットフォーム構築のコストを大幅に最適化でき、ビジネスの特性に応じて購入方法を柔軟に選択できる。たとえば、スポットインスタンスを活用することで計算ノードのコストを大幅に削減できる。
Cloud Hosting の運用保守管理
ビッグデータ分析プラットフォーム全体の運用保守は非常に複雑で、専門人材と多大な投資を必要とする。基礎運用保守から管理運用保守、そしてコンポーネント運用保守に至るまで、クラウドベンダーは多次元な運用保守機能を提供している。
基礎運用保守:クラウドベンダーは自らの大規模サーバー運用保守の経験を活用して AIOps システムを構築し、ハードウェアを事前に検出・分析して、障害発見後に迅速なアクティブ運用保守を実行し、ビジネスへの影響を軽減する。
管理運用保守:EMR はワンクリックデプロイメントですぐに使える状態を実現し、統一された設定管理、プラットフォーム状態監視、障害アラーム機能も提供する。
コンポーネント運用保守:コンポーネント運用保守はビッグデータ分析プラットフォームの中で最も複雑な部分である。バージョンアップ時、コンポーネント間の密接な関係を考慮し、互換性の確保が最優先事項となる。
コンポーネント運用保守のもう一つの重要な側面はパフォーマンス最適化である。クラウドベンダーは自社のクラウドコンピューティングの強みを活かし、インフラストラクチャの最適化、カーネルエンジンの最適化を行い、オープンソースコンポーネントのパフォーマンス向上を支援する。
Cloud Hosting のクラウドエコシステム
クラウド上には豊富なエコシステムが存在し、後発企業が車輪の再発明やゼロからのスタートを避けることができる。下図に示す通りである。
基盤ストレージとしては、クラウド上の Object Storage Service (OSS) と Apsara File Storage for HDFS が提供される。HDFS は OSS とシームレスに連携でき、HDFS ファイルへのアクセスと変わらない。これにより、データアーカイブとコスト最適化を柔軟に行える。
データソースとしては、OSS、Simple Log Service (SLS)、ApsaraDB RDS、メッセージキューなどのサービスに対応している。計算エンジンとしては、クラウド上の EMR プラットフォームは MaxCompute、Realtime Compute for Apache Flink、TensorFlow の各エンジンと連携できる。
統合管理方面では、クラウド上に DataWorks サービスが提供されており、DataWorks を通じて Hadoop エコシステム全体の上位レイヤーのメタデータ管理とデータ品質管理を一元化できる。
さらに、クラウド上では DataV や QuickBI などの分析・可視化機能も提供されている。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
