New release of EMR on ACK
Alibaba Cloud EMR on ACK は、ビッグデータプラットフォームを構築する新たな方法をユーザーに提供します。ユーザーは、Alibaba Cloud Container Service for Kubernetes (ACK) 上にオープンソースのビッグデータサービスをデプロイできます。ハイパフォーマンスでスケーラブルなコンテナのサービスデプロイとアプリケーション管理における ACK の強みを活用することで、ユーザーはビッグデータジョブ自体に集中できます。ACK クラスター上で Spark、Presto、Apache Flink のジョブを簡単に実行でき、オープンソースと 100% 互換性を持ちながら、オープンソースを上回るパフォーマンスを実現します。
1、背景
テクノロジートレンド
・ストレージとコンピューティングの分離、およびクラウドネイティブへの進化
・オンラインビジネス、AI、ビッグデータを ACK クラスターに統一して接続し、ピークシフトスケジューリング、オフラインとオンラインの混在実行によりマシン使用率を向上
・統一された運用保守アクセス、統一された運用保守ツールチェーン、および統一されたモニタリングシステム
・クラスター中心からジョブ中心へ
・マルチバージョンサポート(Spark 2.x と Spark 3.x の同時実行など)
クラウドネイティブが直面する課題
・コンピューティングとストレージの分離:OSS をベースにした HCFS ファイルシステムの構築方法
・既存の HDFS との完全な互換性が必要
・HDFS と同等のパフォーマンス、コスト削減
・計算エンジンのシャッフルデータのストレージと計算の分離:ACK の異機種混在モデルへの対応方法
・異機種混在モデルにはローカルディスクがない
・コミュニティ [Spark-25299] の議論により、Spark の動的リソースのサポートが業界の共通認識に
・ACK のスケジューリング機能:スケジューリングのパフォーマンスボトルネックの解決方法
・YARN と同等のパフォーマンス
・マルチレベルキュー管理
・ピークシフトスケジューリング
・Kubernetes のオペレーティングシステム機能を活用して各ビジネスのピークと谷を調整
EMR on ACK の特長
・Remote Shuffle Service が中間シャッフルデータにストレージと計算の分離スキームを提供
・計算ノードからローカルディスクとクラウドディスクの必要性を排除
・Spark の動的リソース機能のサポート、Spark-25299 の究極のソリューション
・JindoFS が OSS ストレージ向けにレイクアクセラレーションソリューションを提供
・ブロックモードの 1 TB TPCDS シナリオで 15% 以上のパフォーマンス向上
・スケジューリングレベルで Scheduler Framework V2 をサポート
・スケジューリングパフォーマンスがコミュニティの 3 倍以上
・マルチレベルキュー管理を提供
・エンジン機能の強化
・10 TB TPCDS ベンチマークシナリオで、EMR Spark はコミュニティの 3 倍のパフォーマンス向上
・Hudi と DeltaLake はコミュニティより優れた機能を搭載
・包括的なピークシフトスケジューリングスキーム
2、EMR のコンテナ化アーキテクチャ
EMR on ACK アーキテクチャ
・軽量な制御と既存のデータプラットフォームとの連携
・データ開発クラスターやスケジューリングプラットフォームを通じて異なる実行プラットフォームにジョブを投入
・ピークシフトスケジューリング、ビジネスのピークと谷の戦略に応じた調整
・クラウドネイティブデータレイクアーキテクチャ、ACK の強力な拡張性と縮小性
・ACK が柔軟性に優れた異機種混在モデルのクラスターを管理
3、概要
プロダクトホームページ
リファレンスリンク:https://www.aliyun.com/product/emapreduce
EMR on ACK Beta を体験する>>
新規クラスター
・リージョン:杭州、上海、北京、深センなどのリージョンが現在利用可能(継続的に拡大中)
・クラスタータイプ:Spark、Shuffle Service、Presto
・Spark - 汎用分散ビッグデータ処理エンジン
・ETL、オフラインバッチ処理、データモデリングなどの機能を提供
・Shuffle Service - EMR 計算エンジン向けに最適化されたシャッフルサービスを提供
・Kubernetes 環境でのローカルディスクへの依存を解消
・大規模計算クラスターのネットワークとディスクの IO ボトルネックを解決
・ストレージと計算の分離アーキテクチャをサポートし、複数の EMR クラスターに対応可能
・Presto - メモリベースの分散 SQL インタラクティブクエリエンジン
・複数のデータソースをサポート
・ペタバイト規模の大量データの複雑な分析やデータソースを超えたクエリに適しています
・コンポーネントバージョン:Spark (3.1.1)
・専用ノード:
・既存の ACK クラスターの一部のノードを EMR に共有
・新規 ACK クラスターを作成し、クラスター全体を専用ノードとして選択
・OSS バケット:ジョブ、ログ、jar パッケージなどの情報を保存するために使用
クラスター管理
・クラスター ID / 名前:クリックしてジョブ管理に移動
・クラスターステータス:クラスターが利用可能かどうかを検出
・ACK クラスター:既存の ACK クラスターと連携可能
・設定:Spark ジョブ設定
・リリース:リソースの解放
1、背景
テクノロジートレンド
・ストレージとコンピューティングの分離、およびクラウドネイティブへの進化
・オンラインビジネス、AI、ビッグデータを ACK クラスターに統一して接続し、ピークシフトスケジューリング、オフラインとオンラインの混在実行によりマシン使用率を向上
・統一された運用保守アクセス、統一された運用保守ツールチェーン、および統一されたモニタリングシステム
・クラスター中心からジョブ中心へ
・マルチバージョンサポート(Spark 2.x と Spark 3.x の同時実行など)
クラウドネイティブが直面する課題
・コンピューティングとストレージの分離:OSS をベースにした HCFS ファイルシステムの構築方法
・既存の HDFS との完全な互換性が必要
・HDFS と同等のパフォーマンス、コスト削減
・計算エンジンのシャッフルデータのストレージと計算の分離:ACK の異機種混在モデルへの対応方法
・異機種混在モデルにはローカルディスクがない
・コミュニティ [Spark-25299] の議論により、Spark の動的リソースのサポートが業界の共通認識に
・ACK のスケジューリング機能:スケジューリングのパフォーマンスボトルネックの解決方法
・YARN と同等のパフォーマンス
・マルチレベルキュー管理
・ピークシフトスケジューリング
・Kubernetes のオペレーティングシステム機能を活用して各ビジネスのピークと谷を調整
EMR on ACK の特長
・Remote Shuffle Service が中間シャッフルデータにストレージと計算の分離スキームを提供
・計算ノードからローカルディスクとクラウドディスクの必要性を排除
・Spark の動的リソース機能のサポート、Spark-25299 の究極のソリューション
・JindoFS が OSS ストレージ向けにレイクアクセラレーションソリューションを提供
・ブロックモードの 1 TB TPCDS シナリオで 15% 以上のパフォーマンス向上
・スケジューリングレベルで Scheduler Framework V2 をサポート
・スケジューリングパフォーマンスがコミュニティの 3 倍以上
・マルチレベルキュー管理を提供
・エンジン機能の強化
・10 TB TPCDS ベンチマークシナリオで、EMR Spark はコミュニティの 3 倍のパフォーマンス向上
・Hudi と DeltaLake はコミュニティより優れた機能を搭載
・包括的なピークシフトスケジューリングスキーム
2、EMR のコンテナ化アーキテクチャ
EMR on ACK アーキテクチャ
・軽量な制御と既存のデータプラットフォームとの連携
・データ開発クラスターやスケジューリングプラットフォームを通じて異なる実行プラットフォームにジョブを投入
・ピークシフトスケジューリング、ビジネスのピークと谷の戦略に応じた調整
・クラウドネイティブデータレイクアーキテクチャ、ACK の強力な拡張性と縮小性
・ACK が柔軟性に優れた異機種混在モデルのクラスターを管理
3、概要
プロダクトホームページ
リファレンスリンク:https://www.aliyun.com/product/emapreduce
EMR on ACK Beta を体験する>>
新規クラスター
・リージョン:杭州、上海、北京、深センなどのリージョンが現在利用可能(継続的に拡大中)
・クラスタータイプ:Spark、Shuffle Service、Presto
・Spark - 汎用分散ビッグデータ処理エンジン
・ETL、オフラインバッチ処理、データモデリングなどの機能を提供
・Shuffle Service - EMR 計算エンジン向けに最適化されたシャッフルサービスを提供
・Kubernetes 環境でのローカルディスクへの依存を解消
・大規模計算クラスターのネットワークとディスクの IO ボトルネックを解決
・ストレージと計算の分離アーキテクチャをサポートし、複数の EMR クラスターに対応可能
・Presto - メモリベースの分散 SQL インタラクティブクエリエンジン
・複数のデータソースをサポート
・ペタバイト規模の大量データの複雑な分析やデータソースを超えたクエリに適しています
・コンポーネントバージョン:Spark (3.1.1)
・専用ノード:
・既存の ACK クラスターの一部のノードを EMR に共有
・新規 ACK クラスターを作成し、クラスター全体を専用ノードとして選択
・OSS バケット:ジョブ、ログ、jar パッケージなどの情報を保存するために使用
クラスター管理
・クラスター ID / 名前:クリックしてジョブ管理に移動
・クラスターステータス:クラスターが利用可能かどうかを検出
・ACK クラスター:既存の ACK クラスターと連携可能
・設定:Spark ジョブ設定
・リリース:リソースの解放
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
