New release of EMR on ACK

Alibaba Cloud EMR on ACK は、ビッグデータプラットフォームを構築する新たな方法をユーザーに提供します。ユーザーは、Alibaba Cloud Container Service for Kubernetes (ACK) 上にオープンソースのビッグデータサービスをデプロイできます。ハイパフォーマンスでスケーラブルなコンテナのサービスデプロイとアプリケーション管理における ACK の強みを活用することで、ユーザーはビッグデータジョブ自体に集中できます。ACK クラスター上で Spark、Presto、Apache Flink のジョブを簡単に実行でき、オープンソースと 100% 互換性を持ちながら、オープンソースを上回るパフォーマンスを実現します。

1、背景

テクノロジートレンド

・ストレージとコンピューティングの分離、およびクラウドネイティブへの進化

・オンラインビジネス、AI、ビッグデータを ACK クラスターに統一して接続し、ピークシフトスケジューリング、オフラインとオンラインの混在実行によりマシン使用率を向上

・統一された運用保守アクセス、統一された運用保守ツールチェーン、および統一されたモニタリングシステム

・クラスター中心からジョブ中心へ

・マルチバージョンサポート(Spark 2.x と Spark 3.x の同時実行など)

クラウドネイティブが直面する課題

・コンピューティングとストレージの分離:OSS をベースにした HCFS ファイルシステムの構築方法

・既存の HDFS との完全な互換性が必要

・HDFS と同等のパフォーマンス、コスト削減

・計算エンジンのシャッフルデータのストレージと計算の分離:ACK の異機種混在モデルへの対応方法

・異機種混在モデルにはローカルディスクがない

・コミュニティ [Spark-25299] の議論により、Spark の動的リソースのサポートが業界の共通認識に

・ACK のスケジューリング機能:スケジューリングのパフォーマンスボトルネックの解決方法

・YARN と同等のパフォーマンス

・マルチレベルキュー管理

・ピークシフトスケジューリング

・Kubernetes のオペレーティングシステム機能を活用して各ビジネスのピークと谷を調整

EMR on ACK の特長

・Remote Shuffle Service が中間シャッフルデータにストレージと計算の分離スキームを提供

・計算ノードからローカルディスクとクラウドディスクの必要性を排除

・Spark の動的リソース機能のサポート、Spark-25299 の究極のソリューション

・JindoFS が OSS ストレージ向けにレイクアクセラレーションソリューションを提供

・ブロックモードの 1 TB TPCDS シナリオで 15% 以上のパフォーマンス向上

・スケジューリングレベルで Scheduler Framework V2 をサポート

・スケジューリングパフォーマンスがコミュニティの 3 倍以上

・マルチレベルキュー管理を提供

・エンジン機能の強化

・10 TB TPCDS ベンチマークシナリオで、EMR Spark はコミュニティの 3 倍のパフォーマンス向上

・Hudi と DeltaLake はコミュニティより優れた機能を搭載

・包括的なピークシフトスケジューリングスキーム

2、EMR のコンテナ化アーキテクチャ

EMR on ACK アーキテクチャ

・軽量な制御と既存のデータプラットフォームとの連携

・データ開発クラスターやスケジューリングプラットフォームを通じて異なる実行プラットフォームにジョブを投入

・ピークシフトスケジューリング、ビジネスのピークと谷の戦略に応じた調整

・クラウドネイティブデータレイクアーキテクチャ、ACK の強力な拡張性と縮小性

・ACK が柔軟性に優れた異機種混在モデルのクラスターを管理

3、概要

プロダクトホームページ

リファレンスリンク:https://www.aliyun.com/product/emapreduce

EMR on ACK Beta を体験する>>

新規クラスター

・リージョン:杭州、上海、北京、深センなどのリージョンが現在利用可能(継続的に拡大中)

・クラスタータイプ:Spark、Shuffle Service、Presto

・Spark - 汎用分散ビッグデータ処理エンジン

・ETL、オフラインバッチ処理、データモデリングなどの機能を提供

・Shuffle Service - EMR 計算エンジン向けに最適化されたシャッフルサービスを提供

・Kubernetes 環境でのローカルディスクへの依存を解消

・大規模計算クラスターのネットワークとディスクの IO ボトルネックを解決

・ストレージと計算の分離アーキテクチャをサポートし、複数の EMR クラスターに対応可能

・Presto - メモリベースの分散 SQL インタラクティブクエリエンジン

・複数のデータソースをサポート

・ペタバイト規模の大量データの複雑な分析やデータソースを超えたクエリに適しています

・コンポーネントバージョン:Spark (3.1.1)

・専用ノード:

・既存の ACK クラスターの一部のノードを EMR に共有

・新規 ACK クラスターを作成し、クラスター全体を専用ノードとして選択

・OSS バケット:ジョブ、ログ、jar パッケージなどの情報を保存するために使用

クラスター管理

・クラスター ID / 名前:クリックしてジョブ管理に移動

・クラスターステータス:クラスターが利用可能かどうかを検出

・ACK クラスター:既存の ACK クラスターと連携可能

・設定:Spark ジョブ設定

・リリース:リソースの解放

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.