E-MapReduce (EMR) は、Alibaba Cloud 上に構築された、Apache Hadoop と Apache Spark をベースとするオープンソースのビッグデータプラットフォームです。EMR を使用すると、Hadoop および Spark のエコシステムでデータを処理・分析したり、Object Storage Service (OSS) や ApsaraDB RDS などの Alibaba Cloud サービス間でデータを転送したりできます。
デプロイオプション
EMR では、以下のデプロイオプションを提供しています。
|
タイプ |
説明 |
|
EMR on ECS |
Elastic Compute Service (ECS) インスタンス上にオープンソースの Hadoop エコシステムコンポーネントをデプロイします。クラスターとサービスは EMR コンソールから管理します。 |
|
EMR on ACK |
Container Service for Kubernetes (ACK) クラスターをデプロイし、ACK リソース上のコンテナで EMR のビッグデータコンポーネントを実行します。EMR on ACK とは |
|
EMR Serverless Spark |
EMR Serverless Spark は、データおよび AI ワークロード向けのフルマネージドなレイクハウスエンジンです。オープンソースの Spark と 100% の互換性があり、既存のジョブをコード変更なしで |
EMR は、Apache Hadoop、Spark、Flink、StarRocks などのコミュニティのオープンソースサービスをベースに構築されています。運用保守 (O&M) の責任範囲は、デプロイオプションによって異なります。
-
EMR on ECS と EMR on ACK はセミマネージドです。クラスターリソースはお客様の Alibaba Cloud アカウントに属し、キャパシティプランニング、パラメータチューニング、トラブルシューティングなど、オープンソースサービスの日常的な運用保守 (O&M) はお客様の責任となります。ワークロードを継続的に実行するためには、社内にビッグデータの運用保守 (O&M) に関する専門知識を確保しておく必要があります。
-
EMR Serverless Spark と EMR Serverless StarRocks はフルマネージドです。Alibaba Cloud が基盤となるリソースとエンジンサービスを運用するため、お客様はジョブの開発とデータ分析に専念できます。
サポートの全範囲については、「テクニカルサポートの範囲と方法」をご参照ください。
メリット
EMR on ECS
エンタープライズグレードのオープンソースビッグデータサービス。Hadoop、Spark、Flink、Kafka、HBase のクラスターを迅速にデプロイできます。
-
コミュニティのオープンソースコンポーネントを100%使用し、標準リリースを超えるパフォーマンスを実現するための調整と最適化
-
コスト削減のためスポットインスタンスをサポートする、時間ベースの伸縮自在なスケーリング
-
コンピューティングとストレージの分離による、弾力的なリソース活用
-
手動設定なしで、数分でクラスターを作成およびスケーリング
EMR on ACK
-
費用対効果:個別の ACK クラスターが不要
-
シンプルな運用保守 (O&M):ビッグデータとオンラインサービスにわたる統一されたクラスター管理
-
柔軟なインフラストラクチャ:ECS と ACK の両方のリソースモデルをサポートし、シームレスな切り替えが可能
-
緊密な統合:ACK ベースのコンピューティングによるクラウドネイティブなデータレイクアーキテクチャで、無制限のスケーリングを実現
EMR Serverless Spark
-
クラウドネイティブな高速コンピューティングエンジン
-
内蔵 Fusion Engine (Spark Native Engine):オープンソース版より 300% 高いパフォーマンスを実現し、ビッグデータコンピューティングジョブを大幅に高速化します。ベクトル化エンジンとバッチデータ処理技術により、コンピューティング効率が最適化され、メモリ使用量が削減されるため、全体的なパフォーマンスが大幅に向上します。
-
内蔵 Celeborn (リモートシャッフルサービス):ペタバイト規模のシャッフルデータ処理をサポートし、大規模なシャッフルジョブの安定性とパフォーマンスを大幅に向上させます。コンピューティングノードに大容量ディスクは不要です。Spark の動的なリソーススケーリング機能が最大限に活用されることで、ストレージコストが削減され、コンピューティングリソースの総コストが最大 30% 削減されます。
-
-
オープンなデータレイクアーキテクチャ
-
オンデマンドの伸縮自在なスケーリング:コンピューティングとストレージの分離アーキテクチャをサポートします。コンピューティングリソースは数秒以内にスケーリングでき、最小粒度は 1 コアです。リソースは、ジョブまたはキューレベルのきめ細かい粒度で計測されます。ストレージは従量課金制を採用しているため、リソースの無駄がなくなり、企業の運用コストを大幅に削減できます。
-
シームレスな移行と互換性:HDFS と完全に互換性のあるクラウドストレージサービスである OSS-HDFS と統合し、ワークロードのクラウドへのスムーズな移行をサポートします。DLF は、レイクハウスに包括的なメタデータ相互接続を提供することでデータアクセスの一貫性と完全な権限管理を保証し、最新のデータレイクハウスアーキテクチャの容易な構築を支援します。
-
-
ワンストップの開発者エクスペリエンス
-
エンドツーエンドの開発サポート:ジョブの開発、デバッグ、リリース、スケジューリングをカバーするワンストップの開発エクスペリエンスを提供し、エンタープライズグレードの開発とリリースの高い基準を満たします。内蔵のバージョン管理機能は、完全なリリース履歴を記録し、ソースコードと設定の差分比較をサポートすることで、変更を追跡できるようにします。
-
効率的なコラボレーションと安定性:開発環境と本番環境は厳密に分離されているため、ビジネスの安定性が確保され、効率的なチームコラボレーションと安定したデリバリーがサポートされます。
-
-
サーバーレスリソースプラットフォーム
-
すぐに使用可能:手動での管理や複雑なインフラストラクチャの設定なしで、すぐにジョブ開発を開始できます。
-
秒単位の弾力性:リソースは、Spark ジョブのリソース要件に基づいて Pod を起動するために動的にプロビジョニングされ、コンピューティングが完了するとすぐに解放されます。実際に使用したリソースに対してのみ課金されるため、総コンピューティングコストがさらに削減されます。
-
コスト見積もり:ジョブレベルのリソース計測とコスト見積もりを提供し、企業がきめ細かい運用を実現できるよう支援します。
-