すべてのプロダクト
Search
ドキュメントセンター

E-MapReduce:E-MapReduce とは

最終更新日:Aug 28, 2026

E-MapReduce (EMR) は、Alibaba Cloud 上に構築された、Apache Hadoop と Apache Spark をベースとするオープンソースのビッグデータプラットフォームです。EMR を使用すると、Hadoop および Spark のエコシステムでデータを処理・分析したり、Object Storage Service (OSS) や ApsaraDB RDS などの Alibaba Cloud サービス間でデータを転送したりできます。

デプロイオプション

EMR では、以下のデプロイオプションを提供しています。

タイプ

説明

EMR on ECS

Elastic Compute Service (ECS) インスタンス上にオープンソースの Hadoop エコシステムコンポーネントをデプロイします。クラスターとサービスは EMR コンソールから管理します。

EMR on ECS とは

EMR on ACK

Container Service for Kubernetes (ACK) クラスターをデプロイし、ACK リソース上のコンテナで EMR のビッグデータコンポーネントを実行します。EMR on ACK とは

EMR Serverless Spark

EMR Serverless Spark は、データおよび AI ワークロード向けのフルマネージドなレイクハウスエンジンです。オープンソースの Spark と 100% の互換性があり、既存のジョブをコード変更なしで spark-submit や spark-sql を使って実行できます。

EMR Serverless Spark とは

重要

EMR は、Apache Hadoop、Spark、Flink、StarRocks などのコミュニティのオープンソースサービスをベースに構築されています。運用保守 (O&M) の責任範囲は、デプロイオプションによって異なります。

  • EMR on ECS と EMR on ACK はセミマネージドです。クラスターリソースはお客様の Alibaba Cloud アカウントに属し、キャパシティプランニング、パラメータチューニング、トラブルシューティングなど、オープンソースサービスの日常的な運用保守 (O&M) はお客様の責任となります。ワークロードを継続的に実行するためには、社内にビッグデータの運用保守 (O&M) に関する専門知識を確保しておく必要があります。

  • EMR Serverless Spark と EMR Serverless StarRocks はフルマネージドです。Alibaba Cloud が基盤となるリソースとエンジンサービスを運用するため、お客様はジョブの開発とデータ分析に専念できます。

サポートの全範囲については、「テクニカルサポートの範囲と方法」をご参照ください。

メリット

EMR on ECS

エンタープライズグレードのオープンソースビッグデータサービス。Hadoop、Spark、Flink、Kafka、HBase のクラスターを迅速にデプロイできます。

  • コミュニティのオープンソースコンポーネントを100%使用し、標準リリースを超えるパフォーマンスを実現するための調整と最適化

  • コスト削減のためスポットインスタンスをサポートする、時間ベースの伸縮自在なスケーリング

  • コンピューティングとストレージの分離による、弾力的なリソース活用

  • 手動設定なしで、数分でクラスターを作成およびスケーリング

EMR on ACK

  • 費用対効果:個別の ACK クラスターが不要

  • シンプルな運用保守 (O&M):ビッグデータとオンラインサービスにわたる統一されたクラスター管理

  • 柔軟なインフラストラクチャ:ECS と ACK の両方のリソースモデルをサポートし、シームレスな切り替えが可能

  • 緊密な統合:ACK ベースのコンピューティングによるクラウドネイティブなデータレイクアーキテクチャで、無制限のスケーリングを実現

EMR Serverless Spark

  • クラウドネイティブな高速コンピューティングエンジン

    • 内蔵 Fusion Engine (Spark Native Engine):オープンソース版より 300% 高いパフォーマンスを実現し、ビッグデータコンピューティングジョブを大幅に高速化します。ベクトル化エンジンとバッチデータ処理技術により、コンピューティング効率が最適化され、メモリ使用量が削減されるため、全体的なパフォーマンスが大幅に向上します。

    • 内蔵 Celeborn (リモートシャッフルサービス):ペタバイト規模のシャッフルデータ処理をサポートし、大規模なシャッフルジョブの安定性とパフォーマンスを大幅に向上させます。コンピューティングノードに大容量ディスクは不要です。Spark の動的なリソーススケーリング機能が最大限に活用されることで、ストレージコストが削減され、コンピューティングリソースの総コストが最大 30% 削減されます。

  • オープンなデータレイクアーキテクチャ

    • オンデマンドの伸縮自在なスケーリング:コンピューティングとストレージの分離アーキテクチャをサポートします。コンピューティングリソースは数秒以内にスケーリングでき、最小粒度は 1 コアです。リソースは、ジョブまたはキューレベルのきめ細かい粒度で計測されます。ストレージは従量課金制を採用しているため、リソースの無駄がなくなり、企業の運用コストを大幅に削減できます。

    • シームレスな移行と互換性:HDFS と完全に互換性のあるクラウドストレージサービスである OSS-HDFS と統合し、ワークロードのクラウドへのスムーズな移行をサポートします。DLF は、レイクハウスに包括的なメタデータ相互接続を提供することでデータアクセスの一貫性と完全な権限管理を保証し、最新のデータレイクハウスアーキテクチャの容易な構築を支援します。

  • ワンストップの開発者エクスペリエンス

    • エンドツーエンドの開発サポート:ジョブの開発、デバッグ、リリース、スケジューリングをカバーするワンストップの開発エクスペリエンスを提供し、エンタープライズグレードの開発とリリースの高い基準を満たします。内蔵のバージョン管理機能は、完全なリリース履歴を記録し、ソースコードと設定の差分比較をサポートすることで、変更を追跡できるようにします。

    • 効率的なコラボレーションと安定性:開発環境と本番環境は厳密に分離されているため、ビジネスの安定性が確保され、効率的なチームコラボレーションと安定したデリバリーがサポートされます。

  • サーバーレスリソースプラットフォーム

    • すぐに使用可能:手動での管理や複雑なインフラストラクチャの設定なしで、すぐにジョブ開発を開始できます。

    • 秒単位の弾力性:リソースは、Spark ジョブのリソース要件に基づいて Pod を起動するために動的にプロビジョニングされ、コンピューティングが完了するとすぐに解放されます。実際に使用したリソースに対してのみ課金されるため、総コンピューティングコストがさらに削減されます。

    • コスト見積もり:ジョブレベルのリソース計測とコスト見積もりを提供し、企業がきめ細かい運用を実現できるよう支援します。