すべてのプロダクト
Search
ドキュメントセンター

E-MapReduce:EMR on ECS とは

最終更新日:Aug 29, 2026

EMR on ECS は、Alibaba Cloud Elastic Compute Service (ECS) インスタンス上で Apache Hadoop、Spark、Flink、Hive などのオープンソースのビッグデータコンポーネントを実行し、OSS-HDFS や JindoCache などの自社開発コンポーネント、および DataWorks や Data Lake Formation (DLF) との統合を提供します。サブスクリプションと従量課金の両方の課金方法をサポートしており、伸縮性のあるビッグデータクラスターを数分で立ち上げられます。

重要

E-MapReduce (EMR) は、Apache Hadoop、Spark、Flink、StarRocks などのコミュニティのオープンソースサービスをベースにしており、それらに関するクラスター管理プラットフォームを提供します。EMR on ECS はセミマネージドです。クラスターリソースはお客様の Alibaba Cloud アカウントに属し、お客様は容量計画、パラメーターチューニング、トラブルシューティングなど、オープンソースサービスの日常の運用保守を担当します。ワークロードを稼働させ続けるには、ビッグデータに関する社内の運用保守の専門知識が必要です。サポートの全範囲については、「技術サポートの範囲と方法」をご参照ください。

アーキテクチャ

EMR は、Alibaba Cloud サービスとオープンソースコンポーネントを自社開発コンポーネントと共に統合し、クラスター管理機能を提供します。コンポーネントの種類と対応ユースケースの詳細については、「コンポーネント」および「利用シナリオ」をご参照ください。

image

Alibaba Cloud サービス

  • クラスターは ECS インスタンス上で実行されます。

  • データは Object Storage Service (OSS) に保存できます。

  • EMR は DataWorks と統合されています。DataWorks は EMR をジョブのコンピューティングおよびデータストレージエンジンとして使用します。

  • EMR Workflow は、ワークフローとタスクをスケジューリングするフルマネージドサービスです。

オープンソースコンポーネント

EMR は、データ統合、データストレージ、リソース管理、コンピューティングエンジン、データ開発、データサービスの 6 つのカテゴリにわたるオープンソースのビッグデータコンポーネントをバンドルしています。

自社開発コンポーネント

EMR は、Alibaba Cloud インフラストラクチャ上でオープンソースの機能を拡張する、3 つの自社開発コンポーネントを提供します。

  • OSS-HDFS: Hadoop Distributed File System (HDFS) API と互換性のあるオブジェクトストレージソリューションです。ビッグデータコンピューティングタスクは、標準の HDFS プロトコルを介して OSS データに直接アクセスします。

  • JindoCache:データブロックをメモリにキャッシュして読み取りパフォーマンスを向上させ、基盤となるストレージシステムへの負荷を軽減する分散キャッシュソリューションです。

  • DLF-Auth: Data Lake Formation (DLF) のデータ権限管理を可能にする、DLF のコンポーネントです。

クラスター管理

  • クラスターの作成、スケールアウト、オートスケーリングルールの設定を行います。

  • クラスターとサービスの設定を管理し、ノードとサービスの運用保守 (O&M) を実行します。

  • 多次元メトリクス、クラスターレポート分析、およびアラートを使用してクラスターの状態を監視します。

メリット

機能

説明

安定したオープンソースコンポーネント

各 EMR リリースには、最新のオープンソースコンポーネントバージョンが同梱されており、コンポーネント間のバージョン互換性の問題が解消されています。Alibaba Cloud のデプロイ環境は、標準のコミュニティビルドよりもはるかに高いパフォーマンスを実現します。さまざまなバージョンの EMR クラスターで対応しているサービスの詳細については、「リリースバージョン」をご参照ください。

使いやすさ

手動でサービスをデプロイまたは起動することなく、数分でビッグデータコンピューティング環境を立ち上げられます。数回クリックするだけでクラスターのサイズを調整できます。インテリジェントな診断機能を備えた組み込みの監視およびアラート機能により、トラブルシューティングの時間が短縮されます。

費用対効果

使用したコンピューティングリソースに対してのみ料金が発生します。ホットデータとコールドデータをストレージ階層にまたがって階層化することで、単位ストレージコストを削減します。さまざまな運用保守ツール、インテリジェント診断、ビッグデータプラットフォームにより、運用上のオーバーヘッドがさらに削減されます。

スケーラビリティ

負荷またはスケジュールに基づいて、クラスターリソースをスケールアップまたはスケールダウンできます。オートスケーリングは数分以内に完了し、複数の弾力的なリソースタイプをサポートします。

緊密な統合

ECS または Container Service for Kubernetes (ACK) 上にクラスターをデプロイできます。さまざまな ECS インスタンスタイプに対応しています。詳細については、「ECS インスタンス」をご参照ください。ジョブスケジューリングのために DataWorks と統合できます。データレイクシナリオで複数のエンジンにまたがるメタデータを一元管理するために DLF を使用できます。

AI 支援による運用保守

組み込みの EMR AI アシスタントは、クラスターの実行時の状態と監視データを読み取り、質問への回答、パフォーマンスの診断、ヘルスチェックの実行、アラートのプッシュを行います。コンソールで対話したり、DingTalk または Lark グループに追加したりできます。詳細については、「EMR AI アシスタント機能の概要」をご参照ください。

自己管理型 Hadoop クラスターとの詳細な比較については、「EMR クラスターと自己管理型 Hadoop クラスターの比較」をご参照ください。

EMR AI アシスタント

EMR AI アシスタントは、EMR に組み込まれたインテリジェントな運用保守サービスです。大規模言語モデルを基盤としており、クラスターに接続して実行時の状態と監視データを読み取ってから結論を導き出すため、その診断や推奨は一般的なアドバイスではなく、実際のクラスターの状態を反映したものになります。

機能

  • パフォーマンス診断:クエリがタイムアウトしたり、レイテンシーが急上昇したりすると、アシスタントが原因を追跡し、修正案を推奨します。最近低速だったクエリを尋ねると、各クエリのボトルネック分析とともに上位の SQL ステートメントを返します。

  • ヘルスチェック:設定したスケジュールでクラスターの設定と実行時の状態を検査し、検査結果を報告します。

  • プロアクティブアラート:日次レポートとアラートを有効にすると、アシスタントはクラスターを継続的に監視し、監視担当者がいなくても問題を DingTalk または Lark にプッシュします。

  • Q&A:自然言語で質問できます。対話を重ねることで、1 回のセッション内で問題を掘り下げられます。

使用方法

アシスタントは、コンソールの [チャットウィンドウ]、DingTalk または Lark グループ、API と SDK の 3 つの方法で利用できます。

課金

EMR on ECS クラスターの料金は、EMR サービス料金と ECS インスタンス料金で構成されます。クラスターで使用される他の Alibaba Cloud サービス (OSS、DLF、EMR Workflow など) の料金は、各サービスの独自の課金ルール (「課金の概要」、「課金」) に従います。

EMR on ECS は、2 つの課金方法をサポートしています。

  • サブスクリプション:固定期間に基づいて前払いします。割引料金で事前にキャパシティを予約します。

  • 従量課金:使用後に支払います。事前のコミットメントなしで、ワークロードの需要に応じてリソースを購入および解放できます。

クラスターノードによって生成されるインターネットトラフィックは、クラスターの課金方法に関係なく、常に従量課金で請求されます。

料金の詳細については、「課金」をご参照ください。

次のステップ

関連ドキュメント