EMR on ECS は、Alibaba Cloud Elastic Compute Service (ECS) インスタンス上で Apache Hadoop、Spark、Flink、Hive などのオープンソースのビッグデータコンポーネントを実行し、OSS-HDFS や JindoCache などの自社開発コンポーネント、および DataWorks や Data Lake Formation (DLF) との統合を提供します。サブスクリプションと従量課金の両方の課金方法をサポートしており、伸縮性のあるビッグデータクラスターを数分で立ち上げられます。
E-MapReduce (EMR) は、Apache Hadoop、Spark、Flink、StarRocks などのコミュニティのオープンソースサービスをベースにしており、それらに関するクラスター管理プラットフォームを提供します。EMR on ECS はセミマネージドです。クラスターリソースはお客様の Alibaba Cloud アカウントに属し、お客様は容量計画、パラメーターチューニング、トラブルシューティングなど、オープンソースサービスの日常の運用保守を担当します。ワークロードを稼働させ続けるには、ビッグデータに関する社内の運用保守の専門知識が必要です。サポートの全範囲については、「技術サポートの範囲と方法」をご参照ください。
アーキテクチャ
EMR は、Alibaba Cloud サービスとオープンソースコンポーネントを自社開発コンポーネントと共に統合し、クラスター管理機能を提供します。コンポーネントの種類と対応ユースケースの詳細については、「コンポーネント」および「利用シナリオ」をご参照ください。
Alibaba Cloud サービス
-
クラスターは ECS インスタンス上で実行されます。
-
データは Object Storage Service (OSS) に保存できます。
-
EMR は DataWorks と統合されています。DataWorks は EMR をジョブのコンピューティングおよびデータストレージエンジンとして使用します。
-
EMR Workflow は、ワークフローとタスクをスケジューリングするフルマネージドサービスです。
オープンソースコンポーネント
EMR は、データ統合、データストレージ、リソース管理、コンピューティングエンジン、データ開発、データサービスの 6 つのカテゴリにわたるオープンソースのビッグデータコンポーネントをバンドルしています。
自社開発コンポーネント
EMR は、Alibaba Cloud インフラストラクチャ上でオープンソースの機能を拡張する、3 つの自社開発コンポーネントを提供します。
-
OSS-HDFS: Hadoop Distributed File System (HDFS) API と互換性のあるオブジェクトストレージソリューションです。ビッグデータコンピューティングタスクは、標準の HDFS プロトコルを介して OSS データに直接アクセスします。
-
JindoCache:データブロックをメモリにキャッシュして読み取りパフォーマンスを向上させ、基盤となるストレージシステムへの負荷を軽減する分散キャッシュソリューションです。
-
DLF-Auth: Data Lake Formation (DLF) のデータ権限管理を可能にする、DLF のコンポーネントです。
クラスター管理
-
クラスターの作成、スケールアウト、オートスケーリングルールの設定を行います。
-
クラスターとサービスの設定を管理し、ノードとサービスの運用保守 (O&M) を実行します。
-
多次元メトリクス、クラスターレポート分析、およびアラートを使用してクラスターの状態を監視します。
メリット
|
機能 |
説明 |
|
安定したオープンソースコンポーネント |
各 EMR リリースには、最新のオープンソースコンポーネントバージョンが同梱されており、コンポーネント間のバージョン互換性の問題が解消されています。Alibaba Cloud のデプロイ環境は、標準のコミュニティビルドよりもはるかに高いパフォーマンスを実現します。さまざまなバージョンの EMR クラスターで対応しているサービスの詳細については、「リリースバージョン」をご参照ください。 |
|
使いやすさ |
手動でサービスをデプロイまたは起動することなく、数分でビッグデータコンピューティング環境を立ち上げられます。数回クリックするだけでクラスターのサイズを調整できます。インテリジェントな診断機能を備えた組み込みの監視およびアラート機能により、トラブルシューティングの時間が短縮されます。 |
|
費用対効果 |
使用したコンピューティングリソースに対してのみ料金が発生します。ホットデータとコールドデータをストレージ階層にまたがって階層化することで、単位ストレージコストを削減します。さまざまな運用保守ツール、インテリジェント診断、ビッグデータプラットフォームにより、運用上のオーバーヘッドがさらに削減されます。 |
|
スケーラビリティ |
負荷またはスケジュールに基づいて、クラスターリソースをスケールアップまたはスケールダウンできます。オートスケーリングは数分以内に完了し、複数の弾力的なリソースタイプをサポートします。 |
|
緊密な統合 |
ECS または Container Service for Kubernetes (ACK) 上にクラスターをデプロイできます。さまざまな ECS インスタンスタイプに対応しています。詳細については、「ECS インスタンス」をご参照ください。ジョブスケジューリングのために DataWorks と統合できます。データレイクシナリオで複数のエンジンにまたがるメタデータを一元管理するために DLF を使用できます。 |
|
AI 支援による運用保守 |
組み込みの EMR AI アシスタントは、クラスターの実行時の状態と監視データを読み取り、質問への回答、パフォーマンスの診断、ヘルスチェックの実行、アラートのプッシュを行います。コンソールで対話したり、DingTalk または Lark グループに追加したりできます。詳細については、「EMR AI アシスタント機能の概要」をご参照ください。 |
自己管理型 Hadoop クラスターとの詳細な比較については、「EMR クラスターと自己管理型 Hadoop クラスターの比較」をご参照ください。
EMR AI アシスタント
EMR AI アシスタントは、EMR に組み込まれたインテリジェントな運用保守サービスです。大規模言語モデルを基盤としており、クラスターに接続して実行時の状態と監視データを読み取ってから結論を導き出すため、その診断や推奨は一般的なアドバイスではなく、実際のクラスターの状態を反映したものになります。
機能
-
パフォーマンス診断:クエリがタイムアウトしたり、レイテンシーが急上昇したりすると、アシスタントが原因を追跡し、修正案を推奨します。最近低速だったクエリを尋ねると、各クエリのボトルネック分析とともに上位の SQL ステートメントを返します。
-
ヘルスチェック:設定したスケジュールでクラスターの設定と実行時の状態を検査し、検査結果を報告します。
-
プロアクティブアラート:日次レポートとアラートを有効にすると、アシスタントはクラスターを継続的に監視し、監視担当者がいなくても問題を DingTalk または Lark にプッシュします。
-
Q&A:自然言語で質問できます。対話を重ねることで、1 回のセッション内で問題を掘り下げられます。
使用方法
アシスタントは、コンソールの [チャットウィンドウ]、DingTalk または Lark グループ、API と SDK の 3 つの方法で利用できます。
-
開始するには、「EMR AI アシスタントを使ってみる」をご参照ください。
-
すべての機能セットとサポートされているシナリオについては、「EMR AI アシスタント機能の概要」をご参照ください。
-
エディションと課金の詳細については、「EMR AI アシスタントの課金の詳細」をご参照ください。
課金
EMR on ECS クラスターの料金は、EMR サービス料金と ECS インスタンス料金で構成されます。クラスターで使用される他の Alibaba Cloud サービス (OSS、DLF、EMR Workflow など) の料金は、各サービスの独自の課金ルール (「課金の概要」、「課金」) に従います。
EMR on ECS は、2 つの課金方法をサポートしています。
-
サブスクリプション:固定期間に基づいて前払いします。割引料金で事前にキャパシティを予約します。
-
従量課金:使用後に支払います。事前のコミットメントなしで、ワークロードの需要に応じてリソースを購入および解放できます。
クラスターノードによって生成されるインターネットトラフィックは、クラスターの課金方法に関係なく、常に従量課金で請求されます。
料金の詳細については、「課金」をご参照ください。
次のステップ
-
DataWorks で EMR を使用する:単一のインターフェイスからデータレイクを開発および管理できます。詳細については、「DataWorks on EMR を使ってみる」をご参照ください。
-
ユースケースを確認する:詳細については、「利用シナリオ」をご参照ください。
-
コンポーネントのバージョンを確認する:詳細については、「各バージョンで対応しているコンポーネント」をご参照ください。
-
クラスターの監視と運用:詳細については、「クラスターの運用保守」および「クラスターの監視」をご参照ください。