すべてのプロダクト
Search
ドキュメントセンター

E-MapReduce:コンポーネントの概要

最終更新日:Jun 17, 2026

E-MapReduce (EMR) は、データ開発、コンピューティングエンジン、データサービス、リソース管理、データストレージ、およびデータ統合に対応した、オープンソースおよび自社開発のコンポーネントを提供します。ニーズに基づいてコンポーネントを選択し、構成できます。

説明

クラスターの作成時に使用したいコンポーネントが利用できない場合、またはオープンソースコンポーネントが既存のユーザーのみに提供されている場合は、ご自身でインストールおよび管理できます。

EMR は、オープンソースコンポーネント、自社開発コンポーネント、統合された Alibaba Cloud 製品、およびクラスター管理で構成されています。ビッグデータコンポーネントの一覧とそのユースケースについては、サービスアーキテクチャ図をご参照ください。

image

データ開発

データ開発レイヤーは、データ収集、データクレンジング、モデリング、分析、タスクスケジューリングを行うためのビジュアルツールとコード管理を提供します。これにより、企業はデータ資産を効率的に管理、活用できます。

EMR でのデータ開発には、Alibaba Cloud の DataWorksを使用できます。詳細は次のとおりです:

製品名

説明

関連ドキュメント

DataWorks

DataWorks は、エンドツーエンドのデータ統合、開発、ガバナンス、品質管理、運用保守、セキュリティコントロールを提供します。複雑なデータ統合とガバナンスが必要なシナリオに適しています。

オープンソースのデータ開発コンポーネントを使用するには、Hue と Superset を選択できます:

コンポーネントタイプ

コンポーネント名

説明

共通ドキュメント

オープンソース

Hue

Hue は既存のユーザーのみが利用できます。

Hue は、Apache Hadoop エコシステムを操作するためのオープンソースの Web インターフェイスです。

Hue

Superset

Superset は既存のユーザーのみが利用できます。

Superset は、豊富な可視化機能とダッシュボード機能を提供するデータ可視化ツールです。

Superset

コンピューティング エンジン

E-MapReduce (EMR) は、バッチ処理、インタラクティブ分析、ストリーム処理、機械学習向けの主要なコンピューティングエンジンをサポートしています。これらのエンジンは、さまざまなビッグデータシナリオの要件に合わせて、データ構造とロジックを変換します。

コンポーネントタイプ

コンポーネント名

説明

関連ドキュメント

オープンソース

Spark

Spark は、高速で汎用的なビッグデータ処理エンジンで、インメモリコンピューティングを提供し、バッチ処理、リアルタイム処理、機械学習、グラフコンピューティングをサポートします。

Hive

Hive は Hadoop ベースのデータウェアハウスツールで、SQL に似たクエリ言語である HiveQL を提供し、Hadoop 上で大規模なデータを格納、クエリ、分析します。

StarRocks

StarRocks は、次世代の高速な超並列処理 (MPP) データベースで、オンライン分析処理 (OLAP) の多次元分析、高同時実行クエリ、リアルタイム分析をサポートします。

Doris

Doris は高性能なリアルタイム分析データベースで、レポート分析、アドホッククエリ、データレイクのフェデレーションクエリの高速化に適しています。

ClickHouse

ClickHouse はオープンソースの列指向データベース管理システムで、効率的なオンライン分析処理 (OLAP) と大規模データセットに対する高速なクエリ向けに設計されています。

Trino

Trino (旧 PrestoSQL) は、オープンソースの分散 SQL クエリエンジンで、インタラクティブな分析クエリに適しています。

Flink

Flink はストリーム処理エンジンで、大規模なリアルタイムデータストリーム処理をサポートします。

Presto

Presto (PrestoDB とも呼ばれる) は、柔軟でスケーラブルな分散 SQL クエリエンジンで、インタラクティブな分析クエリに適しています。

Tez

Apache Tez は、効率的で柔軟な有向非巡回グラフ (DAG) 実行モデルを提供する分散型ビッグデータ処理フレームワークです。主に MapReduce の代替として機能し、クエリとバッチ処理のパフォーマンスを最適化します。

Tez

Phoenix

Phoenix は HBase 上に構築された SQL の中間レイヤーで、標準の SQL 構文を使用して HBase に格納されたデータをクエリおよび管理できます。

Phoenix

Impala

Impala は既存ユーザーのみが利用できます。

Impala は、Apache Hadoop に格納されたデータ向けの、高性能で低レイテンシーの SQL クエリを提供します。

Kudu

Kudu は既存ユーザーのみが利用できます。

Kudu は、分散型でスケーラブルな列指向のストレージマネージャーで、低レイテンシーのランダム読み取り/書き込み操作と効率的なデータ分析を提供します。

Druid

Druid は既存ユーザーのみが利用できます。

Druid は、分散型のインメモリリアルタイム分析システムで、大規模なデータセットに対する高速でインタラクティブなクエリを実現します。

Druid

データサービス

データサービスレイヤーは、データ暗号化、アクセス制御、データクエリ、データアクセス、API 機能を提供することで、ビッグデータ環境におけるデータセキュリティ、運用パフォーマンス、分析効率を向上させます。

コンポーネントタイプ

コンポーネント名

説明

関連ドキュメント

オープンソース

Ranger

Ranger は、Hadoop エコシステムにおける権限管理と監査を行う、一元化されたセキュリティ管理フレームワークです。

Kerberos

Kerberos は、対称キー技術を使用して他のサービスに身元確認を提供し、シングルサインオン (SSO) をサポートする ID 認証プロトコルです。

OpenLDAP

OpenLDAP は、ユーザー情報とリソース情報を管理および格納するための LDAP プロトコルのオープンソース実装です。ユーザー管理と ID 認証機能を提供します。

OpenLDAP

Kyuubi

Kyuubi は、データレイククエリエンジンに SQL やその他のクエリサービスを提供することで、データ分析とクエリ処理を簡素化する、分散マルチテナント SQL ゲートウェイです。

ZooKeeper

ZooKeeper は、設定、同期、命名など、分散アプリケーションにおける主要なタスクを管理するための分散協調サービスです。一貫性、高性能、信頼性の高いクラスター管理ソリューションを提供します。

Knox

Knox は、Hadoop および関連コンポーネントへのセキュアなアクセスを簡素化すると同時に、統合 ID 認証とアクセス制御を提供する REST API ゲートウェイです。

Knox

Livy

Livy は、REST インターフェイスまたは RPC クライアントライブラリを介して Spark とやり取りするサービスです。

Livy

Kafka Manager

Kafka Manager は既存ユーザーのみが利用できます。

Kafka Manager は Kafka 用のクラスター管理ツールで、Kafka クラスターを管理および監視するための Web インターフェイスを提供します。

Kafka Manager

自社開発

DLF-Auth

DLF-Auth は Data Lake Formation (DLF) が提供するサービスで、DLF が管理するデータベース、テーブル、列、および関数に対するきめ細かなアクセス制御を可能にし、データレイク上で統合されたデータ権限管理を実現します。

DLF-Auth

リソース管理

リソース管理レイヤーは、効率的なリソーススケジューリングと管理を提供し、タスクスケジューリングの自動化、インテリジェントなリソース割り当て、およびクラスターの伸縮自在なスケーリングを可能にすることで、ビッグデータ処理の効率性と信頼性を向上させます。

コンポーネントタイプ

コンポーネント名

説明

関連ドキュメント

オープンソース

YARN

YARN は、クラスターリソースをスケジュールおよび管理する Hadoop のリソース管理システムです。共有クラスターリソース上で、さまざまなタイプの分散コンピューティングタスクの実行をサポートします。

データストレージ

データストレージレイヤーは、構造化データおよび非構造化データの分散ストレージに対応しています。コンピューティングエンジンの要件に適したストレージ方式を選択できます。

コンポーネントタイプ

コンポーネント名

説明

関連ドキュメント

自社開発

OSS-HDFS

OSS-HDFS は、Hadoop 分散ファイルシステム (HDFS) インターフェイスと互換性のあるオブジェクトストレージソリューションであり、ビッグデータコンピューティングタスクが、標準の HDFS プロトコルを使用して Alibaba Cloud OSS 内のデータに直接アクセスできるようにします。

JindoCache

JindoCache は、データブロックをメモリにキャッシュすることで大規模なデータアクセスを高速化し、読み取りパフォーマンスを向上させ、基盤となるストレージシステムへの負荷を軽減する分散キャッシュソリューションです。

ESS

ESS は、既存ユーザーのみが利用できます。新規ユーザーは Celeborn コンポーネントを使用してください。

ESS は、Shuffle をベースとした拡張コンポーネントで、Shuffle の読み書きの問題を最適化します。

ESS

JindoData

JindoData は、既存ユーザーのみが利用できます。新規ユーザーは JindoCache コンポーネントを使用してください。

JindoData は、ビッグデータおよび AI エコシステム向けの自社開発データレイクストレージアクセラレーションスイートで、Alibaba Cloud および業界の主要なデータレイクストレージシステムに包括的なアクセス高速化ソリューションを提供します。

JindoData

SmartData

SmartData は、既存ユーザーのみが利用できます。新規ユーザーは OSS-HDFS コンポーネントを使用してください。

SmartData は、E-MapReduce (EMR) のコンピューティングエンジン向けに、統一されたストレージ最適化、キャッシュ最適化、コンピューティングの高速化、ストレージ機能拡張を提供する自社開発の EMR コンポーネントです。データアクセス、データガバナンス、データセキュリティを対象としています。

SmartData (既存ユーザーのみ)

オープンソース

Paimon

Paimon は、高スループットの書き込みと低レイテンシーのクエリに対応した、統合されたストリームおよびバッチレイクストレージフォーマットです。

Hudi

Hudi は、Hadoop ファイルシステム上でのデータの更新および削除、データ変更の消費に対応した、データレイクストレージフォーマットです。

Iceberg

Iceberg は、高性能な読み書き操作とメタデータ管理を提供するオープンデータレイクテーブルフォーマットです。

Delta Lake

Delta Lake は、オープンソースのデータストレージレイヤーです。原子性、一貫性、分離性、永続性 (ACID) トランザクション、スケーラブルなメタデータ処理、統合されたストリームおよびバッチ処理を提供します。

HDFS

Hadoop 分散ファイルシステム (HDFS) は、大規模データセットを保存するための分散ファイルシステムです。高いフォールトトレランスと高スループットが特徴で、複数のクラスターノードにデータを冗長的に保存します。

HBase

HBase は、Hadoop ファイルシステム上に構築された分散型の列指向オープンソースデータベースです。大規模データセットに対して、低レイテンシーのランダム読み書きアクセスと信頼性の高いストレージを提供します。

Celeborn

Celeborn は、中間データを処理することでビッグデータエンジンの安定性、柔軟性、パフォーマンスを向上させるサービスです。

Celeborn

HBASE-HDFS

HBASE-HDFS は HDFS です。コンピューティングとストレージの分離シナリオでは、ローカルの HBASE-HDFS を使用して先行書き込みログ (WAL) データを保存します。

HBASE-HDFS

Alluxio

Alluxio は、既存ユーザーのみが利用できます。

Alluxio は、クラウドベースのデータ分析と AI のためのオープンソースデータオーケストレーション技術で、複数の基盤となるストレージシステムに対応した統一データアクセスレイヤーを提供します。

Alluxio

データ統合

データ統合レイヤーは、バッチデータ転送、リアルタイムメッセージストリーム処理、および分散ログ収集を行い、データ転送の効率とログ収集の信頼性を向上させます。

コンポーネントタイプ

コンポーネント名

説明

関連ドキュメント

オープンソース

Flume

Flume は、大量のログデータストリームを収集、集約し、集中データストアに移動する、分散で信頼性が高く、高可用性を備えたシステムです。

Sqoop

Sqoop は、Hadoop とリレーショナルデータベース間でデータを効率的に転送するツールです。大規模なデータインポートおよびデータエクスポート操作をサポートします。

Kafka

Kafka は既存ユーザーのみが利用できます。

Kafka は、高スループット、低レイテンシー、永続性を備えたオープンソースの分散イベントストリーミングプラットフォームで、リアルタイムのデータストリーム処理やデータパイプラインアプリケーションに広く使用されています。

参考資料