E-MapReduce (EMR) は、データ開発、コンピューティングエンジン、データサービス、リソース管理、データストレージ、およびデータ統合に対応した、オープンソースおよび自社開発のコンポーネントを提供します。ニーズに基づいてコンポーネントを選択し、構成できます。
クラスターの作成時に使用したいコンポーネントが利用できない場合、またはオープンソースコンポーネントが既存のユーザーのみに提供されている場合は、ご自身でインストールおよび管理できます。
EMR は、オープンソースコンポーネント、自社開発コンポーネント、統合された Alibaba Cloud 製品、およびクラスター管理で構成されています。ビッグデータコンポーネントの一覧とそのユースケースについては、サービスアーキテクチャ図をご参照ください。
データ開発
データ開発レイヤーは、データ収集、データクレンジング、モデリング、分析、タスクスケジューリングを行うためのビジュアルツールとコード管理を提供します。これにより、企業はデータ資産を効率的に管理、活用できます。
EMR でのデータ開発には、Alibaba Cloud の DataWorksを使用できます。詳細は次のとおりです:
|
製品名 |
説明 |
関連ドキュメント |
|
DataWorks |
DataWorks は、エンドツーエンドのデータ統合、開発、ガバナンス、品質管理、運用保守、セキュリティコントロールを提供します。複雑なデータ統合とガバナンスが必要なシナリオに適しています。 |
オープンソースのデータ開発コンポーネントを使用するには、Hue と Superset を選択できます:
|
コンポーネントタイプ |
コンポーネント名 |
説明 |
共通ドキュメント |
|
オープンソース |
Hue |
Hue は既存のユーザーのみが利用できます。 Hue は、Apache Hadoop エコシステムを操作するためのオープンソースの Web インターフェイスです。 |
|
|
Superset |
Superset は既存のユーザーのみが利用できます。 Superset は、豊富な可視化機能とダッシュボード機能を提供するデータ可視化ツールです。 |
コンピューティング エンジン
E-MapReduce (EMR) は、バッチ処理、インタラクティブ分析、ストリーム処理、機械学習向けの主要なコンピューティングエンジンをサポートしています。これらのエンジンは、さまざまなビッグデータシナリオの要件に合わせて、データ構造とロジックを変換します。
|
コンポーネントタイプ |
コンポーネント名 |
説明 |
関連ドキュメント |
|
オープンソース |
Spark |
Spark は、高速で汎用的なビッグデータ処理エンジンで、インメモリコンピューティングを提供し、バッチ処理、リアルタイム処理、機械学習、グラフコンピューティングをサポートします。 |
|
|
Hive |
Hive は Hadoop ベースのデータウェアハウスツールで、SQL に似たクエリ言語である HiveQL を提供し、Hadoop 上で大規模なデータを格納、クエリ、分析します。 |
||
|
StarRocks |
StarRocks は、次世代の高速な超並列処理 (MPP) データベースで、オンライン分析処理 (OLAP) の多次元分析、高同時実行クエリ、リアルタイム分析をサポートします。 |
||
|
Doris |
Doris は高性能なリアルタイム分析データベースで、レポート分析、アドホッククエリ、データレイクのフェデレーションクエリの高速化に適しています。 |
||
|
ClickHouse |
ClickHouse はオープンソースの列指向データベース管理システムで、効率的なオンライン分析処理 (OLAP) と大規模データセットに対する高速なクエリ向けに設計されています。 |
||
|
Trino |
Trino (旧 PrestoSQL) は、オープンソースの分散 SQL クエリエンジンで、インタラクティブな分析クエリに適しています。 |
||
|
Flink |
Flink はストリーム処理エンジンで、大規模なリアルタイムデータストリーム処理をサポートします。 |
||
|
Presto |
Presto (PrestoDB とも呼ばれる) は、柔軟でスケーラブルな分散 SQL クエリエンジンで、インタラクティブな分析クエリに適しています。 |
||
|
Tez |
Apache Tez は、効率的で柔軟な有向非巡回グラフ (DAG) 実行モデルを提供する分散型ビッグデータ処理フレームワークです。主に MapReduce の代替として機能し、クエリとバッチ処理のパフォーマンスを最適化します。 |
||
|
Phoenix |
Phoenix は HBase 上に構築された SQL の中間レイヤーで、標準の SQL 構文を使用して HBase に格納されたデータをクエリおよび管理できます。 |
||
|
Impala |
Impala は既存ユーザーのみが利用できます。 Impala は、Apache Hadoop に格納されたデータ向けの、高性能で低レイテンシーの SQL クエリを提供します。 |
||
|
Kudu |
Kudu は既存ユーザーのみが利用できます。 Kudu は、分散型でスケーラブルな列指向のストレージマネージャーで、低レイテンシーのランダム読み取り/書き込み操作と効率的なデータ分析を提供します。 |
||
|
Druid |
Druid は既存ユーザーのみが利用できます。 Druid は、分散型のインメモリリアルタイム分析システムで、大規模なデータセットに対する高速でインタラクティブなクエリを実現します。 |
データサービス
データサービスレイヤーは、データ暗号化、アクセス制御、データクエリ、データアクセス、API 機能を提供することで、ビッグデータ環境におけるデータセキュリティ、運用パフォーマンス、分析効率を向上させます。
|
コンポーネントタイプ |
コンポーネント名 |
説明 |
関連ドキュメント |
|
オープンソース |
Ranger |
Ranger は、Hadoop エコシステムにおける権限管理と監査を行う、一元化されたセキュリティ管理フレームワークです。 |
|
|
Kerberos |
Kerberos は、対称キー技術を使用して他のサービスに身元確認を提供し、シングルサインオン (SSO) をサポートする ID 認証プロトコルです。 |
||
|
OpenLDAP |
OpenLDAP は、ユーザー情報とリソース情報を管理および格納するための LDAP プロトコルのオープンソース実装です。ユーザー管理と ID 認証機能を提供します。 |
||
|
Kyuubi |
Kyuubi は、データレイククエリエンジンに SQL やその他のクエリサービスを提供することで、データ分析とクエリ処理を簡素化する、分散マルチテナント SQL ゲートウェイです。 |
||
|
ZooKeeper |
ZooKeeper は、設定、同期、命名など、分散アプリケーションにおける主要なタスクを管理するための分散協調サービスです。一貫性、高性能、信頼性の高いクラスター管理ソリューションを提供します。 |
||
|
Knox |
Knox は、Hadoop および関連コンポーネントへのセキュアなアクセスを簡素化すると同時に、統合 ID 認証とアクセス制御を提供する REST API ゲートウェイです。 |
||
|
Livy |
Livy は、REST インターフェイスまたは RPC クライアントライブラリを介して Spark とやり取りするサービスです。 |
||
|
Kafka Manager |
Kafka Manager は既存ユーザーのみが利用できます。 Kafka Manager は Kafka 用のクラスター管理ツールで、Kafka クラスターを管理および監視するための Web インターフェイスを提供します。 |
||
|
自社開発 |
DLF-Auth |
DLF-Auth は Data Lake Formation (DLF) が提供するサービスで、DLF が管理するデータベース、テーブル、列、および関数に対するきめ細かなアクセス制御を可能にし、データレイク上で統合されたデータ権限管理を実現します。 |
リソース管理
リソース管理レイヤーは、効率的なリソーススケジューリングと管理を提供し、タスクスケジューリングの自動化、インテリジェントなリソース割り当て、およびクラスターの伸縮自在なスケーリングを可能にすることで、ビッグデータ処理の効率性と信頼性を向上させます。
|
コンポーネントタイプ |
コンポーネント名 |
説明 |
関連ドキュメント |
|
オープンソース |
YARN |
YARN は、クラスターリソースをスケジュールおよび管理する Hadoop のリソース管理システムです。共有クラスターリソース上で、さまざまなタイプの分散コンピューティングタスクの実行をサポートします。 |
データストレージ
データストレージレイヤーは、構造化データおよび非構造化データの分散ストレージに対応しています。コンピューティングエンジンの要件に適したストレージ方式を選択できます。
|
コンポーネントタイプ |
コンポーネント名 |
説明 |
関連ドキュメント |
|
自社開発 |
OSS-HDFS |
OSS-HDFS は、Hadoop 分散ファイルシステム (HDFS) インターフェイスと互換性のあるオブジェクトストレージソリューションであり、ビッグデータコンピューティングタスクが、標準の HDFS プロトコルを使用して Alibaba Cloud OSS 内のデータに直接アクセスできるようにします。 |
|
|
JindoCache |
JindoCache は、データブロックをメモリにキャッシュすることで大規模なデータアクセスを高速化し、読み取りパフォーマンスを向上させ、基盤となるストレージシステムへの負荷を軽減する分散キャッシュソリューションです。 |
||
|
ESS |
ESS は、既存ユーザーのみが利用できます。新規ユーザーは Celeborn コンポーネントを使用してください。 ESS は、Shuffle をベースとした拡張コンポーネントで、Shuffle の読み書きの問題を最適化します。 |
||
|
JindoData |
JindoData は、既存ユーザーのみが利用できます。新規ユーザーは JindoCache コンポーネントを使用してください。 JindoData は、ビッグデータおよび AI エコシステム向けの自社開発データレイクストレージアクセラレーションスイートで、Alibaba Cloud および業界の主要なデータレイクストレージシステムに包括的なアクセス高速化ソリューションを提供します。 |
||
|
SmartData |
SmartData は、既存ユーザーのみが利用できます。新規ユーザーは OSS-HDFS コンポーネントを使用してください。 SmartData は、E-MapReduce (EMR) のコンピューティングエンジン向けに、統一されたストレージ最適化、キャッシュ最適化、コンピューティングの高速化、ストレージ機能拡張を提供する自社開発の EMR コンポーネントです。データアクセス、データガバナンス、データセキュリティを対象としています。 |
||
|
オープンソース |
Paimon |
Paimon は、高スループットの書き込みと低レイテンシーのクエリに対応した、統合されたストリームおよびバッチレイクストレージフォーマットです。 |
|
|
Hudi |
Hudi は、Hadoop ファイルシステム上でのデータの更新および削除、データ変更の消費に対応した、データレイクストレージフォーマットです。 |
||
|
Iceberg |
Iceberg は、高性能な読み書き操作とメタデータ管理を提供するオープンデータレイクテーブルフォーマットです。 |
||
|
Delta Lake |
Delta Lake は、オープンソースのデータストレージレイヤーです。原子性、一貫性、分離性、永続性 (ACID) トランザクション、スケーラブルなメタデータ処理、統合されたストリームおよびバッチ処理を提供します。 |
||
|
HDFS |
Hadoop 分散ファイルシステム (HDFS) は、大規模データセットを保存するための分散ファイルシステムです。高いフォールトトレランスと高スループットが特徴で、複数のクラスターノードにデータを冗長的に保存します。 |
||
|
HBase |
HBase は、Hadoop ファイルシステム上に構築された分散型の列指向オープンソースデータベースです。大規模データセットに対して、低レイテンシーのランダム読み書きアクセスと信頼性の高いストレージを提供します。 |
||
|
Celeborn |
Celeborn は、中間データを処理することでビッグデータエンジンの安定性、柔軟性、パフォーマンスを向上させるサービスです。 |
||
|
HBASE-HDFS |
HBASE-HDFS は HDFS です。コンピューティングとストレージの分離シナリオでは、ローカルの HBASE-HDFS を使用して先行書き込みログ (WAL) データを保存します。 |
||
|
Alluxio |
Alluxio は、既存ユーザーのみが利用できます。 Alluxio は、クラウドベースのデータ分析と AI のためのオープンソースデータオーケストレーション技術で、複数の基盤となるストレージシステムに対応した統一データアクセスレイヤーを提供します。 |
データ統合
データ統合レイヤーは、バッチデータ転送、リアルタイムメッセージストリーム処理、および分散ログ収集を行い、データ転送の効率とログ収集の信頼性を向上させます。
|
コンポーネントタイプ |
コンポーネント名 |
説明 |
関連ドキュメント |
|
オープンソース |
Flume |
Flume は、大量のログデータストリームを収集、集約し、集中データストアに移動する、分散で信頼性が高く、高可用性を備えたシステムです。 |
|
|
Sqoop |
Sqoop は、Hadoop とリレーショナルデータベース間でデータを効率的に転送するツールです。大規模なデータインポートおよびデータエクスポート操作をサポートします。 |
||
|
Kafka |
Kafka は既存ユーザーのみが利用できます。 Kafka は、高スループット、低レイテンシー、永続性を備えたオープンソースの分散イベントストリーミングプラットフォームで、リアルタイムのデータストリーム処理やデータパイプラインアプリケーションに広く使用されています。 |
参考資料
-
EMR の全体的なアーキテクチャについては、「サービスアーキテクチャ」をご参照ください。
-
各 EMR リリースがサポートするコンポーネントとそのバージョンについては、「各バージョンでサポートされているコンポーネント」をご参照ください。
-
EMR がサポートするシナリオと各シナリオで使用するコンポーネントについては、「ビッグデータのユースケース」をご参照ください。