DataWorks は、ビッグデータの開発とガバナンスのためのワンストッププラットフォームです。コンピュートエンジンと統合してデータ処理タスクを実行し、データソースに接続してこれらのエンジンとの間でデータをやり取りします。このトピックでは、DataWorks がサポートするコンピュートエンジンとデータソースをリストアップします。
コンピュートエンジンのエコシステム
DataWorks は、コンピューティングタスクを直接実行しません。代わりに、エンジンバインディングメカニズムを使用します。コンピューティングリソースをバインドしてプラットフォームにエンジンを登録し、統一インターフェイスからデータ処理タスクの作成、オーケストレーション、管理を行います。
以下のコンピュートエンジンがサポートされています:
エンジン | 典型的なユースケース |
大規模なオフラインバッチ処理 | |
大規模データセットに対するリアルタイムのインタラクティブなクエリ | |
リアルタイムストリーム処理 | |
ECS 上でのオープンソースのビッグデータワークロード (Hadoop、Spark、Hive) | |
コンテナベースのオープンソースビッグデータワークロード | |
StarRocks を使用したサーバーレスのリアルタイム分析 | |
クラスター管理不要のサーバーレス Spark ジョブ | |
オンプレミスの Cloudera Hadoop クラスター | |
MySQL と互換性のあるクラウドネイティブなデータウェアハウジング | |
超並列処理 (MPP) 分析 | |
AnalyticDB と統合された Spark ワークロード | |
全文検索とインテリジェント検索 | |
高性能 OLAP とリアルタイムレポート | |
IoT および時系列データ向けのマルチモデルストレージ |
データソースのエコシステム
データソースは、DataWorks において外部システムに接続するための統一エントリポイントです。管理センターで接続情報とネットワーク設定を一度構成すれば、Data Integration、Data Studio、データマップ、データ分析、DataService Studio の間で接続を再利用でき、構成を繰り返す必要はありません。標準モードでは、データソースの分離を構成して、開発環境と本番環境を物理的に分離することもできます。
以下のサブセクションでは、各 DataWorks モジュールでサポートされているデータソースをリストアップします。
モジュールサポートの概要
このマトリックスを使用して、特定のデータソースをどのモジュールがサポートしているかを確認してください。設定ガイドへのリンクについては、以下の関連サブセクションをご参照ください。
データソース | Data Integration | Data Studio | データマップ | データ分析 | DataService Studio |
MaxCompute | ✓ | ✓ | ✓ | ✓ | |
Hologres | ✓ | ✓ | ✓ | ||
MySQL | ✓ | ✓ | ✓ | ✓ | |
PostgreSQL | ✓ | ✓ | ✓ | ✓ | |
Oracle | ✓ | ✓ | ✓ | ✓ | |
SQL Server | ✓ | ✓ | ✓ | ✓ | |
AnalyticDB for MySQL | ✓ | ✓ | ✓ | ✓ | |
AnalyticDB for PostgreSQL | ✓ | ✓ | ✓ | ✓ | |
StarRocks | ✓ | ✓ | ✓ | ✓ | ✓ |
ClickHouse | ✓ | ✓ | ✓ | ||
Doris | ✓ | ✓ | ✓ | ✓ | |
PolarDB | ✓ | ✓ | ✓ | ||
SelectDB | ✓ | ✓ | ✓ | ||
OceanBase | ✓ | ✓ | ✓ | ||
Tablestore | ✓ | ✓ | ✓ | ||
Tablestore Stream | ✓ | ✓ | |||
Lindorm | ✓ | ✓ | |||
HBase | ✓ | ✓ | |||
Kafka | ✓ | ||||
Object Storage Service (OSS) | ✓ | ||||
Simple Log Service (SLS) / LogHub | ✓ | ||||
DataHub | ✓ | ||||
HDFS | ✓ | ||||
Amazon S3 | ✓ | ||||
Azure Blob Storage | ✓ | ||||
BigQuery | ✓ | ||||
Amazon Redshift | ✓ | ✓ | |||
Elasticsearch | ✓ | ||||
MongoDB | ✓ | ✓ | |||
Redis | ✓ | ||||
Maxgraph | ✓ | ||||
EMR (Hive、Spark SQL、Impala、Presto、Trino) | ✓ | ||||
CDH (Hive、Spark SQL) | ✓ | ✓ | |||
Data Lake Formation (DLF) | ✓ | ✓ | |||
SAP HANA | ✓ | ✓ | ✓ | ||
DB2 | ✓ | ✓ | ✓ | ||
DM | ✓ | ✓ | ✓ | ||
DRDS (PolarDB-X 1.0) | ✓ | ✓ | |||
PolarDB-X 2.0 | ✓ | ||||
MariaDB | ✓ | ✓ | |||
KingbaseES | ✓ | ✓ | |||
Vertica | ✓ | ✓ | |||
GBase8a | ✓ | ✓ | |||
Milvus | ✓ | ||||
TiDB | ✓ | ||||
FTP | ✓ | ||||
HttpFile | ✓ | ||||
RestAPI (HTTP) | ✓ | ||||
Salesforce | ✓ | ||||
Sensors Data | ✓ | ||||
Memcache (OCS) | ✓ | ||||
MetaQ | ✓ | ||||
OSS-HDFS | ✓ | ||||
TOS | ✓ | ||||
TSDB | ✓ | ||||
Graph Database (GDB) | ✓ | ||||
AnalyticDB for Spark | ✓ | ||||
E-MapReduce HIVE | ✓ |
上記の表は、このトピックでリストされているデータソースを対象としています。サポートされているデータソースと同期メソッドの完全なリストについては、「サポートされているデータソースと同期ソリューション」をご参照ください。
Data Integration
Data Integration は、システム間でデータを移動するための主要なモジュールです。管理センターでデータソースを一度構成すれば、それを使用して同期タスクを設定できます。単一テーブルまたはデータベース全体の範囲、およびオフラインモードまたはリアルタイムモードを選択します。サポートされている同期パターンには、完全移行、増分キャプチャ (CDC)、および完全同期と増分同期の自動化が含まれます。
設定手順については、「データソース管理」および「サポートされているデータソースと同期ソリューション」をご参照ください。
クラウドストレージ
データベース
Alibaba Cloud データストア
ビッグデータおよびオープンソースシステム
NoSQL、API、SaaS
Data Studio
Data Studio は、コンピュートエンジンとデータベースにまたがるハイブリッドなオーケストレーションとスケジューリングをサポートします。MaxCompute、EMR、AnalyticDB などのエンジンに加えて、データベースを開発パイプラインのノードとして直接接続できます。データソース接続とスケジューリングポリシーを一度構成すれば、開発モジュールと運用保守モジュールからそれらを呼び出すことができます。
詳細については、「データベースノード」をご参照ください。
MySQL データソース | PolarDB MySQL データソース | SAP HANA データソース |
SQL Server データソース | PolarDB PostgreSQL データソース | Vertica データソース |
Oracle データソース | Doris データソース | DM データソース |
PostgreSQL データソース | MariaDB データソース | KingbaseES データソース |
StarRocks データソース | SelectDB データソース | OceanBase データソース |
DRDS データソース | Amazon Redshift データソース | DB2 データソース |
GBase8a データソース |
データマップ
データマップは、事前に構成されたデータソース接続を使用してメタデータを自動的に収集します。組み込みのコレクターは、データベースのテーブルスキーマ、パーティション情報、およびシステム間のデータリネージを取得します。収集後、データマップでテーブルの詳細を表示し、リネージグラフを視覚化して、データ資産の起源とフローをトレースできます。
詳細については、「メタデータの取得」をご参照ください。
AnalyticDB for PostgreSQL データソース | MySQL データソース | Hologres データソース |
AnalyticDB for MySQL データソース | PostgreSQL データソース | Lindorm データソース |
AnalyticDB for Spark データソース | SQL Server データソース | MaxCompute データソース |
CDH Hive データソース | Oracle データソース | StarRocks データソース |
Data Lake Formation (DLF) | Tablestore (OTS) データソース | ClickHouse データソース |
E-MapReduce HIVE データソース | Paimon Catalog データソース |
データ分析
データ分析では、DataWorks に登録されているエンジンとデータソースを使用して、データのクエリ、分析、変換、視覚化をインタラクティブに行うことができます。
詳細については、「SQL クエリと分析」をご参照ください。
MaxCompute データソース | Hologres データソース | EMR Hive データソース |
EMR Spark SQL データソース | EMR Impala データソース | EMR Presto データソース |
EMR Trino データソース | CDH Hive データソース | CDH Spark SQL データソース |
StarRocks データソース | ClickHouse データソース | SelectDB データソース |
Doris データソース | AnalyticDB for MySQL 3.0 データソース | AnalyticDB for PostgreSQL データソース |
Tablestore (OTS) データソース | MySQL データソース | PostgreSQL データソース |
Oracle データソース | SQL Server データソース |
DataService Studio
DataService Studio は、データソースから API を生成し、チームやアプリケーション間で共有するための標準的なサービスエンドポイントとしてデータを公開します。
詳細については、「API の生成」をご参照ください。