DataWorks est une plateforme tout-en-un dédiée au développement et à la gouvernance du Big Data. Elle s'intègre aux moteurs de calcul pour exécuter les tâches de traitement des données et se connecte aux sources de données afin d'importer et d'exporter les informations vers ces moteurs. Cette rubrique répertorie les moteurs de calcul et les sources de données pris en charge par DataWorks.
Écosystème des moteurs de calcul
DataWorks n'exécute pas directement les tâches de calcul. Il utilise plutôt un mécanisme de liaison : liez les ressources de calcul pour enregistrer un moteur sur la plateforme, puis créez, orchestrez et gérez les tâches de traitement des données depuis une interface unifiée.
Les moteurs de calcul suivants sont pris en charge :
|
Moteur |
Cas d'utilisation typique |
|
Traitement par lots hors ligne à grande échelle |
|
|
Requêtes interactives en temps réel sur de grands ensembles de données |
|
|
Traitement de flux en temps réel |
|
|
Charges de travail Big Data open source (Hadoop, Spark, Hive) sur ECS |
|
|
Charges de travail Big Data open source basées sur des conteneurs |
|
|
Analytique en temps réel serverless avec StarRocks |
|
|
Tâches Spark serverless sans gestion de cluster |
|
|
Clusters Cloudera Hadoop sur site |
|
|
Entrepôt de données natif du cloud compatible avec MySQL |
|
|
Analytique via le traitement massivement parallèle (MPP) |
|
|
Charges de travail Spark intégrées à AnalyticDB |
|
|
Recherche en texte intégral et recherche intelligente |
|
|
OLAP haute performance et rapports en temps réel |
|
|
Stockage multimodèle pour l'IoT et les données de séries temporelles |
Écosystème des sources de données
Une source de données constitue le point d'entrée unifié dans DataWorks pour la connexion aux systèmes externes. Configurez les informations de connexion et les paramètres réseau une seule fois dans Management Center, puis réutilisez cette connexion dans Data Integration, Data Studio, Data Map, DataAnalysis et DataService Studio, sans avoir à répéter la configuration. En mode standard, vous pouvez également configurer l'isolation des sources de données afin de séparer physiquement les environnements de développement et de production.
Les sous-sections ci-dessous répertorient les sources de données prises en charge par chaque module DataWorks.
Aperçu de la prise en charge par module
Utilisez cette matrice pour vérifier quels modules prennent en charge une source de données spécifique. Consultez les sous-sections pertinentes ci-dessous pour accéder aux guides de configuration.
|
Source de données |
Data Integration |
Data Studio |
Data Map |
DataAnalysis |
DataService Studio |
|
MaxCompute |
✓ |
✓ |
✓ |
✓ |
|
|
Hologres |
✓ |
✓ |
✓ |
||
|
MySQL |
✓ |
✓ |
✓ |
✓ |
|
|
PostgreSQL |
✓ |
✓ |
✓ |
✓ |
|
|
Oracle |
✓ |
✓ |
✓ |
✓ |
|
|
SQL Server |
✓ |
✓ |
✓ |
✓ |
|
|
AnalyticDB for MySQL |
✓ |
✓ |
✓ |
✓ |
|
|
AnalyticDB for PostgreSQL |
✓ |
✓ |
✓ |
✓ |
|
|
StarRocks |
✓ |
✓ |
✓ |
✓ |
✓ |
|
ClickHouse |
✓ |
✓ |
✓ |
||
|
Doris |
✓ |
✓ |
✓ |
✓ |
|
|
PolarDB |
✓ |
✓ |
✓ |
||
|
SelectDB |
✓ |
✓ |
✓ |
||
|
OceanBase |
✓ |
✓ |
✓ |
||
|
Tablestore |
✓ |
✓ |
✓ |
||
|
Tablestore Stream |
✓ |
✓ |
|||
|
Lindorm |
✓ |
✓ |
|||
|
HBase |
✓ |
✓ |
|||
|
Kafka |
✓ |
||||
|
Object Storage Service (OSS) |
✓ |
||||
|
Simple Log Service (SLS) / LogHub |
✓ |
||||
|
DataHub |
✓ |
||||
|
HDFS |
✓ |
||||
|
Amazon S3 |
✓ |
||||
|
Azure Blob Storage |
✓ |
||||
|
BigQuery |
✓ |
||||
|
Amazon Redshift |
✓ |
✓ |
|||
|
Elasticsearch |
✓ |
||||
|
MongoDB |
✓ |
✓ |
|||
|
Redis |
✓ |
||||
|
Maxgraph |
✓ |
||||
|
EMR (Hive, Spark SQL, Impala, Presto, Trino) |
✓ |
||||
|
CDH (Hive, Spark SQL) |
✓ |
✓ |
|||
|
Data Lake Formation (DLF) |
✓ |
✓ |
|||
|
SAP HANA |
✓ |
✓ |
✓ |
||
|
DB2 |
✓ |
✓ |
✓ |
||
|
DM |
✓ |
✓ |
✓ |
||
|
DRDS (PolarDB-X 1,0) |
✓ |
✓ |
|||
|
PolarDB-X 2,0 |
✓ |
||||
|
MariaDB |
✓ |
✓ |
|||
|
KingbaseES |
✓ |
✓ |
|||
|
Vertica |
✓ |
✓ |
|||
|
GBase8a |
✓ |
✓ |
|||
|
Milvus |
✓ |
||||
|
TiDB |
✓ |
||||
|
FTP |
✓ |
||||
|
HttpFile |
✓ |
||||
|
RestAPI (HTTP) |
✓ |
||||
|
Salesforce |
✓ |
||||
|
Sensors Data |
✓ |
||||
|
Memcache (OCS) |
✓ |
||||
|
MetaQ |
✓ |
||||
|
OSS-HDFS |
✓ |
||||
|
TOS |
✓ |
||||
|
TSDB |
✓ |
||||
|
Graph Database (GDB) |
✓ |
||||
|
AnalyticDB for Spark |
✓ |
||||
|
E-MapReduce HIVE |
✓ |
Le tableau ci-dessus couvre les sources de données répertoriées dans cette rubrique. Pour obtenir la liste complète des sources de données et des méthodes de synchronisation prises en charge, consultez Sources de données et solutions de synchronisation prises en charge .
Data Integration
Data Integration est le module principal permettant de déplacer des données entre les systèmes. Configurez une source de données une seule fois dans Management Center, puis utilisez-la pour définir des tâches de synchronisation : choisissez une portée table unique ou base de données entière, ainsi qu'un mode hors ligne ou en temps réel. Les modèles de synchronisation pris en charge incluent la migration complète, la capture incrémentielle (CDC) et la synchronisation automatique complète et incrémentielle.
Pour obtenir des instructions de configuration, consultez Gestion des sources de données et Sources de données et solutions de synchronisation prises en charge.
Stockage cloud
Bases de données
Magasins de données Alibaba Cloud
Systèmes Big Data et open source
NoSQL, API et SaaS
Data Studio
Data Studio prend en charge l'orchestration hybride et la planification entre les moteurs de calcul et les bases de données. Outre les moteurs tels que MaxCompute, E-MapReduce (EMR) et AnalyticDB, vous pouvez connecter directement les bases de données en tant que nœuds dans votre pipeline de développement. Configurez les connexions aux sources de données et les politiques de planification une seule fois, puis appelez-les depuis les modules de développement et d'O&M.
Pour plus d'informations, consultez Nœuds de base de données.
|
Source de données MySQL |
Source de données PolarDB MySQL |
Source de données SAP HANA |
|
Source de données SQL Server |
Source de données PolarDB PostgreSQL |
Source de données Vertica |
|
Source de données Oracle |
Source de données Doris |
Source de données DM |
|
Source de données PostgreSQL |
Source de données MariaDB |
Source de données KingbaseES |
|
Source de données StarRocks |
Source de données SelectDB |
Source de données OceanBase |
|
Source de données DRDS |
Source de données Amazon Redshift |
Source de données DB2 |
|
Source de données GBase8a |
Data Map
Data Map utilise des connexions aux sources de données préconfigurées pour collecter automatiquement les métadonnées. Le collecteur intégré récupère les schémas de tables de base de données, les informations de partitionnement et la lignée des données inter-systèmes. Après la collecte, consultez les détails des tables et visualisez le graphe de lignée dans Data Map pour retracer l'origine et le flux de vos actifs de données.
Pour plus d'informations, consultez Acquisition de métadonnées.
|
Source de données AnalyticDB for PostgreSQL |
Source de données MySQL |
Source de données Hologres |
|
Source de données AnalyticDB for MySQL |
Source de données PostgreSQL |
Source de données Lindorm |
|
Source de données AnalyticDB for Spark |
Source de données SQL Server |
Source de données MaxCompute |
|
Source de données CDH Hive |
Source de données Oracle |
Source de données StarRocks |
|
Data Lake Formation (DLF) |
Source de données Tablestore (OTS) |
Source de données ClickHouse |
|
Source de données E-MapReduce HIVE |
Source de données Paimon Catalog |
DataAnalysis
DataAnalysis vous permet d'interroger, d'analyser, de transformer et de visualiser les données de manière interactive en utilisant les moteurs et les sources de données enregistrés dans DataWorks.
Pour plus d'informations, consultez Requête et analyse SQL.
|
Source de données MaxCompute |
Source de données Hologres |
Source de données EMR Hive |
|
Source de données EMR Spark SQL |
Source de données EMR Impala |
Source de données EMR Presto |
|
Source de données EMR Trino |
Source de données CDH Hive |
Source de données CDH Spark SQL |
|
Source de données StarRocks |
Source de données ClickHouse |
Source de données SelectDB |
|
Source de données Doris |
Source de données AnalyticDB for MySQL 3.0 |
Source de données AnalyticDB for PostgreSQL |
|
Source de données Tablestore (OTS) |
Source de données MySQL |
Source de données PostgreSQL |
|
Source de données Oracle |
Source de données SQL Server |
DataService Studio
DataService Studio génère des API à partir des sources de données, exposant les données sous forme de points de terminaison de service standard pour le partage entre les équipes et les applications.
Pour plus d'informations, consultez Générer une API.