MaxCompute met à votre disposition une gamme d'outils pour charger et télécharger des données. La plupart de ces solutions sont open source sur GitHub et maintenues par la communauté. Sélectionnez l'outil adapté à votre cas d'usage.
Services Alibaba Cloud
-
Client MaxCompute (via Tunnel)
Le client s'appuie sur le SDK Tunnel et intègre la commande tunnel pour charger et télécharger des données.
Pour l'installation et les bases de l'utilisation, consultez la rubrique Client MaxCompute.
RemarqueCe projet est open source. Consultez le code sur aliyun-odps-console.
-
DataWorks Data Integration (via Tunnel)
Data Integration est une plateforme stable, efficace et élastique dédiée à la synchronisation des données. Elle propose des services de synchronisation complète hors ligne et incrémentielle en temps réel, ainsi que des fonctionnalités d'intégration et d'échange pour divers systèmes hétérogènes de stockage de données sur Alibaba Cloud.
Les sources de données prises en charge incluent MaxCompute, RDS (MySQL, SQL Server et PostgreSQL), Oracle, FTP, ADS (AnalyticDB), OSS, Memcache et DRDS.
-
Data Transmission Service (DTS) (via Tunnel)
Le Data Transmission Service (DTS) est un service Alibaba Cloud qui assure la migration des données, l'abonnement aux données en temps réel et la synchronisation des données en temps réel entre diverses sources, telles que les bases de données relationnelles (RDBMS), NoSQL et OLAP.
DTS prend en charge la synchronisation des données en temps réel depuis les instances RDS et MySQL vers les tables MaxCompute, mais ne permet pas de synchroniser les données provenant d'autres types de sources vers MaxCompute.
-
MaxCompute Migration Service (MMS)
Le MaxCompute Migration Service (MMS) est un service de migration vers le cloud destiné aux migrations de données à grande échelle et à l'échelle de la plateforme. MMS s'intègre au moteur MaxCompute Spark pour migrer automatiquement les schémas de table et les données. Il prend en charge la migration de volumes importants de données vers MaxCompute depuis diverses sources, notamment BigQuery, Hive, Databricks, Redshift et d'autres instances MaxCompute. Pour plus d'informations, consultez la rubrique MaxCompute Migration Service (MMS)
Outils open source
-
Sqoop (via Tunnel)
S'appuyant sur l'édition communautaire de Sqoop 1.4.6, cet outil a été enrichi pour prendre en charge MaxCompute. Utilisez-le pour importer des données dans MaxCompute depuis des sources telles que des bases de données relationnelles (comme MySQL), HDFS ou Hive, ou pour exporter des données depuis MaxCompute vers des bases de données relationnelles.
RemarqueCe projet est open source. Consultez le code sur aliyun-maxcompute-data-collectors.
-
Kettle (via Tunnel)
Kettle est un outil ETL open source développé en Java. Il fonctionne sous Windows, Unix et Linux et offre une interface graphique permettant de concevoir des flux ETL par glisser-déposer.
RemarqueCe projet est open source. Consultez le code sur aliyun-maxcompute-data-collectors.
-
Flume (via DataHub)
Apache Flume est un service distribué, fiable et disponible conçu pour collecter, agréger et déplacer efficacement de grands volumes de journaux depuis diverses sources vers un magasin de données centralisé. Il prend en charge plusieurs plug-ins Source et Sink.
Le plug-in DataHub Sink pour Apache Flume transfère les journaux vers DataHub en temps réel et archive les données dans des tables MaxCompute.
RemarqueCe projet est open source. Consultez le code sur aliyun-maxcompute-data-collectors.
-
Fluentd (via DataHub)
Fluentd est un logiciel open source dédié à la collecte de journaux depuis diverses sources, notamment les journaux d'application, les journaux système et les journaux d'accès. Il prend en charge des plug-ins qui permettent de filtrer les données de journalisation et de les stocker dans différentes destinations, telles que MySQL, Oracle, MongoDB, Hadoop et Treasure Data.
Le plug-in DataHub pour Fluentd transfère les journaux vers DataHub en temps réel et archive les données dans des tables MaxCompute.
-
Logstash (via DataHub)
Logstash est un framework open source de collecte et de traitement des journaux. Le plug-in logstash-output-datahub importe les données dans DataHub. Grâce à une configuration simple, vous pouvez collecter et transmettre les données, puis exploiter MaxCompute et StreamCompute pour bâtir une solution d'analytique en continu de bout en bout.
Le plug-in DataHub pour Logstash transfère les journaux vers DataHub en temps réel et archive les données dans des tables MaxCompute.
-
OGG (via DataHub)
Le plug-in DataHub pour OGG permet la synchronisation incrémentielle en temps réel des données depuis une base de données Oracle vers DataHub, lesquelles sont ensuite archivées dans des tables MaxCompute.
RemarqueCe projet est open source. Consultez le code sur aliyun-maxcompute-data-collectors.