Tous les produits
Search
Centre de documentation

MaxCompute:Planifier des tâches MaxCompute avec Kettle

Dernière mise à jour :Aug 21, 2026

MaxCompute vous permet de planifier des tâches à l'aide de l'outil ETL Kettle. Grâce à son interface glisser-déposer, vous pouvez définir des flux de traitement des données et vous connecter à un projet MaxCompute via le pilote JDBC.

Informations générales

Kettle est un outil ETL open source écrit en Java. Il fonctionne sous Windows, Unix et Linux et propose une interface graphique pour concevoir des pipelines de données. Kettle prend en charge une large gamme de sources de données, notamment des bases de données telles qu'Oracle, MySQL et DB2, ainsi que des systèmes Big Data comme HDFS, HBase, Cassandra et MongoDB.

Créez une tâche dans Kettle pour vous connecter à un projet MaxCompute, puis planifiez cette tâche dans le cadre d'un flux de travail ETL.

Prérequis

Avant de commencer, assurez-vous de disposer des éléments suivants :

  • Vous avez créé un projet MaxCompute.

    Pour plus d'informations, consultez la rubrique Créer un projet MaxCompute.

  • Vous disposez d'un AccessKey ID et d'un AccessKey secret disposant des autorisations nécessaires pour accéder au projet MaxCompute.

    Accédez à la page AccessKey Management pour obtenir vos identifiants.

  • Vous avez téléchargé le pilote JDBC MaxCompute (version 3.2.8 ou ultérieure). Veillez à télécharger le package contenant toutes les dépendances, dont le nom de fichier inclut jar-with-dependencies.

    Cette rubrique utilise la version 3.2.9 du pilote JDBC MaxCompute à titre d'exemple.

  • Vous avez téléchargé le package d'installation de Kettle et l'avez extrait dans un répertoire local.

    Cette rubrique utilise Kettle 8.2.0.0-342 à titre d'exemple.

Procédure

  1. Étape 1 : Placer le pilote JDBC MaxCompute

    Placez le pilote JDBC MaxCompute dans le répertoire des pilotes de Kettle.

  2. Étape 2 : Se connecter à un projet MaxCompute

    Connectez Kettle à votre projet MaxCompute.

  3. Étape 3 : Créer un flux de planification

    Créez un flux de planification des tâches dans l'interface Spoon.

  4. Étape 4 : Exécuter le flux de planification

    Exécutez le flux de planification des tâches.

  5. Étape 5 : Consulter les résultats de la tâche

    Consultez les résultats de la tâche.

Étape 1 : Placer le pilote JDBC MaxCompute

Placez le fichier JAR du pilote JDBC MaxCompute, par exemple odps-jdbc-3.2.9-jar-with-dependencies.jar, dans le répertoire data-integration/lib de votre installation Kettle.

Étape 2 : Se connecter à un projet MaxCompute

  1. Dans le répertoire data-integration de votre installation Kettle, double-cliquez sur Spoon.bat (sous Windows) ou Spoon (sous macOS) pour lancer Spoon.

  2. Dans la barre de menus supérieure, sélectionnez File > New > Job pour créer une tâche Kettle destinée au flux de planification.

  3. Sous l'onglet View, cliquez avec le bouton droit sur Database connections dans l'arborescence de navigation, puis sélectionnez Create.

  4. Dans la boîte de dialogue Database Connection, sous l'onglet General, configurez les paramètres comme indiqué dans le tableau suivant.

    Parameter

    Description

    Network Connection Name

    Nom personnalisé de la connexion à la base de données. Par exemple, MaxCompute.

    Connection type

    Sélectionnez Generic database.

    Connection Method

    Sélectionnez Native (JDBC).

    Dialect

    Sélectionnez Hadoop Hive 2.

    Custom Connection URL

    URL de connexion au projet MaxCompute. Le format est jdbc:odps:<maxcompute_endpoint>?project=<MaxCompute_project_name>. Supprimez les symboles <> lors de la configuration de l'URL. Paramètres :

    • <MaxCompute_endpoint> : Obligatoire. Endpoint de la région où se trouve votre projet MaxCompute.

      Pour obtenir la liste des endpoints, consultez la rubrique Endpoints.

    • <MaxCompute_project_name> : Obligatoire. Nom du projet MaxCompute cible.

      Il s'agit du nom de votre projet MaxCompute, et non d'un espace de travail. Connectez-vous à la console MaxCompute, changez de région dans le coin supérieur gauche et repérez le nom du projet sur la page Projects.

    Custom Driver Class Name

    Classe du pilote JDBC. Définissez-la sur com.aliyun.odps.jdbc.OdpsDriver.

    User Name

    Votre AccessKey ID pour le projet MaxCompute.

    Accédez à la page AccessKey Management pour obtenir l'AccessKey ID.

    Password

    Votre AccessKey secret.

  5. Cliquez sur Test. Une fois la connexion établie avec succès, cliquez sur OK dans la boîte de dialogue de confirmation. Ensuite, cliquez sur Confirm dans la boîte de dialogue Confirm pour enregistrer la connexion.

Étape 3 : Créer un flux de planification

Sous l'onglet Design de Spoon, construisez un flux de planification des tâches en créant et en reliant les objets principaux.

L'exemple suivant décrit un processus ETL utilisant la commande LOAD pour charger des données depuis OSS vers une table interne MaxCompute. Pour les données d'exemple, consultez la section LOAD. Les tâches de ce processus se décomposent selon les types d'objets principaux suivants.

调度流程

  1. Dans l'interface Spoon, cliquez sur l'onglet Design.

  2. Sur la base de la décomposition des objets présentée ci-dessus, faites glisser les objets principaux depuis le volet de navigation de gauche vers le canevas de la tâche à droite. Reliez les objets principaux selon la structure suivante.

    Pour connecter les objets principaux, sélectionnez un objet source, maintenez la touche Maj enfoncée et cliquez sur l'objet de destination pour créer un lien de connexion.

    Sélectionnez l'onglet Core Objects dans le panneau de gauche, développez les catégories General et autres pour accéder aux composants. La structure de connexion est la suivante : StartCreate tableLoad from OSSProcessingSuccess (chemin de réussite) ; définissez également les chemins d'échec depuis Create table, Load from OSS, Processing vers le nœud Abort job pour la gestion des erreurs.

  3. Cliquez avec le bouton droit sur un objet principal basé sur un script et sélectionnez Edit job entry. Dans la boîte de dialogue SQL, configurez les paramètres répertoriés dans le tableau suivant, puis cliquez sur OK. Répétez cette opération pour configurer tous les objets principaux basés sur un script.

    Parameter

    Description

    Job entry name

    Nom de l'entrée de tâche. Par exemple, Create table, Load from OSS ou Processing.

    Connection

    Nom de la connexion à la base de données à utiliser. Il s'agit de la connexion créée à l'étape 2. Par exemple, MaxCompute.

    Send SQL as single statement?

    Désactivez cette option.

    SQL Script

    Script SQL de l'entrée de tâche. Les scripts SQL des objets principaux basés sur un script dans cet exemple sont les suivants :

    • Create table

      CREATE TABLE ambulance_data_csv_load (
      vehicleId INT,
      recordId INT,
      patientId INT,
      calls INT,
      locationLatitute DOUBLE,
      locationLongtitue DOUBLE,
      recordTime STRING,
      direction STRING);
    • Load from OSS

      LOAD OVERWRITE TABLE ambulance_data_csv_load 
      FROM 
      LOCATION 'oss://oss-cn-hangzhou-internal.aliyuncs.com/mc-test/data_location/' 
      STORED BY 'com.aliyun.odps.CsvStorageHandler' 
      WITH serdeproperties (
      'odps.properties.rolearn'='acs:ram::xxxxx:role/aliyunodpsdefaultrole',   -- The ARN of AliyunODPSDefaultRole. You can obtain it from the RAM console.
      'odps.text.option.delimiter'=','
      );
    • Processing

      INSERT OVERWRITE TABLE ambulance_data_csv SELECT * FROM ambulance_data_csv_load;

Étape 4 : Exécuter le flux de planification

  1. Dans l'interface du flux de planification des tâches, cliquez sur l'icône d'exécution 运行 située dans le coin supérieur gauche. Dans la boîte de dialogue Run Options, cliquez sur Execute.

    Dans la boîte de dialogue, définissez Run configuration sur Pentaho local, Log level sur Basic logging, laissez l'option Clear log before execution cochée par défaut et conservez les autres options par défaut.

  2. Facultatif : Si vous êtes invité à enregistrer la tâche, cliquez sur Yes et attribuez un nom au flux de planification des tâches (par exemple, mc).

  3. Surveillez l'état d'exécution dans le diagramme DAG de l'interface de workflow ou dans la section Execution Results. Le flux de planification des tâches est terminé lorsqu'une coche verte apparaît sur chaque objet.

    À la fin du flux de planification des tâches, le diagramme DAG affiche des coches vertes sur les nœuds Create table, Load from OSS, Processing et Success. La zone Execution Results indique que le résultat de chaque entrée de tâche est vrai, avec la sortie finale Job has ended.

Étape 5 : Consulter les résultats de la tâche

Une fois le flux de planification des tâches terminé, exécutez une requête SQL pour vérifier que les données ont bien été écrites dans la table de destination comme prévu.

  1. Dans l'interface Spoon, cliquez sur l'onglet View. Sous la tâche Kettle créée (par exemple, mc), développez Database connections.

  2. Cliquez avec le bouton droit sur la connexion à la base de données que vous avez créée (par exemple, MaxCompute) et sélectionnez SQL Editor.

  3. Dans la boîte de dialogue Simple SQL editor, saisissez une requête SQL et cliquez sur Execute. Les résultats s'affichent dans la boîte de dialogue Examine preview data.

    La requête SQL est la suivante :

    SELECT * FROM ambulance_data_csv;