MaxCompute vous permet de planifier des tâches via Azkaban. Cette approche facilite la réalisation efficace d'analyses de données à haute fréquence. Cette rubrique explique comment utiliser Azkaban pour planifier des tâches SQL en exécutant des commandes depuis le client MaxCompute.
Informations générales
Azkaban est un système de planification de divers types de tâches, notamment les tâches Command, Hadoop MapReduce, Hive, Spark et Pig. Les tâches de type Command sont les plus couramment utilisées. Azkaban prend également en charge l'utilisation de plug-ins personnalisés. Pour en savoir plus sur Azkaban, consultez Azkaban.
Pour planifier des tâches, vous devez regrouper les fichiers nécessaires dans une archive ZIP. Ces fichiers incluent le fichier de données source ainsi que les scripts de création de tables, d'importation de données et d'interrogation de données. Ensuite, téléchargez cette archive ZIP sur Azkaban.
Cette rubrique illustre l'utilisation de la fonctionnalité de planification des tâches d'Azkaban pour mettre en œuvre la logique SQL relative à la création de tables, à l'importation de données et à leur interrogation. Le schéma ci-dessous présente le flux de travail de planification des tâches et répertorie les fichiers de tâche et les scripts utilisés pour chaque étape.

Prérequis
Avant de planifier des tâches MaxCompute, assurez-vous que les conditions suivantes sont réunies :
-
Le client MaxCompute est téléchargé et installé.
Pour plus d'informations sur l'installation et la configuration du client MaxCompute, consultez Installer et configurer odpscmd.
-
Azkaban est téléchargé et installé.
Pour plus d'informations, consultez la page Getting Started.
Procédure
-
Étape 1 : Préparer les fichiers requis et les compresser dans une archive ZIP.
Préparez les fichiers de données source et les scripts nécessaires à la planification des tâches, puis compressez-les dans une archive ZIP.
-
Étape 2 : Télécharger l'archive ZIP sur Azkaban.
Créez un projet Azkaban, téléchargez l'archive ZIP via ce projet et configurez un flux de travail de planification des tâches.
-
Étape 3 : Exécuter le flux de travail.
Exécutez le flux de travail de planification des tâches.
-
Étape 4 : Consulter les résultats d'exécution du flux de travail.
Consultez le résultat de l'exécution du flux de travail.
Étape 1 : Préparer les fichiers requis et les compresser dans une archive ZIP
-
Préparez les fichiers requis et compressez-les dans une archive ZIP.
Les fichiers suivants sont nécessaires pour cette procédure :
-
Le fichier de données source. Ce fichier est au format TXT. Dans cet exemple, le fichier emp.txt est utilisé. Il contient les données suivantes :
7369,SMITH,CLERK,7902,1980-12-17 00:00:00,800,,20 7499,ALLEN,SALESMAN,7698,1981-02-20 00:00:00,1600,300,30 7521,WARD,SALESMAN,7698,1981-02-22 00:00:00,1250,500,30 7566,JONES,MANAGER,7839,1981-04-02 00:00:00,2975,,20 7654,MARTIN,SALESMAN,7698,1981-09-28 00:00:00,1250,1400,30 7698,BLAKE,MANAGER,7839,1981-05-01 00:00:00,2850,,30 7782,CLARK,MANAGER,7839,1981-06-09 00:00:00,2450,,10 7788,SCOTT,ANALYST,7566,1987-04-19 00:00:00,3000,,20 7839,KING,PRESIDENT,,1981-11-17 00:00:00,5000,,10 7844,TURNER,SALESMAN,7698,1981-09-08 00:00:00,1500,0,30 7876,ADAMS,CLERK,7788,1987-05-23 00:00:00,1100,,20 7900,JAMES,CLERK,7698,1981-12-03 00:00:00,950,,30 7902,FORD,ANALYST,7566,1981-12-03 00:00:00,3000,,20 7934,MILLER,CLERK,7782,1982-01-23 00:00:00,1300,,10 7948,JACCKA,CLERK,7782,1981-04-12 00:00:00,5000,,10 7956,WELAN,CLERK,7649,1982-07-20 00:00:00,2450,,10 7956,TEBAGE,CLERK,7748,1982-12-30 00:00:00,1300,,10 -
Le script de création de table et de chargement des données. Ce fichier est au format SQL. Dans cet exemple, le fichier upload.sql est utilisé. Il contient le contenu suivant :
drop table if exists azkaban_emp; create table azkaban_emp (empno bigint, ename string, job string, mgr bigint, hiredate datetime, sal bigint, comm bigint, deptno bigint) lifecycle 1; tunnel upload emp.txt azkaban_emp; -
Le script d'interrogation des données. Ce fichier est au format SQL. Dans cet exemple, le fichier cat_data.sql est utilisé. Il contient le contenu suivant :
select * from azkaban_emp; -
Le fichier de démarrage de la tâche. Ce fichier est au format job. Dans cet exemple, le fichier start.job est utilisé. Il contient le contenu suivant :
#start type=command command=echo 'job start' -
Le fichier de chargement des données de la tâche. Ce fichier est au format job. Dans cet exemple, le fichier upload_data.job est utilisé. Il contient le contenu suivant :
#upload_data type=command dependencies=start command=D:/odpscmd_public/bin/odpscmd.bat -f 'upload.sql'commandindique le répertoire d'installation local du client MaxCompute. Dans cet exemple,D:/odpscmd_public/bin/odpscmd.batest utilisé. -
Le fichier d'interrogation des données de la tâche. Ce fichier est au format job. Dans cet exemple, le fichier mc.job est utilisé. Il contient le contenu suivant :
#mc.job type=command command=D:/odpscmd_public//bin/odpscmd -f 'cat_data.sql' dependencies=upload_datacommandindique le répertoire d'installation local du client MaxCompute. Dans cet exemple,D:/odpscmd_public/bin/odpscmd.batest utilisé.
-
-
Compressez les fichiers préparés dans une archive ZIP.
Dans cet exemple, les fichiers précédents sont regroupés dans l'archive demo1.zip. L'image suivante affiche le contenu de l'archive demo1.zip.

Étape 2 : Télécharger l'archive ZIP sur Azkaban
-
Connectez-vous à Azkaban.
-
Créez un projet Azkaban.
-
Téléchargez l'archive ZIP générée lors de l'étape 1 dans le projet Azkaban.
Pour savoir comment télécharger une archive ZIP, consultez
.

Une fois l'archive ZIP téléchargée, vous pouvez visualiser le flux de travail sous l'onglet
Graph
. Pour savoir comment afficher un flux de travail, consultez
.

Étape 3 : Exécuter le flux de travail
Une fois le flux de travail créé, cliquez sur Schedule/Execute Flow dans le coin supérieur droit. Dans la boîte de dialogue qui s'affiche, cliquez sur Execute dans le panneau Flow View pour planifier les tâches.
Pour plus d'informations sur l'exécution d'un flux de travail, consultez Executing Flow View.

Étape 4 : Consulter les résultats d'exécution du flux de travail
Après l'exécution du flux de travail, vous pouvez consulter les résultats d'exécution de chaque tâche sous l'onglet Job List de la page Execution . Vous pouvez également localiser une tâche spécifique dans l'onglet Job List et cliquez sur Details dans la colonne Details pour afficher les détails de cette tâche.
Pour plus d'informations sur la consultation des résultats d'exécution d'un flux de travail, consultez Execution.
