Tous les produits
Search
Centre de documentation

:Créer une tâche de synchronisation

Dernière mise à jour :Aug 09, 2026

Cette rubrique explique comment créer une tâche de synchronisation pour exporter des données depuis MaxCompute vers une source de données MySQL.

Prérequis

  • Vous avez créé une instance ApsaraDB RDS for MySQL et obtenu son ID d'instance. Vous avez également ajouté les adresses IP requises à une liste blanche dans la console ApsaraDB RDS. Pour plus d'informations, consultez Créer une instance ApsaraDB RDS for MySQL.

    Remarque

    Lorsque vous utilisez un Serverless Resource Group pour exécuter une tâche de synchronisation pour ApsaraDB RDS, tenez compte des points suivants :

    • Si vous accédez à la source de données via un réseau interne (VPC), ajoutez le bloc CIDR du vSwitch lié au groupe de ressources à la liste blanche de la source de données.

    • Si vous accédez à la source de données via Internet, ajoutez l'adresse IP élastique (EIP) du Virtual Private Cloud (VPC) auquel le Serverless Resource Group est lié à la liste blanche de la source de données.

    Pour plus d'informations, consultez Configurer une liste blanche.

  • Si vous utilisez une base de données ApsaraDB RDS for MySQL, créez une table nommée ODPS_RESULT dans la base de données en exécutant l'instruction suivante :

    CREATE TABLE `ODPS_RESULT` (
    `education`  varchar(255) NULL ,
    `num`  int(10) NULL 
    );

    Une fois la table créée, exécutez l'instruction DESC ODPS_RESULT; pour afficher les détails de la table.

  • Vous avez préparé une table de résultats nommée result_table. Pour plus d'informations, consultez Créer une table et charger des données.

  • Vous avez créé un nœud virtuel (start) et un nœud ODPS SQL (insert_data). Pour plus d'informations, consultez Créer un workflow.

Contexte

Dans DataWorks, vous utilisez généralement Data Integration pour importer périodiquement les données métier générées par votre système dans un espace de travail. Une fois que les tâches SQL ont traité les données, vous pouvez exporter périodiquement les résultats vers une source de données spécifiée pour leur affichage ou leur utilisation ultérieure.工作流程

Data Integration prend en charge l'importation et l'exportation de données vers diverses sources de données, telles qu'ApsaraDB RDS, MySQL, SQL Server, PostgreSQL, MaxCompute, ApsaraDB for Memcache (OCS), PolarDB-X, Object Storage Service (OSS), Oracle, FTP, DM, HDFS et MongoDB. Pour obtenir la liste complète des types de sources de données pris en charge, consultez Sources de données et plug-ins pris en charge.

Étape 1 : Ajouter une source de données

Remarque

Seuls les administrateurs d'espace de travail peuvent ajouter des sources de données. Les membres ayant d'autres rôles peuvent uniquement consulter les sources de données.

  1. Connectez-vous à la console DataWorks. Dans la région cible, cliquez sur More > Management Center dans le volet de navigation de gauche. Sélectionnez un espace de travail dans la liste déroulante et cliquez sur Go to Management Center.

  2. Créez une source de données MySQL.

    1. Dans le volet de navigation de gauche, choisissez Data Sources > Data Sources pour accéder à la page Data Sources.

    2. Cliquez sur Add. Dans la boîte de dialogue Add, sélectionnez MySQL.

  3. Configurez la source de données.

    Dans la boîte de dialogue Add MySQL Data Source, configurez les paramètres. Dans cet exemple, sélectionnez Alibaba Cloud instance mode.

    Le tableau suivant décrit les principaux paramètres.

    Paramètre

    Description

    Environnement applicable

    Configurez la source de données séparément pour l'Development Environment et l'Production Environment.

    Mode de configuration

    Sélectionnez Alibaba Cloud instance mode.

    Compte Alibaba Cloud

    Sélectionnez Current Alibaba Cloud Account.

    Région

    Sélectionnez la région où se trouve la source de données.

    Instance

    Sélectionnez l'instance ApsaraDB RDS for MySQL que vous avez créée. Après avoir sélectionné une instance, vous pouvez cliquer sur Obtain Latest Address pour afficher les détails de l'instance.

    Si aucune instance n'est disponible, vous pouvez accéder à la console ApsaraDB RDS pour en créer une.

    Nom de la base de données, nom d'utilisateur et mot de passe

    Spécifiez le nom de la base de données par défaut pour cette source de données, puis saisissez le nom d'utilisateur et le mot de passe de la base de données. N'utilisez pas le signe « @ » (@) dans le mot de passe.

    Tenez compte des points suivants lors de la configuration d'une tâche de synchronisation :

    • Pour la synchronisation au niveau de la base de données (y compris en temps réel et par lots), vous pouvez sélectionner n'importe quelle base de données dans l'instance ApsaraDB RDS à laquelle vous avez accès.

    • Pour une tâche de synchronisation par lots, si vous utilisez plusieurs bases de données, vous devez ajouter une source de données distincte pour chaque base de données.

    Méthode d'authentification

    Sélectionnez No Authentication.

    Configurer une instance secondaire

    Si la source de données dispose d'une instance en lecture seule (instance secondaire), vous pouvez activer l'option Configure Secondary Instance lors de la configuration de la tâche et sélectionner l'ID de l'instance secondaire. L'utilisation d'une instance secondaire évite d'interférer avec l'instance principale et aide à protéger ses performances. Si plusieurs instances en lecture seule existent, une instance disponible est sélectionnée aléatoirement pour les opérations de lecture.

    Remarque

    Cette fonctionnalité prend uniquement en charge les groupes de ressources serverless.

  4. Testez la connectivité réseau du groupe de ressources.

    Dans les onglets Data integration et Data Scheduling, cliquez sur Test Network Connectivity pour le groupe de ressources correspondant. Un statut « Connected » indique que le test a réussi.

    Remarque
    • Une tâche de synchronisation ne peut utiliser qu'un seul type de groupe de ressources.

    • Vous devez tester la connectivité de chaque groupe de ressources à la source de données. La tâche de synchronisation ne peut pas s'exécuter si son groupe de ressources échoue à se connecter.

  5. Une fois le test de connectivité réussi, cliquez sur Complete Creation pour ajouter la source de données.

Étape 2 : Créer et configurer une tâche de synchronisation

Créez un nœud de synchronisation nommé write_result pour générer une tâche de synchronisation. Cette tâche écrit les données de la table result_table dans votre base de données MySQL. Suivez ces étapes :

  1. Connectez-vous à la console DataWorks. Dans la région cible, cliquez sur Data Development and O&M > Data Development dans le volet de navigation de gauche. Sélectionnez un espace de travail dans la liste déroulante et cliquez sur Go to Data Development.

  2. Créez un nœud de synchronisation par lots.

    Cliquez sur l'icône image.png et choisissez Create Node > Data integration > Batch Synchronization pour créer un nœud de synchronisation par lots.

  3. Configurez la connexion réseau pour la tâche de synchronisation.

    1. Dans l'onglet Configure Network Connections and Resource Groups de la page d'édition du nœud, définissez Source sur MaxCompute(ODPS) et MySQL sur MySQL. Sélectionnez le groupe de ressources et testez sa connectivité à la source de données. Pour plus d'informations sur la configuration réseau, consultez Solutions de connectivité réseau.

    2. Cliquez sur Next step pour accéder à la page Configure tasks.

  4. Configurez la tâche de synchronisation.

    1. Configurez la source et la destination.

      Dans la section Source, sélectionnez MaxCompute(ODPS) comme source de données et saisissez result_table dans le champ Table. Dans la section Destination, sélectionnez MySQL comme source de données, saisissez ODPS_RESULT dans le champ Table et sélectionnez insert into pour la Primary Key Conflict Policy. Cela définit la table source comme étant result_table et la table de destination comme étant ODPS_RESULT. Vous pouvez configurer d'autres paramètres en fonction de vos besoins métier. Pour plus d'informations, consultez Configuration sans code.

    2. Configurez le mappage des champs.

      Mappez les champs source aux champs de destination. La tâche utilise ce mappage de champs pour écrire les données.

    3. Configurez le contrôle du canal.

      Paramètre

      Description

      Expected Maximum Concurrency

      Spécifie le nombre maximal de threads simultanés pour la lecture depuis la source ou l'écriture vers la destination.

      Remarque
      • En raison des spécifications des ressources et d'autres facteurs, la simultanéité réelle lors de l'exécution peut être inférieure ou égale à la valeur configurée. Le groupe de ressources est facturé en fonction de la simultanéité réelle. Pour plus d'informations, consultez Détails de la facturation.

      • Les frais de planification des tâches sont liés au nombre de tâches de synchronisation par lots sur table unique, et non à la simultanéité configurée.

      Sync Rate

      Contrôle la vitesse de synchronisation.

      • Limitation de débit : limite la vitesse de synchronisation pour protéger la base de données source d'une charge de lecture excessive. La valeur minimale de limitation est de 1 Mo/s.

      • Aucune limitation : la tâche offre les performances de transfert maximales disponibles, sous réserve de la simultanéité configurée.

      Remarque

      La métrique de trafic est mesurée par Data Integration et ne représente pas le trafic réel de la carte réseau. Le trafic de la carte réseau est généralement de 1 à 2 fois supérieur au trafic du canal, selon la sérialisation de transport du système de stockage de données.

      Policy for Dirty Data Records

      Les données erronées désignent les enregistrements de données qui n'ont pas pu être écrits dans la destination en raison d'exceptions telles que des conflits de type ou des violations de contraintes. La synchronisation par lots sur table unique permet de définir une politique de gestion des données erronées. Vous pouvez définir le nombre d'enregistrements de données erronées à tolérer et leur impact sur la tâche.

      • Si aucune configuration n'est spécifiée, les données erronées sont autorisées par défaut et n'affectent pas l'exécution de la tâche.

      • Si la valeur est définie sur 0, aucune donnée erronée n'est autorisée. Si des données erronées sont générées pendant la synchronisation, la tâche échoue.

      • Si les données erronées sont autorisées et qu'un seuil est défini :

        • Si les données erronées générées restent dans la limite du seuil, la tâche de synchronisation ignore les données erronées (elles ne sont pas écrites dans la destination) et continue de s'exécuter normalement.

        • Si les données erronées générées dépassent le seuil, la tâche de synchronisation échoue.

      Important

      Un volume excessif de données erronées affecte la vitesse globale de synchronisation de la tâche.

      Distributed Execution

      Contrôle l'activation ou non du mode distribué pour la tâche.

      • Activé : divise la tâche en plusieurs processus pour une exécution simultanée, brisant le goulot d'étranglement du processus unique et améliorant l'efficacité de la synchronisation.

      • Désactivé : la tâche s'exécute dans un processus unique.

      Le mode distribué est recommandé pour les exigences de haute performance. Il peut également exploiter les ressources fragmentées sur les machines, améliorant ainsi l'utilisation des ressources.

      Important
      • La simultanéité doit être supérieure ou égale à 8 pour activer le traitement distribué.

      • L'activation du traitement distribué consomme plus de ressources. Si une erreur d'absence de mémoire (OOM) se produit pendant l'exécution, essayez de désactiver cette fonctionnalité.

      Time Zone

      Pour la synchronisation inter-fuseaux horaires, configurez le fuseau horaire source pour la conversion des fuseaux horaires.

    4. Configurez les dépendances de la tâche.

      Définissez le nœud insert_data comme nœud amont du nœud write_result dans le Workflow actuel. Sur le canevas du workflow, connectez le nœud insert_data au nœud write_result pour établir une dépendance amont/aval. Cela signifie que write_result est exécuté après la fin de insert_data.

  5. Une fois la tâche configurée, cliquez sur l'icône 保存 dans la barre d'outils pour sauvegarder la tâche.

Étape 3 : Valider et déployer la tâche

Après avoir enregistré la tâche de synchronisation, revenez au workflow. Cliquez sur l'icône 提交 dans la barre d'outils pour valider la tâche de synchronisation auprès du système de planification. Le système de planification exécute automatiquement la tâche selon son planning configuré, à partir du lendemain.

Étapes suivantes

Ce didacticiel a expliqué comment créer une tâche de synchronisation pour exporter des données vers différents types de sources de données. Le prochain didacticiel explique comment configurer les propriétés de planification et les dépendances pour une tâche de synchronisation. Pour plus d'informations, consultez Configurer la planification et les dépendances.

Documentation connexe

  • Pour plus d'informations sur la configuration d'une tâche de synchronisation par lots, consultez Configuration sans code.