Tous les produits
Search
Centre de documentation

DataWorks:AI-assisted processing for batch synchronization tasks

Dernière mise à jour :Aug 10, 2026

Intégrez le traitement par modèle d'IA dans le pipeline Data Integration de DataWorks pour analyser, traiter et enrichir les données en temps réel lors de leur transfert de la source vers la destination, révélant ainsi la valeur cachée des données non structurées.

Fonctionnalités

  • Utilisateurs ciblés : les entreprises qui ont besoin d'une analyse et d'un traitement pilotés par l'IA pendant la synchronisation des données afin d'améliorer la qualité des données et d'en extraire la valeur.

  • Intégration transparente : le traitement par l'IA est une étape intégrée à Data Integration qui s'articule parfaitement avec la lecture depuis une source et l'écriture vers une destination.

  • Prise en charge de diverses tâches de TAL : effectuez plusieurs tâches de traitement du langage naturel (TAL) sur les données textuelles durant la synchronisation, telles que l'analyse des sentiments, la génération de résumés, l'extraction de mots-clés et la traduction de texte.

Cas d'utilisation

Secteur

Application type

Service client / E-commerce

Analysez en temps réel le sentiment des commentaires des utilisateurs et des tickets de service client. Extrayez automatiquement les problèmes principaux et les points de retour essentiels.

Conformité / Juridique / Recherche scientifique

Générez automatiquement des résumés et extrayez les informations clés des documents stratégiques, des contrats juridiques et des articles de recherche pendant la synchronisation.

Fabrication / Chaîne d'approvisionnement / Santé

Analysez intelligemment les journaux des appareils, les retours de la chaîne d'approvisionnement ou les enregistrements de communication médecin-patient pour permettre des alertes de risque et une optimisation de la qualité de service.

Collaboration multilingue

Traduisez automatiquement les commentaires des réseaux sociaux, les articles de presse ou les documents commerciaux provenant du monde entier vers une langue unique lors de la synchronisation afin de faciliter l'analyse centralisée.

Prérequis

  • Vous avez créé un espace de travail utilisant Data Studio (nouvelle version).

  • Vous avez préparé le service de grand modèle requis pour le traitement assisté par l'IA. Les étapes de préparation dépendent du fournisseur de modèle sélectionné :

  • Pour les tâches de synchronisation par lots, configurez manuellement les détails de la source de données ou utilisez des sources de données existantes.

  • Assurez-vous que l'espace de travail est lié à un groupe de ressources et que ce groupe de ressources peut se connecter aux sources de données.

Facturation

En plus des frais standard de Data Integration, les tâches de traitement assisté par l'IA engendrent des coûts liés à l'appel du grand modèle :

Exemple

Cet exemple synchronise les données entre deux tables Hologres, traduit la colonne feedback_info en anglais et écrit le résultat dans la table de destination.

Préparer les données de la table source

CREATE TABLE customer_feedback (
    id BIGINT PRIMARY KEY,
    device STRING,
    feedback_info STRING,
    pt INT
)
PARTITIONED BY (pt)
DISTRIBUTED BY HASH(id)
WITH (table_type='Duplication');
INSERT INTO customer_feedback (id, device, feedback_info, pt)
VALUES
(8, 'Huawei MateBook D14', 'Affordable, suitable for students, performance is adequate', 2020),
(1, 'iphone', 'This product is okay, I have used it for 1 year', 2013),
(10, 'Bose QuietComfort 35 II', 'A classic among noise-canceling headphones, maximum comfort', 2021);

Étape 1 : Créer une tâche de synchronisation par lots

  1. Accédez à la page Workspaces de la console DataWorks. Dans la barre de navigation supérieure, sélectionnez la région souhaitée. Localisez l'espace de travail cible et choisissez Shortcuts > Data Studio dans la colonne Actions.

  2. Dans le volet de navigation de gauche, cliquez sur image pour accéder à la page de développement des données. À droite de Project Directory, cliquez sur image et choisissez Create Node > Data Integration > Batch Synchronization. La boîte de dialogue Create Node s'affiche.

  3. Définissez le Path du nœud, la Data source destination et le Name. Ensuite, cliquez sur OK pour créer le nœud de synchronisation par lots.

    Cette rubrique utilise une tâche de synchronisation Hologres vers Hologres comme exemple pour illustrer la fonctionnalité de traitement assisté par l'IA dans les tâches de synchronisation par lots.

Étape 2 : Configurer la tâche de synchronisation

Une fois le nœud de synchronisation par lots créé, l'éditeur de tâches s'ouvre. Configurez les paramètres suivants :

1. Source de données

Configurez les sources de données source et de destination.

  • Type : vous sélectionnez les types de source de données source et de destination à l'étape Créer une tâche de synchronisation par lots. Ces types ne peuvent pas être modifiés. Pour utiliser des types différents, vous devez créer une nouvelle tâche de synchronisation par lots.

  • Data Source : sélectionnez la source de données Hologres liée à l'espace de travail, ou choisissez Add Data Source dans la liste déroulante.

2. Ressource d'exécution

  1. Sélectionnez le Resource Group pour la tâche de synchronisation. Si vous utilisez un groupe de ressources serverless, vous pouvez également spécifier l'Resource Usage (CU) pour la tâche.

  2. Après avoir sélectionné un Resource Group, Data Integration teste automatiquement la connectivité entre le groupe de ressources et les sources de données source et de destination. Vous pouvez également cliquer sur Connectivity Check pour effectuer le test manuellement.

3. Source

Configurez les détails de la table source pour la synchronisation, tels que le Schema, les Tables, la Partition et les conditions de Data Filtering. Cliquez sur Data Preview pour afficher les données spécifiques à synchroniser.

Dans cet exemple, sélectionnez public pour Schema et customer_feedback pour Table.

4. Traitement des données

  1. Dans la section Traitement des données, Enable la fonctionnalité de traitement des données. Cette fonctionnalité nécessite des ressources de calcul supplémentaires et augmente la consommation de ressources de la tâche.

  2. Cliquez sur Add Node et sélectionnez AI-assisted processing.

  3. Configurez les paramètres du traitement assisté par l'IA.

    Les paramètres clés sont décrits ci-dessous.

    Paramètre

    Description

    Model Provider

    Les fournisseurs pris en charge sont DataWorks Model Service, Model Studio et PAI-Marketplace.

    Model Endpoint

    Si vous sélectionnez PAI-Marketplace, saisissez l'endpoint d'appel du modèle. Pour obtenir l'endpoint, consultez la section Test service invocation.

    Model Name

    Le modèle qui effectue le traitement intelligent des données. Sélectionnez un modèle selon vos besoins.

    API Key

    La clé API permettant d'accéder au modèle. Obtenez-la auprès du fournisseur du modèle.

    Processing Description

    Décrivez l'opération sur le champ source en langage naturel. Référencez le nom du champ en utilisant le format #{column_name}. Par exemple, dans ce cas, saisissez Please translate '#{feedback_info}' into English.

    Output Field

    Saisissez le nom du champ où le résultat sera stocké. Si le champ n'existe pas, un nouveau champ est créé.

    Remarque

    Tel que configuré dans cet exemple, le champ feedback_info de la table source est traduit en anglais et stocké dans le champ feedback_processed.

  4. Cliquez sur Output Preview dans le coin supérieur droit de la section Traitement assisté par l'IA pour prévisualiser les données de sortie finales.

  5. (Facultatif) Configurez plusieurs étapes de traitement des données qui s'exécutent séquentiellement.

    Sous la liste de traitement des données, cliquez sur le bouton + pour ajouter une nouvelle étape de traitement des données.

5. Destination

  1. Configurez les informations de la table de destination, telles que le Schema, le Table Name et la Partition.

    • Cliquez sur Generate Target Table Schema pour créer rapidement la table de destination.

    • Si une table destinée à recevoir les données existe déjà à la destination, sélectionnez-la.

  2. Configurez le Write Mode et la Write Conflict Policy.

    Sélectionnez public pour Schema et customer_feedback_after_translate pour Table. Définissez le write mode sur SQL(INSERT INTO), la write conflict strategy sur Ignore et l'option Clear Hologres table before synchronization sur Do not clear destination table (false). Définissez le nombre maximum de connexions (maximum connections) sur 9.

  3. Configurez l'option permettant de supprimer ou non les données existantes dans la table Hologres avant la synchronisation.

  4. (Facultatif) Configurez le nombre de Maximum Connections.

    Le paramètre Maximum Connections n'est effectif que lorsque le mode d'écriture est SQL(INSERT INTO). Lorsque vous démarrez la tâche, assurez-vous que l'instance Hologres dispose de suffisamment de connexions inactives. Une seule tâche peut utiliser jusqu'à neuf connexions.

6. Mappage des champs de destination

Après avoir configuré la source de données, le traitement des données et la destination, cette section affiche le mappage des champs. Par défaut, Data Integration mappe les champs par nom et par position. Pour ajuster un mappage (par exemple, pour mapper feedback_processed vers translate_feedback), cliquez sur les champs correspondants pour les connecter.

Remarque

Dans cet exemple, en plus des mappages par nom identique pour les champs existants de la table source (id, device, feedback_info et pt), vous devez également mapper manuellement le champ feedback_processed, qui stocke le résultat traduit, vers le champ translate_feedback de la table de destination.

Étape 3 : Déboguer la tâche

  1. Dans le volet droit de l'éditeur de tâches, cliquez sur Run Configuration. Configurez le Resource Group et les Script Parameters associés pour le débogage de ce nœud.

  2. Dans la barre d'outils en haut du nœud, cliquez sur Save puis sur Running. Attendez la fin de la tâche et vérifiez que l'exécution a réussi. Vous pouvez accéder à la base de données de destination pour vérifier que les données de la table correspondent aux attentes.

Étape 4 : Configurer la planification

Pour exécuter le nœud de synchronisation par lots selon un planning, configurez la Scheduling Policy dans le volet Scheduling Settings à droite. Pour plus d'informations, consultez la section Configurer les propriétés de planification des nœuds.

Étape 5 : Publier le nœud

Cliquez sur l'icône Publish dans la barre d'outils du nœud pour lancer le processus de publication et publier la tâche dans l'environnement de production. La tâche s'exécute selon le planning uniquement après sa publication.

Étapes suivantes : O&M des tâches

Après avoir publié le nœud, cliquez sur Backfill Data ou sur Perform O&M dans la boîte de dialogue de publication.

  • Backfill Data : cette option prend en charge le backfilling des données uniquement pour le nœud actuel. Pour des opérations de backfilling de données plus complexes, accédez à Operation Center. Pour plus d'informations, consultez la section Gérer les instances de backfilling de données.

  • Perform O&M : après la publication d'une tâche, Operation Center la gère automatiquement. Dans Operation Center, vous pouvez afficher l'état d'exécution de la tâche ou la déclencher manuellement. Pour plus d'informations, consultez la section Operation Center.