La fonctionnalité de traitement des données intégrée aux tâches de synchronisation par lots dans DataWorks nettoie, traite avec l'IA et vectorise les données directement au sein du pipeline de synchronisation, ce qui simplifie votre architecture ETL.
Limites
Cette fonctionnalité est disponible uniquement dans les espaces de travail où la nouvelle version de Data Studio est activée.
Seuls les groupes de ressources serverless sont pris en charge.
Elle est actuellement activée uniquement pour certains canaux de synchronisation par lots à table unique.
L'activation du traitement des données consomme des ressources de calcul supplémentaires (CUs). Surveillez votre quota de ressources.
Accès à la configuration
Sur la page de configuration d'une tâche de synchronisation par lots, faites défiler la page jusqu'à la section de traitement des données.
Par défaut, cette fonctionnalité est désactivée. Activez l'interrupteur pour utiliser le module de traitement des données.
Fonctionnalités
Une fois le traitement des données activé, vous pouvez ajouter une ou plusieurs des règles de traitement suivantes.
1. Remplacement de chaînes
Définissez des règles de remplacement pour différentes colonnes afin de standardiser ou de nettoyer leurs valeurs.
Configuration en mode Assistant
Dans la liste Data Processing List, cliquez sur le bouton +Add Node et sélectionnez Replace String pour ajouter une règle de remplacement. Le tableau suivant décrit les paramètres.
|
Paramètre |
Description |
|
Name |
Nom personnalisé de la règle de remplacement. |
|
Description |
(Facultatif) Description de l'objectif de la règle. |
|
Column Name |
Cliquez sur le bouton +Add Rule pour ajouter une règle de colonne. Sélectionnez une colonne dans la liste déroulante des colonnes de la table source pour appliquer cette règle. |
|
String to Replace |
Saisissez la chaîne d'origine à rechercher et à remplacer. |
|
Replace With |
Nouvelle chaîne à utiliser comme remplacement. |
|
|
Active les expressions régulières pour le motif de la chaîne à remplacer. |
|
|
Définit si le remplacement est sensible à la casse. Par défaut, la recherche n'est pas sensible à la casse. |
Vous pouvez ajouter plusieurs règles pour différentes colonnes. Par exemple, créez une règle pour remplacer 'Male' par '1' dans la colonne gender, et une autre pour remplacer 'active' par 'valid' dans la colonne status.
Aperçu des données de sortie
Après avoir configuré les règles, cliquez sur Output Data Preview dans le coin supérieur droit de la section de traitement des données.
-
Dans la boîte de dialogue qui s'affiche, configurez Input Data. Deux méthodes sont disponibles :
Auto-fetch : le système récupère automatiquement les données depuis la sortie du nœud en amont. Cliquez sur Re-fetch Upstream Output pour actualiser les données.
Manual construction : cliquez sur +Manually Construct Data pour saisir des valeurs personnalisées pour chaque colonne des lignes de données, ou pour tester des conditions limites spécifiques (telles que
NULLou des chaînes vides).
Cliquez sur le bouton Preview dans la section Preview Results.
Le système exécute toutes les règles de traitement configurées et affiche les résultats. Comparez-les à vos attentes pour vérifier les règles.
Les résultats de l'aperçu servent uniquement au débogage et à titre de référence. Les résultats finaux dépendent de l'exécution réelle de la tâche.
Configuration en mode Script
Pour activer le traitement des données en mode script, ajoutez un JSONObject contenant "category": "map", "stepType": "stringreplace" au module steps du script JSON. Pour connaître la procédure générale de configuration en mode script, consultez Configuration en mode script.
{
"category": "map",
"stepType": "stringreplace",
"parameter": {
"condition": [
{
"name": "<Column name to process>",
"replaceString": "<String to replace>",
"replaceByString": "<New replacement string>",
"useRegex": false,
"caseSensitive": false
}
]
},
"displayName": "<Rule name>",
"description": "<Rule description>"
}
2. Traitement assisté par l'IA
Utilisez un grand modèle de langage (LLM) intégré pour traiter et enrichir le contenu des colonnes.
Principaux cas d'utilisation :
Résumé de contenu : extrayez les points clés de grands blocs de texte, tels que des avis sur des produits ou des articles de presse.
Extraction d'informations : extrayez des informations clés à partir de textes non structurés, tels que des noms, des adresses et des coordonnées.
Traduction de texte : traduisez le contenu des colonnes dans une langue spécifiée.
Analyse des sentiments : déterminez le sentiment d'un texte (positif, négatif ou neutre).
Configuration et utilisation : lorsque vous cliquez sur Add Node, sélectionnez le traitement assisté par l'IA. Pour des instructions de configuration détaillées et des cas d'utilisation types, consultez Traitement assisté par l'IA.
3. Vectorisation des données
Convertissez du texte ou d'autres données en vecteurs de haute dimension à l'aide d'un modèle d'embedding. Ces vecteurs capturent les informations sémantiques pour les applications d'IA telles que la génération augmentée par la récupération (RAG), la recherche sémantique et les systèmes de recommandation.
Principaux cas d'utilisation :
Création de bases de connaissances : vectorisez des données textuelles telles que des documents, des tickets et des manuels de produits, puis stockez-les dans une base de données vectorielle pour servir de base de connaissances externe aux LLM.
Recommandations personnalisées : calculez la similarité basée sur les représentations vectorielles des utilisateurs et des éléments pour proposer des recommandations précises.
Configuration et utilisation : lorsque vous cliquez sur Add Node, sélectionnez Data Vectorization, puis choisissez les colonnes à traiter et le modèle d'embedding à utiliser. Pour des instructions de configuration détaillées et des exemples pratiques, consultez Vectorisation.