La source de données TOS permet de lire des fichiers TOS. Utilisez cette source pour récupérer les fichiers stockés dans TOS, les analyser et synchroniser les données vers n'importe quelle destination. Cette rubrique décrit les fonctionnalités de synchronisation des données prises en charge par DataWorks pour TOS.
Limitations
La source de données TOS prend en charge les types de colonne suivants dans DataWorks.
|
Type de données |
Description |
|
STRING |
Type texte. |
|
LONG |
Type entier. |
|
BYTES |
Tableau d'octets. Convertit le contenu textuel lu en un tableau d'octets encodé en |
|
BOOL |
Type booléen. |
|
DOUBLE |
Type à virgule flottante. |
|
DATE |
Type date et heure. Les formats de date et d'heure suivants sont pris en charge :
|
Créer une source de données TOS
Avant de développer une tâche de synchronisation dans DataWorks, ajoutez la source de données requise à DataWorks en suivant les instructions de la rubrique Configuration de la source de données. Consultez les descriptions des paramètres dans la console DataWorks pour comprendre leur signification lors de l'ajout d'une source de données.
Développer une tâche de synchronisation des données
La source de données TOS ne peut être utilisée que comme source dans les tâches de synchronisation par lots d'une seule table. La section suivante décrit le point d'entrée et le processus général de configuration des tâches de synchronisation des données.
Pour la procédure, consultez les rubriques Configuration sans code et Configuration en mode script.
Pour l'ensemble complet des paramètres et un exemple de script pour le mode script, consultez la section Annexe : Exemple de script et paramètres ci-dessous.
Annexe : Exemple de script et paramètres
Configurer une tâche de synchronisation par lots à l'aide de l'éditeur de code
Pour configurer une tâche de synchronisation par lots à l'aide de l'éditeur de code, définissez les paramètres associés dans le script selon les exigences de format de script unifié. Pour plus d'informations, consultez la rubrique Configuration en mode script. Les informations suivantes décrivent les paramètres à configurer pour les sources de données lors de la configuration d'une tâche de synchronisation par lots à l'aide de l'éditeur de code.
Exemple de script Reader
{
"type": "job",
"version": "2.0",
"steps": [
{
"stepType": "tos",
"parameter": {
"datasource": "",
"object": ["f/z/1.csv"],
"fileFormat": "csv",
"encoding": "utf8/gbk/...",
"fieldDelimiter": ",",
"useMultiCharDelimiter": true,
"skipHeader": true,
"compress": "zip/gzip",
"column": [
{
"index": 0,
"type": "long"
},
{
"index": 1,
"type": "boolean"
},
{
"index": 2,
"type": "double"
},
{
"index": 3,
"type": "string"
},
{
"index": 4,
"type": "date"
}
]
},
"name": "Reader",
"category": "reader"
},
{
"stepType": "stream",
"parameter": {},
"name": "Writer",
"category": "writer"
}
],
"setting": {
"errorLimit": {
"record": "0"
},
"speed": {
"concurrent": 1
}
},
"order": {
"hops": [
{
"from": "Reader",
"to": "Writer"
}
]
}
}
Paramètres du script Reader
|
Paramètre |
Description |
Obligatoire |
Valeur par défaut |
|
datasource |
Nom de la source de données. Le mode script prend en charge l'ajout de sources de données. La valeur de ce paramètre doit correspondre au nom de la source de données ajoutée. |
Oui |
Aucune |
|
fileFormat |
Type de fichier source. Types pris en charge : |
Oui |
Aucune |
|
object |
Chemin du fichier. Ce paramètre prend en charge le caractère générique * et peut être configuré sous forme de tableau. Par exemple, pour synchroniser les deux fichiers a/b/1.csv et a/b/2.csv, configurez a/b/*.csv. |
Oui |
Aucune |
|
column |
Liste des colonnes à lire. type spécifie le type de données source. index indique de quelle colonne du texte provient la colonne actuelle (en commençant par 0). value spécifie que le type actuel est une constante. Au lieu de lire les données à partir du fichier source, la colonne correspondante est générée automatiquement en fonction de la valeur.
Remarque
Pour les informations column que vous spécifiez, type est obligatoire et vous devez choisir soit index, soit value. |
Oui |
Tout est lu en tant que |
|
fieldDelimiter |
Délimiteur de champ pour la lecture. Remarque
|
Oui |
|
|
lineDelimiter |
Délimiteur de ligne pour la lecture. Remarque
Ce paramètre prend effet uniquement lorsque fileFormat est défini sur text. |
Non |
Aucune |
|
compress |
Type de compression du texte. Vide par défaut (pas de compression). Types de compression pris en charge : |
Non |
|
|
encoding |
Encodage utilisé pour lire le fichier. |
Non |
|
|
nullFormat |
Les fichiers texte ne peuvent pas définir null (pointeur nul) à l'aide d'une chaîne standard. Le système de synchronisation des données fournit nullFormat pour définir quelles chaînes peuvent être traitées comme null. Par exemple :
|
Non |
Aucune |
|
skipHeader |
Pour les fichiers CSV, utilisez skipHeader pour contrôler si l'en-tête est lu.
Remarque
skipHeader n'est pas pris en charge en mode fichier compressé. |
Non |
|
|
parquetSchema |
Configurez ce paramètre lors de la lecture de TOS au format de fichier Parquet. Il prend effet uniquement lorsque fileFormat est défini sur parquet et décrit le type de stockage des données Parquet. Assurez-vous que toute la configuration respecte la syntaxe JSON après avoir rempli parquetSchema.
|
Non |
Aucune |
|
csvReaderConfig |
Paramètres de configuration pour la lecture des fichiers CSV, sous forme de type Map. La lecture des fichiers CSV utilise csvReader. S'ils ne sont pas configurés, les valeurs par défaut sont utilisées. |
Non |
Aucune |