DataWorks met à votre disposition le connecteur Azure Blob Storage Reader pour lire les données contenues dans les fichiers stockés sur Azure Blob Storage. Ce connecteur vous permet d'accéder aux fichiers, d'analyser leur contenu et de synchroniser les données vers une destination. Cette rubrique détaille les fonctionnalités de synchronisation des données depuis les sources Azure Blob Storage.
Limites
La source de données Azure Blob Storage prend en charge les types de données suivants.
|
Type de données |
Description |
|
STRING |
Texte. |
|
LONG |
Entier. |
|
BYTES |
Tableau d'octets. Le texte lu est converti en tableau d'octets encodé au format UTF-8. |
|
BOOL |
Booléen. |
|
DOUBLE |
Nombre à virgule flottante. |
|
DATE |
Date et heure. Les formats suivants sont pris en charge :
|
Ajouter une source de données
Avant de développer une tâche de synchronisation dans DataWorks, ajoutez la source de données requise en suivant les instructions décrites dans la rubrique Configuration des sources de données. Consultez les descriptions des paramètres dans la console DataWorks pour comprendre leur signification lors de l'ajout d'une source de données.
Développer une tâche de synchronisation des données
Pour connaître le point d'entrée et la procédure de configuration d'une tâche de synchronisation, reportez-vous aux guides suivants.
Configurer une tâche de synchronisation par lots pour une seule table
Pour plus d'informations sur la procédure de configuration, consultez les rubriques Utiliser l'interface sans code et Utiliser l'éditeur de code.
La liste complète des paramètres ainsi qu'un exemple de script pour l'éditeur de code sont disponibles dans la section Annexe : Exemple de script et paramètres.
Annexe : Exemple de script et paramètres
Configurer une tâche de synchronisation par lots via l'éditeur de code
Pour configurer une tâche de synchronisation par lots à l'aide de l'éditeur de code, définissez les paramètres pertinents dans le script, conformément aux exigences du format unifié. Pour plus de détails, voir la rubrique Configuration en mode script. Les informations ci-dessous décrivent les paramètres spécifiques aux sources de données à configurer lors de l'utilisation de l'éditeur de code pour une tâche de synchronisation par lots.
Exemple de script Reader
{
"type": "job",
"version": "2.0",
"steps": [
{
"stepType": "azureblob",
"parameter": {
"datasource": "",
"object": ["f/z/1.csv"],
"fileFormat": "csv",
"encoding": "utf8/gbk/...",
"fieldDelimiter": ",",
"useMultiCharDelimiter": true,
"lineDelimiter": "\n",
"skipHeader": true,
"compress": "zip/gzip",
"column": [
{
"index": 0,
"type": "long"
},
{
"index": 1,
"type": "boolean"
},
{
"index": 2,
"type": "double"
},
{
"index": 3,
"type": "string"
},
{
"index": 4,
"type": "date"
}
]
},
"name": "Reader",
"category": "reader"
},
{
"stepType": "stream",
"parameter": {},
"name": "Writer",
"category": "writer"
}
],
"setting": {
"errorLimit": {
"record": "0"
},
"speed": {
"concurrent": 1
}
},
"order": {
"hops": [
{
"from": "Reader",
"to": "Writer"
}
]
}
}
Paramètres du script Reader
|
Paramètre |
Description |
Obligatoire |
Valeur par défaut |
|
datasource |
Nom de la source de données. Il doit correspondre exactement au nom de la source ajoutée. Vous pouvez ajouter des sources de données via l'éditeur de code. |
Oui |
Aucune valeur par défaut |
|
fileFormat |
Format du fichier source. Valeurs possibles : |
Oui |
Aucune valeur par défaut |
|
object |
Chemin d'accès au fichier. Ce paramètre est requis uniquement lorsque le paramètre fileFormat est défini sur csv ou text. Remarque
Ce paramètre accepte les astérisques ( Par exemple, pour synchroniser les données des fichiers |
Obligatoire si fileFormat est défini sur csv ou text |
Aucune valeur par défaut |
|
path |
Chemin d'accès au fichier. Ce paramètre est requis uniquement lorsque le paramètre fileFormat est défini sur parquet ou orc. Remarque
Ce paramètre accepte les astérisques ( Par exemple, pour synchroniser les données des fichiers |
Obligatoire si fileFormat est défini sur parquet ou orc |
Aucune valeur par défaut |
|
column |
Colonnes dont vous souhaitez lire les données. Le paramètre type indique le type de données source. Le paramètre index spécifie l'ID de la colonne dans le fichier source (les ID commencent à 0). Le paramètre value définit la valeur d'une colonne constante générée automatiquement, plutôt que lue depuis la source. Par défaut, le lecteur traite toutes les données comme des chaînes selon la configuration suivante :
Vous pouvez également configurer le paramètre column au format suivant :
Remarque
Pour le paramètre column, vous devez configurer le paramètre type ainsi que le paramètre index ou value. |
Oui |
"column": ["*"] |
|
fieldDelimiter |
Délimiteur de colonnes utilisé dans le fichier source. Remarque
|
Oui |
, |
|
lineDelimiter |
Délimiteur de lignes utilisé dans le fichier source. Remarque
Ce paramètre prend effet uniquement lorsque le paramètre fileFormat est défini sur text. |
Non |
Aucune valeur par défaut |
|
compress |
Format de compression des fichiers. Par défaut, ce paramètre est vide, ce qui signifie qu'aucune compression n'est appliquée. Les formats suivants sont pris en charge : |
Non |
Aucune valeur par défaut |
|
encoding |
Format d'encodage du fichier source. |
Non |
utf-8 |
|
nullFormat |
Chaîne représentant une valeur null. Aucun standard universel ne définit la représentation des valeurs null dans les fichiers TXT. Utilisez ce paramètre pour définir la chaîne correspondant à une valeur null.
|
Non |
Aucune valeur par défaut |
|
skipHeader |
Indique s'il faut ignorer la ligne d'en-tête dans les fichiers CSV.
Remarque
Le mode de fichier compressé ne prend pas en charge le paramètre skipHeader. |
Non |
false |
|
parquetSchema |
Spécifie le schéma lors de la lecture de fichiers Parquet depuis Azure Blob Storage. Ce paramètre est valide uniquement lorsque fileFormat est défini sur parquet. Assurez-vous que le script global reste un JSON valide après avoir spécifié ce paramètre.
Le paramètre parquetSchema contient les champs suivants :
Exemple de configuration :
|
Non |
Aucune valeur par défaut |
|
csvReaderConfig |
Configurations avancées pour la lecture des fichiers CSV. Ce paramètre est spécifié sous forme de map. Si vous ne le configurez pas, les paramètres par défaut s'appliquent. |
Non |
Aucune valeur par défaut |
|
maxRetryTimes |
Nombre maximal de tentatives autorisées en cas d'échec du téléchargement d'un fichier. Remarque
|
Non |
0 |
|
retryIntervalSeconds |
Intervalle de nouvelle tentative autorisé en cas d'échec du téléchargement d'un fichier. Unité : secondes. Remarque
Il s'agit d'un paramètre avancé, disponible uniquement dans l'éditeur de code. |
Non |
5 |