Tous les produits
Search
Centre de documentation

DataWorks:Source de données Azure Blob Storage

Dernière mise à jour :Aug 24, 2026

DataWorks met à votre disposition le connecteur Azure Blob Storage Reader pour lire les données contenues dans les fichiers stockés sur Azure Blob Storage. Ce connecteur vous permet d'accéder aux fichiers, d'analyser leur contenu et de synchroniser les données vers une destination. Cette rubrique détaille les fonctionnalités de synchronisation des données depuis les sources Azure Blob Storage.

Limites

La source de données Azure Blob Storage prend en charge les types de données suivants.

Type de données

Description

STRING

Texte.

LONG

Entier.

BYTES

Tableau d'octets. Le texte lu est converti en tableau d'octets encodé au format UTF-8.

BOOL

Booléen.

DOUBLE

Nombre à virgule flottante.

DATE

Date et heure. Les formats suivants sont pris en charge :

  • YYYY-MM-dd HH:mm:ss

  • yyyy-MM-dd

  • HH:mm:ss

Ajouter une source de données

Avant de développer une tâche de synchronisation dans DataWorks, ajoutez la source de données requise en suivant les instructions décrites dans la rubrique Configuration des sources de données. Consultez les descriptions des paramètres dans la console DataWorks pour comprendre leur signification lors de l'ajout d'une source de données.

Développer une tâche de synchronisation des données

Pour connaître le point d'entrée et la procédure de configuration d'une tâche de synchronisation, reportez-vous aux guides suivants.

Configurer une tâche de synchronisation par lots pour une seule table

Annexe : Exemple de script et paramètres

Configurer une tâche de synchronisation par lots via l'éditeur de code

Pour configurer une tâche de synchronisation par lots à l'aide de l'éditeur de code, définissez les paramètres pertinents dans le script, conformément aux exigences du format unifié. Pour plus de détails, voir la rubrique Configuration en mode script. Les informations ci-dessous décrivent les paramètres spécifiques aux sources de données à configurer lors de l'utilisation de l'éditeur de code pour une tâche de synchronisation par lots.

Exemple de script Reader

{
  "type": "job",
  "version": "2.0",
  "steps": [
    {
      "stepType": "azureblob",
      "parameter": {
        "datasource": "",
        "object": ["f/z/1.csv"],
        "fileFormat": "csv",
        "encoding": "utf8/gbk/...",
        "fieldDelimiter": ",",
        "useMultiCharDelimiter": true,
        "lineDelimiter": "\n",
        "skipHeader": true,
        "compress": "zip/gzip",
        "column": [
          {
            "index": 0,
            "type": "long"
          },
          {
            "index": 1,
            "type": "boolean"
          },
          {
            "index": 2,
            "type": "double"
          },
          {
            "index": 3,
            "type": "string"
          },
          {
            "index": 4,
            "type": "date"
          }
        ]
      },
      "name": "Reader",
      "category": "reader"
    },
    {
      "stepType": "stream",
      "parameter": {},
      "name": "Writer",
      "category": "writer"
    }
  ],
  "setting": {
    "errorLimit": {
      "record": "0"
    },
    "speed": {
      "concurrent": 1
    }
  },
  "order": {
    "hops": [
      {
        "from": "Reader",
        "to": "Writer"
      }
    ]
  }
}

Paramètres du script Reader

Paramètre

Description

Obligatoire

Valeur par défaut

datasource

Nom de la source de données. Il doit correspondre exactement au nom de la source ajoutée. Vous pouvez ajouter des sources de données via l'éditeur de code.

Oui

Aucune valeur par défaut

fileFormat

Format du fichier source. Valeurs possibles : csv, text, parquet et orc.

Oui

Aucune valeur par défaut

object

Chemin d'accès au fichier. Ce paramètre est requis uniquement lorsque le paramètre fileFormat est défini sur csv ou text.

Remarque

Ce paramètre accepte les astérisques (*) et les tableaux.

Par exemple, pour synchroniser les données des fichiers 1.csv et 2.csv situés dans le chemin a/b, définissez ce paramètre sur a/b/*.csv.

Obligatoire

si fileFormat est défini sur csv ou text

Aucune valeur par défaut

path

Chemin d'accès au fichier. Ce paramètre est requis uniquement lorsque le paramètre fileFormat est défini sur parquet ou orc.

Remarque

Ce paramètre accepte les astérisques (*) et les tableaux.

Par exemple, pour synchroniser les données des fichiers 1.orc et 2.orc situés dans le chemin a/b, définissez ce paramètre sur a/b/*.orc.

Obligatoire

si fileFormat est défini sur parquet ou orc

Aucune valeur par défaut

column

Colonnes dont vous souhaitez lire les données. Le paramètre type indique le type de données source. Le paramètre index spécifie l'ID de la colonne dans le fichier source (les ID commencent à 0). Le paramètre value définit la valeur d'une colonne constante générée automatiquement, plutôt que lue depuis la source.

Par défaut, le lecteur traite toutes les données comme des chaînes selon la configuration suivante :

column": ["*"]

Vous pouvez également configurer le paramètre column au format suivant :

"column":    
    {       
        "type": "long",       
        "index": 0 // La première colonne du fichier est lue. La colonne est de type INT. 
    },    
    {       
        "type": "string",       
        "value": "alibaba" // Une colonne constante de type STRING est générée par Azure Blob Storage Reader. La valeur constante de la colonne est alibaba.     
}
Remarque

Pour le paramètre column, vous devez configurer le paramètre type ainsi que le paramètre index ou value.

Oui

"column": ["*"]

fieldDelimiter

Délimiteur de colonnes utilisé dans le fichier source.

Remarque
  • Vous devez spécifier un délimiteur de colonnes pour Azure Blob Storage Reader. La valeur par défaut est la virgule (,). Si aucun délimiteur n'est indiqué, la valeur par défaut s'applique.

  • Si le délimiteur est non imprimable, saisissez une valeur encodée en Unicode, telle que \u001b ou \u007c.

Oui

,

lineDelimiter

Délimiteur de lignes utilisé dans le fichier source.

Remarque

Ce paramètre prend effet uniquement lorsque le paramètre fileFormat est défini sur text.

Non

Aucune valeur par défaut

compress

Format de compression des fichiers. Par défaut, ce paramètre est vide, ce qui signifie qu'aucune compression n'est appliquée. Les formats suivants sont pris en charge : GZIP, BZIP2 et ZIP.

Non

Aucune valeur par défaut

encoding

Format d'encodage du fichier source.

Non

utf-8

nullFormat

Chaîne représentant une valeur null. Aucun standard universel ne définit la représentation des valeurs null dans les fichiers TXT. Utilisez ce paramètre pour définir la chaîne correspondant à une valeur null.

  • Si vous spécifiez nullFormat:"null", le lecteur interprète la chaîne imprimable « null » comme une valeur null.

  • Si vous spécifiez nullFormat:"\u0001", le lecteur interprète la chaîne non imprimable \u0001 comme une valeur null.

  • Si vous ne configurez pas le paramètre nullFormat, le lecteur ne convertit pas les données source.

Non

Aucune valeur par défaut

skipHeader

Indique s'il faut ignorer la ligne d'en-tête dans les fichiers CSV.

  • True : le lecteur lit les en-têtes du fichier CSV.

  • False : le lecteur ignore les en-têtes du fichier CSV.

Remarque

Le mode de fichier compressé ne prend pas en charge le paramètre skipHeader.

Non

false

parquetSchema

Spécifie le schéma lors de la lecture de fichiers Parquet depuis Azure Blob Storage. Ce paramètre est valide uniquement lorsque fileFormat est défini sur parquet. Assurez-vous que le script global reste un JSON valide après avoir spécifié ce paramètre.

message MessageTypeName {
required, dataType, columnName;
......................;
}

Le paramètre parquetSchema contient les champs suivants :

  • MessageTypeName : nom du type de message.

  • Required/Optional : required indique que la colonne ne peut pas être null. optional indique que la colonne peut être null. Il est recommandé d'utiliser optional pour toutes les colonnes.

  • dataType : les fichiers Parquet prennent en charge divers types de champs, tels que BOOLEAN, INT32, INT64, INT96, FLOAT, DOUBLE, BINARY et FIXED_LEN_BYTE_ARRAY. Définissez ce paramètre sur BINARY si le champ stocke des chaînes.

  • Chaque ligne, y compris la dernière, doit se terminer par un point-virgule (;).

Exemple de configuration :

"parquetSchema": "message m { optional int32 minute_id; optional int32 dsp_id; optional int32 adx_pid; optional int64 req; optional int64 res; optional int64 suc; optional int64 imp; optional double revenue; }"

Non

Aucune valeur par défaut

csvReaderConfig

Configurations avancées pour la lecture des fichiers CSV. Ce paramètre est spécifié sous forme de map. Si vous ne le configurez pas, les paramètres par défaut s'appliquent.

Non

Aucune valeur par défaut

maxRetryTimes

Nombre maximal de tentatives autorisées en cas d'échec du téléchargement d'un fichier.

Remarque
  • Définissez ce paramètre sur 0 pour désactiver la fonctionnalité de nouvelle tentative de téléchargement.

  • Il s'agit d'un paramètre avancé, disponible uniquement dans l'éditeur de code.

Non

0

retryIntervalSeconds

Intervalle de nouvelle tentative autorisé en cas d'échec du téléchargement d'un fichier. Unité : secondes.

Remarque

Il s'agit d'un paramètre avancé, disponible uniquement dans l'éditeur de code.

Non

5