Tous les produits
Search
Centre de documentation

DataWorks:Source de données TOS

Dernière mise à jour :Aug 10, 2026

La source de données TOS permet de lire des fichiers TOS. Utilisez cette source pour récupérer les fichiers stockés dans TOS, les analyser et synchroniser les données vers n'importe quelle destination. Cette rubrique décrit les fonctionnalités de synchronisation des données prises en charge par DataWorks pour TOS.

Limitations

La source de données TOS prend en charge les types de colonne suivants dans DataWorks.

Type de données

Description

STRING

Type texte.

LONG

Type entier.

BYTES

Tableau d'octets. Convertit le contenu textuel lu en un tableau d'octets encodé en UTF-8.

BOOL

Type booléen.

DOUBLE

Type à virgule flottante.

DATE

Type date et heure. Les formats de date et d'heure suivants sont pris en charge :

  • YYYY-MM-dd HH:mm:ss

  • yyyy-MM-dd

  • HH:mm:ss

Créer une source de données TOS

Avant de développer une tâche de synchronisation dans DataWorks, ajoutez la source de données requise à DataWorks en suivant les instructions de la rubrique Configuration de la source de données. Consultez les descriptions des paramètres dans la console DataWorks pour comprendre leur signification lors de l'ajout d'une source de données.

Développer une tâche de synchronisation des données

La source de données TOS ne peut être utilisée que comme source dans les tâches de synchronisation par lots d'une seule table. La section suivante décrit le point d'entrée et le processus général de configuration des tâches de synchronisation des données.

Annexe : Exemple de script et paramètres

Configurer une tâche de synchronisation par lots à l'aide de l'éditeur de code

Pour configurer une tâche de synchronisation par lots à l'aide de l'éditeur de code, définissez les paramètres associés dans le script selon les exigences de format de script unifié. Pour plus d'informations, consultez la rubrique Configuration en mode script. Les informations suivantes décrivent les paramètres à configurer pour les sources de données lors de la configuration d'une tâche de synchronisation par lots à l'aide de l'éditeur de code.

Exemple de script Reader

{
  "type": "job",
  "version": "2.0",
  "steps": [
    {
      "stepType": "tos",
      "parameter": {
        "datasource": "",
        "object": ["f/z/1.csv"],
        "fileFormat": "csv",
        "encoding": "utf8/gbk/...",
        "fieldDelimiter": ",",
        "useMultiCharDelimiter": true,
        "skipHeader": true,
        "compress": "zip/gzip",
        "column": [
          {
            "index": 0,
            "type": "long"
          },
          {
            "index": 1,
            "type": "boolean"
          },
          {
            "index": 2,
            "type": "double"
          },
          {
            "index": 3,
            "type": "string"
          },
          {
            "index": 4,
            "type": "date"
          }
        ]
      },
      "name": "Reader",
      "category": "reader"
    },
    {
      "stepType": "stream",
      "parameter": {},
      "name": "Writer",
      "category": "writer"
    }
  ],
  "setting": {
    "errorLimit": {
      "record": "0"
    },
    "speed": {
      "concurrent": 1
    }
  },
  "order": {
    "hops": [
      {
        "from": "Reader",
        "to": "Writer"
      }
    ]
  }
}

Paramètres du script Reader

Paramètre

Description

Obligatoire

Valeur par défaut

datasource

Nom de la source de données. Le mode script prend en charge l'ajout de sources de données. La valeur de ce paramètre doit correspondre au nom de la source de données ajoutée.

Oui

Aucune

fileFormat

Type de fichier source. Types pris en charge : csv, text, parquet et orc.

Oui

Aucune

object

Chemin du fichier. Ce paramètre prend en charge le caractère générique * et peut être configuré sous forme de tableau.

Par exemple, pour synchroniser les deux fichiers a/b/1.csv et a/b/2.csv, configurez a/b/*.csv.

Oui

Aucune

column

Liste des colonnes à lire. type spécifie le type de données source. index indique de quelle colonne du texte provient la colonne actuelle (en commençant par 0). value spécifie que le type actuel est une constante. Au lieu de lire les données à partir du fichier source, la colonne correspondante est générée automatiquement en fonction de la valeur.

  • Par défaut, toutes les données sont lues en tant que type String. La configuration est la suivante.

    column": ["*"]
  • Spécifiez les informations de colonne comme suit.

    "column":    
        {       
            "type": "long",       
            "index": 0 //Obtient le champ int de la première colonne du texte TOS.
        },    
        {       
            "type": "string",       
            "value": "alibaba" //Génère en interne le champ de chaîne 'alibaba' à partir de TOS en tant que champ actuel.    
    }
Remarque

Pour les informations column que vous spécifiez, type est obligatoire et vous devez choisir soit index, soit value.

Oui

Tout est lu en tant que STRING.

fieldDelimiter

Délimiteur de champ pour la lecture.

Remarque
  • Lorsque TOS Reader lit des données, spécifiez un délimiteur de champ. S'il n'est pas spécifié, la valeur par défaut est la virgule (,), qui est également préremplie dans la configuration de l'interface utilisateur.

  • Si le délimiteur n'est pas visible, saisissez le code Unicode. Par exemple : \u001b ou \u007c.

Oui

,

lineDelimiter

Délimiteur de ligne pour la lecture.

Remarque

Ce paramètre prend effet uniquement lorsque fileFormat est défini sur text.

Non

Aucune

compress

Type de compression du texte. Vide par défaut (pas de compression). Types de compression pris en charge : gzip, bzip2 et zip.

Non

Pas de compression

encoding

Encodage utilisé pour lire le fichier.

Non

utf-8

nullFormat

Les fichiers texte ne peuvent pas définir null (pointeur nul) à l'aide d'une chaîne standard. Le système de synchronisation des données fournit nullFormat pour définir quelles chaînes peuvent être traitées comme null. Par exemple :

  • Si vous définissez nullFormat:"null", cela équivaut à un « caractère visible ». Si les données source sont null, la synchronisation des données les traite comme un champ null.

  • Si vous définissez nullFormat:"\u0001", cela équivaut à un « caractère invisible ». Si les données source sont la chaîne "\u0001", la synchronisation des données les traite comme un champ null.

  • Si "nullFormat" n'est pas spécifié, cela équivaut à « non configuré », ce qui signifie que les données source sont écrites dans la destination telles quelles, sans conversion.

Non

Aucune

skipHeader

Pour les fichiers CSV, utilisez skipHeader pour contrôler si l'en-tête est lu.

  • True : Lit l'en-tête lors de la synchronisation de la source de données.

  • False : Ne lit pas l'en-tête lors de la synchronisation de la source de données.

Remarque

skipHeader n'est pas pris en charge en mode fichier compressé.

Non

false

parquetSchema

Configurez ce paramètre lors de la lecture de TOS au format de fichier Parquet. Il prend effet uniquement lorsque fileFormat est défini sur parquet et décrit le type de stockage des données Parquet. Assurez-vous que toute la configuration respecte la syntaxe JSON après avoir rempli parquetSchema.

message MessageTypeName {
required or optional, data type, column name;
......................;
}
  • Le format de parquetSchema est décrit comme suit :

    • Nom MessageType : saisissez un nom.

    • Obligatoire ou non : required indique non nul, optional indique nullable. Nous recommandons de tout définir sur optional.

    • Type de données : les fichiers Parquet prennent en charge BOOLEAN, Int32, Int64, Int96, FLOAT, DOUBLE, BINARY (utilisez BINARY pour le type chaîne) et fixed_len_byte_array.

    • Chaque ligne de colonne doit se terminer par un point-virgule, y compris la dernière ligne.

  • Exemple de configuration :

    "parquetSchema": "message m { optional int32 minute_id; optional int32 dsp_id; optional int32 adx_pid; optional int64 req; optional int64 res; optional int64 suc; optional int64 imp; optional double revenue; }"

Non

Aucune

csvReaderConfig

Paramètres de configuration pour la lecture des fichiers CSV, sous forme de type Map. La lecture des fichiers CSV utilise csvReader. S'ils ne sont pas configurés, les valeurs par défaut sont utilisées.

Non

Aucune