Tous les produits
Search
Centre de documentation

DataWorks:Source de données SelectDB

Dernière mise à jour :Aug 10, 2026

Data Integration de DataWorks vous permet d'écrire des données dans SelectDB via une synchronisation hors ligne, qu'il s'agisse d'une table unique ou de l'ensemble d'une base de données. Cette rubrique décrit les capacités de synchronisation des données prises en charge.

Versions de SelectDB prises en charge

SelectDB Writer utilise le pilote MySQL 5.1.47. Pour plus d'informations sur les fonctionnalités du pilote, consultez MySQL Connectors. Le pilote prend en charge les versions suivantes :

  • Versions standard de SelectDB : 2.2.31 et 2.2.22.

  • Versions Alibaba Cloud de SelectDB : 2,4, 3,0 et 4,0.

Limites

L'écriture de données dans des champs de type BITMAP, HLL (HyperLogLog) ou QUANTILE_STATE n'est pas prise en charge.

Types de champs pris en charge

Pour obtenir la liste complète des types de champs pour chaque version de SelectDB, consultez la documentation officielle de SelectDB. Le tableau suivant présente, à titre d'exemple, les types de champs pris en charge pour SelectDB 2.2.22.

|
**Type de champ SelectDB**
|
**Écriture hors ligne (SelectDB Writer)**
| | --- | --- | |
INT
|
Pris en charge
| |
BIGINT
|
Pris en charge
| |
LARGEINT
|
Pris en charge
| |
SMALLINT
|
Pris en charge
| |
TINYINT
|
Pris en charge
| |
BOOLEAN
|
Pris en charge
| |
DECIMAL
|
Pris en charge
| |
DOUBLE
|
Pris en charge
| |
FLOAT
|
Pris en charge
| |
CHAR
|
Pris en charge
| |
VARCHAR
|
Pris en charge
| |
STRING
|
Pris en charge
| |
DATE
|
Pris en charge
| |
DATEV2
|
Pris en charge
| |
DATETIME
|
Pris en charge
| |
DATETIMEV2
|
Pris en charge
| |
ARRAY
|
Pris en charge
| |
JSONB
|
Pris en charge
| |
BITMATP
|
Non pris en charge
| |
HLL (HyperLogLog)
|
Non pris en charge
| |
QUANTILE_STATE
|
Non pris en charge
|























































































Préparatifs avant la synchronisation des données

Avant de synchroniser des données sur DataWorks, préparez l'environnement de synchronisation côté SelectDB comme décrit dans cette rubrique. Cette étape garantit que les tâches de synchronisation des données SelectDB peuvent être correctement configurées et exécutées sur DataWorks. Les sections suivantes détaillent les préparatifs requis avant la synchronisation avec SelectDB.

Préparatif 1 : Confirmer la version de SelectDB

Data Integration impose des exigences de version pour SelectDB. Pour plus d'informations, consultez Versions de SelectDB prises en charge. Vérifiez si l'instance SelectDB à synchroniser respecte les exigences de version depuis la console SelectDB.

Préparatif 2 : Créer un compte et configurer les autorisations

Nous vous recommandons de créer un compte SelectDB dédié afin que DataWorks puisse accéder à la source de données. Si vous souhaitez utiliser l'utilisateur admin par défaut de l'entrepôt de données SelectDB pour vous connecter, définissez un mot de passe pour cet utilisateur admin.

Préparatif 3 : Configurer la connexion réseau pour SelectDB

SelectDB prend en charge les connexions via réseau privé et public. Data Integration vous permet de vous connecter à SelectDB via l'un ou l'autre type de réseau.

  1. Connexion par réseau privé : Une connexion par réseau privé offre une bande passante plus élevée et une connectivité plus stable ; nous vous recommandons donc cette option. Avant d'utiliser une connexion par réseau privé, créez un endpoint en suivant les instructions fournies dans Network Configuration. Une fois l'endpoint créé, attendez que son statut passe de Creating à Available et que l'état de la connexion passe de Connecting à Connected. Vous devez ensuite associer le VPC de l'endpoint au VPC du groupe de ressources. Pour plus d'informations, consultez Configurer la connectivité réseau.

  2. Connexion par réseau public : Ajoutez les adresses EIP du groupe de ressources à la liste d'autorisation de SelectDB. Pour plus d'informations, consultez Ajouter la liste d'autorisation.

Ajouter une source de données

Avant de développer une tâche de synchronisation dans DataWorks, ajoutez la source de données requise à DataWorks en suivant les instructions de Configuration de la source de données. Consultez les descriptions des paramètres dans la console DataWorks pour comprendre la signification des paramètres lors de l'ajout d'une source de données.

La section suivante décrit les éléments de configuration d'une source de données SelectDB :

  • Mysql Connection Address : Saisissez la chaîne de connexion JDBC. Copiez la JDBC Connection String depuis Connection Method > Other Methods dans la console SelectDB. Les adresses IP publiques et privées sont toutes deux prises en charge.

  • HTTP Connection Address : Saisissez l'adresse d'accès via le protocole HTTP. Copiez l'HTTP Protocol Access Address depuis Connection Method > Other Methods dans la console SelectDB. Les adresses IP publiques et privées sont toutes deux prises en charge.

  • Username : Saisissez le nom d'utilisateur de l'entrepôt de données SelectDB.

  • Password : Saisissez le mot de passe de l'utilisateur correspondant pour l'entrepôt de données SelectDB.

Développement de tâches de synchronisation des données

Pour obtenir des informations sur le point d'entrée et la procédure de configuration d'une tâche de synchronisation, consultez les guides de configuration suivants.

Guide de configuration des tâches de synchronisation par lots pour une table unique

Guide de configuration des tâches de synchronisation par lots pour toute la base de données

Annexe : Exemple de script SelectDB et description des paramètres

Configurer une tâche de synchronisation par lots à l'aide de l'éditeur de code

Si vous souhaitez configurer une tâche de synchronisation par lots à l'aide de l'éditeur de code, configurez les paramètres associés dans le script selon les exigences de format de script unifié. Pour plus d'informations, consultez Configuration en mode Script. Les informations suivantes décrivent les paramètres que vous devez configurer pour les sources de données lors de la configuration d'une tâche de synchronisation par lots à l'aide de l'éditeur de code.

Exemple de script Writer

{ "stepType": "selectdb",//Le nom du plug-in. "parameter": { "postSql"://Les instructions SQL exécutées après l'exécution de la tâche de synchronisation des données. [], "preSql": [],//Les instructions SQL exécutées avant l'exécution de la tâche de synchronisation des données. "datasource":"selectdb_datasource",//Le nom de la source de données. "table": "selectdb_table_name",//Le nom de la table. "column": [ "id", "table_id", "table_no", "table_name", "table_status" ], "loadProps":{ "format":"csv",//Spécifie le format CSV. "column_separator": "\\x01",//Spécifie le délimiteur de colonne. "line_delimiter": "\\x02"//Spécifie le délimiteur de ligne. } }, "name": "Writer", "category": "writer" }

Paramètres du script Writer

Paramètre

Description

Obligatoire

Valeur par défaut

datasource

Le nom de la source de données. Le mode Script vous permet d'ajouter des sources de données. La valeur de ce paramètre doit correspondre au nom de la source de données ajoutée.

Oui

N/A

table

Le nom de la table à synchroniser.

Oui

N/A

column

Les colonnes dans lesquelles les données sont écrites dans la table de destination. Séparez les noms de colonnes par des virgules (,). Exemple : "column":["id","name","age"]. Pour écrire des données dans toutes les colonnes dans l'ordre, utilisez (). Exemple : "column":[""].

Oui

N/A

preSql

Les instructions SQL à exécuter avant l'exécution de la tâche de synchronisation des données. Actuellement, le mode Assistant ne permet d'exécuter qu'une seule instruction SQL, tandis que le mode Script en prend plusieurs en charge. Par exemple, vous pouvez effacer les anciennes données de la table avant l'exécution de la tâche.

Non

N/A

postSql

Les instructions SQL à exécuter après l'exécution de la tâche de synchronisation des données. Actuellement, le mode Assistant ne permet d'exécuter qu'une seule instruction SQL, tandis que le mode Script en prend plusieurs en charge. Par exemple, vous pouvez ajouter un horodatage.

Non

N/A

maxBatchRows

Le nombre maximal de lignes à importer par lot. Ce paramètre fonctionne conjointement avec batchSize pour contrôler le volume de chaque importation par lot. L'importation par lot commence lorsque l'un ou l'autre seuil est atteint.

Non

500000

batchSize

La taille maximale des données à importer par lot. Ce paramètre fonctionne conjointement avec maxBatchRows pour contrôler le volume de chaque importation par lot. L'importation par lot commence lorsque l'un ou l'autre seuil est atteint.

Non

94371840

maxRetries

Le nombre de tentatives après l'échec d'une importation par lot.

Non

3

labelPrefix

Le préfixe de libellé pour chaque chargement par lot. Le libellé final est composé de labelPrefix + UUID pour former un libellé globalement unique, garantissant ainsi que les données ne sont pas importées plusieurs fois.

Non

datax_selectdb_writer_

loadProps

Les paramètres de requête pour COPY INTO, principalement utilisés pour configurer le format des données lors de l'importation. Par défaut, les données sont importées au format JSON. Si loadProps n'est pas configuré ou défini sur "loadProps":{}, le format JSON par défaut est utilisé, comme indiqué dans la configuration suivante. (Actuellement, SelectDB ne prend en charge que strip_outer_array=true.)

"loadProps": {
        "format": "json",
        "strip_outer_array":true
    }

Si vous souhaitez importer des données au format CSV, spécifiez le format CSV et configurez les délimiteurs de ligne et de colonne comme suit. Si vous ne spécifiez pas les délimiteurs de ligne et de colonne, toutes les données d'entrée sont converties en chaînes par défaut, avec \t comme délimiteur de colonne et \n comme délimiteur de ligne, afin de former un fichier CSV pour l'opération d'importation SelectDB.

"loadProps": {
        "format":"csv",
        "column_separator": "\\x01",
        "line_delimiter": "\\x02"
    }

Non

N/A

clusterName

Le nom du cluster SelectDB Cloud. Vous pouvez le consulter sur la console SelectDB.

Non

N/A

flushInterval

L'intervalle de temps (en ms) entre les lots d'écriture de données. Si les paramètres maxBatchRows et batchSize sont définis sur des valeurs élevées, le système peut déclencher l'importation des données en fonction de l'intervalle de temps avant que le volume de données spécifié ne soit atteint.

Non

30000