Data Lake Formation (DLF) d'Alibaba Cloud est une plateforme entièrement gérée qui offre des services unifiés pour la gestion des métadonnées, du stockage, des autorisations, ainsi que pour l'analyse et l'optimisation du stockage. L'intégration de données de DataWorks permet d'écrire des données dans des sources de données DLF. Cette rubrique explique comment configurer et utiliser une source de données Data Lake Formation dans DataWorks.
Limites
L'utilisation d'une source de données Data Lake Formation est limitée à l'intégration de données et aux groupes de ressources serverless.
Créer une source de données
-
Connectez-vous à la console DataWorks. Dans la région cible, cliquez sur dans le volet de navigation de gauche. Sélectionnez un espace de travail dans la liste déroulante, puis cliquez sur Go to Management Center.
Sur la page Workspace Management, cliquez sur Data Sources dans le volet de navigation de gauche pour accéder à la page des sources de données.
-
Cliquez sur Add Data Source. Dans la boîte de dialogue qui s'affiche, recherchez et sélectionnez DLF. Configurez les paramètres comme indiqué dans le tableau suivant.
Parameter
Description
Data Source Name
Saisissez un nom personnalisé pour la source de données. Ce nom doit être unique au sein de l'espace de travail, ne contenir que des lettres, des chiffres et des traits de soulignement (_), et ne peut pas commencer par un chiffre ou un trait de soulignement.
Configuration Mode
Seul le mode Alibaba Cloud Instance Mode est pris en charge.
Endpoint
Sélectionnez l'endpoint de l'instance du moteur DLF dans la liste déroulante.
Access identity
Sélectionnez l'une des options suivantes :
-
Alibaba Cloud Account
-
Alibaba Cloud RAM User
-
Alibaba Cloud RAM Role
RemarqueSi vous sélectionnez RAM user ou RAM role comme identité d'accès, vous devez accorder les autorisations suivantes à l'utilisateur RAM ou au rôle RAM :
-
Dans la console RAM, attachez la stratégie système AliyunDataWorksDIAccessDLF à l'utilisateur RAM ou au rôle RAM afin d'accorder les autorisations d'accès aux métadonnées DLF. Pour plus d'informations, consultez Accorder des autorisations à un utilisateur RAM.
-
Dans la console Data Lake Formation, accordez l'autorisation Data Editor au rôle RAM ou à l'utilisateur RAM sur les tables à synchroniser.
DLF data catalog
Sélectionnez un catalogue de données DLF dans la même région que votre espace de travail DataWorks.
Database Name
Sélectionnez une base de données dans le catalogue de données.
Une fois les paramètres configurés, testez la connectivité avec le groupe de ressources serverless. Si le test réussit, cliquez sur Complete Modification. En cas d'échec, consultez la section Configuration de la connectivité réseau pour résoudre le problème.
-
Créer une tâche d'intégration de données
Vous pouvez utiliser une source de données Data Lake Formation dans une tâche d'intégration de données DataWorks. Pour plus d'informations, consultez la section Synchroniser des données vers Data Lake Formation.
Annexe : Exemples de scripts et paramètres
Configuration du script de tâche hors ligne
Lors de la configuration d'une tâche hors ligne via l'éditeur de code, vous devez ajouter les paramètres au script de la tâche selon le format requis. Pour plus d'informations, consultez la section Configurer une tâche dans l'éditeur de code. Les sections suivantes décrivent les paramètres de source de données utilisables dans l'éditeur de code.
Exemple de script Reader
{
"type": "job",
"version": "2.0",
"steps": [
{
"stepType": "dlf",
"parameter": {
"datasource": "guxuan_dlf",
"table": "auto_ob_3088545_0523",
"column": [
"id",
"col1",
"col2",
"col3"
],
"tableType": "table",
"where": "id > 1"
},
"name": "Reader",
"category": "reader"
},
{
"stepType": "stream",
"parameter": {
"print": false
},
"name": "Writer",
"category": "writer"
}
],
"setting": {
"errorLimit": {
"record": "" // The number of error records that are allowed.
},
"speed": {
"throttle": true, // Set to true to enable rate limiting. If set to false, rate limiting is disabled and the mbps parameter is ignored.
"concurrent": 20, // The number of concurrent threads.
"mbps": "12" // The maximum data transfer rate. Unit: MB/s.
}
},
"order": {
"hops": [
{
"from": "Reader",
"to": "Writer"
}
]
}
}
Paramètres du script Reader
|
Parameter |
Description |
Required |
Default |
|
datasource |
Nom de la source de données DLF. |
Oui |
S/O |
|
table |
Nom de la table source. |
Oui |
S/O |
|
tableType |
Type de table. Valeurs valides : |
Non |
table |
|
column |
Noms des colonnes à lire depuis la table source. |
Oui |
S/O |
|
where |
Condition de filtrage. |
Non |
S/O |
Exemple de script Writer
{
"type": "job",
"version": "2.0",
"steps": [
{
"stepType": "stream",
"parameter": {
},
"name": "Reader",
"category": "reader"
},
{
"stepType": "dlf",
"parameter": {
"datasource": "guxuan_dlf",
"column": [
"id",
"col1",
"col2",
"col3"
],
"tableType": "table",
"table": "auto_ob_3088545_0523"
},
"name": "Writer",
"category": "writer"
}
],
"setting": {
"errorLimit": {
"record": "" // The number of error records that are allowed.
},
"speed": {
"throttle": true, // Set to true to enable rate limiting. If set to false, rate limiting is disabled and the mbps parameter is ignored.
"concurrent": 20, // The number of concurrent threads.
"mbps": "12" // The maximum data transfer rate. Unit: MB/s.
}
},
"order": {
"hops": [
{
"from": "Reader",
"to": "Writer"
}
]
}
}
Paramètres du script Writer
|
Parameter |
Description |
Required |
Default |
|
datasource |
Nom de la source de données DLF. |
Oui |
S/O |
|
table |
Nom de la table de destination. |
Oui |
S/O |
|
tableType |
Type de table. Valeurs valides : |
Non |
table |
|
column |
Colonnes de la table de destination. |
Oui |
S/O |