La fonctionnalité Data Upload (Téléchargement de données) de DataWorks vous permet de charger des données provenant de diverses sources, telles que des fichiers locaux, des feuilles de calcul issues de Data Analysis, des fichiers OSS et des fichiers HTTP, vers des moteurs comme MaxCompute, EMR Hive, Hologres et StarRocks pour analyse et gestion. Ce service de transfert de données pratique vous aide à exploiter rapidement vos données pour dynamiser votre activité. Cette rubrique explique comment utiliser la fonctionnalité Data Upload pour charger des données.
Notes
Si vos opérations impliquent des transferts de données transfrontaliers (par exemple, le transfert de données depuis la Chine continentale vers un emplacement situé hors de Chine continentale, ou entre différents pays ou régions), vous devez d'abord lire et comprendre la déclaration de conformité associée. Dans le cas contraire, le téléchargement peut échouer et vous pourriez engager votre responsabilité légale.
Avant de charger des données, nous vous recommandons d'utiliser des en-têtes en anglais dans votre fichier source. Les en-têtes en chinois peuvent provoquer des échecs d'analyse et entraîner l'échec du chargement.
Limites
-
Limites liées aux groupes de ressources : La fonctionnalité Data Upload nécessite de spécifier un groupe de ressources pour la planification et un groupe de ressources pour Data Integration.
Cette fonctionnalité prend uniquement en charge un groupe de ressources serverless (recommandé), un groupe de ressources exclusif pour la planification et un groupe de ressources exclusif pour Data Integration. Vous devez configurer un groupe de ressources pour la planification et un groupe de ressources pour Data Integration pour le moteur respectif dans .
-
Le groupe de ressources sélectionné doit être associé à l'espace de travail DataWorks contenant la table de destination. Vous devez également garantir la connectivité réseau entre le groupe de ressources sélectionné et la source de données utilisée pour la tâche de chargement.
RemarquePour configurer le groupe de ressources d'un moteur dans Data Analysis, consultez la section Gestion du système.
Pour établir la connectivité réseau entre une source de données et un groupe de ressources, consultez les Solutions de connectivité réseau.
Pour associer un groupe de ressources exclusif à son espace de travail désigné, consultez les sections Utilisation des groupes de ressources exclusifs pour la planification et Utilisation d'un groupe de ressources exclusif pour Data Integration.
-
Autorisations requises pour le chargement de données :
Tables MaxCompute (tables ODPS) : Il vous suffit d'être le propriétaire de la table. Vous n'avez pas besoin du rôle développeur, analyste ou opérateur dans l'espace de travail DataWorks.
-
Tables autres que MaxCompute (telles que Hologres, EMR Hive et StarRocks) : En plus d'être le propriétaire de la table, vous devez avoir un rôle attribué dans l'espace de travail DataWorks.
Tables dans l'environnement de développement : Vous devez disposer du rôle développeur.
Tables dans l'environnement de production : Vous devez disposer du rôle opérateur.
Limites relatives au type de table : Vous ne pouvez charger des données que dans des tables internes ou des tables sous le catalogue par défaut (applicable à StarRocks).
Facturation
Le chargement de données entraîne les frais suivants :
Frais de transfert de données.
Si de nouvelles tables sont créées, des frais de calcul et de stockage sont appliqués.
Tous les frais sont facturés par le moteur. Pour plus d'informations, consultez les sections Facturation MaxCompute, Facturation Hologres, Facturation E-MapReduce et Facturation EMR Serverless StarRocks.
Accéder à la page Data Upload
-
Connectez-vous à la console DataWorks. Dans la région cible, cliquez sur dans le volet de navigation de gauche. Cliquez sur Go to Data Upload and Download.
Cliquez sur l'icône
dans le volet de navigation de gauche pour accéder à la page Upload Data.Cliquez sur Upload Data et suivez les instructions à l'écran pour charger les données.
Sélectionner les données à charger
Vous pouvez charger des données à partir de fichiers locaux, de feuilles de calcul, d'OSS et de fichiers HTTP. Sélectionnez une source de données en fonction de vos besoins métier.
Lorsque vous chargez un fichier, indiquez si vous souhaitez ignorer les données erronées selon vos besoins.
Oui : Si des données erronées sont détectées, le système les ignore automatiquement et poursuit le chargement.
Non : Si des données erronées sont détectées, le système ne les ignore pas et le chargement est interrompu.
Fichier local
Si les données à charger sont stockées dans un fichier local, sélectionnez cette méthode.
Définissez Data Source sur Local File.
-
Specify Data to Be Uploaded : Suivez les instructions à l'écran pour faire glisser le fichier local vers la zone Select File.
RemarqueLes formats suivants sont pris en charge :
CSV,XLS,XLSXetJSON. La taille maximale des données pour un fichierCSVest de5GB. La taille maximale des données pour les autres types de fichiers est de100MB.Par défaut, seule la première feuille d'un fichier est chargée. Pour charger des données provenant de plusieurs feuilles dans un fichier, vous devez créer un fichier distinct pour chaque feuille et la placer en tant que première feuille.
Le chargement de fichiers au format
SQLn'est pas pris en charge.
Feuille de calcul
Si les données à charger sont stockées dans une feuille de calcul DataWorks Data Analysis, sélectionnez cette méthode.
Définissez Data Source sur Workbook.
-
Specify Data to Be Uploaded :
Sélectionnez la feuille de calcul à charger dans la liste déroulante située à côté de Select File.
Si la feuille de calcul n'existe pas, cliquez sur le bouton Create pour en créer une. Vous pouvez également Créer un classeur via le module Data Analysis et importer des données.
OSS
Si les données à charger sont stockées dans OSS, sélectionnez cette méthode.
Prérequis :
Vous avez créé un bucket OSS et stocké les données à charger dans le bucket OSS. Vous pouvez ensuite charger les données OSS vers la source de données correspondante.
Pour éviter les problèmes d'autorisation, accordez au compte Alibaba Cloud qui effectue l'opération de chargement l'autorisation d'accéder au bucket cible via la section Présentation des autorisations et du contrôle d'accès avant de charger les données.
Procédure de chargement :
Définissez Data Source sur OSS.
-
Specify Data to Be Uploaded :
-
Dans la liste déroulante Select Bucket, sélectionnez le bucket OSS cible qui contient les données à charger.
RemarqueVous ne pouvez charger des données qu'à partir de buckets situés dans la même région que l'espace de travail DataWorks actuel.
-
Dans la zone Select File, sélectionnez le fichier à charger.
RemarqueSeuls les fichiers aux formats
CSV,XLS,XLSXetJSONsont pris en charge.
-
Fichier HTTP
Si les données à charger sont stockées dans un fichier HTTP, sélectionnez cette méthode.
Définissez Data Source sur HTTP File.
-
Specify Data to Be Uploaded :
Paramètre
Description
File URL
Sélectionnez l'URL du fichier.
RemarqueLes URL de fichiers HTTP et HTTPS sont prises en charge.
File Type
Le type de fichier est détecté automatiquement en fonction du fichier que vous chargez.
Les formats de fichiers suivants sont pris en charge :
CSV,XLSetXLSX. La taille maximale des données pour un fichierCSVest de 5 Go. La taille maximale des données pour les autres types de fichiers est de 50 Mo.Request Method
Trois méthodes sont prises en charge : GET, POST et PUT. Nous vous recommandons d'utiliser GET pour récupérer les données, mais vous pouvez sélectionner une méthode en fonction des méthodes de requête autorisées que vous avez définies.
Advanced Parameters
Vous pouvez également configurer Request Header et Request Body dans Advanced Parameters en fonction de vos besoins métier.
Configurer la table de destination
Dans la section Configure Destination Table, sélectionnez un Compute Engine pour le chargement de données et configurez les paramètres pertinents en fonction du moteur sélectionné.
Lorsque vous configurez la table de destination, assurez-vous de distinguer PROD (environnement de production) et DEV (environnement de développement) lors de la sélection d'une source de données. Si vous sélectionnez le mauvais environnement, les données seront chargées dans un environnement non souhaité.
MaxCompute
Pour charger des données dans une table interne MaxCompute, configurez les paramètres comme décrit dans le tableau suivant.
|
Paramètre |
Description |
|
|
Nom du projet MaxCompute |
Sélectionnez une source de données MaxCompute associée à la région actuelle. Si la source de données est introuvable, vous pouvez Associer une ressource de calcul MaxCompute à l'espace de travail actuel pour générer une source de données portant le même nom. |
|
|
Table de destination |
Vous pouvez sélectionner Existing Table ou Create Table. |
|
|
|
Sélectionner la table de destination |
La table dans laquelle vous souhaitez charger les données. Vous pouvez rechercher une table par mot-clé. Remarque
Vous ne pouvez charger des données que dans une table dont vous êtes le propriétaire (vous êtes le propriétaire de la table). Pour plus d'informations, consultez la section Limites d'utilisation. |
|
Méthode de chargement |
Sélectionnez une méthode pour ajouter des données à la table de destination.
|
|
|
|
Nom de la table |
Spécifiez un nom personnalisé pour la nouvelle table. Remarque
Lors de la création d'une table dans MaxCompute, le système utilise les informations de compte MaxCompute configurées dans la ressource de calcul DataWorks pour créer la table dans le projet MaxCompute correspondant. |
|
Type de table |
Sélectionnez Non-partitioned Table ou Partitioned Table selon vos besoins. Si vous sélectionnez une table partitionnée, vous devez spécifier la colonne de partition et ses valeurs. |
|
|
Cycle de vie |
Spécifiez le cycle de vie de la table. Une fois le cycle de vie écoulé, la table peut devenir indisponible. Pour plus d'informations sur le cycle de vie des tables, consultez les sections Cycle de vie et Gérer le cycle de vie des tables. |
|
EMR Hive
Pour charger des données dans une table interne EMR Hive, configurez les paramètres comme décrit dans le tableau suivant.
|
Paramètre |
Description |
|
Source de données |
Sélectionnez une source de données EMR Hive (mode instance Alibaba Cloud) associée à l'espace de travail actuel dans la région actuelle. |
|
Table de destination |
Vous ne pouvez charger des données que dans une Existing Table. |
|
Sélectionner la table de destination |
La table dans laquelle vous souhaitez charger les données. Vous pouvez rechercher une table par mot-clé. Remarque
|
|
Méthode de chargement |
Sélectionnez une méthode pour ajouter des données à la table de destination.
|
Hologres
Pour charger des données dans une table interne Hologres, configurez les paramètres comme décrit dans le tableau suivant.
|
Paramètre |
Description |
|
Source de données |
Sélectionnez une source de données Hologres associée à l'espace de travail actuel dans la région actuelle. Si la source de données est introuvable, vous pouvez Associer une ressource de calcul Hologres à l'espace de travail actuel pour générer une source de données portant le même nom. |
|
Table de destination |
Vous ne pouvez charger des données que dans une Existing Table. |
|
Sélectionner la table de destination |
La table dans laquelle vous souhaitez charger les données. Vous pouvez rechercher une table par mot-clé. Remarque
|
|
Méthode de chargement |
Sélectionnez une méthode pour ajouter des données à la table de destination.
|
|
Politique de conflit de clé primaire |
Si le chargement des données provoque un conflit de clé primaire dans la table de destination, vous pouvez utiliser les politiques suivantes.
|
StarRocks
Pour charger des données dans une table sous le catalogue par défaut de StarRocks, configurez les paramètres comme décrit dans le tableau suivant.
|
Paramètre |
Description |
|
Source de données |
Sélectionnez une source de données StarRocks associée à l'espace de travail actuel dans la région actuelle. |
|
Table de destination |
Vous ne pouvez charger des données que dans une Existing Table. |
|
Sélectionner la table de destination |
La table dans laquelle vous souhaitez charger les données. Vous pouvez rechercher une table par mot-clé. Remarque
|
|
Méthode de chargement |
Sélectionnez une méthode pour ajouter des données à la table de destination.
|
|
Paramètres avancés |
Vous pouvez configurer les paramètres de requête Stream Load. |
Aperçu des données à charger
Après avoir configuré la table de destination, vous pouvez ajuster l'encodage du fichier et le mappage des colonnes en fonction de l'aperçu des données.
Actuellement, seules les 20 premières lignes de données peuvent être affichées en aperçu.
File Encoding Format : Si les données contiennent des caractères illisibles, vous pouvez modifier le format d'encodage. Les formats d'encodage suivants sont pris en charge :
UTF-8,GB18030,Big5,UTF-16LEetUTF-16BE.-
Aperçu des données et configuration des colonnes de la table de destination :
-
Charger des données dans une table existante : Vous devez configurer le mappage entre les colonnes du fichier source et les colonnes de la table de destination. Le chargement des données n'est possible qu'après configuration du mappage. Les méthodes de mappage incluent Mapping by Column Name et Mapping by Order. Après la configuration du mappage, vous pouvez également personnaliser les noms des colonnes dans la table de destination.
RemarqueSi les données à charger n'ont aucun mappage vers une colonne de la table de destination, elles sont grisées et ne seront pas chargées.
Les mappages en double entre les données à charger et les colonnes de la table de destination ne sont pas autorisés.
Les noms et les types de colonnes ne peuvent pas être vides. Sinon, les données ne peuvent pas être chargées.
-
Charger des données dans une nouvelle table : Vous pouvez utiliser Intelligent Field Generation pour remplir automatiquement les informations de colonne, ou modifier manuellement les informations de colonne.
RemarqueLes noms et les types de colonnes ne peuvent pas être vides. Sinon, les données ne peuvent pas être chargées.
Les moteurs EMR Hive, Hologres et StarRocks ne prennent pas en charge la création de nouvelles tables lors du chargement de données.
-
-
Ignore First Row : Indique s'il faut charger ou non la première ligne des données du fichier (généralement les noms de colonnes) dans la table de destination.
Sélectionné : Si la première ligne contient des noms de colonnes, elle n'est pas chargée dans la table de destination.
Effacé : Si la première ligne contient des données, elle est chargée dans la table de destination.
Charger les données
Après avoir affiché l'aperçu des données, cliquez sur le bouton Upload Data en bas à gauche pour charger les données.
Étapes suivantes
Une fois les données chargées, cliquez sur l'icône
dans le volet de navigation de gauche pour accéder à la page Upload Data. Recherchez la tâche de chargement de données créée et effectuez les opérations suivantes selon vos besoins :
Poursuivre le chargement : Cliquez sur Resume dans la colonne Operation pour recharger les données.
Interroger les données : Cliquez sur Query Data dans la colonne Operation pour interroger et analyser les données.
Afficher les détails du chargement : Cliquez sur le Table Name cible pour accéder à Data Map et afficher les informations détaillées sur la table de destination. Pour plus d'informations, consultez la section Récupération des métadonnées.
Annexe : Déclaration de conformité pour le chargement de données transfrontalier
Si vos opérations impliquent des transferts de données transfrontaliers (par exemple, le transfert de données depuis la Chine continentale vers un emplacement situé hors de Chine continentale, ou entre différents pays ou régions), vous devez d'abord lire et comprendre la déclaration de conformité associée. Dans le cas contraire, le chargement peut échouer et vous pourriez engager votre responsabilité légale.
Les opérations de données transfrontalières transféreront les données de votre activité cloud vers la région que vous avez sélectionnée ou la région où le produit est déployé. Vous devez vous assurer que les opérations respectent les exigences suivantes :
Vous disposez de l'autorisation de traiter les données commerciales cloud concernées.
Vous avez adopté des technologies et des politiques de protection des données suffisantes.
Le transfert de données est conforme aux exigences des lois et réglementations applicables. Par exemple, les données transférées ne contiennent aucun contenu restreint, interdit de transfert ou interdit de divulgation en vertu des lois applicables.
Alibaba Cloud vous rappelle que si vos opérations de chargement de données peuvent entraîner des transferts de données transfrontaliers, consultez des professionnels juridiques ou de la conformité avant d'effectuer ces opérations afin de garantir que les transferts de données transfrontaliers sont conformes aux lois, réglementations et politiques réglementaires applicables (par exemple, obtenir une autorisation valide des personnes concernées, signer et déposer les clauses contractuelles pertinentes, et réaliser les évaluations de sécurité requises et autres obligations légales).
Si vous effectuez des opérations de données transfrontalières sans respecter cette déclaration de conformité, vous assumerez les conséquences juridiques correspondantes. Vous êtes également responsable de toute perte subie par Alibaba Cloud et ses affiliés.
Références
Data Studio prend également en charge le chargement de fichiers CSV ou texte locaux vers des tables MaxCompute. Pour plus d'informations, consultez la section Charger des données.
Pour plus d'opérations sur les tables MaxCompute, consultez la section Créer et utiliser des tables MaxCompute.
Pour plus d'opérations sur les tables Hologres, consultez la section Créer une table Hologres.
Pour plus d'opérations sur les tables EMR, consultez la section Créer une table EMR.
FAQ
-
Problème de configuration du groupe de ressources.
Message d'erreur : La source de fichier actuelle ou le moteur de destination nécessite un groupe de ressources pour le chargement de données. Contactez l'administrateur de l'espace de travail pour configurer un groupe de ressources.
Solution : Pour configurer le groupe de ressources d'un moteur dans Data Analysis, consultez la section Gestion du système.
-
Problème d'association du groupe de ressources.
Message d'erreur : Le groupe de ressources configuré pour le chargement global de données dans votre espace de travail n'est pas associé à l'espace de travail auquel appartient la table cible. Contactez l'administrateur de l'espace de travail pour les associer.
Solution : Vous pouvez associer le groupe de ressources en tant que groupe de ressources de l'espace de travail qui est configuré dans la gestion du système.