Utilisez des instructions SQL pour interroger et analyser rapidement les données provenant de sources telles que MaxCompute, EMR Hive et Hologres. Cette rubrique décrit comment interroger des sources de données à l'aide d'instructions SQL.
DataWorks vous recommande d'essayer la nouvelle version de Data Analysis afin de bénéficier des dernières fonctionnalités et d'une meilleure expérience utilisateur.
Sources de données prises en charge
La fonctionnalité de requête SQL prend en charge les sources de données suivantes : MaxCompute, Hologres, EMR, CDH, StarRocks, ClickHouse, SelectDB, Doris, AnalyticDB for MySQL 3.0, AnalyticDB for PostgreSQL, Tablestore, MySQL, PostgreSQL, Oracle et SQL Server.
Cette fonctionnalité prend uniquement en charge les sources de données ajoutées à un espace de travail.
Autorisations relatives aux sources de données
Portée des sources de données
Vous ne pouvez interroger les données que depuis les sources de données situées dans les espaces de travail auxquels vous avez accès. Contactez un administrateur pour vous ajouter à un espace de travail en tant qu'analyste de données, concepteur de modèles, développeur, opérateur, administrateur d'espace de travail ou propriétaire de projet.
Autorisations d'accès aux sources de données
L'accès aux sources de données prend en charge les deux modes d'identité suivants.
|
Mode d'identité d'accès |
Description |
Sources de données prises en charge |
Autorisation |
|
Executor Identity |
Le compte Alibaba Cloud actuellement connecté à DataWorks. |
MaxCompute et Hologres. |
Demandez à l'administrateur du projet MaxCompute ou de l'instance Hologres spécifié de vous accorder des autorisations d'accès en tant que membre. |
|
Data Source Default Access Identity |
L'identité d'accès configurée lors de la création de la source de données. |
Toutes les sources de données. |
Si votre compte de connexion actuel n'est pas l'identité d'accès par défaut de la source de données, demandez à un utilisateur disposant du rôle workspace administrator d'accorder l'accès à votre compte Alibaba Cloud actuel. |
Si le contrôle d'accès basé sur une liste d'autorisation est activé pour le projet MaxCompute, ajoutez les adresses IP requises à la liste d'autorisation IP du projet MaxCompute.
Accéder à la fonctionnalité
Connectez-vous à DataWorks Data Analysis, basculez vers la région cible, puis cliquez sur Enter Data Analysis.
Si vous voyez Switch to New DataAnalysis dans la barre de navigation, vous avez accédé à la page héritée de Data Analysis.
(Non recommandé) Si vous voyez Return to Legacy DataAnalysis dans la barre de navigation, cliquez dessus pour revenir à la page héritée de Data Analysis.
Étape 1 : Ajouter des répertoires
Ajoutez des tables issues des répertoires recommandés par le système et des sources de données autorisées à votre répertoire. Une fois le répertoire ajouté, vous pouvez afficher rapidement les tables qu'il contient, consulter leurs schémas et générer des requêtes SQL.
-
Sur la page d'analyse SQL, cliquez sur le bouton
situé à droite de la zone de recherche au-dessus du répertoire pour ajouter un répertoire.DataMap - Metadata : Métadonnées de table collectées dans Data Map. Chaque source de données ou ressource de calcul peut être ajoutée en tant que jeu de données.
DataMap - Data Album : Collections de données qui regroupent les tables de sujets spécifiques dans Data Map. Chaque collection de données peut être ajoutée en tant que jeu de données.
My Favorites : Tables que vous avez ajoutées à vos favoris dans Data Map.
My MaxCompute Tables : Toutes les tables MaxCompute dont le compte de connexion actuel est le propriétaire.
Public Data : Jeux de données publics fournis par MaxCompute, utilisables pour générer rapidement des données de test.
RemarqueVous pouvez ajouter jusqu'à 12 jeux de données. Les jeux de données inutilisés peuvent être supprimés.
Étape 2 : Créer une requête SQL
Requête basée sur le catalogue de données
Une fois les répertoires de données ajoutés, les jeux de données correspondants s'affichent dans l'arborescence de gauche.
Dans l'arborescence de gauche, cliquez pour développer un jeu de données ajouté (par exemple, mes tables MaxCompute).
Cliquez avec le bouton droit sur le nom de la table à analyser et sélectionnez Generate SQL Statement dans le menu contextuel. Une instruction SQL recommandée basée sur la table est automatiquement générée sous forme de fichier temporaire.
Modifiez l'instruction SQL selon vos besoins, puis cliquez sur Save pour enregistrer le fichier temporaire dans My Files.
Requête basée sur les sources de données
Dans l'arborescence de gauche, placez le curseur sur My Files et cliquez sur le bouton
à droite pour créer un fichier.-
Rédigez une instruction de requête SQL dans le nouveau fichier et enregistrez-la dans My Files.
RemarqueLorsque vous modifiez des instructions SQL, DataWorks suggère automatiquement les tables MaxCompute auxquelles vous avez accès.
Requête basée sur le SQL partagé
Dans l'arborescence de gauche, cliquez sur Shared Files pour afficher les fichiers SQL partagés par d'autres utilisateurs. Cliquez sur un fichier SQL, puis sur la page de détails à droite, cliquez sur Copy SQL.
Requête basée sur les jeux de données publics
Après avoir ajouté un jeu de données public au répertoire, cliquez sur ce jeu de données. Dans la barre supérieure de la page de détails à droite, vous pouvez sélectionner un moteur différent pour Generate SQL Statement. Vous pouvez utiliser les jeux de données publics à des fins de test.
Étape 3 : Configurer le moteur de requête et exécuter la requête
-
Cliquez sur le bouton
situé dans le coin supérieur droit de la page de détails SQL pour configurer le moteur de requête SQL.Paramètre
Description
Workspace
L'espace de travail où réside le moteur d'exécution.
ImportantAssurez-vous de disposer des autorisations d'accès à l'espace de travail. Sinon, contactez l'administrateur de l'espace de travail pour vous ajouter en tant que membre de l'espace de travail.
Datasource Type
Le type et le nom du moteur d'exécution.
ImportantSi aucun projet spécifique n'est indiqué dans l'instruction SQL, le moteur d'exécution sert de source de données par défaut.
Data Source Name
Access Identity Mode
Sélectionnez le mode d'accès pour les requêtes SQL :
Executor Identity : Pris en charge uniquement pour les moteurs MaxCompute et Hologres. Ce mode est recommandé lorsque vous êtes membre du projet MaxCompute ou de l'instance Hologres et que vous disposez des autorisations SELECT.
Data Source Default Access Identity : Si votre compte actuel diffère de l'identité d'accès par défaut configurée lors de la création de la source de données, accordez cette identité à votre compte actuel.
-
Une fois l'instruction SQL rédigée, exécutez l'intégralité du script ou sélectionnez une partie pour une exécution partielle. Cliquez sur l'icône déroulante
située à côté du bouton d'exécution pour changer de mode d'exécution. Sélectionnez différents modes selon les scénarios.Avant l'exécution d'une instruction SQL MaxCompute, le coût estimé s'affiche. Vous pouvez également cliquer sur dans la barre d'outils au-dessus du fichier SQL pour estimer le coût.
Mode d'exécution
Scénario
Condition de déclenchement
Moteurs applicables
Mode de requête (LIMIT 10000)
Aperçu rapide des données et vérification de la logique de requête. Ce mode convient aux scénarios où vous souhaitez uniquement visualiser un petit échantillon de résultats pour une exploration préliminaire des données.
Le résultat de la requête affiche ≤ 10 000 lignes et ≤ 10 Mo.
Aucune limite
Mode de requête (données complètes)
Obtention de l'ensemble complet des résultats pour analyse ou exportation. Basculez vers ce mode lorsque vous devez traiter et visualiser toutes les données.
Le résultat de la requête affiche > 10 000 lignes ou > 10 Mo.
MaxCompute,Hologres,StarRocks,ClickHouse,MySQLMode de table temporaire
Réutilisation des résultats dans des requêtes complexes en plusieurs étapes. Utilisez la sortie d'une requête comme entrée de la suivante pour améliorer l'efficacité du développement et du débogage.
Le résultat de la requête affiche ≤ 10 000 lignes et ≤ 10 Mo, et est automatiquement écrit dans une table temporaire.
Uniquement
MaxCompute -
Une fois l'instruction SQL exécutée, consultez le journal d'exécution, les résultats et l'instruction SQL correspondante sur la page des résultats de la requête.
Cliquez sur les boutons situés dans le coin supérieur droit de la zone des résultats de la requête pour basculer la mise en page de la page entre côte à côte et haut-bas.
Étape 4 : Visualiser les résultats de la requête
Dans la barre d'outils à gauche des résultats de la requête, cliquez sur le bouton pour générer automatiquement des graphiques visuels à partir des résultats.
Cliquez sur le bouton Copilot au-dessus du graphique pour essayer la fonctionnalité Copilot.
Étape 5 : Exporter et partager
Si vous devez exporter des données vers votre machine locale, puis les importer dans une autre source de données, nous vous recommandons d'utiliser les tâches de synchronisation par lots de Data Integration pour une migration et une synchronisation des données plus efficaces et stables.
Les résultats des requêtes SQL peuvent être exportés sous les formes suivantes :
-
Fichier local : Téléchargez les résultats de la requête sur votre machine locale au format CSV, TXT ou XLS. Les informations clés sont les suivantes :
Élément
Description
Limites de téléchargement
Seuls les moteurs MaxCompute et EMR sont pris en charge. Pour plus d'informations, consultez les limites du nombre de lignes téléchargeables.
Si le projet MaxCompute a activé les restrictions de téléchargement de données (le téléchargement de données est interdit), le téléchargement de données via Data Analysis échouera.
ImportantSi cette option n'apparaît pas, consultez la FAQ pour résoudre le problème.
Scope
Vous pouvez choisir de télécharger Only Data Displayed in Table ou All Data.
Only Data Displayed in Table : Télécharge uniquement les données affichées sur la page actuelle, soit par défaut jusqu'à
10000lignes.All Data : Exporte toutes les données de résultat interrogées dans la limite de téléchargement.
Méthode de téléchargement
Deux méthodes de téléchargement sont prises en charge : Download After Approval et Download Without Approval.
Téléchargement après approbation : Configurez des règles d'identification des risques pour identifier les risques liés aux opérations de téléchargement de données. Lors du téléchargement de données, soumettez une demande d'approbation de téléchargement afin de garantir la conformité et la sécurité des données.
RemarqueSeule l'édition Enterprise de DataWorks prend en charge la configuration et l'activation des règles d'identification des risques.
Téléchargement sans approbation : Par défaut, les téléchargements ne nécessitent pas d'approbation. Aucune demande d'autorisation n'est nécessaire pendant le processus de téléchargement.
-
OSS : Exportez les résultats de la requête dans un format spécifié (tel que CSV ou Parquet) vers Alibaba Cloud Object Storage Service (OSS). Cette méthode convient à l'archivage de grands volumes de données ou à l'intégration avec d'autres services cloud.
Lors de la première utilisation de cette fonctionnalité, autorisez DataWorks à accéder à vos ressources OSS. Dans la liste déroulante File Path , cliquez sur le lien Authorize dans l'invite et suivez les instructions pour compléter l'autorisation RAM.
Paramètre
Description
Chemin du fichier
Cliquez sur le bouton de dossier à droite pour sélectionner le bucket OSS et le répertoire où vous souhaitez stocker le fichier de résultat.
Nom du fichier
Un nom de fichier est généré automatiquement. Vous pouvez également le modifier manuellement.
Type de fichier
Sélectionnez le format du fichier d'exportation. Les formats pris en charge incluent
csv,text,orcetparquet.Délimiteur
Spécifiez le délimiteur entre les colonnes. Le délimiteur par défaut est une virgule (
,).Encodage
Sélectionnez le format d'encodage du fichier, tel que
UTF-8ouGBK.CU
Configurez le nombre d'unités de calcul (CU) pour cette tâche d'exportation. La valeur par défaut est de 1 CU.
Groupe de ressources
Sélectionnez le groupe de ressources serverless pour exécuter cette tâche d'exportation. Si aucun groupe de ressources n'est sélectionné, le groupe de ressources Data Integration configuré dans Data Analysis > System Management est utilisé par défaut.
Une fois la configuration terminée, cliquez sur OK pour démarrer la tâche d'exportation. Consultez la progression de l'exportation, le journal d'exécution et les détails de la configuration sur la page d'exécution de la tâche. Une fois la tâche réussie, accédez à la console OSS pour télécharger le fichier exporté sur votre machine locale.
-
Table MaxCompute : Exportez les résultats de la requête directement vers une table MaxCompute sans avoir à télécharger les données sur votre machine locale au préalable. Définissez le cycle de vie de la table selon vos besoins.
Cette option est disponible uniquement lorsque vous interrogez le contenu du moteur MaxCompute.
Feuille de calcul : Enregistrez les résultats dans une feuille de calcul pour approfondir l'analyse des données. Vous pouvez également partager les derniers résultats d'analyse avec d'autres personnes.
-
Autres opérations
Gestion des versions des fichiers SQL
Sur la page de modification du fichier SQL, cliquez également sur dans la barre d'outils pour afficher les différences entre le code enregistré automatiquement et le code enregistré manuellement, et sélectionner la version que vous souhaitez enregistrer.
Recherche de code
Au-dessus de l'arborescence de répertoires à gauche, cliquez sur
pour rechercher du code par mot-clé. Cette fonctionnalité est disponible uniquement pour DataWorks Standard Edition et les éditions supérieures.
Afficher l'historique d'exécution
Au-dessus de l'arborescence de répertoires à gauche, cliquez sur
pour afficher l'historique d'exécution des requêtes SQL.
FAQ
Comment accorder l'accès en utilisant l'identité d'accès par défaut de la source de données ?
-
Accédez au Security Center.
Connectez-vous à la console DataWorks. Dans la région cible, cliquez sur dans le volet de navigation de gauche. Sur la page qui s'affiche, cliquez sur Go to Security Center.
Dans le volet de navigation de gauche, cliquez sur pour accéder à la page de contrôle d'accès Data Analysis.
Basculez vers l'espace de travail cible, localisez la source de données concernée et cliquez sur le bouton d'autorisation à droite pour accorder l'accès.
Erreur d'exécution de la requête SQL ?
Si vous rencontrez une erreur liée à This node can only run on exclusive resource groups lors de l'exécution, configurez le Resource Group for Scheduling et le Resource Group for Data Integration pour le moteur correspondant dans .
L'affichage ou le téléchargement des résultats de la requête est-il limité ?
Les résultats des requêtes SQL n'affichent qu'un nombre limité de lignes. Suivez ces étapes pour ajuster la limite d'affichage au maximum. Vous pouvez également gérer les capacités de téléchargement. Pour plus d'informations, consultez la rubrique Configurer les limites d'affichage et de téléchargement des résultats de requête.
-
Accédez au Security Center.
Connectez-vous à la console DataWorks. Dans la région cible, cliquez sur dans le volet de navigation de gauche. Sur la page qui s'affiche, cliquez sur Go to Security Center.
Dans le volet de navigation de gauche, cliquez sur pour accéder à la page de contrôle d'accès Data Analysis.
Basculez vers l'onglet Query Result Control et ajustez les paramètres Maximum rows per display, Maximum rows per copy, Maximum rows per download et Allow download.