MaxCompute met à votre disposition plusieurs jeux de données publics que vous pouvez interroger avec MaxCompute SQL afin d'explorer rapidement le service. Cette rubrique répertorie les jeux de données disponibles et explique comment interroger et analyser ces données.
Présentation
MaxCompute propose des jeux de données publics classés en plusieurs catégories, notamment les événements publics GitHub, les statistiques nationales, les données de référence TPC, les données du commerce numérique, les données des services liés au mode de vie ainsi que les données financières et boursières. Tous ces jeux de données sont stockés dans différents schémas du projet public BIGDATA_PUBLIC_DATASET.
|
Catégorie |
Description |
Nom du jeu de données |
Schéma |
|
|
Événements publics GitHub |
Les développeurs sur GitHub génèrent un grand nombre d'événements lorsqu'ils travaillent sur des projets open source. GitHub enregistre les détails de chaque événement, y compris son type, le développeur concerné et le dépôt. Les événements incluent l'ajout d'un dépôt aux favoris (starring) et la validation de code. |
Jeu de données des événements publics GitHub |
github_events |
|
|
Statistiques nationales |
Données annuelles du PIB pour les pays du monde entier et pour les provinces chinoises. |
Jeu de données des statistiques nationales |
national_data |
|
|
Données de performance TPC |
TPC-DS |
TPC-DS est une référence décisionnelle qui modélise des aspects clés tels que les requêtes et la maintenance des données, et évalue les performances des technologies émergentes comme les systèmes Big Data. |
|
|
|
TPC-H |
TPC-H est une référence décisionnelle composée de requêtes ad hoc orientées métier et de modifications de données concurrentes, conçue pour exécuter des requêtes complexes sur de grands volumes de données et répondre à des questions commerciales critiques. |
|
|
|
|
TPCx-BB |
TPCx-BB (TPC Express Benchmark BB) est une référence Big Data qui mesure les performances des systèmes basés sur Hadoop en exécutant 30 requêtes analytiques courantes sur les composants matériels et logiciels. |
|
|
|
|
Commerce numérique |
Données issues de services tels que la publicité Taobao, les achats Taobao et le commerce électronique Alibaba. |
Jeu de données du commerce numérique |
commerce |
|
|
Services liés au mode de vie |
Données sur l'immobilier d'occasion, les films et les résultats au box-office, l'attribution des numéros de téléphone mobile, ainsi que les codes administratifs et de division urbain-rural. |
Jeu de données des services liés au mode de vie |
life_service |
|
|
Finance et actions |
Informations boursières, y compris les données de base, les états financiers trimestriels et les cours de négociation. |
Jeu de données financier et boursier |
finance |
|
Clause de non-responsabilité
Les jeux de données publics de MaxCompute sont destinés uniquement aux tests de produit. Les données ne sont pas mises à jour périodiquement et leur exactitude n'est pas garantie. Par conséquent, n'utilisez pas ces données dans un environnement de production.
La génération et l'analyse des données TPC dans les jeux de données publics MaxCompute sont basées sur les références TPC. Ces résultats de test ne sont pas comparables aux résultats publiés des références TPC, car ils ne satisfont pas à toutes les exigences des références TPC.
Les données de test de performance TPC dans MaxCompute proviennent de TPC. Vous pouvez également générer vos propres données TPC. Pour plus de détails sur la génération des données de test TPC, consultez la documentation officielle de TPC.
Notes
Les jeux de données publics sont accessibles à tous les utilisateurs de MaxCompute. Lorsque vous interrogez ces jeux de données, tenez compte des points suivants :
-
Toutes les données du jeu de données public sont stockées dans le projet
BIGDATA_PUBLIC_DATASET. Toutefois, vous n'êtes pas membre de ce projet. Par conséquent, vous devez utiliser l'accès inter-projets pour récupérer les données. Lorsque vous rédigez un script SQL, vous devez spécifier le nom du projet et le nom du schéma avant le nom de la table. De plus, si la syntaxe de schéma au niveau du locataire est désactivée, vous devez activer la syntaxe de schéma au niveau de la session pour garantir le bon fonctionnement de vos commandes. Voici un exemple de commande :-- Enable session-level schema syntax SET odps.namespace.schema=true; -- Query 100 rows from the dwd_github_events_odps table SELECT * FROM bigdata_public_dataset.github_events.dwd_github_events_odps WHERE ds='2024-05-10' limit 100;ImportantAucun frais de stockage ne vous est facturé pour les jeux de données publics, mais vous êtes redevable des frais de calcul pour vos requêtes. Pour plus d'informations sur la facturation, consultez Frais de calcul (paiement à l'utilisation).
Étant donné que les jeux de données publics nécessitent un accès inter-projets, vous ne pouvez pas trouver les tables de ces jeux de données dans le Data Map de DataWorks.
Le projet destiné aux jeux de données publics utilise des schémas. Si la syntaxe de schéma au niveau du locataire n'est pas activée pour votre projet, vous ne pouvez pas afficher directement les jeux de données publics dans DataAnalysis de DataWorks. Toutefois, vous pouvez toujours interroger les données en exécutant des instructions SQL.
Détails des tables
Les sections suivantes détaillent les tables présentes dans chaque schéma du projet public BIGDATA_PUBLIC_DATASET.
Données publiques d'événements GitHub
|
Nom du projet |
BIGDATA_PUBLIC_DATASET |
|
Nom du schéma |
github_events |
|
Régions disponibles |
Chine (Hangzhou), Chine (Shanghai), Chine (Beijing), Chine (Zhangjiakou), Chine (Ulanqab), Chine (Shenzhen), Chine (Chengdu) |
|
Tables et descriptions |
Les développeurs sur GitHub génèrent un grand volume d'événements lorsqu'ils travaillent sur des projets open source. GitHub enregistre les détails de chaque événement, tels que le type d'événement, le développeur et le dépôt, et les publie en tant qu'événements publics. Parmi les exemples figurent l'ajout d'un dépôt aux favoris (starring) et la validation de code. Pour obtenir la liste des types d'événements, consultez la page GitHub Events. MaxCompute traite les données d'événements publics provenant de GH Archive par lots pour générer les tables suivantes :
Remarque
Les données de ces tables proviennent de GH Archive. |
|
Cycle de mise à jour |
|
|
Interroger la structure de la table |
|
|
Exemple de requête |
|
|
Pour plus d'informations et d'exemples de requêtes, consultez Données publiques d'événements GitHub. |
|
Statistiques nationales
|
Nom du projet |
BIGDATA_PUBLIC_DATASET |
|
Nom du schéma |
national_data |
|
Régions disponibles |
Chine (Hangzhou), Chine (Shanghai), Chine (Beijing), Chine (Zhangjiakou), Chine (Ulanqab), Chine (Shenzhen), Chine (Chengdu) |
|
Tables et descriptions |
Remarque
Les données de la table |
|
Cycle de mise à jour |
Il s'agit d'un jeu de données statique qui n'est pas mis à jour. |
|
Interroger la structure de la table |
|
|
Exemple de requête |
|
Données TPC-DS
|
Nom du projet |
BIGDATA_PUBLIC_DATASET |
|
Nom du schéma |
tpcds_10g, tpcds_100g, tpcds_1t, tpcds_10t |
|
Régions disponibles |
Chine (Hangzhou), Chine (Shanghai), Chine (Beijing), Chine (Zhangjiakou), Chine (Ulanqab), Chine (Shenzhen), Chine (Chengdu), Chine (Hong Kong), Japon (Tokyo), Singapour, Malaisie (Kuala Lumpur), Indonésie (Jakarta), États-Unis (Virginie), États-Unis (Silicon Valley), Royaume-Uni (Londres), Allemagne (Francfort), Émirats arabes unis (Dubaï), Chine (Shanghai) Finance, Chine (Beijing) Finance, Cloud gouvernemental Chine (Beijing), Chine (Shenzhen) Finance |
|
Tables et descriptions |
Le modèle TPC-DS simule le système de vente d'une grande chaîne de détail nationale disposant de trois canaux de vente :
Remarque
Les données de ces tables proviennent de TPC. |
|
Cycle de mise à jour |
Il s'agit d'un jeu de données statique qui n'est pas mis à jour. |
|
Interroger la structure de la table |
|
|
Exemple de requête |
|
|
Pour des exemples de requêtes sur des jeux de données de différentes tailles, consultez Données TPC-DS. Pour plus de détails sur les données, consultez la spécification officielle TPC Benchmark DS. |
|
Données TPC-H
|
Nom du projet |
BIGDATA_PUBLIC_DATASET |
|
Nom du schéma |
tpch_10g, tpch_100g, tpch_1t, tpch_10t |
|
Régions disponibles |
Chine (Hangzhou), Chine (Shanghai), Chine (Beijing), Chine (Zhangjiakou), Chine (Ulanqab), Chine (Shenzhen), Chine (Chengdu), Chine (Hong Kong), Japon (Tokyo), Singapour, Malaisie (Kuala Lumpur), Indonésie (Jakarta), États-Unis (Virginie), États-Unis (Silicon Valley), Royaume-Uni (Londres), Allemagne (Francfort), Émirats arabes unis (Dubaï), Chine (Shanghai) Finance, Chine (Beijing) Finance, Cloud gouvernemental Chine (Beijing), Chine (Shenzhen) Finance |
|
Tables et descriptions |
TPC-H est un benchmark permettant d'évaluer les systèmes de traitement analytique en ligne (OLAP). Il simule les transactions entre fournisseurs et clients, et inclut des données telles que les commandes, les produits et les clients.
Remarque
Les données de ces tables proviennent de TPC. |
|
Cycle de mise à jour |
Il s'agit d'un jeu de données statique qui n'est pas mis à jour. |
|
Interroger la structure de la table |
|
|
Exemple de requête |
|
|
Pour plus d'informations et d'exemples de requêtes, consultez la spécification officielle TPC Benchmark H. |
|
Données TPCx-BB
|
Nom du projet |
BIGDATA_PUBLIC_DATASET |
|
Nom du schéma |
tpcxbb_10g, tpcxbb_100g, tpcxbb_1t, tpcxbb_10t |
|
Régions disponibles |
Chine (Hangzhou), Chine (Shanghai), Chine (Beijing), Chine (Zhangjiakou), Chine (Ulanqab), Chine (Shenzhen), Chine (Chengdu), Chine (Hong Kong), Japon (Tokyo), Singapour, Malaisie (Kuala Lumpur), Indonésie (Jakarta), États-Unis (Virginie), États-Unis (Silicon Valley), Royaume-Uni (Londres), Allemagne (Francfort), Émirats arabes unis (Dubaï), Chine (Shanghai) Finance, Chine (Beijing) Finance, Cloud gouvernemental Chine (Beijing), Chine (Shenzhen) Finance |
|
Tables et descriptions |
TPCx-BB est un benchmark de big data qui simule un scénario de vente au détail en ligne. Le jeu de données comprend des enregistrements de ventes et de retours, ainsi que des informations sur les articles et les promotions. Les tables sont les suivantes :
Remarque
Les données de ces tables proviennent de TPC. |
|
Cycle de mise à jour |
Il s'agit d'un jeu de données statique qui n'est pas mis à jour. |
|
Interroger la structure de la table |
|
|
Exemple de requête |
|
|
Pour plus d'informations et d'exemples de requêtes, consultez la spécification officielle TPCx-BB. |
|
Jeu de données de commerce numérique
|
Nom du projet |
BIGDATA_PUBLIC_DATASET |
|
Nom du schéma |
commerce |
|
Régions disponibles |
Chine (Hangzhou), Chine (Shanghai), Chine (Beijing), Chine (Zhangjiakou), Chine (Ulanqab), Chine (Shenzhen), Chine (Chengdu) |
|
Tables et descriptions |
Remarque
Les données de ces tables proviennent du jeu de données Tianchi Lab - Prédiction du taux de clics (CTR) des annonces display Taobao. |
|
Cycle de mise à jour |
Il s'agit d'un jeu de données statique qui n'est pas mis à jour. |
|
Interroger la structure de la table |
|
|
Exemple de requête |
|
Jeu de données de services de style de vie
|
Nom du projet |
BIGDATA_PUBLIC_DATASET |
|
Nom du schéma |
life_service |
|
Régions disponibles |
Chine (Hangzhou), Chine (Shanghai), Chine (Beijing), Chine (Zhangjiakou), Chine (Ulanqab), Chine (Shenzhen), Chine (Chengdu) |
|
Tables et descriptions |
|
|
Cycle de mise à jour |
|
|
Interroger la structure de la table |
|
|
Exemple de requête |
|
Jeu de données financières et boursières
|
Nom du projet |
BIGDATA_PUBLIC_DATASET |
|
Nom du schéma |
finance |
|
Régions disponibles |
Chine (Hangzhou), Chine (Shanghai), Chine (Beijing), Chine (Zhangjiakou), Chine (Ulanqab), Chine (Shenzhen), Chine (Chengdu) |
|
Tables et descriptions |
|
|
Cycle de mise à jour |
Les données sont statiques et fournies dans des partitions basées sur la date. |
|
Interroger la structure de la table |
|
|
Exemple de requête |
|
Interroger un jeu de données public
Prérequis
Vous avez activé MaxCompute et créé un projet. Pour plus d'informations, consultez la rubrique Créer un projet MaxCompute.
Outils pris en charge
Procédure (exemple : nœud de développement de données DataWorks)
Connectez-vous à la console DataWorks et sélectionnez une région dans le coin supérieur gauche.
-
Créer un nœud ODPS SQL et saisissez l'exemple SQL suivant.
-- View GDP trends for provinces in China over the past 20 years. SET odps.namespace.schema=true; SET odps.sql.validate.orderby.limit = false; SELECT region, gdp, year FROM bigdata_public_dataset.national_data.annual_gdp_by_province ORDER BY year ASC; -
Cliquez sur
pour afficher les résultats.Dans l'éditeur SQL, saisissez la requête suivante :
SELECT region, gdp, year FROM bigdata_public_dataset.national_data.annual_gdp_by_province ORDER BY year ASC;, puis cliquez sur Run pour l'exécuter. Le tableau de résultats contient trois colonnes : region (province), gdp (valeur du PIB) et year (année), affichant les données du PIB de chaque province pour chaque année.
Rubriques connexes
Pour plus d'informations sur l'exportation des données depuis MaxCompute, consultez les rubriques suivantes :