Todos os produtos
Search
Central de documentação

MaxCompute:Public datasets

Última atualização: Jul 10, 2026

O MaxCompute oferece diversos conjuntos de dados públicos que você pode consultar com o MaxCompute SQL para explorar rapidamente o service. Esta página lista os conjuntos de dados disponíveis e demonstra como consultar e analisar esses dados.

Introdução

O MaxCompute disponibiliza conjuntos de dados públicos em várias categorias, incluindo dados de eventos públicos do GitHub, estatísticas nacionais, dados de benchmark TPC, dados de comércio digital, dados de services de estilo de vida, além de dados financeiros e de ações. Todos os conjuntos de dados estão armazenados em diferentes schemas no projeto público BIGDATA_PUBLIC_DATASET.

Categoria

Descrição

Nome do conjunto de dados

Schema

Dados de eventos públicos do GitHub

Desenvolvedores no GitHub geram um grande volume de eventos ao trabalhar em projetos open-source. O GitHub registra detalhes de cada evento, incluindo tipo, desenvolvedor responsável e repositório. Exemplos incluem marcar um repositório como favorito e fazer commits de código.

Conjunto de dados de eventos públicos do GitHub

github_events

Estatísticas nacionais

Dados anuais de PIB de países ao redor do mundo e de províncias na China.

Conjunto de dados de estatísticas nacionais

national_data

Dados de desempenho TPC

TPC-DS

O TPC-DS é um benchmark de suporte à decisão que modela aspectos essenciais, como consultas e manutenção de dados, e avalia o desempenho de tecnologias emergentes, como sistemas de big data.

  • Conjunto de dados de benchmark TPC-DS 10 GB

  • Conjunto de dados de benchmark TPC-DS 100 GB

  • Conjunto de dados de benchmark TPC-DS 1 TB

  • Conjunto de dados de benchmark TPC-DS 10 TB

  • tpcds_10g

  • tpcds_100g

  • tpcds_1t

  • tpcds_10t

TPC-H

O TPC-H é um benchmark de suporte à decisão composto por consultas ad hoc orientadas a negócios e modificações simultâneas de dados. Ele foi projetado para executar consultas complexas em grandes conjuntos de dados e responder a questões críticas de negócios.

  • Conjunto de dados de benchmark TPC-H 10 GB

  • Conjunto de dados de benchmark TPC-H 100 GB

  • Conjunto de dados de benchmark TPC-H 1 TB

  • Conjunto de dados de benchmark TPC-H 10 TB

  • tpch_10g

  • tpch_100g

  • tpch_1t

  • tpch_10t

TPCx-BB

O TPCx-BB (TPC Express Benchmark BB) é um benchmark de big data que mede o desempenho de sistemas baseados em Hadoop executando 30 consultas analíticas comuns em componentes de hardware e software.

  • Conjunto de dados de benchmark TPCx-BB 10 GB

  • Conjunto de dados de benchmark TPCx-BB 100 GB

  • Conjunto de dados de benchmark TPCx-BB 1 TB

  • Conjunto de dados de benchmark TPCx-BB 10 TB

  • tpcbb_10g

  • tpcbb_100g

  • tpcbb_1t

  • tpcbb_10t

Comércio digital

Dados provenientes de services como publicidade do Taobao, compras no Taobao e e-commerce da Alibaba.

Conjunto de dados de comércio digital

commerce

Services de estilo de vida

Dados sobre imóveis usados, filmes e bilheterias, atribuição de números de celular, além de códigos administrativos e de divisão urbano-rural.

Conjunto de dados de services de estilo de vida

life_service

Finanças e ações

Informações sobre ações, incluindo dados básicos, relatórios financeiros trimestrais e preços de negociação.

Conjunto de dados financeiros e de ações

finance

Aviso legal

  • Os conjuntos de dados públicos do MaxCompute destinam-se exclusivamente a testes do product. Os dados não são atualizados periodicamente e sua precisão não é garantida. Portanto, não utilize estes dados em ambiente de produção.

  • A geração e análise de dados TPC nos conjuntos de dados públicos do MaxCompute baseiam-se em benchmarks TPC. Estes resultados de teste não são comparáveis aos resultados oficiais de benchmarks TPC publicados, pois não atendem a todos os requisitos exigidos pelo TPC.

  • Os dados de teste de desempenho TPC no MaxCompute são provenientes do TPC. Você também pode gerar seus próprios dados TPC. Para obter detalhes sobre a geração de dados de teste TPC, consulte a documentação oficial do TPC.

Observações

Os conjuntos de dados públicos estão disponíveis para todos os usuários do MaxCompute. Ao consultar esses conjuntos, observe o seguinte:

  • Todos os dados do conjunto público estão armazenados no projeto BIGDATA_PUBLIC_DATASET. No entanto, você não é membro deste projeto. Por isso, use acesso entre projetos para recuperar os dados. Ao escrever um script SQL, especifique o nome do projeto e o nome do schema antes do nome da tabela. Além disso, se a sintaxe de schema no nível de tenant estiver desativada, ative a sintaxe de schema no nível de sessão para garantir a execução correta dos comandos. Veja abaixo um exemplo de comando:

    -- Enable session-level schema syntax
    SET odps.namespace.schema=true; 
    -- Query 100 rows from the dwd_github_events_odps table
    SELECT * FROM bigdata_public_dataset.github_events.dwd_github_events_odps WHERE ds='2024-05-10' limit 100;
    Importante

    Não há cobrança de taxas de armazenamento para conjuntos de dados públicos, mas as taxas de computação das suas consultas são cobradas normalmente. Para mais informações sobre faturamento, consulte Taxas de computação (pagamento conforme o uso).

  • Como os conjuntos de dados públicos exigem acesso entre projetos, não é possível localizar tabelas desses conjuntos no Data Map do DataWorks.

  • O projeto dos conjuntos de dados públicos utiliza schemas. Caso a sintaxe de schema no nível de tenant não esteja ativada para o seu projeto, não será possível visualizar os conjuntos de dados públicos diretamente no DataAnalysis do DataWorks. Ainda assim, você pode consultar os dados executando instruções SQL.

Detalhes das tabelas

As seções a seguir detalham as tabelas em cada schema do projeto público BIGDATA_PUBLIC_DATASET.

Dados de eventos públicos do GitHub

Nome do projeto

BIGDATA_PUBLIC_DATASET

Nome do schema

github_events

Regiões disponíveis

China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu)

Tabelas e descrições

Desenvolvedores no GitHub geram um grande volume de eventos ao trabalhar em projetos open-source. O GitHub registra detalhes de cada evento, como tipo de evento, desenvolvedor e repositório, publicando-os como eventos públicos. Exemplos incluem marcar um repositório como favorito e fazer commits de código. Para obter uma lista de tipos de eventos, consulte GitHub Events.

O MaxCompute processa offline os dados de eventos públicos do GH Archive para gerar as seguintes tabelas:

  • dwd_github_events_odps (tabela de fatos para dados de eventos públicos do GitHub)

  • dws_overview_by_repo_month (tabela agregada de métricas mensais de eventos públicos do GitHub)

Nota

Os dados nestas tabelas têm como source o GH Archive.

Ciclo de atualização

  • dwd_github_events_odps: Atualizada a cada hora (T+1).

  • dws_overview_by_repo_month: Atualizada diariamente (T+1).

Consultar estrutura da tabela

-- Enable session-level schema syntax.
SET odps.namespace.schema=true; 
-- Query the structure of the dwd_github_events_odps table. To query other tables, replace the schema and table names.
DESC bigdata_public_dataset.github_events.dwd_github_events_odps;

Exemplo de consulta

-- Enable session-level schema syntax.
SET odps.namespace.schema=true; 
-- This example counts the top-starred projects over the past year. Note that this query does not account for unstarring events.
SELECT
    repo_id,
    repo_name,
    COUNT(actor_login) total
FROM
    bigdata_public_dataset.github_events.dwd_github_events_odps
WHERE
    ds>=date_add(getdate(), -365)
    AND type = 'WatchEvent'
GROUP BY
    repo_id,
    repo_name
ORDER BY
    total DESC
LIMIT 10;

Para mais informações e exemplos de consulta, consulte Dados de Eventos Públicos do GitHub.

Estatísticas nacionais

Nome do projeto

BIGDATA_PUBLIC_DATASET

Nome do schema

national_data

Regiões disponíveis

China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu)

Tabelas e descrições

  • annual_gdp_by_province (PIB anual por província na China)

  • annual_gdp_by_country (PIB anual por país no mundo)

Nota

Os dados da tabela annual_gdp_by_province vêm do National Bureau of Statistics, enquanto os dados da tabela annual_gdp_by_country provêm do Fundo Monetário Internacional (IMF).

Ciclo de atualização

Este é um conjunto de dados estático e não recebe atualizações.

Consultar estrutura da tabela

-- Enable session-level schema syntax.
SET odps.namespace.schema=true; 
-- Query the structure of the annual_gdp_by_province table. To query other tables, replace the schema and table names.
DESC bigdata_public_dataset.national_data.annual_gdp_by_province;

Exemplo de consulta

-- Enable session-level schema syntax.
SET odps.namespace.schema=true; 
-- This example shows the GDP trend for Beijing over the past 20 years.
SELECT
    region,
    gdp,
    year
FROM
    bigdata_public_dataset.national_data.annual_gdp_by_province
WHERE
    region='Beijing'
ORDER BY
    year ASC
LIMIT 20;

Dados TPC-DS

Nome do projeto

BIGDATA_PUBLIC_DATASET

Nome do schema

tpcds_10g, tpcds_100g, tpcds_1t, tpcds_10t

Regiões disponíveis

China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu), China (Hong Kong), Japan (Tokyo), Singapore, Malaysia (Kuala Lumpur), Indonesia (Jakarta), US (Virginia), US (Silicon Valley), UK (London), Germany (Frankfurt), UAE (Dubai), China (Shanghai) Finance, China (Beijing) Finance, China (Beijing) Government Cloud, China (Shenzhen) Finance

Tabelas e descrições

O modelo TPC-DS simula o sistema de vendas de uma grande rede de varejo nacional com três canais de venda: store (lojas físicas), web (lojas online) e catalog (pedidos por telefone). Para cada canal, um par de tabelas registra vendas e devoluções. O conjunto de dados também inclui tabelas de dimensão para itens, promoções, clientes e outras informações.

  • call_center (dados de call center)

  • catalog_page (catálogo de products)

  • catalog_returns (registros de devolução de products do canal catálogo)

  • catalog_sales (registros de vendas de products do canal catálogo)

  • customer (dados de clientes)

  • customer_address (dados de endereço dos clientes)

  • customer_demographics (dados demográficos de crédito dos clientes)

  • date_dim (dimensão de data)

  • household_demographics (dados demográficos de crédito domiciliar)

  • income_band (faixas de renda)

  • inventory (dados de inventário)

  • item (dados de itens)

  • promotion (promoções de products)

  • reason (motivos de devolução)

  • ship_mode (modos de envio)

  • store (dados de lojas)

  • store_returns (registros de devolução de products do canal loja)

  • store_sales (registros de vendas de products do canal loja)

  • time_dim (dimensão de tempo)

  • warehouse (dados de armazéns)

  • web_page (dados de páginas web)

  • web_returns (registros de devolução de products do canal web)

  • web_sales (registros de vendas de products do canal web)

  • web_site (dados de sites)

Nota

Os dados nestas tabelas têm como source o TPC.

Ciclo de atualização

Este é um conjunto de dados estático e não recebe atualizações.

Consultar estrutura da tabela

-- Enable session-level schema syntax.
SET odps.namespace.schema=TRUE; 
-- Query the structure of the call_center table in the tpcds_10g schema. To query tables from other dataset sizes, replace the schema and table names.
DESC bigdata_public_dataset.tpcds_10g.call_center;

Exemplo de consulta

SET odps.namespace.schema=TRUE; 
SELECT dt.d_year ,
       item.i_brand_id brand_id ,
       item.i_brand brand ,
       SUM(ss_sales_price) sum_agg
FROM bigdata_public_dataset.tpcds_10g.date_dim dt ,
     bigdata_public_dataset.tpcds_10g.store_sales ,
     bigdata_public_dataset.tpcds_10g.item
WHERE dt.d_date_sk = store_sales.ss_sold_date_sk
  AND store_sales.ss_item_sk = item.i_item_sk
  AND item.i_manufact_id = 190
  AND dt.d_moy = 12
GROUP BY dt.d_year ,
         item.i_brand ,
         item.i_brand_id
ORDER BY dt.d_year,
         sum_agg DESC,
         brand_id LIMIT 100;

Para exemplos de consulta em conjuntos de dados de diferentes tamanhos, consulte Dados TPC-DS.

Para mais detalhes sobre os dados, consulte a especificação oficial do TPC Benchmark DS.

Dados TPC-H

Nome do projeto

BIGDATA_PUBLIC_DATASET

Nome do schema

tpch_10g, tpch_100g, tpch_1t, tpch_10t

Regiões disponíveis

China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu), China (Hong Kong), Japan (Tokyo), Singapore, Malaysia (Kuala Lumpur), Indonesia (Jakarta), US (Virginia), US (Silicon Valley), UK (London), Germany (Frankfurt), UAE (Dubai), China (Shanghai) Finance, China (Beijing) Finance, China (Beijing) Government Cloud, China (Shenzhen) Finance

Tabelas e descrições

O TPC-H é um benchmark para avaliação de sistemas de processamento analítico online (OLAP). Ele simula transações entre fornecedores e clientes, incluindo dados como pedidos, products e clientes.

  • customer (dados de clientes)

  • lineitem (dados de itens de linha)

  • nation (dados de nações)

  • orders (dados de pedidos)

  • part (dados de peças)

  • partsupp (dados de fornecedores de peças)

  • region (dados de regiões)

  • supplier (dados de fornecedores)

Nota

Os dados nestas tabelas têm como source o TPC.

Ciclo de atualização

Este é um conjunto de dados estático e não recebe atualizações.

Consultar estrutura da tabela

-- Enable session-level schema syntax.
SET odps.namespace.schema=TRUE; 
-- Query the structure of the lineitem table in the tpch_10g schema. To query tables from other dataset sizes, replace the schema and table names.
DESC bigdata_public_dataset.tpch_10g.lineitem;

Exemplo de consulta

SET odps.namespace.schema=TRUE; 
SET odps.sql.validate.orderby.limit=FALSE;
SET odps.sql.hive.compatible=TRUE;
SELECT l_returnflag,
       l_linestatus,
       sum(l_quantity) AS sum_qty,
       sum(l_extendedprice) AS sum_base_price,
       sum(l_extendedprice * (1 - l_discount)) AS sum_disc_price,
       sum(l_extendedprice * (1 - l_discount) * (1 + l_tax)) AS sum_charge,
       avg(l_quantity) AS avg_qty,
       avg(l_extendedprice) AS avg_price,
       avg(l_discount) AS avg_disc,
       count(*) AS count_order
FROM bigdata_public_dataset.tpch_10g.lineitem
WHERE l_shipdate <= date'1998-12-01' - interval '90' DAY
GROUP BY l_returnflag,
         l_linestatus
ORDER BY l_returnflag,
         l_linestatus;

Para mais informações e exemplos de consulta, consulte a especificação oficial do TPC Benchmark H.

Dados TPCx-BB

Nome do projeto

BIGDATA_PUBLIC_DATASET

Nome do schema

tpcxbb_10g, tpcxbb_100g, tpcxbb_1t, tpcxbb_10t

Regiões disponíveis

China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu), China (Hong Kong), Japan (Tokyo), Singapore, Malaysia (Kuala Lumpur), Indonesia (Jakarta), US (Virginia), US (Silicon Valley), UK (London), Germany (Frankfurt), UAE (Dubai), China (Shanghai) Finance, China (Beijing) Finance, China (Beijing) Government Cloud, China (Shenzhen) Finance

Tabelas e descrições

O TPCx-BB é um benchmark de big data que simula um cenário de varejo online. O conjunto de dados inclui registros de vendas e devoluções, além de informações sobre itens e promoções. As tabelas são as seguintes:

  • customer (dados de clientes)

  • customer_address (dados de endereço dos clientes)

  • customer_demographics (dados demográficos de crédito dos clientes)

  • date_dim (dimensão de data)

  • household_demographics (dados demográficos de crédito domiciliar)

  • income_band (faixas de renda)

  • inventory (dados de inventário)

  • item (dados de itens)

  • item_marketprices (Preços de concorrentes para o item)

  • product_reviews (avaliações de products)

  • promotion (promoções de products)

  • reason (motivos de devolução)

  • ship_mode (modos de envio)

  • store (dados de lojas)

  • store_returns (registros de devolução de products do canal loja)

  • store_sales (registros de vendas de products do canal loja)

  • time_dim (dimensão de tempo)

  • warehouse (dados de armazéns)

  • web_clickstreams (clickstreams da web)

  • web_page (dados de páginas web)

  • web_returns (registros de devolução de products do canal web)

  • web_sales (registros de vendas de products do canal web)

  • web_site (dados de sites)

Nota

Os dados nestas tabelas têm como source o TPC.

Ciclo de atualização

Este é um conjunto de dados estático e não recebe atualizações.

Consultar estrutura da tabela

-- Enable session-level schema syntax.
SET odps.namespace.schema=TRUE; 
-- Query the structure of the web_sales table in the tpcxbb_10g schema. To query tables from other dataset sizes, replace the schema and table names.
DESC bigdata_public_dataset.tpcxbb_10g.web_sales;

Exemplo de consulta

SET odps.namespace.schema=TRUE; 
SELECT * FROM bigdata_public_dataset.tpcxbb_10g.web_sales limit 100;

Para mais informações e exemplos de consulta, consulte a especificação oficial do TPCx-BB.

Conjunto de dados de comércio digital

Nome do projeto

BIGDATA_PUBLIC_DATASET

Nome do schema

commerce

Regiões disponíveis

China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu)

Tabelas e descrições

  • adv_raw_sample (uma amostra bruta de logs de impressões e cliques de anúncios display de mais de um milhão de usuários do Taobao selecionados aleatoriamente durante um período de oito dias.)

  • adv_ad_feature (informações básicas sobre alguns dos anúncios na tabela raw_sample)

  • user_profile (informações básicas sobre todos os usuários na tabela raw_sample)

  • behavior_log (comportamento de compra de todos os usuários no raw_sample durante 22 dias, incluindo navegação, adição ao carrinho, favoritismo e compra)

Ciclo de atualização

Este é um conjunto de dados estático e não recebe atualizações.

Consultar estrutura da tabela

-- Enable session-level schema syntax.
SET odps.namespace.schema=TRUE; 
-- Query the structure of the behavior_log table. To query other tables, replace the table name.
DESC bigdata_public_dataset.commerce.behavior_log;

Exemplo de consulta

-- Enable session-level schema syntax.
SET odps.namespace.schema=TRUE; 
-- This example uses the behavior_log table to count the top three best-selling product category IDs over a 22-day period.
SELECT cate,
       count(btag) sales
FROM behavior_log
WHERE btag='buy'
GROUP BY cate
ORDER BY sales DESC LIMIT 3;

Conjunto de dados de services de estilo de vida

Nome do projeto

BIGDATA_PUBLIC_DATASET

Nome do schema

life_service

Regiões disponíveis

China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu)

Tabelas e descrições

  • movie_basic_info (informações básicas de filmes)

  • movie_box (informações básicas de bilheteria)

  • areacode_basic_info_2020 (códigos administrativos e de divisão urbano-rural de 2020)

  • phoneno_basic_info_2020 (atribuição de números de celular de 2020)

Ciclo de atualização

  • movie_basic_info, movie_box: Dados estáticos, fornecidos em partições baseadas em data.

  • areacode_basic_info_2020, phoneno_basic_info_2020: Conjuntos de dados estáticos, sem atualizações.

Consultar estrutura da tabela

-- Enable session-level schema syntax.
SET odps.namespace.schema=TRUE; 
-- Query the structure of the movie_box table. To query other tables, replace the table name.
DESC bigdata_public_dataset.life_service.movie_box;

Exemplo de consulta

-- Enable session-level schema syntax.
SET odps.namespace.schema=TRUE;
-- This example queries the top ten movies by box office rank on January 14, 2017.
SELECT moviename
FROM bigdata_public_dataset.life_service.movie_box
WHERE ds ='20170114'
ORDER BY rank ASC LIMIT 10;

Conjunto de dados financeiros e de ações

Nome do projeto

BIGDATA_PUBLIC_DATASET

Nome do schema

finance

Regiões disponíveis

China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu)

Tabelas e descrições

  • ods_enterprise_share_basic (informações básicas de ações)

  • ods_enterprise_share_quarter_cashflow (demonstração de fluxo de caixa trimestral)

  • ods_enterprise_share_quarter_growth (dados trimestrais de crescimento empresarial)

  • ods_enterprise_share_quarter_operation (dados trimestrais de movimentação financeira)

  • ods_enterprise_share_quarter_profit (demonstração de lucro trimestral)

  • ods_enterprise_share_quarter_report (relatório trimestral)

  • ods_enterprise_share_trade_h (preços de ações)

Ciclo de atualização

Dados estáticos, fornecidos em partições baseadas em data.

Consultar estrutura da tabela

-- Enable session-level schema syntax.
SET odps.namespace.schema=TRUE; 
-- Query the structure of the ods_enterprise_share_basic table. To query other tables, replace the table name.
DESC bigdata_public_dataset.finance.ods_enterprise_share_basic;

Exemplo de consulta

-- Enable session-level schema syntax.
SET odps.namespace.schema=TRUE;
-- This example queries basic stock information for January 14, 2017.
SELECT *
FROM bigdata_public_dataset.finance.ods_enterprise_share_basic
WHERE ds ='20170114' LIMIT 10;

Consultar um conjunto de dados público

Pré-requisitos

Você deve ter ativado o MaxCompute e criado um projeto. Para mais informações, consulte Criar um projeto MaxCompute.

Ferramentas suportadas

Procedimento (Exemplo: Nó de Desenvolvimento de Dados do DataWorks)

  1. Faça login no console do DataWorks e selecione uma região no canto superior esquerdo.

  2. Criar um workspace.

  3. Anexar uma source de dados MaxCompute.

  4. Criar um nó ODPS SQL e insira o seguinte exemplo de SQL.

    -- View GDP trends for provinces in China over the past 20 years.
    SET odps.namespace.schema=true; 
    SET odps.sql.validate.orderby.limit = false;
    SELECT
        region,
        gdp,
        year
    FROM
        bigdata_public_dataset.national_data.annual_gdp_by_province
    ORDER BY
        year ASC;
  5. Clique em image.png para visualizar os resultados.image.png

Tópicos relacionados

Para mais informações sobre exportação de dados do MaxCompute, consulte os seguintes tópicos:

  • Download: Baixa dados ou os resultados de execução de uma instância específica para sua máquina local.

  • UNLOAD: Exporta dados para armazenamento externo, como OSS e Hologres.