O MaxCompute oferece diversos conjuntos de dados públicos que você pode consultar com o MaxCompute SQL para explorar rapidamente o service. Esta página lista os conjuntos de dados disponíveis e demonstra como consultar e analisar esses dados.
Introdução
O MaxCompute disponibiliza conjuntos de dados públicos em várias categorias, incluindo dados de eventos públicos do GitHub, estatísticas nacionais, dados de benchmark TPC, dados de comércio digital, dados de services de estilo de vida, além de dados financeiros e de ações. Todos os conjuntos de dados estão armazenados em diferentes schemas no projeto público BIGDATA_PUBLIC_DATASET.
|
Categoria |
Descrição |
Nome do conjunto de dados |
Schema |
|
|
Dados de eventos públicos do GitHub |
Desenvolvedores no GitHub geram um grande volume de eventos ao trabalhar em projetos open-source. O GitHub registra detalhes de cada evento, incluindo tipo, desenvolvedor responsável e repositório. Exemplos incluem marcar um repositório como favorito e fazer commits de código. |
Conjunto de dados de eventos públicos do GitHub |
github_events |
|
|
Estatísticas nacionais |
Dados anuais de PIB de países ao redor do mundo e de províncias na China. |
Conjunto de dados de estatísticas nacionais |
national_data |
|
|
Dados de desempenho TPC |
TPC-DS |
O TPC-DS é um benchmark de suporte à decisão que modela aspectos essenciais, como consultas e manutenção de dados, e avalia o desempenho de tecnologias emergentes, como sistemas de big data. |
|
|
|
TPC-H |
O TPC-H é um benchmark de suporte à decisão composto por consultas ad hoc orientadas a negócios e modificações simultâneas de dados. Ele foi projetado para executar consultas complexas em grandes conjuntos de dados e responder a questões críticas de negócios. |
|
|
|
|
TPCx-BB |
O TPCx-BB (TPC Express Benchmark BB) é um benchmark de big data que mede o desempenho de sistemas baseados em Hadoop executando 30 consultas analíticas comuns em componentes de hardware e software. |
|
|
|
|
Comércio digital |
Dados provenientes de services como publicidade do Taobao, compras no Taobao e e-commerce da Alibaba. |
Conjunto de dados de comércio digital |
commerce |
|
|
Services de estilo de vida |
Dados sobre imóveis usados, filmes e bilheterias, atribuição de números de celular, além de códigos administrativos e de divisão urbano-rural. |
Conjunto de dados de services de estilo de vida |
life_service |
|
|
Finanças e ações |
Informações sobre ações, incluindo dados básicos, relatórios financeiros trimestrais e preços de negociação. |
Conjunto de dados financeiros e de ações |
finance |
|
Aviso legal
Os conjuntos de dados públicos do MaxCompute destinam-se exclusivamente a testes do product. Os dados não são atualizados periodicamente e sua precisão não é garantida. Portanto, não utilize estes dados em ambiente de produção.
A geração e análise de dados TPC nos conjuntos de dados públicos do MaxCompute baseiam-se em benchmarks TPC. Estes resultados de teste não são comparáveis aos resultados oficiais de benchmarks TPC publicados, pois não atendem a todos os requisitos exigidos pelo TPC.
Os dados de teste de desempenho TPC no MaxCompute são provenientes do TPC. Você também pode gerar seus próprios dados TPC. Para obter detalhes sobre a geração de dados de teste TPC, consulte a documentação oficial do TPC.
Observações
Os conjuntos de dados públicos estão disponíveis para todos os usuários do MaxCompute. Ao consultar esses conjuntos, observe o seguinte:
-
Todos os dados do conjunto público estão armazenados no projeto
BIGDATA_PUBLIC_DATASET. No entanto, você não é membro deste projeto. Por isso, use acesso entre projetos para recuperar os dados. Ao escrever um script SQL, especifique o nome do projeto e o nome do schema antes do nome da tabela. Além disso, se a sintaxe de schema no nível de tenant estiver desativada, ative a sintaxe de schema no nível de sessão para garantir a execução correta dos comandos. Veja abaixo um exemplo de comando:-- Enable session-level schema syntax SET odps.namespace.schema=true; -- Query 100 rows from the dwd_github_events_odps table SELECT * FROM bigdata_public_dataset.github_events.dwd_github_events_odps WHERE ds='2024-05-10' limit 100;ImportanteNão há cobrança de taxas de armazenamento para conjuntos de dados públicos, mas as taxas de computação das suas consultas são cobradas normalmente. Para mais informações sobre faturamento, consulte Taxas de computação (pagamento conforme o uso).
Como os conjuntos de dados públicos exigem acesso entre projetos, não é possível localizar tabelas desses conjuntos no Data Map do DataWorks.
O projeto dos conjuntos de dados públicos utiliza schemas. Caso a sintaxe de schema no nível de tenant não esteja ativada para o seu projeto, não será possível visualizar os conjuntos de dados públicos diretamente no DataAnalysis do DataWorks. Ainda assim, você pode consultar os dados executando instruções SQL.
Detalhes das tabelas
As seções a seguir detalham as tabelas em cada schema do projeto público BIGDATA_PUBLIC_DATASET.
Dados de eventos públicos do GitHub
|
Nome do projeto |
BIGDATA_PUBLIC_DATASET |
|
Nome do schema |
github_events |
|
Regiões disponíveis |
China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu) |
|
Tabelas e descrições |
Desenvolvedores no GitHub geram um grande volume de eventos ao trabalhar em projetos open-source. O GitHub registra detalhes de cada evento, como tipo de evento, desenvolvedor e repositório, publicando-os como eventos públicos. Exemplos incluem marcar um repositório como favorito e fazer commits de código. Para obter uma lista de tipos de eventos, consulte GitHub Events. O MaxCompute processa offline os dados de eventos públicos do GH Archive para gerar as seguintes tabelas:
Nota
Os dados nestas tabelas têm como source o GH Archive. |
|
Ciclo de atualização |
|
|
Consultar estrutura da tabela |
|
|
Exemplo de consulta |
|
|
Para mais informações e exemplos de consulta, consulte Dados de Eventos Públicos do GitHub. |
|
Estatísticas nacionais
|
Nome do projeto |
BIGDATA_PUBLIC_DATASET |
|
Nome do schema |
national_data |
|
Regiões disponíveis |
China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu) |
|
Tabelas e descrições |
Nota
Os dados da tabela |
|
Ciclo de atualização |
Este é um conjunto de dados estático e não recebe atualizações. |
|
Consultar estrutura da tabela |
|
|
Exemplo de consulta |
|
Dados TPC-DS
|
Nome do projeto |
BIGDATA_PUBLIC_DATASET |
|
Nome do schema |
tpcds_10g, tpcds_100g, tpcds_1t, tpcds_10t |
|
Regiões disponíveis |
China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu), China (Hong Kong), Japan (Tokyo), Singapore, Malaysia (Kuala Lumpur), Indonesia (Jakarta), US (Virginia), US (Silicon Valley), UK (London), Germany (Frankfurt), UAE (Dubai), China (Shanghai) Finance, China (Beijing) Finance, China (Beijing) Government Cloud, China (Shenzhen) Finance |
|
Tabelas e descrições |
O modelo TPC-DS simula o sistema de vendas de uma grande rede de varejo nacional com três canais de venda:
Nota
Os dados nestas tabelas têm como source o TPC. |
|
Ciclo de atualização |
Este é um conjunto de dados estático e não recebe atualizações. |
|
Consultar estrutura da tabela |
|
|
Exemplo de consulta |
|
|
Para exemplos de consulta em conjuntos de dados de diferentes tamanhos, consulte Dados TPC-DS. Para mais detalhes sobre os dados, consulte a especificação oficial do TPC Benchmark DS. |
|
Dados TPC-H
|
Nome do projeto |
BIGDATA_PUBLIC_DATASET |
|
Nome do schema |
tpch_10g, tpch_100g, tpch_1t, tpch_10t |
|
Regiões disponíveis |
China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu), China (Hong Kong), Japan (Tokyo), Singapore, Malaysia (Kuala Lumpur), Indonesia (Jakarta), US (Virginia), US (Silicon Valley), UK (London), Germany (Frankfurt), UAE (Dubai), China (Shanghai) Finance, China (Beijing) Finance, China (Beijing) Government Cloud, China (Shenzhen) Finance |
|
Tabelas e descrições |
O TPC-H é um benchmark para avaliação de sistemas de processamento analítico online (OLAP). Ele simula transações entre fornecedores e clientes, incluindo dados como pedidos, products e clientes.
Nota
Os dados nestas tabelas têm como source o TPC. |
|
Ciclo de atualização |
Este é um conjunto de dados estático e não recebe atualizações. |
|
Consultar estrutura da tabela |
|
|
Exemplo de consulta |
|
|
Para mais informações e exemplos de consulta, consulte a especificação oficial do TPC Benchmark H. |
|
Dados TPCx-BB
|
Nome do projeto |
BIGDATA_PUBLIC_DATASET |
|
Nome do schema |
tpcxbb_10g, tpcxbb_100g, tpcxbb_1t, tpcxbb_10t |
|
Regiões disponíveis |
China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu), China (Hong Kong), Japan (Tokyo), Singapore, Malaysia (Kuala Lumpur), Indonesia (Jakarta), US (Virginia), US (Silicon Valley), UK (London), Germany (Frankfurt), UAE (Dubai), China (Shanghai) Finance, China (Beijing) Finance, China (Beijing) Government Cloud, China (Shenzhen) Finance |
|
Tabelas e descrições |
O TPCx-BB é um benchmark de big data que simula um cenário de varejo online. O conjunto de dados inclui registros de vendas e devoluções, além de informações sobre itens e promoções. As tabelas são as seguintes:
Nota
Os dados nestas tabelas têm como source o TPC. |
|
Ciclo de atualização |
Este é um conjunto de dados estático e não recebe atualizações. |
|
Consultar estrutura da tabela |
|
|
Exemplo de consulta |
|
|
Para mais informações e exemplos de consulta, consulte a especificação oficial do TPCx-BB. |
|
Conjunto de dados de comércio digital
|
Nome do projeto |
BIGDATA_PUBLIC_DATASET |
|
Nome do schema |
commerce |
|
Regiões disponíveis |
China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu) |
|
Tabelas e descrições |
Nota
Os dados nestas tabelas vêm do Tianchi Lab - Conjunto de dados de Previsão de Taxa de Cliques (CTR) de Anúncios Display do Taobao. |
|
Ciclo de atualização |
Este é um conjunto de dados estático e não recebe atualizações. |
|
Consultar estrutura da tabela |
|
|
Exemplo de consulta |
|
Conjunto de dados de services de estilo de vida
|
Nome do projeto |
BIGDATA_PUBLIC_DATASET |
|
Nome do schema |
life_service |
|
Regiões disponíveis |
China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu) |
|
Tabelas e descrições |
|
|
Ciclo de atualização |
|
|
Consultar estrutura da tabela |
|
|
Exemplo de consulta |
|
Conjunto de dados financeiros e de ações
|
Nome do projeto |
BIGDATA_PUBLIC_DATASET |
|
Nome do schema |
finance |
|
Regiões disponíveis |
China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu) |
|
Tabelas e descrições |
|
|
Ciclo de atualização |
Dados estáticos, fornecidos em partições baseadas em data. |
|
Consultar estrutura da tabela |
|
|
Exemplo de consulta |
|
Consultar um conjunto de dados público
Pré-requisitos
Você deve ter ativado o MaxCompute e criado um projeto. Para mais informações, consulte Criar um projeto MaxCompute.
Ferramentas suportadas
Procedimento (Exemplo: Nó de Desenvolvimento de Dados do DataWorks)
Faça login no console do DataWorks e selecione uma região no canto superior esquerdo.
-
Criar um nó ODPS SQL e insira o seguinte exemplo de SQL.
-- View GDP trends for provinces in China over the past 20 years. SET odps.namespace.schema=true; SET odps.sql.validate.orderby.limit = false; SELECT region, gdp, year FROM bigdata_public_dataset.national_data.annual_gdp_by_province ORDER BY year ASC; Clique em
para visualizar os resultados.
Tópicos relacionados
Para mais informações sobre exportação de dados do MaxCompute, consulte os seguintes tópicos: