Todos os produtos
Search
Central de documentação

DataWorks:Fonte de dados de conjunto de dados público

Última atualização: Jun 27, 2026

O DataWorks oferece uma source de dados de conjunto de dados público integrada e pronta para uso, que permite experimentar a sincronização em lote de tabela única sem configure. Este tópico descreve os recursos de sincronização de conjuntos de dados públicos compatíveis com o DataWorks.

Conjuntos de dados e regiões compatíveis

  • Para obter a lista de conjuntos de dados públicos compatíveis e seus detalhes, consulte a categoria Alibaba Cloud Marketplace Datasets na DataWorks Gallery. Assine um conjunto de dados antes de utilizá-lo em uma tarefa de sincronização.

  • A source de dados de conjunto de dados público está disponível nas seguintes regiões:

    China (Beijing), China (Shanghai), China (Hangzhou), China (Shenzhen), China (Zhangjiakou), China (Chengdu), China (Ulanqab), China (Hong Kong), Japão (Tokyo), Singapura, Malásia (Kuala Lumpur), Indonésia (Jakarta), Alemanha (Frankfurt), Reino Unido (London), EUA (Silicon Valley) e EUA (Virginia).

Desenvolver uma tarefa de sincronização de dados

Para acessar o ponto de entrada e o procedimento geral de configure das tarefas de sincronização de dados, consulte os guias abaixo.

Guia de configure de tarefa de sincronização em lote de tabela única

Apêndice: Exemplo de script e descrições de parâmetros

Modo script para tarefas em lote

Ao configure uma tarefa em lote no modo script, siga o formato de script unificado e defina os parâmetros correspondentes no script da tarefa. Para mais detalhes, consulte Configuração no modo script. As seções a seguir descrevem a configure de parâmetros da source de dados no modo script.

Exemplo de script do Reader

{
    "type": "job",
    "version": "2.0",
    "steps": [
        {
            "stepType": "public_dataset",
            "parameter": {
                "datasource": "Curated Book Dataset",
                "column": [
                    "bookid",
                    "title",
                    "authors",
                    "average_rating",
                    "isbn",
                    "isbn13",
                    "language_code",
                    "__num_pages",
                    "ratings_count",
                    "text_reviews_count",
                    "publication_date",
                    "publisher"
                ],
                "table": "good_reads_books"
            },
            "name": "Reader",
            "category": "reader"
        },
        {
            "stepType": "stream",
            "parameter": {
                "print": true
            },
            "name": "Writer",
            "category": "writer"
        }
    ],
    "setting": {
        "errorLimit": {
            "record": "0"
        },
        "locale": "zh_CN",
        "speed": {
            "concurrent": 2,
            "throttle": false
        }
    }
}

Parâmetros do script do Reader

Parâmetro

Descrição

Obrigatório

Valor padrão

datasource

Nome do conjunto de dados público, por exemplo, Curated Book Dataset.

Sim

Nenhum

table

Nome da tabela a sincronizar. Encontre o nome da tabela nos detalhes do conjunto de dados.

Sim

Nenhum

column

Colunas a ler da tabela do conjunto de dados público, separadas por vírgulas. Exemplo: "column": ["ID", "name", "age"].

Sim

Nenhum