O DataWorks oferece uma source de dados de conjunto de dados público integrada e pronta para uso, que permite experimentar a sincronização em lote de tabela única sem configure. Este tópico descreve os recursos de sincronização de conjuntos de dados públicos compatíveis com o DataWorks.
Conjuntos de dados e regiões compatíveis
Para obter a lista de conjuntos de dados públicos compatíveis e seus detalhes, consulte a categoria Alibaba Cloud Marketplace Datasets na DataWorks Gallery. Assine um conjunto de dados antes de utilizá-lo em uma tarefa de sincronização.
-
A source de dados de conjunto de dados público está disponível nas seguintes regiões:
China (Beijing), China (Shanghai), China (Hangzhou), China (Shenzhen), China (Zhangjiakou), China (Chengdu), China (Ulanqab), China (Hong Kong), Japão (Tokyo), Singapura, Malásia (Kuala Lumpur), Indonésia (Jakarta), Alemanha (Frankfurt), Reino Unido (London), EUA (Silicon Valley) e EUA (Virginia).
Desenvolver uma tarefa de sincronização de dados
Para acessar o ponto de entrada e o procedimento geral de configure das tarefas de sincronização de dados, consulte os guias abaixo.
Guia de configure de tarefa de sincronização em lote de tabela única
Consulte Configuração por UI sem código e Configuração no modo script para ver o procedimento.
Para obter o conjunto completo de parâmetros do modo script e um exemplo de script, consulte o Apêndice: Exemplo de script e descrições de parâmetros abaixo.
Apêndice: Exemplo de script e descrições de parâmetros
Modo script para tarefas em lote
Ao configure uma tarefa em lote no modo script, siga o formato de script unificado e defina os parâmetros correspondentes no script da tarefa. Para mais detalhes, consulte Configuração no modo script. As seções a seguir descrevem a configure de parâmetros da source de dados no modo script.
Exemplo de script do Reader
{
"type": "job",
"version": "2.0",
"steps": [
{
"stepType": "public_dataset",
"parameter": {
"datasource": "Curated Book Dataset",
"column": [
"bookid",
"title",
"authors",
"average_rating",
"isbn",
"isbn13",
"language_code",
"__num_pages",
"ratings_count",
"text_reviews_count",
"publication_date",
"publisher"
],
"table": "good_reads_books"
},
"name": "Reader",
"category": "reader"
},
{
"stepType": "stream",
"parameter": {
"print": true
},
"name": "Writer",
"category": "writer"
}
],
"setting": {
"errorLimit": {
"record": "0"
},
"locale": "zh_CN",
"speed": {
"concurrent": 2,
"throttle": false
}
}
}
Parâmetros do script do Reader
|
Parâmetro |
Descrição |
Obrigatório |
Valor padrão |
|
datasource |
Nome do conjunto de dados público, por exemplo, Curated Book Dataset. |
Sim |
Nenhum |
|
table |
Nome da tabela a sincronizar. Encontre o nome da tabela nos detalhes do conjunto de dados. |
Sim |
Nenhum |
|
column |
Colunas a ler da tabela do conjunto de dados público, separadas por vírgulas. Exemplo: "column": ["ID", "name", "age"]. |
Sim |
Nenhum |