A fonte de dados BigQuery conecta o DataWorks ao Google BigQuery e permite ler dados do BigQuery em tarefas de sincronização offline. Configure a tarefa pela interface visual sem código ou pelo editor de código.
Recursos compatíveis
|
Recurso |
Compatível |
|
Sincronização offline (em lote) |
Sim |
|
Configuração pela interface visual sem código |
Sim |
|
Configuração pelo editor de código |
Sim |
|
Sincronização incremental (via filtro |
Sim |
|
Sincronização baseada em partição |
Sim |
|
Sincronização simultânea (via |
Sim |
Regiões compatíveis
As fontes de dados BigQuery estão disponíveis nas seguintes regiões: China (Hong Kong), Japão (Tóquio), Singapura, Malásia (Kuala Lumpur), Indonésia (Jacarta), Alemanha (Frankfurt), Reino Unido (Londres), EUA (Vale do Silício) e EUA (Virgínia).
A versão do SDK do BigQuery é google-cloud-bigquery 2.29.0. Para obter mais detalhes sobre o SDK, consulte a documentação do BigQuery.
Tipos de campo compatíveis
A tabela a seguir lista os tipos de campo do BigQuery compatíveis com o DataWorks e os respectivos tipos Java correspondentes.
|
Tipo BigQuery |
Tipo Java |
|
BOOL |
Bool |
|
INT64 |
Long |
|
FLOAT64 |
BigDecimal |
|
NUMERIC |
BigDecimal |
|
BIGNUMERIC |
BigDecimal |
|
STRING |
String |
|
BYTES |
Bytes |
|
STRUCT |
String |
|
ARRAY |
String |
|
TIMESTAMP |
Date |
|
DATE |
Date |
|
TIME |
Date |
|
DATETIME |
Date |
|
GEOGRAPHY |
String |
|
JSON |
String |
|
INTERVAL |
String |
Para consultar a referência completa de tipos do BigQuery, acesse a documentação de tipos de dados do BigQuery.
Pré-requisitos
Antes de começar, verifique se você tem:
Conectividade de rede entre a fonte de dados BigQuery e um grupo de recursos serverless ou exclusivo para Data Integration. Use um grupo de recursos serverless para a maioria das tarefas de sincronização. Para instruções de configuração, consulte Soluções de conectividade de rede.
Um arquivo de autenticação de conta de serviço (chave JSON) baixado do Google Cloud.
O Project ID do BigQuery do seu projeto no Google Cloud.
Adicione a fonte de dados BigQuery
Adicione o BigQuery como fonte de dados no DataWorks antes de criar uma tarefa de sincronização. Siga as instruções em Gerenciamento de fontes de dados.
Os parâmetros a seguir são específicos da fonte de dados BigQuery:
|
Parâmetro |
Descrição |
|
BigQuery Project ID |
O ID do seu projeto no Google Cloud. |
|
BigQuery authorization information |
Faça upload do arquivo de autenticação JSON baixado do Google Cloud. |
Dica: Visualize as descrições dos parâmetros diretamente no console do DataWorks ao adicionar a fonte de dados.
Configure uma tarefa de sincronização
Para configurar a tarefa passo a passo, consulte:
Apêndice: Exemplo de script e descrição de parâmetros
Use o exemplo de script e a referência de parâmetros a seguir para configurar uma tarefa de sincronização em lote do BigQuery no editor de código. Para requisitos gerais do editor de código, consulte Configurar uma tarefa no editor de código.
Exemplo de script do Reader
{
"stepType": "bigquery",
"parameter": {
"datasource": "bq_test1",
"dataSet": "database_0724",
"table": "partition_1107",
"column": [
"id",
"table_id",
"table_no",
"table_name",
"table_status"
],
"where": "xxx=3",
"partition": [
"_PARTITIONTIME='2023-11-07'"
]
},
"name": "Reader",
"category": "reader"
}
Parâmetros do Reader
|
Parâmetro |
Obrigatório |
Padrão |
Descrição |
|
|
Sim |
Nenhum |
Nome da fonte de dados. Deve corresponder exatamente ao nome da fonte de dados adicionada no DataWorks. |
|
|
Sim |
Nenhum |
Dataset do BigQuery. |
|
|
Sim |
Nenhum |
Nome da tabela a sincronizar. |
|
|
Sim |
Nenhum |
Colunas a ler. Exemplo: |
|
|
Não |
Nenhum |
Condição de filtro aplicada à consulta. O BigQuery Reader combina |
|
|
Não |
Nenhuma |
Partições a sincronizar. Exemplo: |
|
|
Não |
Nenhum |
Campo usado para particionar dados na sincronização simultânea. Não tem efeito se |