Todos os produtos
Search
Central de documentação

Elasticsearch:Sincronizar dados do HBase para o Alibaba Cloud Elasticsearch com o DataWorks

Última atualização: Jul 17, 2026

O Alibaba Cloud Elasticsearch permite pesquisar e analisar dados armazenados no HBase. Use o Data Integration no DataWorks para sincronizar dados offline do HBase para uma instância do Alibaba Cloud Elasticsearch.

Contexto

O DataWorks é uma plataforma completa de desenvolvimento e governança de big data, construída sobre mecanismos de big data. Ele integra recursos como desenvolvimento de dados, agendamento de tarefas e gerenciamento de dados. Com as tarefas de sincronização do DataWorks, você sincroniza rapidamente dados de diversas fontes para o Alibaba Cloud Elasticsearch.

  • Fontes de dados compatíveis:

    • Bancos de dados da Alibaba Cloud (MySQL, PostgreSQL, SQL Server, MongoDB e HBase)

    • Alibaba Cloud PolarDB-X (atualizado a partir do DRDS)

    • Alibaba Cloud MaxCompute

    • Alibaba Cloud OSS

    • Alibaba Cloud Tablestore

    • Versões autogerenciadas de HDFS, Oracle, FTP, DB2 e outros tipos de banco de dados compatíveis

  • Cenários de uso:

Pré-requisitos

Nota
  • A sincronização de dados é compatível apenas com o Alibaba Cloud Elasticsearch. O Elasticsearch autogerenciado não é suportado.

  • A instância do HBase, a instância do Alibaba Cloud Elasticsearch e o workspace do DataWorks devem estar na mesma região.

  • A instância do HBase, a instância do Alibaba Cloud Elasticsearch e o workspace do DataWorks devem estar no mesmo fuso horário. Caso contrário, poderá ocorrer uma diferença de fuso horário entre os dados de origem e de destino durante a sincronização de dados temporais.

Faturamento

Procedimento

Etapa 1: Preparar os dados de origem

Este exemplo utiliza a seguinte instrução de criação de tabela e dados de teste. Para mais informações sobre como importar dados para uma instância do HBase, consulte Usar o HBase Shell para acesso.

  • Instrução de criação de tabela

    create 'student', {NAME => 'name'}, {NAME => 'ID'}, {NAME => 'gender'}
  • Dados de teste

    Execute o comando put para inserir dados na tabela. Exemplo: put 'student', 'row1', 'name:a', 'xiaoming'.

    Execute o comando scan para visualizar os dados na tabela. Exemplo: scan 'student'.HBase测试数据

Etapa 2: Adquirir e configurar um grupo de recursos exclusivo

Adquira um grupo de recursos exclusivo para o Data Integration e associe uma VPC e um workspace a ele. Um grupo de recursos exclusivo garante transmissão de dados rápida e estável.

  1. Faça login no console do DataWorks.

  2. Na barra de navegação superior, selecione uma região. No painel de navegação à esquerda, clique em Resource Groups.

  3. Na aba Exclusive Resource Group, clique em Create Legacy Resource Group > Resource Group for Data Integration.

  4. Na página DataWorks Exclusive Resources (Subscription), defina Resource Type como Exclusive Resource Group for Data Integration, insira um nome para o grupo de recursos e clique em Buy Now para adquirir o grupo de recursos exclusivo.

    Para mais informações, consulte Etapa 1: Adquirir um grupo de recursos.

  5. Na coluna Actions do grupo de recursos exclusivo criado, clique em Network Settings para associar uma VPC.

    Nota

    Este procedimento sincroniza dados por meio de uma VPC usando um grupo de recursos exclusivo para Data Integration. Para mais informações, consulte Configurar uma lista de permissões de endereços IP.

    Para sincronizar dados, o grupo de recursos exclusivo deve se conectar às VPCs das instâncias do HBase e do Alibaba Cloud Elasticsearch. Associe o grupo de recursos à Virtual Private Cloud (VPC), Zone e VSwitch de ambas as instâncias. Para visualizar as informações de VPC da instância do Alibaba Cloud Elasticsearch, consulte Visualizar as informações básicas de uma instância do Elasticsearch.

    Importante

    Após associar uma VPC, adicione o vSwitch CIDR Block da VPC às listas de permissões de endereços IP privados das instâncias do HBase e do Alibaba Cloud Elasticsearch. Para mais informações, consulte Configurar uma lista de permissões de endereços IP públicos ou privados para uma instância do Elasticsearch.

  6. No canto superior esquerdo, clique no ícone de voltar para retornar à página Resource List.

  7. Na coluna Actions do grupo de recursos exclusivo, clique em Attach Workspace para associar o workspace de destino.

    Para mais informações, consulte Etapa 2: Associar um workspace.

Etapa 3: Adicionar fontes de dados

Adicione as fontes de dados do HBase e do Elasticsearch ao Data Integration no DataWorks.

  1. Acesse a página do Data Integration.

    1. Faça login no console do DataWorks.

    2. No painel de navegação à esquerda, clique em Workspace.

    3. Na coluna Actions do workspace desejado, escolha Shortcuts > Data Integration.

  2. No painel de navegação à esquerda, clique em Data Source.

  3. Adicione uma fonte de dados do HBase.

    1. Na página Data Sources, clique em Add Data Source.

    2. Na caixa de diálogo Add Data Source, pesquise e selecione HBase.

    3. Na caixa de diálogo Add HBase Data Source, configure os parâmetros na seção Basic Information.

      Para mais informações, consulte Configurar uma fonte de dados do HBase.

    4. Na seção Connection Configuration, clique em Test Connectivity. O status Connected indica que a conexão foi bem-sucedida.

    5. Clique em OK.

  4. Adicione uma fonte de dados do Elasticsearch da mesma maneira. Para mais informações, consulte Configurar uma fonte de dados do Elasticsearch.

Etapa 4: Configurar e executar uma tarefa de sincronização offline

Configure e execute uma tarefa de sincronização offline em um grupo de recursos exclusivo.

Nota
  1. Acesse a página de Desenvolvimento de Dados.

    1. Faça login no console do DataWorks.

    2. No painel de navegação à esquerda, clique em Workspace.

    3. Na coluna Actions do workspace de destino, escolha Shortcuts > Data development.

  2. Crie um nó de sincronização offline.

    1. Na aba Data Development (image), escolha Create > New business process.

    2. Clique com o botão direito no fluxo de trabalho criado e escolha Create Node > Data Integration > Batch Synchronization.

    3. Na caixa de diálogo Create Node, insira um nome para o nó e clique em OK.

  3. Configure a rede e os recursos.

    1. Na seção Source, selecione HBase na lista suspensa Source e selecione o nome da fonte de dados de origem na lista suspensa Data Source Name.

    2. Na seção Resource Group, selecione o grupo de recursos exclusivo.

    3. Na seção Destination, selecione Elasticsearch na lista suspensa Destination e selecione o nome da fonte de dados de destino na lista suspensa Data Source Name.

  4. Clique em Next.

  5. Configure a tarefa.

    1. Na seção Source, selecione a tabela que deseja sincronizar.

    2. Na seção Destination, configure os parâmetros.

    3. Na seção Field Mapping, mapeie a Source Column para a Target Column. Para mais informações, consulte Configurar uma tarefa de sincronização offline usando a interface gráfica sem código.

    4. Na seção Channel Control, configure os parâmetros do canal.

    Para mais informações, consulte Configurar uma tarefa de sincronização offline usando a interface gráfica sem código.

  6. Execute a tarefa.

    1. (Opcional) No lado direito da página, clique em Properties para configurar os parâmetros de agendamento. Para mais informações, consulte Configuração de agendamento.

    2. Na barra de ferramentas superior, clique no ícone Salvar para salvar a tarefa.

    3. Na barra de ferramentas superior, clique no ícone Enviar para enviar a tarefa.

      Se você configurar propriedades de agendamento, a tarefa será executada periodicamente. Também é possível clicar no ícone Executar no canto superior direito do editor de nós para executar a tarefa imediatamente.

      A mensagem Shell run successfully! no log de execução indica que a tarefa foi executada com sucesso.

Etapa 5: Verificar os dados sincronizados

  1. Faça login no console do Kibana do seu cluster Elasticsearch e acesse a página inicial do Kibana.

  2. No menu de navegação à esquerda, clique em Dev tools.

  3. Na aba Console, execute o seguinte comando para visualizar os dados sincronizados.

    POST /student_info/_search?pretty
    {
       "query": { "match_all": {}}
    }
    Nota

    student_info é o nome do índice de destino configurado na tarefa de sincronização offline.