Todos os produtos
Search
Central de documentação

DataWorks:Coleta de metadados

Última atualização: Jul 10, 2026

O Data Map do DataWorks oferece o recurso de Metadata Collection para consolidar e gerenciar centralmente os metadados de diversas fontes de dados do DataWorks. Visualize os metadados agregados de todas as fontes no Data Map e crie crawlers para coletar esses metadados no DataWorks.

Visão geral

A coleta de metadados é fundamental para construir um Data Map de nível empresarial e alcançar uma gestão unificada de ativos de dados. Um crawler extrai automaticamente metadados técnicos (como bancos de dados, tabelas e colunas), linhagem de dados e informações de partição de fontes de dados do DataWorks (como MaxCompute, Hologres, MySQL e CDH Hive) distribuídas em diferentes workspaces dentro da mesma região. Em seguida, consolida essas informações no Data Map do DataWorks como uma visualização unificada de dados.

A coleta de metadados permite:

  • Construir uma visualização unificada de dados: Elimine silos de dados gerenciando centralmente os metadados de múltiplas fontes heterogêneas.

  • Ative a descoberta e busca de dados: Permita que os consumidores de dados localizem rápida e precisamente as informações necessárias.

  • Analisar a linhagem de dados ponta a ponta: Rastreie claramente a origem e o fluxo dos dados para facilitar a análise de impacto e a solução de problemas.

  • Fortalecer a governança de dados: Implemente Classificação de Dados, controle de acesso, monitoramento de qualidade e gerenciamento de ciclo de vida com base em metadados abrangentes.

Faturamento

Por padrão, cada tarefa de coleta consome 0,25 CU multiplicado pelo tempo de execução da tarefa, gerando taxas de unidade de computação. Cada coleta bem-sucedida gera uma instância de agendamento, incorrendo em taxas de agendamento.

Limitações

  • Caso uma fonte de dados utilize lista de permissões para controle de acesso, configure-a previamente. Para mais informações, consulte Lista de permissões para coleta de metadados.

  • A implantação do DataWorks e a fonte de dados devem estar na mesma região. Se for necessário coletar metadados entre regiões, use um endpoint público ao criar a fonte de dados. Para mais detalhes, consulte Criar uma fonte de dados.

  • Não há suporte para coleta de metadados em fontes de dados AnalyticDB for MySQL com SSL ativado.

Ponto de entrada

  1. Faça login no console do DataWorks. Na região desejada, clique em Data Governance > Data Map no painel de navegação à esquerda. Na página exibida, clique em Go to Data Map.

  2. No painel de navegação à esquerda, clique em image para acessar a página de coleta de metadados.

Crawlers integrados

Os crawlers integrados são pré-configurados e executados automaticamente (quase em tempo real) pela plataforma DataWorks para coletar metadados essenciais profundamente integrados ao DataWorks. Não é necessário criá-los; basta gerenciar o escopo da coleta.

Importante

Se não encontrar a tabela desejada no Data Map, acesse My Data > My Tools > Refresh Table Metadata e sincronize manualmente as tabelas relevantes.

Crawler padrão do MaxCompute

Este crawler coleta metadados dos projetos MaxCompute associados à sua conta. Acesse a página de detalhes, clique em Modify Data Scope para selecionar os projetos a serem coletados e clique em Permission Configurations para configurar a visibilidade dos metadados dentro do tenant.

  1. Na seção Built-in da página de coleta de metadados, localize o cartão MaxCompute Default Crawler e clique em Details.

  2. A página de detalhes do MaxCompute Default Crawler contém duas abas: Basic Information e Data Scope.

    • Basic Information: Exibe as propriedades básicas do crawler, como tipo e método de coleta. Essas informações são somente leitura.

    • Data Scope: Gerencia de quais projetos MaxCompute este crawler coleta metadados.

  3. Modifique o escopo de coleta:

    1. Mude para a aba Data Scope e clique no botão Modify Data Scope.

    2. Na caixa de diálogo exibida, selecione ou desmarque os projetos MaxCompute dos quais deseja coletar metadados.

      Importante

      Por padrão, o escopo inclui todos os projetos MaxCompute associados a workspaces na região atual sob seu tenant. Após modificar o escopo de dados, os objetos de metadados coletados no Data Map ficarão consistentes com o escopo atual. Os metadados de projetos desmarcados não estarão visíveis.

    3. Clique em OK para salvar as alterações.

  4. Configure a visibilidade dos metadados:

    • Na lista Data Scope, localize o projeto desejado e clique em Permission Configurations na coluna Actions.

    • Selecione uma política de visibilidade conforme seus requisitos de governança de dados:

      • Public Within Tenant: Todos os membros do tenant podem pesquisar e visualizar os metadados deste projeto.

      • Only members in the associated workspace can search and view.: Apenas membros de workspaces específicos podem acessar os metadados deste projeto, garantindo o isolamento dos dados.

Crawler padrão do DLF

Importante

Para ativar a coleta em tempo real de metadados do DLF, conceda a permissão Data Reader à função vinculada ao service AliyunServiceRoleForDataworksOnEmr no console do DLF.

O Crawler Padrão do DLF coleta metadados do Data Lake Formation (DLF) associado à sua conta.

  1. Na seção Built-in da página de coleta de metadados, localize o cartão DLF Default Crawler e clique em Details para visualizar as informações básicas.

  2. Mude para a aba Data Scope para ver a lista de Catálogos DLF incluídos no escopo de coleta e a quantidade de tabelas que contêm.

    Por padrão, todos os catálogos acessíveis (incluindo DLF e DLF-Legacy) são coletados.

Crawlers personalizados

Os crawlers personalizados permitem gerenciar centralmente os metadados em diferentes ambientes e motores.

  • Para fontes de dados comuns

    Crie crawlers personalizados para fontes de dados estruturadas ou semiestruturadas, como Hologres, StarRocks, MySQL, Oracle e CDH Hive. O sistema analisa as estruturas físicas de banco de dados e tabelas na origem para extrair e sincronizar automaticamente os metadados, incluindo atributos de colunas, índices e partições.

  • Para fontes de dados do tipo metadado (catálogo)

    Para metadados nativos em formato de lake autodeclarados e não gerenciados pelo DLF, como Paimon Catalog e outras fontes de dados do tipo metadado, também é possível criar crawlers para coleta direta.

Create Custom Crawler

  1. Na seção de lista de crawlers personalizados na página de coleta de metadados, clique em Create Metadata Crawler.

  2. Selecione um tipo de coleta: Na página de seleção de tipo, escolha o tipo de fonte de dados alvo para coleta, como Hologres ou StarRocks.

  3. Configure as definições básicas e o grupo de recursos:

    • Basic Configurations:

      • Selecione um workspace: Escolha o workspace que contém a fonte de dados.

      • Select Data Source: Selecione uma fonte de dados alvo criada anteriormente na lista suspensa. Após a seleção, o sistema exibe automaticamente os detalhes da fonte de dados.

      • Name: Nomeie o crawler para facilitar a identificação posterior. Por padrão, o nome é igual ao nome da fonte de dados.

    • Resource Group Configuration:

      • Resource Group: Selecione um grupo de recursos para executar a tarefa de coleta.

      • Test Network Connectivity: Esta etapa é crítica. Clique em Test Network Connectivity para garantir que o grupo de recursos possa acessar a fonte de dados.

        Importante
  4. Configure a coleta de metadados:

    • Collection Scope: Defina os bancos de dados (database/schema) a serem coletados. Se a fonte de dados estiver na granularidade de banco de dados, o banco correspondente será selecionado por padrão. É possível selecionar bancos adicionais além da fonte de dados.

      Importante
      • Cada banco de dados pode ser configurado em apenas um crawler. Se um banco aparecer esmaecido, ele já está sendo coletado por outro crawler.

      • Ao reduzir o escopo de coleta, os metadados fora desse escopo deixarão de ser pesquisáveis no Data Map.

  5. Configure o aprimoramento inteligente e o plano de coleta:

    • Aprimoramento inteligente (Beta):

      • Descrições geradas por IA: Quando ativado, o sistema utiliza um modelo de linguagem grande para gerar automaticamente descrições de negócios para tabelas e colunas após a coleta de metadados. Visualize as descrições geradas por IA na página de detalhes de um objeto de tabela no Data Map.

    • Collection Plan:

      • Trigger Mode: Selecione manual ou periódico.

        • Manual: O crawler executa apenas quando acionado manualmente. Ideal para coletas únicas ou sob demanda.

        • Periódico: Configure uma tarefa agendada (mensal, diária, semanal ou horária) para que o sistema atualize os metadados automaticamente de forma periódica.

          Para configurar uma tarefa agendada com granularidade de minuto, selecione o ciclo de coleta horária e marque todas as granularidades de minuto para implementar uma execução a cada 5 minutos.
          Importante

          Apenas fontes de dados no ambiente de produção suportam coleta periódica.

  6. Salve a configuração: Clique em Save ou Save and Run para concluir a criação do crawler.

Gerencie crawlers personalizados

Após a criação, o crawler aparece na lista de crawlers personalizados. Realize as seguintes operações:

  • Operações na lista: Diretamente na lista, é possível Run, Stop ou Delete um crawler. Utilize os recursos de Filter e Search no topo para localizar rapidamente o crawler desejado.

    Importante

    Ao excluir um crawler de metadados, os objetos coletados por ele no Data Map tornam-se inválidos. Não será mais possível pesquisar ou visualizar esses objetos e seus detalhes. Proceda com cautela.

  • Operações em lote: Selecione vários crawlers na lista e utilize Batch Run ou Batch Stop na parte inferior da lista para acionar ou encerrar múltiplas tarefas de coleta simultaneamente, aumentando a eficiência da gestão.

  • Status do crawler: A lista exibe o status atual de cada crawler. Os status comuns incluem Not Run, Waiting, Running, Successful, Failed e Manually Terminated.

    Nota

    Se a fonte de dados associada a um crawler for desassociada ou tornar-se inválida, o crawler entrará no estado congelado. Um crawler congelado não pode ser executado, apenas excluído.

  • Visualize detalhes e logs: Clique no nome do crawler alvo para acessar sua página de detalhes.

    • Basic Information: Visualize todos os itens de configuração do crawler.

    • Data Scope: Visualize ou Modify Data Scope.

      Se nenhuma coleta tiver sido realizada, a contagem de tabelas e a hora da última atualização estarão vazias.
      As seguintes fontes de dados não suportam modificação de escopo: EMR Hive, CDH Hive, Lindorm, ElasticSearch, OTS, MongoDB e AnalyticDB for Spark no AnalyticDB MySQL.
    • Run Logs: Acompanhe o histórico de execução de cada tarefa de coleta. É possível visualizar o horário de início, duração, status e volume de dados coletados em cada tarefa. Quando uma tarefa falhar, clicar em View Logs é o ponto de entrada principal para identificar e resolver problemas.

  • Acionar coleta manualmente: No canto superior direito da página de detalhes, clique no botão Collect Metadata para iniciar imediatamente uma tarefa de coleta. Isso é útil quando você deseja visualizar uma tabela recém-criada no Data Map instantaneamente.

Próximos passos

Após a coleta dos metadados, utilize as seguintes capacidades do Data Map:

  • Pesquise suas tabelas coletadas no Data Map e visualize seus detalhes, informações de colunas, partições e prévia dos dados. Para mais informações, consulte Visualizar detalhes da tabela.

  • Analise a linhagem upstream e downstream de uma tabela para compreender o fluxo de processamento de dados ponta a ponta. Para mais detalhes, consulte Linhagem de dados.

  • Adicione ativos a uma Coleção de Dados para organizar e gerenciar seus dados sob uma perspectiva de negócios. Consulte Criar uma Coleção de Dados para saber mais.

Perguntas frequentes

Apêndice: Escopo de coleta e tempestividade

Fonte de dados

Data Source Type

Collection Mode

Granularidade da coleta

Tempestividade de atualização de metadados

Tabela/Coluna

Partition

Linhagem

MaxCompute

Coletado automaticamente pelo sistema por padrão

Instância

Projetos regulares: Tempo real

Projetos externos: T+1

Regiões da China continental: Tempo real

Regiões internacionais: T+1

Tempo real

Data Lake Formation (DLF)

Instância

Tempo real

Importante

Para ativar a coleta em tempo real, conceda a permissão Data Reader à função vinculada ao service AliyunServiceRoleForDataworksOnEmr no console do DLF. Para mais informações, consulte a seção Crawler padrão do DLF acima.

Tempo real

Há suporte para linhagem em metadados DLF dos motores Serverless Spark, Serverless StarRocks, Serverless Flink e EMR Impala. Outros motores não são suportados.

Importante

Para clusters EMR, é necessário ativar o EMR_HOOK.

Para exibir a linhagem de tarefas EMR Impala, ative o registro de linhagem na configuração do Impala do cluster EMR. Isso é suportado apenas para clusters EMR DataLake e está atualmente em fase de lançamento gradual. Entre em contato com o suporte técnico da Alibaba Cloud para ativar esse recurso antes de usar. Para detalhes de configuração, consulte Linhagem de dados.

Hologres

Crie crawler manualmente

Banco de dados

Depende do ciclo de coleta

Não suportado

Tempo real

EMR Hive

Instância

Depende do ciclo de coleta

Depende do ciclo de coleta

Tempo real

Importante

É necessário ativar o EMR_HOOK para o cluster.

Para exibir a linhagem de tarefas EMR Impala, ative o registro de linhagem na configuração do Impala do cluster EMR. Isso é suportado apenas para clusters EMR DataLake e está atualmente em fase de lançamento gradual. Entre em contato com o suporte técnico da Alibaba Cloud para ativar esse recurso antes de usar. Para detalhes de configuração, consulte Linhagem de dados.

CDH Hive

Instância

Depende do ciclo de coleta

Tempo real

Tempo real

StarRocks

Banco de dados

  • Modo instância: Tempo real.

  • Modo string de conexão: Depende do ciclo de coleta.

Não suportado

Tempo real

Importante

Apenas o modo instância suporta coleta de linhagem. O modo string de conexão não suporta coleta de linhagem.

AnalyticDB for MySQL

Banco de dados

Depende do ciclo de coleta

Não suportado

Tempo real

Nota

É necessário enviar um ticket para ativar o recurso de linhagem de dados na instância AnalyticDB for MySQL.

AnalyticDB for Spark

Instância

Tempo real

Não suportado

Tempo real

AnalyticDB for PostgreSQL

Banco de dados

Depende do ciclo de coleta

Não suportado

Tempo real

Lindorm

Instância

Depende do ciclo de coleta

Não suportado

Tempo real

OTS

Instância

Depende do ciclo de coleta

Não suportado

Não suportado

MongoDB

Instância

Depende do ciclo de coleta

Não suportado

Não suportado

ElasticSearch

Instância

Depende do ciclo de coleta

Não suportado

Atualização T+1

Paimon Catalog

Catálogo

Depende do ciclo de coleta

Depende do ciclo de coleta

Não suportado

Outros tipos de fonte de dados (MySQL, PostgreSQL, SQL Server, Oracle, ClickHouse, SelectDB, OceanBase, etc.)

Banco de dados

Depende do ciclo de coleta

Não suportado

Não suportado

Nota
  • "Depende do ciclo de coleta" na tabela significa que os metadados são atualizados periodicamente com base no plano de coleta configurado para o crawler (como mensal, diário, semanal ou horário).

  • AnalyticDB for Spark e AnalyticDB for MySQL compartilham o mesmo ponto de entrada para coleta de metadados.

Código da tarefa

O Data Map suporta busca por código de tarefa e navegação rápida. A tabela abaixo descreve o escopo do código pesquisável.

Origem do código

Escopo da coleta

Método de acionamento da coleta

Data Studio

Data Studio - Crie um nó e edite código

Coleta automática

Legacy Data Studio

Legacy Data Studio - Crie um nó e edite código

Data Analysis

Data Analysis - Crie uma consulta SQL e edite código

Data Service

Data Service - Crie um service API Data Push

Ativos de API

O Data Map permite visualizar metadados de APIs do Data Service, conforme descrito abaixo:

API Type

Escopo da coleta

Método de acionamento da coleta

Geração de API (modo assistente)

Data Service - Crie uma API no modo assistente

Coleta automática

Geração de API (modo script)

Data Service - Crie uma API no modo script

Registrar API

Data Service - Registrar uma API

Orquestração de API

Data Service - Crie uma orquestração de API

Ativos de IA

O Data Map suporta a visualização e o gerenciamento de ativos de IA, fornecendo linhagem de ativos de IA para rastrear a origem, o uso e a evolução de dados e modelos. A tabela a seguir descreve os tipos de ativos de IA suportados.

Tipo de ativo

Escopo da coleta

Método de acionamento da coleta

Dataset

  • PAI - Crie um dataset/Registrar um dataset

  • DataWorks - Crie um dataset

Coleta automática

Modelo de IA

PAI - Tarefa de treinamento de modelo/Registrar um modelo/Implantar um service de modelo

Tarefa de algoritmo

PAI - Tarefa de treinamento/Tarefa de workflow/Tarefa de treinamento distribuído

Serviço de modelo

PAI - Implantar um service de modelo (implantação EAS)

Workspace

O Data Map permite visualizar metadados do workspace, conforme descrito abaixo:

Projeto

Collection Mode

Método de acionamento da coleta

Workspace

DataWorks - Crie um workspace

Coleta automática