O Data Map do DataWorks oferece o recurso de Metadata Collection para consolidar e gerenciar centralmente os metadados de diversas fontes de dados do DataWorks. Visualize os metadados agregados de todas as fontes no Data Map e crie crawlers para coletar esses metadados no DataWorks.
Visão geral
A coleta de metadados é fundamental para construir um Data Map de nível empresarial e alcançar uma gestão unificada de ativos de dados. Um crawler extrai automaticamente metadados técnicos (como bancos de dados, tabelas e colunas), linhagem de dados e informações de partição de fontes de dados do DataWorks (como MaxCompute, Hologres, MySQL e CDH Hive) distribuídas em diferentes workspaces dentro da mesma região. Em seguida, consolida essas informações no Data Map do DataWorks como uma visualização unificada de dados.
A coleta de metadados permite:
Construir uma visualização unificada de dados: Elimine silos de dados gerenciando centralmente os metadados de múltiplas fontes heterogêneas.
Ative a descoberta e busca de dados: Permita que os consumidores de dados localizem rápida e precisamente as informações necessárias.
Analisar a linhagem de dados ponta a ponta: Rastreie claramente a origem e o fluxo dos dados para facilitar a análise de impacto e a solução de problemas.
Fortalecer a governança de dados: Implemente Classificação de Dados, controle de acesso, monitoramento de qualidade e gerenciamento de ciclo de vida com base em metadados abrangentes.
Faturamento
Por padrão, cada tarefa de coleta consome 0,25 CU multiplicado pelo tempo de execução da tarefa, gerando taxas de unidade de computação. Cada coleta bem-sucedida gera uma instância de agendamento, incorrendo em taxas de agendamento.
Limitações
Caso uma fonte de dados utilize lista de permissões para controle de acesso, configure-a previamente. Para mais informações, consulte Lista de permissões para coleta de metadados.
A implantação do DataWorks e a fonte de dados devem estar na mesma região. Se for necessário coletar metadados entre regiões, use um endpoint público ao criar a fonte de dados. Para mais detalhes, consulte Criar uma fonte de dados.
Não há suporte para coleta de metadados em fontes de dados AnalyticDB for MySQL com SSL ativado.
Ponto de entrada
Faça login no console do DataWorks. Na região desejada, clique em no painel de navegação à esquerda. Na página exibida, clique em Go to Data Map.
No painel de navegação à esquerda, clique em
para acessar a página de coleta de metadados.
Crawlers integrados
Os crawlers integrados são pré-configurados e executados automaticamente (quase em tempo real) pela plataforma DataWorks para coletar metadados essenciais profundamente integrados ao DataWorks. Não é necessário criá-los; basta gerenciar o escopo da coleta.
Se não encontrar a tabela desejada no Data Map, acesse e sincronize manualmente as tabelas relevantes.
Crawler padrão do MaxCompute
Este crawler coleta metadados dos projetos MaxCompute associados à sua conta. Acesse a página de detalhes, clique em Modify Data Scope para selecionar os projetos a serem coletados e clique em Permission Configurations para configurar a visibilidade dos metadados dentro do tenant.
Na seção Built-in da página de coleta de metadados, localize o cartão MaxCompute Default Crawler e clique em Details.
-
A página de detalhes do MaxCompute Default Crawler contém duas abas: Basic Information e Data Scope.
Basic Information: Exibe as propriedades básicas do crawler, como tipo e método de coleta. Essas informações são somente leitura.
Data Scope: Gerencia de quais projetos MaxCompute este crawler coleta metadados.
-
Modifique o escopo de coleta:
Mude para a aba Data Scope e clique no botão Modify Data Scope.
-
Na caixa de diálogo exibida, selecione ou desmarque os projetos MaxCompute dos quais deseja coletar metadados.
ImportantePor padrão, o escopo inclui todos os projetos MaxCompute associados a workspaces na região atual sob seu tenant. Após modificar o escopo de dados, os objetos de metadados coletados no Data Map ficarão consistentes com o escopo atual. Os metadados de projetos desmarcados não estarão visíveis.
Clique em OK para salvar as alterações.
-
Configure a visibilidade dos metadados:
Na lista Data Scope, localize o projeto desejado e clique em Permission Configurations na coluna Actions.
-
Selecione uma política de visibilidade conforme seus requisitos de governança de dados:
Public Within Tenant: Todos os membros do tenant podem pesquisar e visualizar os metadados deste projeto.
Only members in the associated workspace can search and view.: Apenas membros de workspaces específicos podem acessar os metadados deste projeto, garantindo o isolamento dos dados.
Crawler padrão do DLF
Para ativar a coleta em tempo real de metadados do DLF, conceda a permissão Data Reader à função vinculada ao service AliyunServiceRoleForDataworksOnEmr no console do DLF.
O Crawler Padrão do DLF coleta metadados do Data Lake Formation (DLF) associado à sua conta.
Na seção Built-in da página de coleta de metadados, localize o cartão DLF Default Crawler e clique em Details para visualizar as informações básicas.
-
Mude para a aba Data Scope para ver a lista de Catálogos DLF incluídos no escopo de coleta e a quantidade de tabelas que contêm.
Por padrão, todos os catálogos acessíveis (incluindo DLF e DLF-Legacy) são coletados.
Crawlers personalizados
Os crawlers personalizados permitem gerenciar centralmente os metadados em diferentes ambientes e motores.
-
Para fontes de dados comuns
Crie crawlers personalizados para fontes de dados estruturadas ou semiestruturadas, como Hologres, StarRocks, MySQL, Oracle e CDH Hive. O sistema analisa as estruturas físicas de banco de dados e tabelas na origem para extrair e sincronizar automaticamente os metadados, incluindo atributos de colunas, índices e partições.
-
Para fontes de dados do tipo metadado (catálogo)
Para metadados nativos em formato de lake autodeclarados e não gerenciados pelo DLF, como Paimon Catalog e outras fontes de dados do tipo metadado, também é possível criar crawlers para coleta direta.
Create Custom Crawler
Na seção de lista de crawlers personalizados na página de coleta de metadados, clique em Create Metadata Crawler.
Selecione um tipo de coleta: Na página de seleção de tipo, escolha o tipo de fonte de dados alvo para coleta, como Hologres ou StarRocks.
-
Configure as definições básicas e o grupo de recursos:
-
Basic Configurations:
Selecione um workspace: Escolha o workspace que contém a fonte de dados.
Select Data Source: Selecione uma fonte de dados alvo criada anteriormente na lista suspensa. Após a seleção, o sistema exibe automaticamente os detalhes da fonte de dados.
Name: Nomeie o crawler para facilitar a identificação posterior. Por padrão, o nome é igual ao nome da fonte de dados.
-
Resource Group Configuration:
Resource Group: Selecione um grupo de recursos para executar a tarefa de coleta.
-
Test Network Connectivity: Esta etapa é crítica. Clique em Test Network Connectivity para garantir que o grupo de recursos possa acessar a fonte de dados.
ImportanteVerifique se a fonte de dados possui restrições de lista de permissões ativadas. Caso precise coletar metadados de uma fonte com controle de acesso baseado em lista de permissões, consulte Adicionar endereços IP do grupo de recursos à lista de permissões e Configurar lista de permissões para uma fonte de dados para definir as permissões adequadas.
Se a fonte de dados não tiver restrições de lista de permissões ativadas, consulte Configurar conectividade de rede para uma fonte de dados para estabelecer a conectividade de rede.
Caso o teste de conectividade retorne o erro
Backend service call failed: test connectivity failed.not support data type, entre em contato com o suporte técnico para atualizar o grupo de recursos.
-
-
Configure a coleta de metadados:
-
Collection Scope: Defina os bancos de dados (database/schema) a serem coletados. Se a fonte de dados estiver na granularidade de banco de dados, o banco correspondente será selecionado por padrão. É possível selecionar bancos adicionais além da fonte de dados.
ImportanteCada banco de dados pode ser configurado em apenas um crawler. Se um banco aparecer esmaecido, ele já está sendo coletado por outro crawler.
Ao reduzir o escopo de coleta, os metadados fora desse escopo deixarão de ser pesquisáveis no Data Map.
-
-
Configure o aprimoramento inteligente e o plano de coleta:
-
Aprimoramento inteligente (Beta):
Descrições geradas por IA: Quando ativado, o sistema utiliza um modelo de linguagem grande para gerar automaticamente descrições de negócios para tabelas e colunas após a coleta de metadados. Visualize as descrições geradas por IA na página de detalhes de um objeto de tabela no Data Map.
-
Collection Plan:
-
Trigger Mode: Selecione manual ou periódico.
Manual: O crawler executa apenas quando acionado manualmente. Ideal para coletas únicas ou sob demanda.
-
Periódico: Configure uma tarefa agendada (mensal, diária, semanal ou horária) para que o sistema atualize os metadados automaticamente de forma periódica.
Para configurar uma tarefa agendada com granularidade de minuto, selecione o ciclo de coleta horária e marque todas as granularidades de minuto para implementar uma execução a cada 5 minutos.
ImportanteApenas fontes de dados no ambiente de produção suportam coleta periódica.
-
-
Salve a configuração: Clique em Save ou Save and Run para concluir a criação do crawler.
Gerencie crawlers personalizados
Após a criação, o crawler aparece na lista de crawlers personalizados. Realize as seguintes operações:
-
Operações na lista: Diretamente na lista, é possível Run, Stop ou Delete um crawler. Utilize os recursos de Filter e Search no topo para localizar rapidamente o crawler desejado.
ImportanteAo excluir um crawler de metadados, os objetos coletados por ele no Data Map tornam-se inválidos. Não será mais possível pesquisar ou visualizar esses objetos e seus detalhes. Proceda com cautela.
Operações em lote: Selecione vários crawlers na lista e utilize Batch Run ou Batch Stop na parte inferior da lista para acionar ou encerrar múltiplas tarefas de coleta simultaneamente, aumentando a eficiência da gestão.
-
Status do crawler: A lista exibe o status atual de cada crawler. Os status comuns incluem Not Run, Waiting, Running, Successful, Failed e Manually Terminated.
NotaSe a fonte de dados associada a um crawler for desassociada ou tornar-se inválida, o crawler entrará no estado congelado. Um crawler congelado não pode ser executado, apenas excluído.
-
Visualize detalhes e logs: Clique no nome do crawler alvo para acessar sua página de detalhes.
Basic Information: Visualize todos os itens de configuração do crawler.
-
Data Scope: Visualize ou Modify Data Scope.
Se nenhuma coleta tiver sido realizada, a contagem de tabelas e a hora da última atualização estarão vazias.
As seguintes fontes de dados não suportam modificação de escopo: EMR Hive, CDH Hive, Lindorm, ElasticSearch, OTS, MongoDB e AnalyticDB for Spark no AnalyticDB MySQL.
Run Logs: Acompanhe o histórico de execução de cada tarefa de coleta. É possível visualizar o horário de início, duração, status e volume de dados coletados em cada tarefa. Quando uma tarefa falhar, clicar em View Logs é o ponto de entrada principal para identificar e resolver problemas.
Acionar coleta manualmente: No canto superior direito da página de detalhes, clique no botão Collect Metadata para iniciar imediatamente uma tarefa de coleta. Isso é útil quando você deseja visualizar uma tabela recém-criada no Data Map instantaneamente.
Próximos passos
Após a coleta dos metadados, utilize as seguintes capacidades do Data Map:
Pesquise suas tabelas coletadas no Data Map e visualize seus detalhes, informações de colunas, partições e prévia dos dados. Para mais informações, consulte Visualizar detalhes da tabela.
Analise a linhagem upstream e downstream de uma tabela para compreender o fluxo de processamento de dados ponta a ponta. Para mais detalhes, consulte Linhagem de dados.
Adicione ativos a uma Coleção de Dados para organizar e gerenciar seus dados sob uma perspectiva de negócios. Consulte Criar uma Coleção de Dados para saber mais.
Perguntas frequentes
-
P: A coleta de MySQL ou outras fontes do tipo banco de dados expira ou falha?
R: Verifique se você adicionou o bloco CIDR do vSwitch do grupo de recursos à lista de permissões. Confirme o vSwitch CIDR Block do grupo de recursos.
Apêndice: Escopo de coleta e tempestividade
Fonte de dados
|
Data Source Type |
Collection Mode |
Granularidade da coleta |
Tempestividade de atualização de metadados |
||
|
Tabela/Coluna |
Partition |
Linhagem |
|||
|
MaxCompute |
Coletado automaticamente pelo sistema por padrão |
Instância |
Projetos regulares: Tempo real Projetos externos: T+1 |
Regiões da China continental: Tempo real Regiões internacionais: T+1 |
Tempo real |
|
Data Lake Formation (DLF) |
Instância |
Tempo real Importante
Para ativar a coleta em tempo real, conceda a permissão Data Reader à função vinculada ao service |
Tempo real |
Há suporte para linhagem em metadados DLF dos motores Serverless Spark, Serverless StarRocks, Serverless Flink e EMR Impala. Outros motores não são suportados. Importante
Para clusters EMR, é necessário ativar o EMR_HOOK. Para exibir a linhagem de tarefas EMR Impala, ative o registro de linhagem na configuração do Impala do cluster EMR. Isso é suportado apenas para clusters EMR DataLake e está atualmente em fase de lançamento gradual. Entre em contato com o suporte técnico da Alibaba Cloud para ativar esse recurso antes de usar. Para detalhes de configuração, consulte Linhagem de dados. |
|
|
Hologres |
Crie crawler manualmente |
Banco de dados |
Depende do ciclo de coleta |
|
Tempo real |
|
EMR Hive |
Instância |
Depende do ciclo de coleta |
Depende do ciclo de coleta |
Tempo real Importante
É necessário ativar o EMR_HOOK para o cluster. Para exibir a linhagem de tarefas EMR Impala, ative o registro de linhagem na configuração do Impala do cluster EMR. Isso é suportado apenas para clusters EMR DataLake e está atualmente em fase de lançamento gradual. Entre em contato com o suporte técnico da Alibaba Cloud para ativar esse recurso antes de usar. Para detalhes de configuração, consulte Linhagem de dados. |
|
|
CDH Hive |
Instância |
Depende do ciclo de coleta |
Tempo real |
Tempo real |
|
|
StarRocks |
Banco de dados |
|
|
Tempo real Importante
Apenas o modo instância suporta coleta de linhagem. O modo string de conexão não suporta coleta de linhagem. |
|
|
AnalyticDB for MySQL |
Banco de dados |
Depende do ciclo de coleta |
|
Tempo real Nota
É necessário enviar um ticket para ativar o recurso de linhagem de dados na instância AnalyticDB for MySQL. |
|
|
AnalyticDB for Spark |
Instância |
Tempo real |
|
Tempo real |
|
|
AnalyticDB for PostgreSQL |
Banco de dados |
Depende do ciclo de coleta |
|
Tempo real |
|
|
Lindorm |
Instância |
Depende do ciclo de coleta |
|
Tempo real |
|
|
OTS |
Instância |
Depende do ciclo de coleta |
|
|
|
|
MongoDB |
Instância |
Depende do ciclo de coleta |
|
|
|
|
ElasticSearch |
Instância |
Depende do ciclo de coleta |
|
Atualização T+1 |
|
|
Paimon Catalog |
Catálogo |
Depende do ciclo de coleta |
Depende do ciclo de coleta |
|
|
|
Outros tipos de fonte de dados (MySQL, PostgreSQL, SQL Server, Oracle, ClickHouse, SelectDB, OceanBase, etc.) |
Banco de dados |
Depende do ciclo de coleta |
|
|
|
"Depende do ciclo de coleta" na tabela significa que os metadados são atualizados periodicamente com base no plano de coleta configurado para o crawler (como mensal, diário, semanal ou horário).
AnalyticDB for Spark e AnalyticDB for MySQL compartilham o mesmo ponto de entrada para coleta de metadados.
Código da tarefa
O Data Map suporta busca por código de tarefa e navegação rápida. A tabela abaixo descreve o escopo do código pesquisável.
|
Origem do código |
Escopo da coleta |
Método de acionamento da coleta |
|
Data Studio |
Data Studio - Crie um nó e edite código |
Coleta automática |
|
Legacy Data Studio |
Legacy Data Studio - Crie um nó e edite código |
|
|
Data Analysis |
Data Analysis - Crie uma consulta SQL e edite código |
|
|
Data Service |
Data Service - Crie um service API Data Push |
Ativos de API
O Data Map permite visualizar metadados de APIs do Data Service, conforme descrito abaixo:
|
API Type |
Escopo da coleta |
Método de acionamento da coleta |
|
Geração de API (modo assistente) |
Data Service - Crie uma API no modo assistente |
Coleta automática |
|
Geração de API (modo script) |
Data Service - Crie uma API no modo script |
|
|
Registrar API |
Data Service - Registrar uma API |
|
|
Orquestração de API |
Data Service - Crie uma orquestração de API |
Ativos de IA
O Data Map suporta a visualização e o gerenciamento de ativos de IA, fornecendo linhagem de ativos de IA para rastrear a origem, o uso e a evolução de dados e modelos. A tabela a seguir descreve os tipos de ativos de IA suportados.
|
Tipo de ativo |
Escopo da coleta |
Método de acionamento da coleta |
|
Dataset |
|
Coleta automática |
|
Modelo de IA |
PAI - Tarefa de treinamento de modelo/Registrar um modelo/Implantar um service de modelo |
|
|
Tarefa de algoritmo |
PAI - Tarefa de treinamento/Tarefa de workflow/Tarefa de treinamento distribuído |
|
|
Serviço de modelo |
PAI - Implantar um service de modelo (implantação EAS) |
Workspace
O Data Map permite visualizar metadados do workspace, conforme descrito abaixo:
|
Projeto |
Collection Mode |
Método de acionamento da coleta |
|
Workspace |
DataWorks - Crie um workspace |
Coleta automática |