O Data Map do DataWorks fornece informações detalhadas de linhagem para tabelas e APIs do DataService Studio nas respectivas páginas de detalhes. Isso facilita o rastreamento da origem dos dados e o gerenciamento de dependências. O console categoriza recursos de computação e metadados por tipo, como EMR Hive, Data Lake Formation (DLF) e Data Lake Formation (DLF-Legacy). Este tópico explica como visualizar a linhagem para cada tipo.
Table Lineage
Ponto de entrada para visualização
No Data Map, localize uma tabela e acesse a página de detalhes. Clique em Lineage Information para visualizar os detalhes de linhagem no nível da tabela e no nível do campo. Você também pode executar uma análise de impacto para obter uma lista de tabelas downstream, baixe essa lista como arquivo local ou envie notificações de alteração por e-mail.
O Data Map exibe a linhagem extraída de jobs de agendamento e informações de encaminhamento de dados. A linhagem proveniente de operações manuais, como consultas temporárias, não está incluída. A linhagem de dados offline é atualizada com base T+1.
Para visualizar linhagens complexas e multiníveis em uma área maior, clique em Open in New Page (ícone de tela cheia) na barra de ferramentas superior direita do gráfico de linhagem. Essa ação abre a linhagem em uma página separada. O botão está disponível nas abas de linhagem para tabelas, conjuntos de dados, APIs do DataService Studio e ativos de IA.
Se o recurso de linhagem de dados não estiver ativado para seu workspace ou tenant, uma página de assinatura aparecerá ao acessar a aba de linhagem. Siga as instruções na tela para adquirir ou ative o recurso.
Limites para cada source de dados
EMR Hive, DLF e DLF-Legacy
EMR Hive: Para gerencie metadados de um cluster EMR no DataWorks, configure primeiro o EMR-HOOK no cluster. Sem a configuração do EMR-HOOK, o DataWorks não exibe a linhagem. Para mais informações, consulte Configurar EMR-HOOK para Hive.
-
DLF e DLF-Legacy: Para tabelas no Data Lake Formation (DLF) e Data Lake Formation (DLF-Legacy), o Data Map exibe a linhagem após a coleta de metadados. Há suporte quando jobs de computação utilizam metadados do DLF com o engine Serverless Spark, Serverless StarRocks ou Serverless Flink. Para outros engines ou cenários, a exibição da linhagem depende das capacidades de aquisição e análise de metadados. Para mais informações, consulte Aquisição de metadados.
ImportanteOs engines Serverless Spark, Serverless StarRocks e Serverless Flink devem estar associados a um workspace do DataWorks. Caso contrário, a linhagem correspondente será considerada irrelevante para o DataWorks e ignorada.
Para clusters de computação EMR Hive: Não há suporte para visualização de linhagem em clusters EMR on ACK Spark, mas há suporte para clusters EMR Serverless Spark.
Para clusters de computação EMR Hive: A linhagem não está disponível para tarefas executadas em nós EMR Presto.
-
Engine EMR Impala: A aquisição de linhagem para jobs do EMR Impala depende dos logs de linhagem do próprio Impala. No console do cluster EMR, acesse Cluster Services > Impala > Configuration. Defina o parâmetro
lineage_event_log_dircomo/mnt/disk1/log/impala/lineage_loge reinicie o service Impala. Após essas etapas, o Data Map do DataWorks poderá exibir a linhagem nos níveis de tabela e de campo para jobs do EMR Impala.NotaHá suporte apenas para jobs do Impala em clusters EMR DataLake. Tanto os metadados HMS (correspondentes ao tipo de source de dados EMR Hive) quanto DLF (correspondentes ao tipo de source de dados DLF) são compatíveis.
Não existem requisitos quanto à versão do cluster EMR ou à versão do Impala. Basta que o Impala esteja implantado no cluster.
Este recurso está atualmente em liberação gradual (gray release). Antes de utilizá-lo, abra um ticket ou entre em contato com o suporte técnico da Alibaba Cloud para ativá-lo.
AnalyticDB for MySQL
Execute a instrução SQL
set adb_config RC_LINEAGE_INFO_LOG_ENABLE=trueno engine correspondente para ative o recurso de linhagem de dados na instância do AnalyticDB for MySQL.Quando a source de metadados for do tipo AnalyticDB for Spark, a coleta automática terá suporte.
Quando a source de metadados for do tipo AnalyticDB for Spark, ative a linhagem em tempo real configurando o parâmetro do Spark
spark.sql.queryExecutionListeners = com.aliyun.dataworks.meta.lineage.LineageListener.
Para tabelas do tipo AnalyticDB for MySQL, alguns comandos de processamento SQL não suportam a geração de informações de linhagem no Data Map. Aplicam-se os seguintes limites.
-
Comandos SQL sem suporte para exibição de linhagem:
SQL sem suporte
Exemplo
join,unionou o uso de palavras-chave como*não têm suporte.Por exemplo, o SQL abaixo usa
*, então o Data Map não consegue exibir a linhagem.INSERT INTO test SELECT * FROM test1, test2 WHERE test1.id = test2.idSubconsultas não têm suporte.
Por exemplo, o SQL abaixo contém uma subconsulta, então o Data Map não consegue exibir a linhagem.
SELECT column1, column2 FROM table1 WHERE column3 IN (SELECT column4 FROM table2 WHERE column5 = 'value') -
Exemplos de comandos SQL com suporte para exibição de linhagem:
-
Exemplo 1: Crie uma tabela chamada A (sem especificar colunas) e selecione colunas específicas (excluindo *) da tabela B como conteúdo da tabela A. Por exemplo:
CREATE TABLE test AS SELECT id,name FROM test1; -
Exemplo 2: Insira colunas específicas (excluindo *) da tabela A que atendam à condição column1 = value1 na tabela B (sem especificar colunas). Por exemplo:
INSERT INTO test SELECT id,name FROM test1 WHERE name='test'; -
Exemplo 3: Sobrescreva colunas específicas (excluindo *) da tabela A na tabela B em um banco de dados. Por exemplo:
INSERT OVERWRITE INTO db_name.test SELECT id,name FROM test1;
-
CDH
Para exibir a linhagem de tabelas no processamento de dados de nós CDH Spark SQL e CDH Spark no Data Map, configure os parâmetros do Spark para cada módulo de processamento de dados em .
-
Faça login no console do DataWorks. Na região de destino, clique em no painel de navegação à esquerda. Selecione um workspace na lista suspensa e clique em Go to Management Center.
No painel de navegação à esquerda, clique em Cluster Management e localize o cluster CDH de destino criado.
-
Clique em Edit Spark Parameters.

-
Adicione parâmetros do Spark com base no módulo específico de processamento de dados.
Por exemplo, para exibir a linhagem de tabelas no processamento de dados por nós CDH Spark SQL e CDH Spark no módulo Operation Center - Scheduled Instances do Data Map, adicione os seguintes parâmetros no módulo correspondente:
Spark Property Name:
spark.sql.queryExecutionListeners.Spark Property Value:
com.aliyun.dataworks.meta.lineage.LineageListener.
Clique em Confirm para concluir a edição.
Lindorm
A coleta de informações de linhagem tem suporte apenas no modo de instância. O modo de string de conexão não oferece suporte à coleta de informações de linhagem.
Para exibir a linhagem de tabelas no processamento de dados de nós Lindorm Spark e Lindorm Spark SQL no Data Map, configure os parâmetros do Spark para cada módulo de processamento de dados em .
-
Faça login no console do DataWorks. Na região de destino, clique em no painel de navegação à esquerda. Selecione um workspace na lista suspensa e clique em Go to Management Center.
No painel de navegação à esquerda, clique em Computing Resources e localize o recurso de computação Lindorm criado.
Clique em Edit Spark Parameters.
-
Adicione parâmetros do Spark com base no módulo específico de processamento de dados.
Por exemplo, para exibir a linhagem de tabelas no processamento de dados por nós Lindorm Spark e Lindorm Spark SQL no módulo Operation Center - Scheduled Instances do Data Map, adicione os seguintes parâmetros no módulo correspondente:
Spark Property Name:
spark.sql.queryExecutionListeners.Spark Property Value:
com.aliyun.dataworks.meta.lineage.LineageListener.
Clique em Confirm para concluir a configuração dos parâmetros do Spark.
Suporte de linhagem para cada source de dados
A categoria original E-MapReduce no Data Map foi dividida em EMR Hive, DLF e DLF-Legacy com base nas sources de metadados. A tabela a seguir lista o suporte de linhagem por categoria de source de dados conforme exibido no console atual.
Fonte de dados | Data Integration | Data Studio | ||
Linhagem no nível da tabela | Linhagem no nível da coluna | Linhagem no nível da tabela | Linhagem no nível da coluna | |
AnalyticDB MySQL
|
|
|
|
|
AnalyticDB PostgreSQL
|
|
|
|
|
ClickHouse
|
|
|
|
|
CDH/CDP
|
|
| Hive, Impala, Spark, Spark SQL
| Hive, Impala, Spark, Spark SQL
|
EMR Hive
|
(OSS, Hive)
|
(OSS, Hive)
| Engines compatíveis: E-MapReduce, Serverless Spark, Serverless StarRocks, Serverless Flink e EMR Impala (apenas clusters EMR DataLake; atualmente em liberação gradual; entre em contato com o suporte técnico da Alibaba Cloud para ative antes do uso).
| Engines compatíveis: E-MapReduce, Serverless Spark, Serverless StarRocks, Serverless Flink e EMR Impala (apenas clusters EMR DataLake; atualmente em liberação gradual; entre em contato com o suporte técnico da Alibaba Cloud para ative antes do uso).
|
DLF-Legacy
|
(OSS, Hive)
|
(OSS, Hive)
| Engines compatíveis: E-MapReduce, Serverless Spark, Serverless StarRocks, Serverless Flink e EMR Impala (apenas clusters EMR DataLake; atualmente em liberação gradual; entre em contato com o suporte técnico da Alibaba Cloud para ative antes do uso).
| Engines compatíveis: E-MapReduce, Serverless Spark, Serverless StarRocks, Serverless Flink e EMR Impala (apenas clusters EMR DataLake; atualmente em liberação gradual; entre em contato com o suporte técnico da Alibaba Cloud para ative antes do uso).
|
DLF
|
(OSS, Hive)
|
(OSS, Hive)
| Engines compatíveis: Serverless Spark, Serverless StarRocks, Serverless Flink e EMR Impala (apenas clusters EMR DataLake; atualmente em liberação gradual; entre em contato com o suporte técnico da Alibaba Cloud para ative antes do uso).
| Engines compatíveis: Serverless Spark, Serverless StarRocks, Serverless Flink e EMR Impala (apenas clusters EMR DataLake; atualmente em liberação gradual; entre em contato com o suporte técnico da Alibaba Cloud para ative antes do uso).
|
Hologres
|
|
|
|
|
Kafka
|
(Kafka sincronizado para MaxCompute/Hologres) |
|
|
|
Lindorm
|
|
|
|
|
MaxCompute
|
|
|
|
|
MySQL
|
(MySQL sincronizado para MaxCompute/Hologres) |
|
|
|
Oracle
|
|
|
|
|
OceanBase
|
|
|
|
|
OSS
|
|
|
|
|
PolarDB MySQL
|
|
|
|
|
PolarDB PostgreSQL
|
|
|
|
|
PostgreSQL
|
|
|
|
|
StarRocks
|
|
|
|
|
SelectDB
|
|
|
|
|
SQL Server
|
|
|
|
|
Tablestore (OTS)
|
|
|
|
|
Linhagem de API do DataService Studio
Localize uma API do DataService Studio no Data Map e acesse a página de detalhes. Clique em Lineage Information para visualizar os detalhes da linhagem da API.
Linhagem de ativos de IA
A linhagem de ativos de IA rastreia conjuntos de dados de entrada, conjuntos de resultados de saída e relacionamentos entre modelos usados no treinamento. Para mais informações, consulte Linhagem de ativos de IA.
Página de detalhes
Sincronização em tempo real