O service de linhagem de ativos de IA é essencial para otimizar a gestão de ativos de IA corporativos. Ele rastreia e compreende de forma abrangente a origem e a evolução de dados e modelos, o que melhora significativamente a transparência e a eficiência da gestão. Além disso, oferece suporte robusto e vantagens competitivas para empresas do setor de IA.
Introdução
O service de linhagem de ativos de IA ajuda as empresas a gerenciar e otimizar seus ativos de IA com eficiência. Esse service permite que as organizações acompanhem e entendam a origem, o uso e a evolução dos dados e modelos de maneira ágil. A solução abrange diversos tipos de ativos de IA, incluindo datasets (versões), pipelines de processamento de dados, jobs de treinamento, modelos (versões), serviços de modelo e outros metadados. A página de detalhes de cada ativo oferece um ponto de entrada para visualizar as informações de linhagem, facilitando o acesso e a análise.

O service de linhagem de ativos de IA é adequado para os seguintes cenários:
Gestão de ativos de IA: O service fornece informações detalhadas sobre a linhagem dos ativos, permitindo que as empresas obtenham insights sobre a origem e o uso de seus recursos de IA. Isso melhora a qualidade dos dados e modelos, garante a conformidade das práticas de IA da empresa com padrões regulatórios e apoia uma gestão de dados e tomada de decisão precisas.
Rastreabilidade de modelos: No contexto de Responsible AI practices, manter a transparência dos modelos de IA é fundamental. O service permite rastrear datasets, métodos de engenharia de features e ajustes de parâmetros usados no treinamento de modelos para atender à conformidade regulatória, verificar resultados de experimentos e realizar auditorias de modelos.
Solução de problemas e otimização: As informações de linhagem de ativos ajudam a localizar rapidamente a causa raiz de problemas de desempenho em serviços de IA. Por exemplo, é possível rastrear uma queda repentina na precisão da previsão do modelo até alterações no processamento de dados upstream. Um gráfico de linhagem auxilia as empresas a identificar e resolver o problema com agilidade.
Melhoria no uso de recursos: Compreender as dependências entre tarefas permite alocar recursos de computação adequadamente, evitando cálculos redundantes e reduzindo custos. As informações de linhagem também ajudam a identificar dependências entre tarefas e dados, determinando quais tarefas podem ser executadas em paralelo em experimentos de grande escala. Consequentemente, há uma melhoria no uso e no processamento de recursos.
Aumento da eficiência na colaboração: Em grandes organizações, várias equipes podem compartilhar a mesma infraestrutura de pesquisa. Informações claras de linhagem facilitam a comunicação entre equipes e o compartilhamento de conhecimento, acelerando o processo de inovação.
Pré-requisitos
Para usar o service de linhagem de ativos de IA, ative o DataWorks no console do DataWorks.
DataWorks Standard Edition: Se você precisa do service de linhagem de ativos de IA comum, ative o DataWorks Standard Edition.
DataWorks Professional Edition: Caso necessite dos recursos de relatórios de linhagem para treinamento e pipeline jobs do Deep Learning Containers (DLC), ative o DataWorks Professional Edition.
Para obter mais informações sobre as edições do DataWorks, consulte DataWorks: Features by edition.
Método de relatório de linhagem e ponto de entrada
O relatório de linhagem refere-se ao registro e à geração automáticos ou manuais de vários metadados relacionados a modelos de IA e às relações entre metadados e modelos durante o desenvolvimento, treinamento, implantação e manutenção no Platform for AI (PAI). O relatório de linhagem envolve as seguintes operações.
Criar um dataset
Os datasets suportam gestão de versões. Cada versão é um ativo de linhagem independente. É possível visualizar as informações de linhagem sobre uma versão específica do dataset e as relações upstream e downstream dessa versão.
-
Estrutura das informações de linhagem
-
Ponto de entrada: Create and manage datasets
Ponto de entrada para visualizar as informações de linhagem: Na lista de datasets, localize o dataset desejado e clique no nome dele. Na seção Version Details da página de detalhes do dataset, clique em View Lineage para visualizar as informações de linhagem.
Pré-processar dados
Ponto de entrada: Se você executar uma tarefa de data analysis em um ambiente de produção baseado no mecanismo MaxCompute no DataWorks e a entrada e saída forem uma tabela do MaxCompute ou um caminho do OSS, também será possível visualizar e analisar as informações de linhagem. Por exemplo, ao obter uma tabela do MaxCompute após executar várias tarefas SQL e registrar essa tabela como um dataset do PAI, você pode rastrear as tarefas que geraram a tabela com base nas informações de linhagem.
Ponto de entrada para visualizar as informações de linhagem: Na lista de datasets, localize o dataset desejado e clique no nome dele. Na seção Version Details da página de detalhes do dataset, clique em View Lineage para visualizar as informações de linhagem.
Criar um job de rotulagem
Ao criar um job de rotulagem de dados no iTAG, especifique um dataset de entrada. Após a criação do job de rotulagem, o sistema exibe automaticamente as informações de linhagem na seguinte estrutura.
-
Estrutura das informações de linhagem
-
Ponto de entrada
-
Criar um job de rotulagem
No painel de navegação à esquerda do PAI console, clique em Data Preparation > Intelligent Labeling (iTAG) para acessar a página de rotulagem inteligente. Na área Quick Start, clique no cartão Create Task para criar uma tarefa de rotulagem.
-
Exportar dados de resultado da rotulagem
Na página de rotulagem inteligente iTAG, clique em Go to Management Page no canto superior direito.
Na lista de tarefas, clique em Get Labeling Results na coluna Actions. Na caixa de diálogo, configure as seguintes opções:
Data Format: Selecione
csvExport to Dataset: Selecione Yes
OSS Output Path: Especifique o caminho de saída
Clique em OK.
-
Ponto de entrada para visualizar as informações de linhagem: Na lista de datasets rotulados, localize o dataset rotulado desejado e clique no nome do dataset de source. Na seção Version Details da página de detalhes do dataset, clique em View Lineage para visualizar as informações de linhagem.
-
Estrutura das informações de linhagem
-
Ponto de entrada: Create a pipeline
Na página de detalhes do pipeline, adicione os componentes relacionados conforme suas necessidades de negócio. Neste exemplo, os componentes Read File Data e Dataset Register foram adicionados.
-
Ponto de entrada para visualizar as informações de linhagem: Na lista de pipeline jobs, localize o pipeline job desejado e clique no nome dele. Na seção Basic Information da página de detalhes do pipeline, clique em View Lineage para visualizar as informações de linhagem.
A página de análise de linhagem exibe um diagrama de fluxo de dados: da esquerda para a direita, um nó de arquivo do OSS
dataset_input/, um nó do PAI Flow e um nó de datasetd_prod_20241119l424/v2, indicando que os dados fluem do OSS através do PAI Flow para um dataset do PAI. O cabeçalho da página oferece três opções de alternância: Hide Sibling Nodes on Expand, Enable Thumbnail e Enable Cycle Detection. -
Estrutura das informações de linhagem
-
Ponto de entrada: Train a model
No painel de navegação à esquerda, escolha Quick Start > Model Gallery. Localize um modelo que suporte treinamento e clique no botão Train no cartão do modelo.
Ponto de entrada para visualizar as informações de linhagem: Na lista de modelos, localize o modelo desejado e clique no nome dele. Na lista de versões de modelo da página de detalhes do modelo, selecione a versão desejada e clique no número da versão. No painel Model Version, clique em View Lineage para visualizar as informações de linhagem.
-
Estrutura das informações de linhagem
-
Ponto de entrada: Register a model
No painel de navegação à esquerda do PAI console, escolha AI Asset Management > Models para acessar a página de gestão de modelos e clique em Register New Model.
NotaÉ possível registrar um modelo manualmente. Após a execução de um job de treinamento enviado no Model Gallery, o modelo gerado também será registrado automaticamente como um modelo no workspace atual. Para obter mais informações, consulte Model Gallery.
Ponto de entrada para visualizar as informações de linhagem: Na lista de modelos, localize o modelo desejado e clique no nome dele. Na lista de versões de modelo da página de detalhes do modelo, selecione a versão desejada e clique no número da versão. No painel Model Version, clique em View Lineage para visualizar as informações de linhagem.
-
Estrutura das informações de linhagem
-
Ponto de entrada: Register a model
Escolha AI Asset Management > Models. Na página Model, localize o modelo desejado e clique em Deploy in EAS na coluna Actions.
-
Na aba Events da página Workspace Details, clique em Create Event Rule. No painel Create Event Rule, defina o parâmetro Event Type como Models e selecione Version Approved na lista suspensa.
Clique em Create Event Rule. No painel à direita, defina Event Type como Model e selecione o evento Model Version Approved. Configure Rule Name, Rule Description, Event Scope e Event Target (como ativar DingTalk Notification e inserir a URL do Webhook) conforme necessário.
Quando o valor do parâmetro Version Approval Status para uma versão específica do modelo mudar de Pending para Approved, o service de modelo será atualizado automaticamente.
No painel de navegação à esquerda, escolha AI Asset Management > Models. Abra a lista de versões do modelo para visualizar o status de aprovação de cada versão (por exemplo, a versão 0.6.0 mostra Approved).
-
Ponto de entrada para visualizar as informações de linhagem: Na lista de serviços de modelo, localize o service de modelo desejado e clique no nome dele. Na aba Overview da página de detalhes do service de modelo, clique em View Lineage na seção Basic Information para visualizar as informações de linhagem.
NotaSe um service no Elastic Algorithm Service (EAS) tiver várias versões, o service corresponderá à mesma instância do EAS nas informações de linhagem. Para analisar uma versão específica do service, atualize o valor VersionId do service para localizar a versão.
Criar um pipeline job
Um pipeline job pode ser considerado um ativo independente. Durante o envio de um pipeline job no Machine Learning Designer, se o pipeline contiver o componente Read Table, Read File Data, Model Register ou Dataset Register, o sistema relatará automaticamente as informações de linhagem na seguinte estrutura após a execução do pipeline job.
Criar um job de treinamento de modelo
Model Gallery
Após a execução do job de treinamento de modelo enviado no Model Gallery, o sistema exibe automaticamente as informações de linhagem na seguinte estrutura.
DLC
Durante o envio de um job de treinamento de modelo, você pode relatar manualmente as informações de linhagem e configurar entradas e saídas conforme suas necessidades de negócio. Esta solução é adequada para usuários com habilidades técnicas avançadas e negócios bem estabelecidos. Caso contrário, a precisão das informações de linhagem pode ser afetada. Se tiver dúvidas, entre em contato com seu gerente de contas para ser adicionado à lista de permissões de acesso ao recurso.
Registrar um modelo
Os modelos suportam gestão de versões. Cada versão serve como um ativo de linhagem independente. É possível visualizar as informações de linhagem sobre uma versão específica do modelo e as relações upstream e downstream do modelo.
Implantar um serviço de modelo
Os modelos suportam gestão de versões. Cada versão serve como um ativo de linhagem independente. É possível visualizar as informações de linhagem sobre uma versão específica do modelo e as relações upstream e downstream do modelo.