Todos os produtos
Search
Central de documentação

DataWorks:Identificar dados com um modelo personalizado

Última atualização: Jun 27, 2026

O DataWorks permite treinar modelos com base nos campos de amostra fornecidos. Esse processo identifica padrões de conteúdo nos campos de destino e gera um modelo de regra para descobrir dados com padrões semelhantes em seus ativos de dados. Este tópico explica como criar um modelo personalizado de identificação de dados.

Limitações

  • O DataWorks não oferece suporte ao treinamento de modelos em campos de amostra com menos de 10 linhas de dados ou em dados com menos de 4 ou mais de 40 caracteres. O tamanho mínimo da amostra é de 10 linhas e o máximo é de 10.000 linhas. Se o número total de linhas nos campos selecionados exceder 10.000, o sistema selecionará aleatoriamente 10.000 linhas para o treinamento do modelo. Caso o total seja inferior a 10.000, todas as linhas disponíveis serão utilizadas no treinamento.

  • Atualmente, o DataWorks suporta treinamento de modelos apenas para dados que contêm números, letras do alfabeto inglês e caracteres especiais. Não há suporte para treinamento em campos de amostra que contenham caracteres chineses, incluindo pontuação chinesa.

Criar um modelo

  1. Acesse o Data Security Guard.

    1. Faça login no console do DataWorks. Na região de destino, clique em Data Governance > Security Center no painel de navegação à esquerda. Na página exibida, clique em Go to Security Center.

    2. No painel de navegação à esquerda, clique em Data Security > Sensitive Data Management e, em seguida, clique em Try Now para acessar o Data Security Guard.

      Nota
      • Se sua conta Alibaba Cloud já estiver autorizada, você será direcionado à página inicial do Data Security Guard.

      • Caso sua conta Alibaba Cloud não esteja autorizada, você será redirecionado para a página de autorização do Data Security Guard. Para usar os recursos do Data Security Guard pela primeira vez, acesse Data Security > Sensitive Data Management, selecione Data Security Guard na caixa de diálogo pop-up e conclua a autorização.

  2. No painel de navegação à esquerda, clique em Rule Setting > Sensitive Data Identification para acessar a página Sensitive data identification.

  3. Crie um modelo e inicie o treinamento.

    1. Na aba Self-generated data identification models, clique em Create Model.

    2. Na caixa de diálogo Create Model, configure o Model Name e selecione as amostras de treinamento.

      • Positive sample field: Selecione um ou mais campos de amostra de um workspace específico para o treinamento do modelo. O DataWorks utiliza esses campos para identificar padrões de conteúdo e gerar um modelo de regra correspondente. Use esse modelo para descobrir dados com padrões de conteúdo semelhantes em seus ativos de dados.

        Nota

        O DataWorks não oferece suporte ao treinamento de modelos em campos de amostra com menos de 10 linhas de dados ou em dados com menos de 4 ou mais de 40 caracteres. O tamanho mínimo da amostra é de 10 linhas e o máximo é de 10.000 linhas. Se o número total de linhas nos campos selecionados exceder 10.000, o sistema selecionará aleatoriamente 10.000 linhas para o treinamento do modelo. Caso o total seja inferior a 10.000, todas as linhas disponíveis serão utilizadas no treinamento.

        Atualmente, o DataWorks suporta treinamento de modelos apenas para dados que contêm números, letras do alfabeto inglês e caracteres especiais. Não há suporte para treinamento em campos de amostra que contenham caracteres chineses, incluindo pontuação chinesa.

      • Negative sample field: Para melhorar a precisão do modelo, selecione campos de amostra negativa. O sistema usa o conteúdo dos campos negativos selecionados como amostras negativas durante o treinamento. Se nenhum campo negativo for selecionado, o sistema gerará amostras negativas automaticamente com base nos padrões e no volume das amostras positivas para concluir o treinamento.

    3. Clique em Next Step.

    4. Selecione I accept that Data Security Guard will use samples for model training e clique em Start Training.

      O sistema extrai aleatoriamente até 100 linhas de dados de cada campo de amostra selecionado. O tempo estimado é calculado com base na quantidade de campos de amostra.

      Nota

      O treinamento do modelo pode levar bastante tempo. Feche a caixa de diálogo de treinamento e execute outras operações enquanto o processo continua em segundo plano.

  4. Visualize os resultados do treinamento do modelo.

    Na página Self-generated data identification models, verifique o status e os resultados do treinamento do modelo desejado. Essas informações ajudam a determinar se o modelo está pronto para implantação e identificação de dados.

    • Verifique o status do treinamento.

      • Remaining hh:mm:ss: O modelo está em treinamento.

      • Training Completed: O treinamento do modelo foi concluído.

      • Draft: O modelo foi criado, mas ainda não passou pelo treinamento e não pode ser usado para identificação de dados.

    • Analise os resultados do treinamento.

      Para um modelo com status Training Completed, clique no ícone 编辑模型 na coluna Actions para verificar a precisão com que os recursos extraídos pelo modelo identificam os dados de amostra. Recomendamos implantar o modelo somente quando sua precisão atingir 100%.

      Nota

      Para obter melhores resultados, adicione mais dados de amostra e retreine o modelo até que a precisão atinja 100% antes da implantação.

      A página de avaliação divide-se nas seções Positive sample e Negative sample, que mostram a taxa de acerto, total de amostras, acertos e falhas. A seção Identification details exibe os resultados de identificação (correspondência ou não) para 10 linhas de amostra aleatórias. Clique em Refresh para visualizar outras amostras aleatórias.

  5. Clique em Create para finalizar a criação do modelo de regra.

Próximas etapas

Após criar o modelo de regra, acesse a página Data identification rules para implantar o modelo e identificar dados. Para mais informações sobre como usar um modelo personalizado na página Data identification rules, consulte Configurar uma regra de identificação de dados e executar uma tarefa de identificação.