O Data Security Guard permite configurar regras de detecção com base em tipos de campos sensíveis para identificar dados sensíveis no seu tenant. O DataWorks oferece diversos tipos de campos sensíveis e regras de detecção integrados. Se as regras integradas não atenderem às suas necessidades de negócios, crie tipos de campos sensíveis e regras de detecção personalizados. Este tópico descreve como criar um novo tipo de campo sensível e configurar uma regra de detecção de dados.
Contexto
O DataWorks permite definir regras de detecção de dados com base em níveis de sensibilidade e categorias para identificar dados sensíveis na sua organização. Se os resultados da detecção forem imprecisos, visualize e corrija-os manualmente. O módulo Visão Geral de Dados Sensíveis exibe a distribuição de todos os campos sensíveis identificados recentemente pelas regras de detecção, divididos por projeto. A figura a seguir ilustra o fluxo de trabalho das regras de detecção de dados.

Acessar as regras de detecção de dados
Faça login no console do DataWorks. Na região de destino, clique em no painel de navegação à esquerda. Na página exibida, clique em Go to Security Center.
-
No painel de navegação à esquerda, clique em e, em seguida, clique em Try Now para acessar o Data Security Guard.
NotaSe a sua conta Alibaba Cloud já estiver autorizada, você será direcionado para a página inicial do Data Security Guard.
Caso sua conta Alibaba Cloud não esteja autorizada, você será redirecionado para a página de autorização do Data Security Guard. Para usar os recursos do Data Security Guard pela primeira vez, acesse , selecione Data Security Guard na caixa de diálogo pop-up e conclua a autorização.
No painel de navegação à esquerda, escolha Rule Setting > Sensitive Data Detection para ir à página de regras de detecção de dados.
Etapa 1: Configurar classificação e graduação de dados
Um tipo de campo sensível deve pertencer a uma categoria de dados e ter um nível de sensibilidade definido. Portanto, antes de criar um novo tipo de campo sensível e configurar sua regra de detecção, configure primeiro a classificação e a graduação de dados.
O Data Security Guard fornece um modelo integrado de classificação e graduação com quatro níveis de sensibilidade e quatro categorias principais, que podem ser usados diretamente. O DataWorks permite editar o modelo integrado ou criar novas classificações e graduações. É possível definir até 10 níveis de sensibilidade. Para categorias, personalize várias camadas, subcategorias e os tipos de campos sensíveis que elas contêm.
-
Configure os níveis de sensibilidade na página .
A página de classificação e graduação de dados exibe o modelo integrado padrão. Clique no ícone
ao lado do modelo para modificar o nome do modelo, a descrição e o número de níveis de sensibilidade.
-
Configure as categorias de dados na página Rule Setting > Sensitive Data Detection.
Ao usar o Data Security Guard pela primeira vez, o painel de navegação à esquerda na página de regras de detecção de dados exibe as categorias padrão do modelo integrado de classificação e graduação. Pesquise uma categoria pelo nome ou clique no ícone
ao lado de uma categoria para executar ações como Add Sibling Category, Add Subcategory, Rename e Delete.Usuários existentes do Data Security Guard podem criar categorias de dados no painel de navegação à esquerda na página de regras de detecção de dados. O limite máximo é de quatro categorias.
Os nomes das categorias devem ser exclusivos. Podem conter apenas caracteres chineses, letras e dígitos, com comprimento de 1 a 30 caracteres.
Antes de excluir uma categoria, verifique se ela contém regras de detecção de campos sensíveis publicadas. Em caso afirmativo, cancele a publicação de todas as regras na categoria antes de excluí-la. Para mais informações, consulte Gerenciar regras de detecção de dados.
Para mais detalhes sobre como configurar níveis de sensibilidade de dados, consulte Configurar classificação e graduação de dados.
Etapa 2: Configurar uma regra de detecção de dados
As regras de detecção são configuradas com base em tipos de campos sensíveis. Este tópico usa o exemplo de criar um novo tipo de campo sensível e configurar uma regra de detecção de dados para orientá-lo durante o processo de configuração. Também é possível configurar regras de detecção com base em tipos de campos sensíveis integrados.
Na página de regras de detecção de dados, clique em +Sensitive Field Type no canto superior direito para criar um tipo de campo sensível.
-
Configure as informações básicas do tipo de campo sensível.
-
Na aba Basic Information, configure o tipo, a categoria e o nível de sensibilidade do campo sensível.
A tabela a seguir descreve os parâmetros.
Parâmetro
Descrição
Tipo de campo sensível
Nome personalizado do tipo de campo sensível, como Nome, Número do Documento de Identidade ou Número de Telefone. O nome deve ser exclusivo.
Categoria
Selecione a categoria à qual o tipo de campo sensível pertence. Se as categorias existentes não atenderem aos seus requisitos, acesse a página Data classification grading para configurá-las. Para mais informações, consulte Configurar classificação e graduação de dados.
Nível de sensibilidade
Selecione o nível de sensibilidade para o tipo de campo sensível. Um número maior indica um nível de sensibilidade mais alto. Se os níveis existentes não atenderem aos seus requisitos, acesse a página Data classification grading para configurá-los. Para mais informações, consulte Configurar classificação e graduação de dados.
Clique em Next Step.
-
-
Configure a regra de detecção para o tipo de campo sensível.
Na aba Rule Setting, configure a regra de detecção de dados, especifique as condições de correspondência e teste a precisão da regra.
Parâmetro
Descrição
Hit Rules
Na lista suspensa à direita, selecione a condição de correspondência para a regra de detecção:
-
Satisfy any rule: Aciona a regra se qualquer condição de
Data Content IdentificationouField Name Identificationfor atendida. -
Satisfy all rules: Aciona a regra somente se todas as condições de
Data Content IdentificationeField Name Identificationforem atendidas.
NotaA configuração Hit Rules aplica-se apenas às regras de
Data Content IdentificationeField Name Identification.Data Content Identification
Identifica o conteúdo (valor) dos dados de um campo. Por exemplo, se o campo
nametiver o valor "Zhang San", a regra identifica "Zhang San".NotaO recurso de verificação de conteúdo está disponível apenas no DataWorks Professional Edition ou superior. Se estiver usando uma edição inferior, faça upgrade para a Professional Edition ou superior. Para mais informações sobre upgrades, consulte Selecionar e adquirir uma edição do DataWorks.
Defina o conteúdo da regra usando um dos quatro tipos de regra a seguir para corresponder a texto sensível:
-
Regular Expression: Insira uma expressão regular e forneça dados de teste para verificar sua precisão.
-
Built-in Detection Rule: Selecione uma regra de detecção integrada e forneça dados de teste para verificar sua precisão.
NotaA Built-in Detection Rule está disponível apenas no DataWorks Enterprise Edition.
-
Sample Library: Selecione uma amostra de regra configurada e forneça dados de teste para verificar sua precisão. Para mais informações sobre como configurar amostras, consulte Identificar dados usando uma biblioteca de amostras.
-
Self-generated Model: Selecione um modelo de regra personalizado e forneça dados de teste para verificar sua precisão. Para mais informações sobre como configurar modelos personalizados, consulte Identificar dados usando um modelo personalizado.
NotaO tipo de regra Self-generated Model é suportado apenas para o mecanismo MaxCompute. O recurso Self-generated Model está disponível apenas no DataWorks Enterprise Edition.
Field Name Identification
Identifica o nome de um campo. Por exemplo, se o campo
nametiver o valor "Zhang San", a regra identificaname.Insira os campos a serem identificados como dados sensíveis. Vários campos são correspondidos usando uma relação
OR. Os formatos de entrada para diferentes fontes de dados são:-
EMR, CDH e MaxCompute:
project.table.column -
Hologres:
instance_id.project.table.column
Use um asterisco (*) como curinga em qualquer parte do formato. Exemplos:
-
a.b.*: Indica que todos os campos na tabela b do projeto a serão identificados como dados sensíveis.
-
ab.c.salary: Indica que todos os campos salary em tabelas que começam com c, dentro de projetos que começam com ab, são identificados como dados sensíveis.
-
cd.ef.sa*ry : Indica que, em um projeto terminado em
cd, todos os campos que começam comsae terminam comryem uma tabela começando comefserão identificados como dados sensíveis.
Field Annotation Identification
Identifica o comentário de um campo. Por exemplo, configure "phone number" e "contact info" como palavras-chave de comentário para o tipo de campo sensível de número de telefone. Quando o sistema detectar um campo cujo comentário contenha "contact info", o serviço identificará o campo como um número de telefone.
Insira comentários de campo na caixa de texto. Os comentários podem ter até 100 caracteres, sem restrições de tipo de caractere. Adicione até 10 caixas de texto.
Field exclusion
Insira os campos a serem excluídos na caixa de entrada. Campos que corresponderem às regras de exclusão de campos não serão correspondidos por esta regra de identificação. Corresponda vários campos, avaliados com base em uma relação
OR. Os formatos de entrada para diferentes fontes de dados são:-
EMR, CDH e MaxCompute:
project.table.column -
Hologres:
instance_id.project.table.column
Use um asterisco (*) como curinga em qualquer parte do formato. Exemplos:
-
a.b.*: Indica que todos os campos na tabela b do projeto a serão identificados como dados sensíveis.
-
ab.c.salary: Indica que todos os campos salary em tabelas que começam com c, dentro de projetos que começam com ab, são identificados como dados sensíveis.
-
cd.ef.sa*ry : Indica que, em um projeto terminado em
cd, todos os campos que começam comsae terminam comryem uma tabela começando comefserão identificados como dados sensíveis.
Hit rate configuration
Esta configuração permite personalizar a taxa de correspondência. Ela especifica a porcentagem mínima de dados não vazios em um campo que devem corresponder às condições de
Data Content Identificationpara que a regra seja acionada. Por exemplo, 50%. O padrão é 50%.A taxa de correspondência é calculada pela seguinte fórmula:
100% * (Número de entradas de dados correspondentes no campo) / (Número total de entradas de dados no campo).NotaA taxa de correspondência aplica-se apenas às regras de
Data Content Identification. -
-
Publique a regra de detecção de dados.
Clique em Publish para publicar a regra de detecção de dados atual. Após a publicação, use a regra em tarefas de detecção para identificar os dados sensíveis correspondentes.
Se não precisar usar a regra imediatamente, clique em Save as Draft para salvá-la.
-
Quando uma coluna de dados corresponde às regras de detecção de vários tipos de campos sensíveis, a prioridade das regras segue a ordem abaixo:
Se os tipos de campos sensíveis tiverem o mesmo número de condições de correspondência, a prioridade de identificação será .
Caso os tipos de campos sensíveis tenham o mesmo número e tipo de condições de correspondência, a regra com o nível de sensibilidade mais alto terá prioridade.
Etapa 3: Autorizar e iniciar uma tarefa de detecção
Após configurar as regras de detecção de dados, autorize e inicie uma tarefa de detecção de dados sensíveis, que identificará dados sensíveis no seu tenant com base nessas regras.
-
Autorize a tarefa de detecção de dados sensíveis.
Na primeira vez que iniciar uma tarefa de detecção de dados sensíveis, clique em Authorize Now no canto superior esquerdo da página Sensitive Data Detection e siga as instruções na tela para conceder permissões.
NotaDepois que a tarefa de detecção de dados sensíveis for iniciada, clique em Authorization Records no canto superior direito da página Sensitive Data Detection para visualizar os detalhes da autorização.
-
Inicie a tarefa de detecção de dados sensíveis.
-
Configure a tarefa de detecção de dados sensíveis.
Ao configurar uma tarefa de detecção de dados sensíveis, especifique o tipo de tarefa, o método de varredura e o escopo. Configure uma tarefa em tempo real, uma tarefa agendada ou crie manualmente uma nova tarefa de detecção.
-
Configure uma tarefa em tempo real.
A tabela a seguir descreve os parâmetros.
Parâmetro
Descrição
Detection account
Especifique se deseja usar uma conta Alibaba Cloud ou um usuário RAM para amostrar e verificar dados. O escopo dos dados que podem ser amostrados varia conforme as permissões da conta selecionada.
NotaSe usar um usuário RAM para detecção, esse usuário deverá ter permissões no projeto MaxCompute.
Real-time detection
Apenas o ODPS suporta detecção em tempo real. Quando os metadados do ODPS mudam, como na adição de novas tabelas ou campos, ou na alteração de campos, o Data Security Guard inicia automaticamente uma tarefa de detecção para os metadados modificados.
O Data Security Guard recupera informações de alterações de metadados em tempo real. Se a alteração for devido a uma nova tabela ou campo, pode ser que ainda não haja dados. Nesse caso, o serviço usa apenas metadados para a identificação de dados sensíveis.
-
Configure uma tarefa agendada. A tabela a seguir descreve os parâmetros.
Parâmetro
Descrição
Execution
Ative a tarefa manualmente.
Scan and update policy for subsequent detection tasks
Duas opções estão disponíveis:
-
Verificar novamente e atualizar resultados apenas para regras alteradas, dados afetados por essas alterações e dados sem resultados anteriores.
-
Verificar novamente todos os dados e substituir todos os resultados existentes.
Marque a caixa de seleção para impedir que o serviço substitua resultados corrigidos manualmente.
Detection account
Especifique se deseja usar uma Alibaba Cloud Account ou uma Sub-account para amostrar e verificar dados. O escopo dos dados que podem ser amostrados e verificados varia conforme as permissões da conta selecionada.
NotaSe usar um usuário RAM para amostragem e verificação, esse usuário deverá ter permissões no projeto MaxCompute.
Content identification
Especifique se deseja ativar Content Identification e Metadata Identification. As regras correspondentes entram em vigor apenas quando esta opção é selecionada.
NotaSe não ativar a Content Identification, o Data Security Guard não amostrará nem verificará seus dados. As regras de identificação de conteúdo não entrarão em vigor, mas as regras de nome de campo e comentário de campo permanecerão ativas.
Alibaba Cloud Account
Especifique o número de entradas de dados a serem amostradas para identificação de conteúdo. Recomenda-se um valor maior que 100.
Este parâmetro é obrigatório quando a Content Identification está ativada.
Scan frequency e Scan time
Defina o ciclo de verificação para a tarefa agendada.
Este parâmetro é necessário apenas quando o Task type está definido como Scheduled Task.
Defina a Scan Frequency como Once a week ou Once a day. Para verificações semanais, selecione qualquer dia de Monday to Friday. O intervalo de tempo vai de 00:00 a 23:59.
Scan scope
Configure o escopo de dados para a tarefa de detecção de dados sensíveis.
-
Sub-account: Verifica todos os dados acessíveis pela conta autorizada dentro do tenant atual.
-
Partial Data: Verifica dados de tabelas dentro de projetos especificados.
Nota-
Por padrão, o escopo inclui todos os projetos em todos os mecanismos de dados.
-
Atualmente, é possível verificar tabelas especificadas em projetos ODPS, EMR e Hologres.
-
Os nomes das tabelas podem ter até
100caracteres. Todos os tipos de caracteres são suportados. Se deixar este campo em branco, todas as tabelas serão verificadas. -
O curinga
.é suportado. Por exemplo,.namecorresponde a tabelas terminadas emnameprivate.* corresponde a tabelas começando comprivate. -
Use vírgulas (,) para separar vários nomes de tabelas ou campos.
-
-
Se selecionar Partial Data, adicione vários escopos de verificação de projetos ou bancos de dados. O escopo final de verificação é a união de todos os escopos especificados.
-
Selecione manualmente os projetos no painel à esquerda.
-
Após selecionar um projeto, as tabelas dentro desse escopo são exibidas à direita. Selecione tabelas manualmente ou selecione todas. Por padrão, todas as tabelas no escopo selecionado são incluídas.
-
A pesquisa por palavra-chave é suportada tanto para escopos de projeto/banco de dados quanto para tabelas. Para pesquisar uma tabela, selecione primeiro um projeto e realize a pesquisa dentro dele.
-
-
-
-
Configure uma tarefa manual, que cria uma nova tarefa de detecção. A tabela a seguir descreve os parâmetros.
Parâmetro
Descrição
Scan and update policy for the detection task
Duas opções estão disponíveis:
-
Verificar novamente e atualizar resultados apenas para regras alteradas, dados afetados por essas alterações e dados sem resultados anteriores.
-
Verificar novamente todos os dados e substituir todos os resultados existentes.
Marque a caixa de seleção para impedir que o serviço substitua resultados corrigidos manualmente.
Detection account
Especifique se deseja usar uma Alibaba Cloud Account ou uma Sub-account para amostrar e verificar dados. O escopo dos dados que podem ser amostrados e verificados varia conforme as permissões da conta selecionada.
NotaSe usar um usuário RAM para amostragem e verificação, esse usuário deverá ter permissões no projeto MaxCompute.
Content identification
Especifique se deseja ativar Content Identification e Metadata Identification. As regras correspondentes entram em vigor apenas quando esta opção é selecionada.
NotaSe não ativar a Content Identification, o Data Security Guard não amostrará nem verificará seus dados. As regras de identificação de conteúdo não entrarão em vigor, mas as regras de nome de campo e comentário de campo permanecerão ativas.
Sampling quantity
Especifique o número de entradas de dados a serem amostradas para identificação de conteúdo. Recomenda-se um valor maior que 100.
Este parâmetro é obrigatório quando a Content Identification está ativada.
Scan scope
Configure o escopo de dados para a tarefa de detecção de dados sensíveis.
-
Task type: Verifica todos os dados acessíveis pela conta autorizada dentro do tenant atual.
-
Partial Data: Verifica dados de tabelas dentro de projetos especificados.
Nota-
Por padrão, o escopo inclui todos os projetos em todos os mecanismos de dados.
-
Atualmente, é possível verificar tabelas especificadas em projetos ODPS, EMR e Hologres.
-
Os nomes das tabelas podem ter até
100caracteres. Todos os tipos de caracteres são suportados. Se deixar este campo em branco, todas as tabelas serão verificadas. -
O curinga
.é suportado. Por exemplo,.namecorresponde a tabelas terminadas emnameprivate.* corresponde a tabelas começando comprivate. -
Use vírgulas (,) para separar vários nomes de tabelas ou campos.
-
-
Se selecionar Partial Data, adicione vários escopos de verificação de projetos ou bancos de dados. O escopo final de verificação é a união de todos os escopos especificados.
-
Selecione manualmente os projetos no painel à esquerda.
-
Após selecionar um projeto, as tabelas dentro desse escopo são exibidas à direita. Selecione tabelas manualmente ou selecione todas. Por padrão, todas as tabelas no escopo selecionado são incluídas.
-
A pesquisa por palavra-chave é suportada tanto para escopos de projeto/banco de dados quanto para tabelas. Para pesquisar uma tabela, selecione primeiro um projeto e realize a pesquisa dentro dele.
-
-
-
-
-
Clique em Full Backup para iniciar a tarefa de verificação.
Após o início da tarefa, o Alibaba Cloud Account muda da seguinte forma:
Tarefa em tempo real: O status muda para Enabling.
Tarefa agendada: O status muda para Enabling. O serviço inicia a tarefa de detecção no horário configurado.
Nova tarefa de detecção: Uma barra de progresso aparece. A verificação é concluída quando o progresso atinge 100%. O progresso é calculado da seguinte forma: (Número de tabelas verificadas na tarefa atual / Número total de tabelas a serem verificadas na tarefa atual) × 100%.
NotaSe modificar uma regra de detecção, as alterações entrarão em vigor na próxima verificação agendada. Para acionar a nova regra imediatamente, crie manualmente uma nova tarefa de detecção.
Após a conclusão de uma tarefa de verificação, o Sub-account é atualizado para No Task.
-
Gerenciar regras de detecção de dados
Copiar uma regra: Para copiar rapidamente uma regra existente, clique no ícone
. O nome da nova regra recebe, por padrão, o sufixo -copy, e seu status é Sampling quantity. Configure-a conforme necessário.-
Editar uma regra: Para modificar informações da regra, clique no ícone
.NotaNão é possível modificar as informações básicas de regras configuradas com base em tipos de campos sensíveis integrados.
Após a modificação de uma regra, os resultados de identificação para campos que correspondiam anteriormente à regra são limpos.
-
Excluir uma regra: Se uma regra não for mais necessária, clique no ícone
para excluí-la.ImportanteA exclusão de uma regra de detecção para um tipo de campo sensível tem um impacto significativo. Revise cuidadosamente as consequências abaixo antes de confirmar a exclusão:
Os registros deste tipo de campo sensível são excluídos dos resultados de detecção. Para mais informações, consulte Visualizar e corrigir manualmente resultados de detecção de dados sensíveis.
As informações de distribuição de dados sensíveis no Data Discovery deixam de incluir estatísticas para este tipo de campo sensível. Para mais informações, consulte Visão Geral de Dados Sensíveis.
O tipo de campo sensível é removido de quaisquer regras de identificação de riscos que o referenciem. Para mais informações, consulte Gerenciar regras de identificação de riscos.
-
Publicar regras em lote: As regras devem ser publicadas antes de poderem ser usadas para identificar dados sensíveis. Se tiver um grande número de regras, publique-as em lotes clicando em Full Backup.
-
Na página de regras de detecção de dados, clique em Enable e selecione as regras que deseja publicar.
NotaSelecione apenas regras que estejam no estado Node Status.
-
Clique em Node Status. Após a publicação das regras, o status delas muda para Draft.
NotaPara cancelar, clique em Batch Publish. As regras retornam ao estado Batch Publish.
-
-
Invalidar regras em lote: Após a invalidação de uma regra, ela deixa de ser usada para detectar o tipo de campo sensível correspondente. Os registros deste tipo de campo sensível são excluídos de módulos como Data Discovery e correção manual. Antes de invalidar uma regra, confirme se o tipo de campo sensível dela é referenciado por alguma regra de mascaramento de dados ou Draft. Em caso afirmativo, invalide primeiro a regra de mascaramento de dados e remova a referência das Deploy. Para mais informações, consulte Criar uma regra de mascaramento de dados e Gerenciar regras de identificação de riscos.
-
Na página de regras de detecção de dados, clique em Batch Invalidate e selecione as regras que deseja invalidar.
NotaSelecione apenas regras que estejam no estado Yes.
-
Clique em Batch Invalidate. Após a invalidação das regras, o status delas muda para Cancel.
NotaPara cancelar, clique em Draft. As regras retornam ao estado Risk identification rules.
-
Visualizar registros de execução de tarefas
A página Sensitive Data Detection > Risk identification rules > Task Execution Records lista tarefas concluídas na última semana, mas não tarefas em andamento. Visualize detalhes como Yes, Draft, Cancel, Yes, Identify Tasks e Start time.