O Content Moderation oferece suporte a bibliotecas de texto personalizadas para alinhar os resultados de detecção às necessidades do seu negócio. Essas bibliotecas aplicam-se a cenários como detecção de violações de texto em imagens, antispam de texto, antispam de arquivos e antispam de voz. Use-as para gerenciar textos que você deseja bloquear, filtrar ou enviar para revisão humana e adaptar-se a novos requisitos de moderação.
Contexto
Antes de usar uma biblioteca de texto personalizada, leia este documento com atenção para compreender o funcionamento dessas bibliotecas. Isso evita configurações incorretas, como a adição de palavras-chave inadequadas, que podem gerar falsos positivos e comprometer a precisão da detecção.
As bibliotecas de texto personalizadas dividem-se em bibliotecas baseadas em feedback e bibliotecas autogerenciadas.
Uma biblioteca baseada em feedback é gerada automaticamente a partir dos seus registros de revisão humana e aplica-se, por padrão, a todos os cenários de detecção do mesmo tipo. Você pode gerenciar o texto contido nela, mas não pode desativar ou excluir a biblioteca em si. Para mais informações sobre revisão humana, consulte revisão humana.
Crie uma biblioteca de texto autogerenciada para uso em uma detecção específica ou em uma categoria de cenários de detecção. Nesse caso, você gerencia tanto o conteúdo textual quanto a própria biblioteca.
Você pode criar até 10 bibliotecas de texto autogerenciadas. Esse limite não inclui as bibliotecas baseadas em feedback.
Este tópico descreve como gerenciar bibliotecas de texto personalizadas no console do Content Moderation. Além do console, você também pode realizar essas operações por meio de APIs ou SDKs. Para mais detalhes, consulte os seguintes documentos:
Tipos de texto
Uma biblioteca de texto personalizada pode conter dois tipos de conteúdo: Text e texto similar.
-
Text
Uma palavra-chave é um termo curto ou frase específica usada para controle de conteúdo. Se um texto contiver uma palavra-chave predefinida, o sistema acionará uma correspondência. Configure palavras-chave diferentes para cada cenário de negócio.
No Content Moderation, palavras-chave aplicam-se aos cenários de detecção de violações de texto em imagens e antispam de texto. As configurações podem apresentar pequenas variações conforme o cenário.
Palavras-chave em chinês aceitam os operadores lógicos AND (
&) e NOT (~). Por exemplo:Ao definir "A&B", a correspondência ocorre apenas se o texto contiver tanto "A" quanto "B".
Ao definir "A~B", a correspondência acontece somente se o texto incluir "A", mas não "B". Caso o texto contenha ambos, o sistema não aciona nenhuma correspondência.
NotaO operador AND (
&) deve preceder o operador NOT (~). Por exemplo, você pode definir "A&B~C" como palavra-chave, mas não pode configurar "A~C&B". -
Texto similar
O recurso de texto similar avalia a semelhança semântica entre frases ou parágrafos. Dois trechos de texto podem apresentar leves variações, mas transmitir o mesmo significado geral ou descrever o mesmo evento. O sistema verifica se o texto analisado apresenta alta similaridade com amostras predefinidas. Se a pontuação de similaridade atingir determinado limiar, o sistema aciona uma correspondência.
Uma biblioteca de texto similar destina-se ao cenário de antispam de texto. Nela, você define uma lista de bloqueios, uma lista de confiança e uma lista de revisão para o seu negócio. A lista de revisão contém textos que exigem análise humana. Ao manter amostras relevantes na biblioteca, você orienta o service de antispam de texto a filtrar conteúdos correspondentes a essas amostras.
Limitações
Tipo | Item | Limite |
Biblioteca de texto | Quantidade de bibliotecas | Até 10 bibliotecas de texto autogerenciadas. |
Biblioteca de texto | Comprimento do nome da biblioteca | Até 20 caracteres. |
Palavra-chave | Tipo de palavra-chave |
|
Palavra-chave | Número de palavras-chave por biblioteca | Até 10.000. |
Palavra-chave | Comprimento máximo da palavra-chave | 50 caracteres (incluindo símbolos). |
Palavra-chave | Codificação de palavra-chave em chinês | UTF-8. |
Palavra-chave | Formato da palavra-chave | Palavras-chave não podem conter os seguintes caracteres especiais, seja em forma de largura total ou meia largura:
|
Texto similar | Comprimento do texto similar | De 20 a 10.000 caracteres. Nota Para evitar falsos positivos, recomenda-se manter o texto com 200 caracteres ou menos. |
Texto similar | Número de entradas de texto similar por biblioteca | Até 10.000. |
Texto similar | Formato de codificação do texto | UTF-8. |
Texto similar | Conteúdo do texto similar | As amostras de texto devem conter características semânticas chinesas distintas e extraíveis. Se o mecanismo de análise identificar que uma amostra possui poucas características, ele ignorará a amostra. Nota Por exemplo, o sistema pode ignorar uma amostra composta apenas por letras sem sentido, dígitos ou diversos emojis. |
Procedimento
Faça login no console do Content Moderation.
No painel de navegação à esquerda, escolha Machine audit V1.0 > Risk Libraries.
Na aba Custom Text Library, clique em Create Text Library.
-
Na caixa de diálogo Create Custom Text Library, configure os parâmetros conforme descrito na Tabela 1 e clique em OK.
Tabela 1. Parâmetros para criação de uma biblioteca de texto personalizada
Parâmetro
Descrição
Name
Nome da biblioteca de texto. Nomes duplicados são permitidos, mas recomenda-se adotar um nome exclusivo para o seu negócio.
Detection Scene
Caso de uso da biblioteca de texto. Valores válidos:
Text Anti-spam: Aplicável a antispam de texto (quando o parâmetro
scenesincluiantispam).Texts or Objects on Image: Aplicável a moderação de imagens (quando o parâmetro
scenesincluiad).
Type
Tipo de texto na biblioteca. Valores válidos:
Text: Usa correspondência por palavra-chave. Aciona uma correspondência se o conteúdo contiver a palavra-chave. Oferece ampla cobertura.
Similar Text: Usa correspondência por similaridade de texto. Aciona uma correspondência apenas se todo o segmento de texto for semelhante a uma amostra. Proporciona alta precisão.
NotaEsta opção está disponível somente quando Detection Scene estiver definido como Text Anti-spam.
Match Mode
Quando Type estiver definido como Text, selecione o modo de correspondência para a biblioteca. Valores válidos:
Precise: O sistema aciona uma correspondência apenas se o texto verificado contiver conteúdo idêntico a uma palavra-chave da biblioteca.
Check after Preprocess Texts : Normaliza o texto verificado e as palavras-chave antes da correspondência. A lógica de normalização funciona da seguinte forma:
Letras maiúsculas são convertidas para minúsculas. Por exemplo, se o texto de entrada for "bitCoin", ele corresponderá à palavra-chave "bitcoin".
Caracteres do chinês tradicional são uniformemente convertidos para chinês simplificado. Por exemplo, ao inserir o texto "中國", ele corresponderá à palavra-chave "中国".
Caracteres visualmente semelhantes são convertidos. Por exemplo, o texto de entrada "②" corresponderá à palavra-chave "2".
NotaPara uma biblioteca de texto similar, o sistema usa a correspondência após normalização por padrão.
Suggestion
Finalidade da biblioteca de texto.
Se Type for Text, os valores válidos são:
Block list: Se houver correspondência, o resultado da revisão automatizada será
suggestion=block.Review List: Se houver correspondência, o resultado da revisão automatizada será
suggestion=review.Filter List: O sistema ignora as palavras-chave nesta lista, mas ainda verifica o restante do conteúdo.
Se Type for Similar Text, os valores válidos são:
Block list: Se houver correspondência, o resultado da revisão automatizada será
suggestion=block.Review List: Se houver correspondência, o resultado da revisão automatizada será
suggestion=review.Trust list: Se houver correspondência, o resultado da revisão automatizada será
suggestion=pass.
BizType
O parâmetro
BizTypepermite configurar e aplicar diferentes bibliotecas de texto conforme os requisitos do negócio, como especificar uma biblioteca para uma detecção específica. A lógica é a seguinte:Se você definir
BizTypecomo "A" para uma biblioteca de texto e também passarBizType="A"na solicitação de API, a detecção usará apenas as bibliotecas habilitadas com esseBizType.Caso contrário, a detecção utilizará todas as bibliotecas de texto habilitadas.
Após criar a biblioteca de texto, ela aparecerá na lista de bibliotecas.
-
Gerencie o conteúdo (palavras-chave ou texto similar) da sua biblioteca de texto.
A lista Custom Text Library exibe todas as suas bibliotecas de texto personalizadas. Uma biblioteca baseada em feedback é identificada pela tag System e segue o formato de nomenclatura
SCENE_FEEDBACK_WHITE/BLACK. Por exemplo, ANTISPAM_FEEDBACK_BLACK é uma lista de bloqueios gerada pelo sistema para o cenário de antispam de texto.Localize a biblioteca que deseja gerenciar e clique em Modify na coluna Actions.
-
Na página Text Libraries, gerencie as palavras-chave da biblioteca.
A página Text Libraries mostra todas as palavras-chave adicionadas e a quantidade de ocorrências na coluna Detected in Last Seven Days. Essa contagem não inclui o dia atual.
NotaApós adicionar ou excluir palavras-chave, as alterações entram em vigor em aproximadamente 15 minutos.
Clique em Add Keyword ou Import e siga as instruções na tela para adicionar palavras-chave à biblioteca.
Para remover palavras-chave, selecione aquelas que deseja excluir e clique em Batch Delete. Você também pode clicar em Delete ao lado de uma palavra-chave individual para removê-la.
Operações relacionadas
Para uma biblioteca de texto autogerenciada, clique em Delete, Modify ou Disable na coluna Actions da página Custom Text Library para gerenciar a biblioteca.