Todos os produtos
Search
Central de documentação

AI Guardrails:Text Moderation with LLMs

Última atualização: Jun 30, 2026

O Text Moderation 2.0 usa modelos de linguagem grandes (LLMs) para detectar texto inadequado. Em comparação com abordagens baseadas em regras, os LLMs identificam violações complexas e sutis com maior precisão.

Importante

Para enviar feedback ou solicitar recursos, entre em contato com seu gerente de conta.

Serviços

Estão disponíveis os seguintes serviços de moderação de texto baseados em LLM:

Serviço

Descrição

Casos de uso

Nome do serviço: UGC Text Moderation (LLM)

Serviço: ugc_moderation_byllm_global

Serviço de moderação de texto UGC com suporte a 119 idiomas, incluindo chinês, inglês, espanhol, francês, português, italiano, árabe, japonês, coreano, indonésio, russo, vietnamita, alemão e tailandês. Para obter a lista completa de itens detectáveis, consulte o console do Content Moderation.

Moderação de texto UGC de uso geral.

Nome do serviço: UGC Scenario Text Moderation Large Model Service_China Version

Serviço: ugc_moderation_byllm_ec

Serviço de moderação de texto baseado em LLM para cenários UGC. Para obter a lista completa de itens detectáveis, consulte o console do Content Moderation.

Indicado para moderação de texto UGC voltada ao mercado da China continental.

Faturamento

O serviço de moderação de texto baseado em LLM oferece dois métodos de faturamento: pagamento conforme o uso .

Pagamento conforme o uso

Ao ativar o serviço Content Moderation , o método de faturamento padrão é o pagamento conforme o uso. A cobrança ocorre diariamente com base no uso real. Não há cobrança se você não utilizar o serviço.

Tipo de moderação

Serviços

Preço unitário

Moderação de texto baseada em LLM (Avançada) (text_advanced)

  • UGC Text Moderation Large Model Service_Professional Edition: ugc_moderation_byllm_global

  • Recurso de tradução de texto

USD 0,60 por 1.000 chamadas

Nota
  • Cada chamada ao serviço listado à esquerda gera cobrança. Por exemplo, ao fazer 100 chamadas para o UGC Text Moderation (LLM), o custo será de USD 0,06.

  • Recurso de tradução de texto: Após ativar o recurso de tradução de texto, cada solicitação é cobrada uma vez a cada 500 caracteres.

Moderação de texto baseada em LLM (Entrada na China) (text_llm_standard_cn)

  • Cross-border UGC text moderation (LLM): ugc_moderation_byllm_ec

USD 0,31 por 1.000 chamadas

Nota

Cada chamada ao serviço listado à esquerda gera cobrança. Por exemplo, ao fazer 100 chamadas para o UGC Scenario Text Moderation Large Model Service_China Version, o custo será de USD 0,031.

Nota

No método de faturamento pago conforme o uso do Content Moderation 2.0, o sistema gera faturas a cada 24 horas. Nos detalhes de faturamento, o campo moderationType corresponde ao tipo de moderação. Visualize seus detalhes de faturamento.

Planos de recursos

Para volumes de moderação altos ou consistentes, os planos de recursos oferecem descontos significativos. É possível adquirir e acumular vários planos. Para mais informações, consulte Adquirir um plano de recursos para o Content Moderation 2.0.

Tipo de moderação

Fator de compensação

Moderação de texto baseada em LLM (Avançada) (text_advanced)

Cada chamada de API bem-sucedida consome 2 chamadas do seu plano de recursos.

Nota

Por exemplo, se o seu plano de recursos tiver uma cota de 10 chamadas, uma chamada de API bem-sucedida consumirá 2 chamadas, restando 8 chamadas no plano.

Moderação de texto baseada em LLM (Entrada na China) (text_llm_standard_cn)

Cada chamada de API bem-sucedida consome 1,04 chamadas do seu plano de recursos.

Nota

Por exemplo, se o seu plano de recursos tiver uma cota de 10 chamadas, uma chamada de API bem-sucedida consumirá 1,04 chamadas, restando 8,96 chamadas no plano.

Após adquirir um plano de recursos, o uso da API do Content Moderation 2.0 é deduzido primeiramente desse plano. Quando o plano se esgota, o uso subsequente é cobrado no modelo de pagamento conforme o uso. Monitore o saldo restante do plano e as cobranças de pagamento conforme o uso. Configure alertas de saldo baixo no sistema de Planos de Recursos.

Rótulos de risco

Definições de rótulos

O Text Moderation 2.0 suporta mais de 30 rótulos granulares distribuídos em 6 categorias de risco. O serviço retorna uma pontuação de confiança (0–100, onde valores maiores indicam maior confiança) para cada rótulo. Se o conteúdo apresentar múltiplos tipos de risco, vários rótulos granulares serão retornados. As tabelas a seguir listam os valores dos rótulos de risco, as faixas de pontuação de confiança correspondentes e seus significados.

Rótulo

Pontuação de confiança

Descrição

pornographic_adult

0–100

Suspeita de conteúdo pornográfico

sexual_terms

0–100

Suspeita de conteúdo de saúde sexual

sexual_suggestive

0–100

Suspeita de conteúdo vulgar

sexual_orientation

0–100

Suspeita de conteúdo relacionado à orientação sexual

regional_cn

0–100

Suspeita de conteúdo politicamente sensível relacionado à China continental

regional_illegal

0–100

Suspeita de conteúdo político ilegal

regional_controversial

0–100

Suspeita de controvérsia política

regional_racism

0–100

Suspeita de racismo

violent_extremist

0–100

Suspeita de organização extremista

violent_incidents

0–100

Suspeita de conteúdo extremista

violent_weapons

0–100

Suspeita de armas e munições

violence_unscList

0–100

Lista de sanções das Nações Unidas

contraband_drug

0–100

Suspeita de conteúdo relacionado a drogas

contraband_gambling

0–100

Suspeita de conteúdo relacionado a jogos de azar

inappropriate_ethics

0–100

Suspeita de conteúdo antiético

inappropriate_profanity

0–100

Suspeita de conteúdo ofensivo ou abusivo

inappropriate_oral

0–100

Suspeita de linguagem vulgar

inappropriate_religion

0–100

Suspeita de blasfêmia religiosa

pt_to_contact

0–100

Suspeita de informações de contato para publicidade

pt_to_sites

0–100

Suspeita de redirecionamento para sites externos

customized

0–100

Correspondência em lista personalizada de palavras-chave

Configure rótulos de risco

Ative ou desative rótulos de risco no console. Também é possível ajustar o escopo de detecção para rótulos específicos. Consulte o console do Content Moderation para obter detalhes.

  1. No painel de navegação à esquerda, escolha Machine Moderation UGC Text Moderation Large Model Service_Professional Edition V2.0>Text Moderation>UGC Text Moderation (LLM).

  2. Na aba Rules Management, localize uma solução de moderação de modelo grande, por exemplo, aigc_moderation_byllm _global, e clique em UGC Scenario Text Moderation Large Model Service_China Version na coluna Operation.

    1. Selecione um tipo de detecção para configurar, como detecção de conteúdo inadequado.

    2. Clique em Edite e modifique as configurações de detecção.

    3. Clique em Salve. A nova configuração entra em vigor no ambiente de produção em 2 a 5 minutos.

Integração

Etapa 1: Ativar o serviço

Para ativar o serviço Text Moderation 2.0, acesse ativar serviço.

Etapa 2: Conceder permissões a um usuário RAM

Antes de usar o SDK ou chamar uma API, conceda as permissões necessárias a um usuário RAM. Crie um par de AccessKey para sua conta Alibaba Cloud ou para um usuário RAM a fim de autenticar chamadas de API. Para obter instruções, consulte Obter uma chave de acesso.

  1. Faça login no console do RAM usando sua conta Alibaba Cloud.

  2. Crie um usuário RAM. Para detalhes, consulte Criar um usuário RAM.

  3. Conceda a política de sistema AliyunYundunGreenWebFullAccess ao usuário RAM. Essa política concede acesso total ao Content Moderation. Para detalhes, consulte Gerenciar permissões de usuário RAM.

O usuário RAM agora pode chamar a API do Content Moderation.

Etapa 3: Instale e integre o SDK

Para consultar o guia de integração do SDK, veja SDK do Serviço TextModerationPlus 2.0 PLUS e Guia de Integração.

Referência da API

Visão geral

Use a operação TextModerationPlus para criar uma tarefa de moderação de conteúdo de texto. Para construir solicitações HTTP, consulte Estrutura da Solicitação. Você também pode usar uma solicitação pré-construída conforme descrito no guia Introdução.

Teste essa operação no OpenAPI Explorer sem precisar calcular a assinatura manualmente. Após testar uma chamada, o OpenAPI Explorer gera exemplos de código SDK automaticamente.

  • Interface de serviço: TextModerationPlus

  • Regiões e endpoints suportados:

Região

Endpoint público

Endpoint VPC

Serviços suportados

China (Xangai)

green-cip.cn-shanghai.aliyuncs.com

green-cip-vpc.cn-shanghai.aliyuncs.com

ugc_moderation_byllm_ec

China (Pequim)

green-cip.cn-beijing.aliyuncs.com

green-cip-vpc.cn-beijing.aliyuncs.com

China (Hangzhou)

green-cip.cn-hangzhou.aliyuncs.com

green-cip-vpc.cn-hangzhou.aliyuncs.com

China (Shenzhen)

green-cip.cn-shenzhen.aliyuncs.com

green-cip-vpc.cn-shenzhen.aliyuncs.com

China (Chengdu)

green-cip.cn-chengdu.aliyuncs.com

Não disponível

China (Hong Kong)

green-cip.cn-hongkong.aliyuncs.com

green-cip-vpc.cn-hongkong.aliyuncs.com

ugc_moderation_byllm_global

Singapura

green-cip.ap-southeast-1.aliyuncs.com

green-cip-vpc.ap-southeast-1.aliyuncs.com

EUA (Virgínia)

green-cip.us-east-1.aliyuncs.com

green-cip-vpc.us-east-1.aliyuncs.com

Alemanha (Frankfurt)

green-cip.eu-central-1.aliyuncs.com

green-cip-vpc.eu-central-1.aliyuncs.com

Importante

Para as regiões Alemanha (Frankfurt) e China (Hong Kong), nós na região de Singapura realizam a inferência de moderação de texto. O serviço processa resultados de inferência, dados e logs localmente nas regiões Alemanha (Frankfurt) e China (Hong Kong).

  • Faturamento: Esta operação é faturada. A cobrança ocorre apenas para solicitações que retornam código de status HTTP 200. Não há custos para solicitações que retornam outros códigos de erro. Para mais informações sobre faturamento, consulte Preços.

Limite de QPS

O limite de taxa padrão é de 50 solicitações por segundo por conta. Exceder esse limite aciona limitações (throttling), o que pode interromper sua aplicação. Para solicitar um limite de taxa maior, entre em contato com seu gerente de conta.

Parâmetros da solicitação

Parâmetro

Tipo

Obrigatório

Exemplo

Descrição

Service

String

Sim

ugc_moderation_byllm_global

  • ugc_moderation_byllm_global: UGC Text Moderation Large Model Service_Professional Edition

  • ugc_moderation_byllm_ec: LLM-based Text Moderation Service in UGC Scenarios

ServiceParameters

JSONString

Sim

Os parâmetros do serviço de moderação, especificados como uma string JSON. Para detalhes, consulte ServiceParameters.

Tabela 1. ServiceParameters

Parâmetro

Tipo

Obrigatório

Exemplo

Descrição

content

String

Sim

testing content

O conteúdo de texto a ser moderado. O conteúdo pode ter até 2.000 caracteres.

dataId

String

Não

text0424****

Um identificador exclusivo para seus dados comerciais.

Máximo de 64 caracteres. Caracteres permitidos: letras, dígitos, sublinhados (_), hífens (-) e pontos (.).

accountId

String

Não

ID0728****

O ID da conta do usuário final em sua plataforma. Use este parâmetro para vincular resultados a um usuário específico. Por exemplo, se o usuário A conversar com o usuário B, passe o ID de A para as mensagens de A e o ID de B para as mensagens de B.

Nota

Habilita moderação consciente do contexto. Para ativar esse recurso, entre em contato com seu gerente de conta ou envie um ticket.

infoType

String

Não

llmContent

O tipo de informação suplementar a ser recuperada. Valores válidos:

  • llmContent: Retorna o resultado bruto da detecção do LLM.

Parâmetros de resposta

Parâmetro

Tipo

Exemplo

Descrição

Code

Integer

200

O código de status HTTP. Para mais informações, consulte Códigos de status.

Data

JSONObject

{"Result":[...]}

Os dados do resultado da moderação. Para mais informações, consulte Data.

Message

String

OK

A mensagem de resultado da solicitação.

RequestId

String

AAAAAA-BBBB-CCCCC-DDDD-EEEEEEEE****

O ID da solicitação.

Tabela 2. Data

Parâmetro

Tipo

Exemplo

Descrição

Result

JSONArray

Os resultados da detecção, incluindo rótulos de risco e pontuações de confiança. Para mais informações, consulte Result.

RiskLevel

String

high

O nível de risco, determinado com base nos limiares configurados de pontuação de alto e baixo risco. Valores válidos:

  • high: Alto risco (Se o conteúdo corresponder a uma biblioteca personalizada, o nível de risco será high.)

  • medium: Risco médio

  • low: Baixo risco

  • none: Nenhum risco detectado

Nota

Tome medidas imediatas para conteúdo de risco high e revise manualmente conteúdo de risco medium. Trate conteúdo de risco low apenas se exigir uma alta taxa de recall; caso contrário, trate-o da mesma forma que conteúdo com nível de risco none. Configure os limiares de pontuação de risco no console do Content Moderation.

DataId

String

text0424****

O ID dos dados do conteúdo moderado.

Nota

Se você especificou o parâmetro dataId na solicitação, o mesmo valor será retornado neste campo.

AccountId

String

10123****

O ID da conta.

Nota

Se você especificou o parâmetro accountId na solicitação, o mesmo valor será retornado neste campo.

Ext

Object

Informações suplementares para o texto. Para mais informações, consulte Ext.

TranslatedContent

String

O conteúdo de texto traduzido. Retornado apenas quando o recurso de tradução de texto está ativado.

Nota

O recurso de tradução de texto está disponível atualmente apenas na região Singapura (Singapura). Configure-o gerenciando regras de detecção no console. Custos adicionais se aplicam.

Tabela 3. Result

Parâmetro

Tipo

Exemplo

Descrição

Label

String

political_xxx

O rótulo de risco para o conteúdo moderado. Múltiplos rótulos e pontuações podem ser retornados. Para obter uma lista de rótulos suportados, consulte Rótulos de risco.

Description

String

Suspected pornographic content

Uma descrição do campo Label.

Importante

Este campo serve apenas como referência e pode sofrer alterações. Para sua lógica de tratamento, utilize o campo Label em vez deste.

Confidence

Float

81,22

A pontuação de confiança, que varia de 0 a 100. O valor tem precisão de duas casas decimais. Alguns rótulos não retornam pontuação de confiança.

Riskwords

String

AA,BB,CC

As palavras de risco detectadas, separadas por vírgulas. Este campo não é retornado para alguns rótulos.

CustomizedHit

JSONArray

[{"LibName":"...","Keywords":"..."}]

Se o conteúdo corresponder a uma entrada em uma biblioteca personalizada, o Label será customized, e este campo retornará o nome da biblioteca e as palavras-chave correspondentes. Para mais informações, consulte CustomizedHit.

RiskPositions

JSONArray

Informações sobre a posição das palavras de risco detectadas. Para mais informações, consulte RiskPositions.

Tabela 4. CustomizedHit

Parâmetro

Tipo

Exemplo

Descrição

LibName

String

Custom Library 1

O nome da biblioteca personalizada.

Keywords

String

Custom Keyword 1,Custom Keyword 2

As palavras-chave personalizadas correspondentes, separadas por vírgulas.

Tabela 5. RiskPositions

Parâmetro

Tipo

Exemplo

Descrição

RiskWord

String

AA

A palavra de risco detectada.

StartPos

Integer

10

A posição inicial da palavra de risco no texto.

EndPos

Integer

12

A posição final da palavra de risco no texto.

Tabela 6. Ext

Parâmetro

Tipo

Exemplo

Descrição

Tabela 7. LlmContent

Parâmetro

Tipo

Exemplo

Descrição

OutputText

String

Suspected vulgar language

O resultado bruto da detecção do modelo de moderação de texto baseado em LLM.

Exemplos

Exemplo de solicitação:

{
    "Service": "ugc_moderation_byllm_global",
    "ServiceParameters": {
        "content": "testing content",
        "dataId": "text0424****"
    }
}

Exemplos de resposta:

  • Correspondência com política do sistema:

{
    "Code": 200,
    "Data": {
        "Result": [
            {
                "Label": "political_entity",
                "Description": "Suspected political entity",
                "Confidence": 100.0,
                "RiskWords": "WordA,WordB",
                "RiskPositions": [
                    {
                        "EndPos": 14,
                        "RiskWord": "WordA",
                        "StartPos": 16
                    }
                ]
            },
            {
                "Label": "political_figure",
                "Description": "Suspected political figure",
                "Confidence": 100.0,
                "RiskWords": "WordB,WordC",
                "RiskPositions": [
                    {
                        "EndPos": 24,
                        "RiskWord": "WordC",
                        "StartPos": 26
                    }
                ]
            }
        ],
        "RiskLevel": "high",
        "DataId": "text0424****"
    },
    "Message": "OK",
    "RequestId": "AAAAAA-BBBB-CCCCC-DDDD-EEEEEEEE****"
}
  • Correspondência com biblioteca personalizada:

{
    "Code": 200,
    "Data": {
        "Result": [
            {
                "Description": "Hit a custom library",
                "CustomizedHit": [
                     {
                        "LibName": "Custom Library Name 1",
                        "Keywords": "custom keyword"
                     }
                ],
                "Confidence": 100,
                "Label": "customized"
             }
        ],
        "RiskLevel": "high",
        "DataId": "text0424****"
    },
    "Message": "OK",
    "RequestId": "AAAAAA-BBBB-CCCCC-DDDD-EEEEEEEE****"
}
  • Resultado bruto do LLM:

{
  "RequestId": "ZZZZZ-2024-0307-FORYOU-EVER",
  "Message": "OK",
  "Data": {
    "Ext": {
      "LlmContent": {
        "OutputText": "Suspected offensive or abusive content"
      }
    },
    "Result": [
      {
        "RiskWords": "risk word",
        "Description": "Suspected offensive or abusive content",
        "Confidence": 100.0,
        "Label": "inappropriate_profanity",
        "RiskPositions": [
          {
            "RiskWord": "risk word",
            "EndPos": 5,
            "StartPos": 2
          }
        ]
      }
    ],
    "RiskLevel": "high"
  },
  "Code": 200
}

Códigos de status

Código

Texto do status

Descrição

200

OK

A solicitação foi bem-sucedida.

400

BAD_REQUEST

Solicitação inválida. Verifique seus parâmetros de solicitação.

408

PERMISSION_DENY

Sua conta pode estar não autorizada, com pagamento atrasado ou o serviço não está ativado.

500

GENERAL_ERROR

Erro interno do servidor. Tente novamente a solicitação. Se o erro persistir, entre em contato com o Suporte Online.

581

TIMEOUT

Tempo da solicitação esgotado. Tente novamente. Se o erro persistir, entre em contato com o Suporte Online.

588

EXCEED_QUOTA

Limite de taxa excedido. Reduza a frequência de suas solicitações.