Todos os produtos
Search
Central de documentação

AI Guardrails:Serviço multilíngue do Voice Moderation 2.0

Última atualização: Jul 17, 2026

O Voice Moderation 2.0 atualiza seus modelos de áudio para oferecer suporte a conteúdo em chinês, inglês e misto (chinês-inglês). Além disso, fornece políticas de moderação e um sistema de tags adaptado às necessidades de negócios globais.

Recursos

Em comparação com o Voice Moderation 1.0, o Voice Moderation 2.0 utiliza políticas dedicadas e um sistema de tags que atendem aos requisitos de negócios globais. Também oferece recursos adicionais para simplificar a integração e auxiliar na revisão manual.

Item de comparação

Voice Moderation Version 2.0

Voice Moderation 1.0

Suporte multilíngue

  • A região de Singapore oferece suporte a 35 idiomas, incluindo chinês, inglês, árabe, alemão, russo, francês, coreano, japonês, espanhol, italiano, indonésio, vietnamita, malaio, tailandês, hindi, turco, português, holandês, polonês, bengali, persa, sueco, dinamarquês, norueguês, islandês, finlandês, bielorrusso, lituano, tcheco, eslovaco, húngaro, grego e romeno.

  • A região US (Virginia) oferece suporte a chinês, inglês e conteúdo misto de chinês e inglês.

Oferece suporte apenas ao chinês por padrão.

Capacidade de moderação

  • Utiliza múltiplos modelos paralelos combinados com características linguísticas e regionais para garantir políticas mais precisas.

  • Adiciona novos modelos de detecção de recursos não semânticos, como detecção de gemidos.

  • Usa um único modelo que equilibra precisão e recall com base nas características do idioma.

  • Não oferece suporte à detecção de gemidos por padrão.

Sistema de tags

Emprega um sistema de tags global com adição de tags internacionais, como palavrões e conflitos regionais. Oferece suporte a múltiplas tags de risco e subtags.

Utiliza o sistema de tags de e oferece suporte apenas a uma única tag de risco.

Funcionalidade da API

  • Aplica segmentação ajustável de duração fixa. Segmentos de tamanho fixo melhoram a eficiência da revisão manual.

  • Retorna todos os segmentos de áudio e seus textos transcritos, juntamente com URLs temporárias para revisão manual.

  • Realiza segmentação baseada em sentenças semânticas, resultando em tamanhos de segmento variáveis, de alguns segundos a dezenas de segundos.

  • Retorna apenas segmentos sinalizados como arriscados e não fornece URLs temporárias de segmentos por padrão.

Tags de internacionalização

O serviço multilíngue do Voice Moderation 2.0 utiliza um sistema de tags global. Se o conteúdo contiver vários tipos de riscos, múltiplas tags serão retornadas simultaneamente. As categorias de tags incluem, mas não se limitam às seguintes:

Tipo de tag

Categoria

Tags primárias (labels)

  • violence: conteúdo violento ou terrorista

  • contraband: itens proibidos

  • sexuality: conteúdo pornográfico

  • profanity: palavrões ou linguagem abusiva

  • pullinTraffic: conteúdo promocional ou de atração de tráfego

  • regional: conflito regional

  • C_customized: biblioteca definida pelo usuário correspondente

Subtags (riskTips)

As subtags são retornadas no formato xxx_yyy. Por exemplo: contraband_Drugs.

Desempenho do serviço

O Voice Moderation 2.0 usa um mecanismo central de alto desempenho que agenda dezenas de modelos e políticas simultaneamente para entregar resultados rápidos.

Desempenho do serviço

Descrição

Tamanho do arquivo

O 2.0 aumenta o tamanho máximo suportado de arquivos de áudio de 200 MB para 500 MB.

Formatos de arquivo de áudio

Formatos de áudio suportados: MP3, WAV, AAC, WMA, OGG, M4A, AMR.

Formatos de vídeo suportados: AVI, FLV, MP4, MPG, ASF, WMV, MOV, RMVB, RM.

Streams de áudio ao vivo

Protocolos suportados: RTMP, HLS, HTTP-FLV, RTSP.

Taxa de solicitações (QPS)

O limite de QPS para envio de tarefas aumenta de 50 solicitações por segundo para 100 solicitações por segundo.

Streams simultâneas

O 2.0 aumenta o limite padrão de streams simultâneas de 20 para 50.

Nota

QPS refere-se ao número de solicitações de API que o serviço pode processar por segundo. Streams simultâneas referem-se ao número de arquivos de áudio ou streams ao vivo processados simultaneamente.

Faturamento

O serviço Voice Moderation 2.0 oferece suporte ao pagamento conforme o uso .

Pagamento conforme o uso

Ao ativar o Voice Moderation 2.0, o pagamento conforme o uso é habilitado por padrão. O faturamento ocorre diariamente com base no uso real. Não há cobrança se você não chamar o serviço.

Tipo de moderação

Cenários suportados (serviços)

Preço unitário

Voice Moderation Standard (audio_standard)

  • Moderação de mídia de áudio e vídeo multilíngue: audio_multilingual_global

  • Moderação de streaming ao vivo multilíngue para entretenimento social: stream_multilingual_global

USD 9,0 por 1.000 minutos

Guia de Integração

Etapa 1: Ative o serviço

Acesse Ativar o serviço para habilitar o Voice Moderation 2.0.

Etapa 2: Conceder permissões a um usuário RAM

Antes de integrar o SDK ou chamar a API, conceda permissões a um usuário RAM e crie um par de AccessKey para autenticação. Para obter instruções, consulte Obter um AccessKey.

Conceder permissões a um usuário RAM

  1. Faça login no RAM console usando sua conta Alibaba Cloud.

  2. Crie um usuário RAM. Para detalhes, consulte Criar um usuário RAM.

  3. Conceda a política de sistema AliyunYundunGreenWebFullAccess ao usuário RAM. Esta política concede acesso total ao Content Moderation. Para detalhes, consulte Gerencie permissões de usuário RAM.

    O usuário RAM agora pode chamar a API do Content Moderation.

Etapa 3: Instale e integre o SDK

Regiões suportadas:

Região

Endpoint público

Endpoint privado

Singapore

https://green-cip.ap-southeast-1.aliyuncs.com

https://green-cip-vpc.ap-southeast-1.aliyuncs.com

US (Virginia)

https://green-cip.us-east-1.aliyuncs.com

https://green-cip-vpc.us-east-1.aliyuncs.com

Nota

Para obter códigos de exemplo do SDK em outros idiomas, use a ferramenta de depuração online do Portal do Desenvolvedor OpenAPI. Esta ferramenta gera automaticamente códigos de exemplo do SDK para a API.

API

Notas de uso

Endpoint de negócios: https://green-cip.{region}.aliyuncs.com.

Chame este endpoint para criar uma tarefa de moderação de voz. Para instruções sobre como construir solicitações HTTP, consulte Fazer chamadas HTTP nativas. Alternativamente, use solicitações HTTP pré-construídas. Para mais informações, consulte Voice Moderation SDK e guia de integração do Enhanced Edition 2.0.

  • Business endpoints:

    • Enviar tarefa de moderação: VoiceModeration

    • Consultar resultado da moderação: VoiceModerationResult

  • Billing information:

    Esta API é faturável. As cobranças aplicam-se apenas a solicitações que retornam um código de status HTTP 200. Solicitações que retornam outros códigos de erro não são faturadas.

Envie uma tarefa de moderação

Parâmetros de solicitação

Nome

Tipo

Obrigatório

Exemplo

Descrição

Service

String

Sim

audio_multilingual_global

O tipo de serviço de moderação. Valores válidos:

  • audio_multilingual_global: moderação de mídia de áudio e vídeo multilíngue

  • stream_multilingual_global: moderação de streaming ao vivo multilíngue para entretenimento social

ServiceParameters

JSONString

Sim

Uma string formatada em JSON contendo parâmetros exigidos pelo serviço de moderação. Para descrições de cada parâmetro, consulte ServiceParameters.

Tabela 1. ServiceParameters

Nome

Tipo

Obrigatório

Exemplo

Descrição

url

String

Sim

http://aliyundoc.com/test.flv

A URL do objeto a ser moderado: uma URL HTTP ou HTTPS pública.

callback

String

Não

http://aliyundoc.com

A URL de callback para a qual o Content Moderation envia o resultado da moderação. Suporta HTTP e HTTPS. Se não for especificada, você deve consultar os resultados periodicamente.

Seu endpoint de callback deve suportar o método POST, dados codificados em UTF-8 e os parâmetros de formulário checksum e content.

O Content Moderation define checksum e content da seguinte forma ao chamar seu endpoint de callback:

  • checksum: Uma string gerada aplicando o algoritmo SHA256 à concatenação de user UID + seed + content. O UID do usuário é o ID da sua conta Alibaba Cloud, disponível no Alibaba Cloud Management Console. Para evitar adulteração, verifique o checksum recebido regenerando-o com o mesmo algoritmo.

    Nota

    O UID do usuário deve ser o UID da sua conta Alibaba Cloud, não o UID de um usuário RAM.

  • content: Uma string formatada em JSON. Analise-a como um objeto JSON. Para um exemplo da estrutura de content, consulte o exemplo de resposta em "Consultar resultados da moderação".

Nota

Se o seu servidor retornar um código de status HTTP 200 ao receber o callback, o Content Moderation considera a entrega bem-sucedida. Qualquer outro código de status é tratado como falha. Em caso de falha, o Content Moderation tenta novamente até 16 vezes. Se todas as tentativas falharem, nenhuma outra tentativa será feita. Verifique o status do seu endpoint de callback se isso ocorrer.

Seed

String

Não

abc****

Uma string aleatória para assinar solicitações de callback.

Pode conter letras, dígitos e sublinhados (_), até 64 caracteres. Use este valor para verificar se as solicitações de callback se originam do Alibaba Cloud Content Moderation.

Nota

Este campo é obrigatório ao usar uma URL de callback.

cryptType

String

Não

SHA256

O algoritmo de criptografia para o conteúdo do callback. O Content Moderation criptografa user UID + seed + content usando o algoritmo especificado antes de enviá-lo para sua URL de callback. Valores válidos:

  • SHA256 (padrão): Usa o algoritmo SHA256.

  • SM3: Usa o algoritmo padrão nacional chinês HMAC-SM3, retornando uma string hexadecimal em minúsculas. Por exemplo, criptografar "abc" com SM3 retorna "66c7f0f462eeedd9d1f2d46bdc10e4e24167c4875cf2f7a2297da02b8f4ba8e0".

liveId

String

Não

liveId1****

O ID do stream de áudio ao vivo.

Evita tarefas de moderação duplicadas. Se fornecido, o sistema verifica se existe uma tarefa usando UID + service + liveId. Se encontrada, retorna o taskId existente sem iniciar uma nova tarefa.

DataId

String

Não

voice20240307***

O ID de dados associado ao objeto de detecção.

Pode conter letras, dígitos, sublinhados (_), hifens (-) e pontos (.), até 64 caracteres. Use-o para identificar exclusivamente seus dados de negócios.

Parâmetros de resposta

Nome

Tipo

Valor de exemplo

Descrição

Code

Integer

200

O código de erro, que corresponde ao código de status HTTP. Para mais informações, consulte Descrições de códigos.

data

JSONObject

{"taskId": "AAAAA-BBBBB"}

Os dados do resultado da moderação.

Message

String

OK

A mensagem de resposta para a solicitação.

RequestId

String

AAAAAA-BBBB-CCCCC-DDDD-EEEEEEEE****

O ID da solicitação.

Exemplos

Exemplo de solicitação

{
  "service":"audio_multilingual_global",
  "serviceParameters":"{\"cryptType\":\"SHA256\",\"seed\":\"abc***123\",\"callback\":\"https://aliyun.com/callback\",\"url\":\"http://aliyundoc.com/test.flv"}"
}

Exemplo de resposta de sucesso

{
  "code":200,
  "data":{
    "taskId":"AAAAA-BBBBB"
  },
  "message":"SUCCESS",
  "requestId":"AAAAAA-BBBB-CCCCC-DDDD-EEEEEEEE****"
}

Consultar resultados da tarefa

Após a conclusão da moderação, a resposta inclui dados de todos os segmentos de áudio.

Parâmetros de solicitação

Nome

Tipo

Obrigatório

Exemplo

Descrição

Service

String

Sim

audio_multilingual_global

O tipo de serviço de moderação.

ServiceParameters

JSONString

Sim

Uma string formatada em JSON contendo parâmetros exigidos pelo serviço de moderação. Para descrições de cada parâmetro, consulte ServiceParameters.

Tabela 2. ServiceParameters

Nome

Tipo

Obrigatório

Exemplo

Descrição

taskId

String

Sim

AAAAA-BBBBB

O ID da tarefa retornado ao enviar a tarefa.

Parâmetros de resposta

Nome

Tipo

Exemplo

Descrição

Code

Integer

200

O código de erro, que corresponde ao código de status HTTP. Para mais informações, consulte Descrições de códigos.

data

JSONObject

{"url":xxxx,"results":xxx}

Os parâmetros de resposta em formato JSON.

Message

String

OK

A mensagem de resposta para a solicitação.

RequestId

String

AAAAAA-BBBB-CCCCC-DDDD-EEEEEEEE****

O ID da solicitação.

Tabela 3. Data

Nome

Tipo

Exemplo

Descrição

url

String

https://aliyundoc.com

A URL do objeto moderado.

LiveId

String

liveId1****

O ID do stream de áudio ao vivo (opcional).

DataId

String

voice20240307***

O ID de dados do objeto moderado (opcional).

RiskLevel

String

high

O nível geral de risco do áudio, calculado a partir de todos os segmentos. Valores possíveis:

  • high: alto risco

  • medium: risco médio

  • low: baixo risco

  • none: nenhum risco detectado

Nota

Tome medidas imediatas para conteúdo de alto risco. Revise manualmente o conteúdo de risco médio. Para conteúdo de baixo risco, trate-o como "none", a menos que você exija um alto recall.

sliceDetails

JSONArray

Resultados detalhados para cada segmento de áudio. Para detalhes, consulte sliceDetails.

Tabela 4. sliceDetails

Nome

Tipo

Exemplo

Descrição

startTime

Integer

0

O tempo inicial do segmento, em segundos.

endTime

Integer

4065

O tempo final do segmento, em segundos.

startTimestamp

Integer

1678854649720

O timestamp inicial do segmento, em milissegundos.

endTimestamp

Integer

1678854649720

O timestamp final do segmento, em milissegundos.

text

String

nasty

O texto transcrito do segmento de áudio.

url

String

https://aliyundoc.com

Uma URL temporária para o segmento de áudio. Esta URL expira após 30 minutos. Salve o conteúdo prontamente.

labels

String

pullinTraffic

Tags (separe múltiplas tags com vírgulas). Inclui:

  • violence: conteúdo violento ou terrorista

  • contraband: itens proibidos

  • sexuality: conteúdo pornográfico

  • profanity: palavrões ou linguagem abusiva

  • pullinTraffic: conteúdo promocional ou de atração de tráfego

  • regional: conflito regional

  • C_customized: biblioteca definida pelo usuário correspondente

RiskLevel

String

high

O nível de risco do segmento de áudio. Valores possíveis:

  • high: alto risco

  • medium: risco médio

  • low: baixo risco

  • none: nenhum risco detectado

riskWords

String

AAA,BBB,CCC

Palavras de risco detectadas, separadas por vírgulas.

riskTips

String

sexuality_Suggestive

Subtags, separadas por vírgulas.

extend

String

{\"riskTips\":\"sexuality_Suggestive\",\"riskWords\":\"pxxxxy\"}

Campo reservado.

Exemplos

Exemplo de solicitação

{
  "service":"audio_multilingual_global",
  "serviceParameters":"{\"taskId\":\"AAAAA-BBBBB"}"
}

Exemplo de resposta de sucesso

{
    "Code": 200,
    "Data": {
        "DataId": "voice20240307***",
        "LiveId": "liveId1****",
        "RiskLevel": "high",
        "SliceDetails": [
            {
                "EndTime": 4065,
                "Labels": "political_content,xxxx",
                "RiskLevel": "high",
                "RiskTips": "contraband_prohibited_items",
                "RiskWords": "risk word A",
                "StartTime": 0,
                "Text": "Content Moderation product test case",
                "Url": "https://aliyundoc.com"
            }
        ]
    },
    "Message": "OK",
    "RequestId": "AAAAAA-BBBB-CCCCC-DDDD-EEEEEEEE****"
}

Formato da mensagem de callback

As mensagens de callback são enviadas como dados de formulário formatados em JSON:

Nome do Campo

Tipo

Descrição

checksum

String

Uma string de checksum gerada aplicando o algoritmo SHA256 à concatenação de user UID + seed + content.

O UID do usuário é o ID da sua conta Alibaba Cloud, disponível no Alibaba Cloud Management Console. Para evitar adulteração, verifique o checksum recebido regenerando-o com o mesmo algoritmo.

Nota

O UID do usuário deve ser o UID da sua conta Alibaba Cloud, não o UID de um usuário RAM.

taskId

String

O ID da tarefa da mensagem de callback.

content

String

O resultado da moderação serializado como uma string JSON. Analise-o como um objeto JSON. A estrutura corresponde à resposta de "Consultar resultados da tarefa". Para detalhes, consulte Parâmetros de resposta.

Descrições de códigos

A tabela a seguir descreve os códigos retornados pela API. Apenas solicitações com código 200 são faturadas.

Código

Descrição

200

Solicitação bem-sucedida.

280

Moderação em andamento.

400

Parâmetros de solicitação vazios.

401

Parâmetros de solicitação inválidos.

402

O comprimento do parâmetro de solicitação excede o limite permitido. Verifique e corrija.

403

A solicitação excede o limite de QPS. Verifique e ajuste suas configurações de QPS.

404

Falha no download do arquivo. Verifique o arquivo ou tente novamente.

405

Tempo limite de download do arquivo excedido, possivelmente porque o arquivo está inacessível. Verifique e tente novamente.

406

O tamanho do arquivo excede o limite permitido. Verifique e tente novamente.

407

Formato de arquivo não suportado. Verifique e tente novamente.

408

A conta não tem permissão para chamar esta API. Isso pode ocorrer porque o serviço não está ativado, a conta tem um pagamento atrasado ou a conta chamadora não está autorizada.

480

Limite de streams simultâneas excedido. Verifique e ajuste a concorrência.

500

Erro do sistema.