Os fluxos de trabalho inteligentes permitem criar pipelines de processamento de mídia modulares e personalizáveis. Este tópico apresenta exemplos de configuração para tradução de transmissões ao vivo e reconhecimento de legendas em RTC.
Cenário 1: Tradução de transmissão ao vivo
Um fluxo de trabalho inteligente executa reconhecimento de fala em uma transmissão ao vivo, gera traduções em tempo real e envia os resultados intermediários e finais de cada frase ao servidor HTTP por meio de callback.
Configuração geral da topologia

A topologia inclui seis nós: Start, Automatic Speech Recognition (ASR), Large Language Model (LLM), Code Execution, HTTP Request e End.
As configurações dos nós são as seguintes:
Nó Start

Ao iniciar o fluxo de trabalho, passe os seguintes parâmetros de entrada ao nó Start:
{
"live_url": {
"Url": "rtmp://test.com/test_app/test_stream?auth_key=test",
"MaxIdleTime": 20
},
"source_language_id": "es"
}
|
Parâmetro |
Obrigatório |
Descrição |
|
live_url |
Sim |
Passe como um Object com os seguintes campos:
|
|
source_language_id |
Sim |
Idioma de origem. Selecione um valor na lista a seguir. |
Mandarin Chinese: zh
English: en
Spanish: es
Japanese: ja
Korean: ko
French: fr
Thai: th
Russian: ru
German: de
Guangxi dialect: guangxi
Portuguese: pt
Cantonese: yue
Traditional Cantonese: yue_hant
Minnan: minnan
Polish: pl
Italian: it
Ukrainian: uk
Dutch: nl
Arabic: ar
Indonesian: id
Turkish: tr
Vietnamese: vi
Nó ASR

Defina a variável de entrada como o parâmetro live_url do nó Start e o idioma de entrada como o parâmetro source_language_id do mesmo nó. Mantenha os demais parâmetros com os valores padrão ou configure-os conforme necessário.
Nó LLM

Este exemplo configura o modelo qwen-mt-turbo pelo método Custom Model Integration (OpenAI-compliant). Para obter mais informações sobre como adquirir uma chave de API, consulte Obter uma chave de API. Nos parâmetros do modelo, defina o idioma de origem (que pode ser auto) e o idioma de destino. O prompt do usuário pode referenciar diretamente os resultados intermediários ou finais do nó ASR.
Nó Code Execution

Para mesclar os resultados de tradução do ASR e do LLM destinados ao callback, use um script Python no nó Code Execution. Defina a saída do LLM no campo TransText do resultado do ASR e retorne um JSONObject como dados de callback.
Nó HTTP Request

Configure os seguintes ajustes:
Configuração da API: endereço público do servidor de callback.
Parâmetros de URL: result_type=mid_en. É possível personalizar o tipo de callback.
Tipo de corpo da requisição: json.
Dados do corpo da requisição: referencie a saída JSON dos dados de callback.
Cenário 2: Reconhecimento de legendas em RTC
Um fluxo de trabalho inteligente executa ASR em um fluxo de áudio específico dentro de um canal de Comunicação em Tempo Real (RTC). Os resultados do reconhecimento são enviados ao cliente por meio de callback DataChannel para exibir as legendas.
Configuração geral da topologia

A topologia inclui quatro nós: Start, ASR, RTC Ingest e End.
As configurações dos nós são as seguintes:
Nó Start

Descrições das variáveis:
rtc: ao iniciar o fluxo de trabalho, passe os parâmetros do RTC, incluindo AppId, ChannelId e UserId. Também selecione o fluxo de áudio de saída.
source_language_id: idioma de origem para o reconhecimento.
push_app_id: AppId do RTC para o callback DataChannel.
push_channel_id: ChannelId do RTC para o callback DataChannel.
push_uid: UserId do RTC para o callback DataChannel.
Exemplo de variável:
{
"rtc": {
"AppId": "xxx",
"ChannelId": "rtcaitest1",
"UserId": "userA"
},
"source_language_id": "zh",
"push_app_id": "app_id",
"push_channel_id": "channel_id",
"push_uid": "user_id"
}
Nó ASR

Defina a variável de entrada como o áudio proveniente da entrada de transmissão ao vivo do nó Start e o idioma de entrada como o parâmetro source_language_id do mesmo nó. Mantenha os demais parâmetros com os valores padrão ou personalize-os conforme necessário.
Nó RTC Ingest

A variável de entrada text deve referenciar o texto de saída do nó ASR. O App ID, o channel ID e o user ID correspondem aos campos push_app_id, push_channel_id e push_uid do nó Start, representando as informações de função para a ingestão de fluxo via DataChannel.