Todos os produtos
Search
Central de documentação

SuperApp:Guia de Configuração de Nós

Última atualização: Jun 29, 2026

Configure fluxos de trabalho de processamento de vídeo com IA ao compor nós que executam detecção facial, transcrição de fala, amostragem de quadros e extração de texto.

Um fluxo de trabalho de IA encadeia vários nós em um pipeline de processamento de ponta a ponta. Cada nó realiza uma tarefa específica de IA — detecção facial, transcrição de fala, amostragem de quadros ou extração de texto. Combine-os para atender ao seu caso de uso.

Fluxos de trabalho de IA

Os fluxos de trabalho de IA dividem-se em dois tipos: fluxos de trabalho predefinidos e fluxos de trabalho personalizados.

Fluxos de trabalho predefinidos

Há três fluxos de trabalho predefinidos disponíveis. Cada um agrupa um conjunto fixo de nós otimizados para um cenário comum:

  1. Face Extraction + Video Summary (OTT)

  2. Frame Extraction & Analysis (Custom)

  3. Speech Extraction + ASR + Text Content Extraction + Frame Extraction & Analysis (Custom)

1. Face Extraction + Video Summary (OTT)

  • Fluxo de trabalho:image

  • Caso de uso: Extraia informações faciais do vídeo e gere um resumo conciso. Ideal para conteúdo Over-The-Top (OTT), como compilações de celebridades ou coletâneas de âncoras de telejornal.

  • Vantagem: Combina detecção facial e sumarização de conteúdo em uma única execução, o que reduz o esforço de filtragem manual.

2. Frame Extraction & Analysis (Custom)

  • Fluxo de trabalho:image

  • Caso de uso: Análise de vídeo quadro a quadro — detecção de quadros de anúncios, moderação de conteúdo visual ou extração de quadros-chave.

  • Vantagem: Foca na inspeção de conteúdo no nível do quadro, adequada para análise visual de alta precisão.

3. Speech Extraction + ASR + Text Content Extraction + Frame Extraction & Analysis (Custom)

  • Fluxo de trabalho:image

  • Caso de uso: Pipeline de ponta a ponta que combina transcrição de áudio, extração de texto e análise de quadros. Adequado para moderação de conteúdo em replays de transmissões ao vivo ou análise multidimensional de vídeos longos.

  • Vantagem: Abrange todo o pipeline de áudio → texto → visual em um único fluxo de trabalho, eliminando a necessidade de coordenar várias ferramentas.

Fluxos de trabalho personalizados

Com fluxos de trabalho personalizados, é possível combinar qualquer um dos cinco nós de processamento de IA disponíveis para atender ao seu caso de uso específico:

  • Face Recognition

  • Speech Extraction + ASR

  • Text Content Extraction

  • Video Summary (OTT)

  • Frame Extraction & Analysis (Custom)

Para conhecer as capacidades de cada nó, consulte:Descrição das Capacidades dos Nós

Nota
  • Use Speech Extraction + ASR (Reconhecimento Automático de Fala), Text Content Extraction e Frame Extraction & Analysis (Custom) em conjunto quando seu fluxo de trabalho exigir análise de texto proveniente da fala.

  • O nó Speech Extraction + ASR gera a transcrição necessária como entrada para o Text Content Extraction. Executar o Text Content Extraction sem um nó Speech Extraction + ASR anterior causará falha na tarefa.

Combinações recomendadas de fluxos de trabalho

Use a tabela a seguir para selecione uma combinação com base no seu cenário. Para obter detalhes sobre cada combinação, consulte as seções abaixo.

Cenário

Padrão

Mais indicado para

Compensação

1. Análise profunda sequencial de cadeia completa

Sequencial

Estruturação profunda passo a passo, em que cada etapa alimenta a seguinte

Maior latência de ponta a ponta; falhas nas etapas iniciais bloqueiam as posteriores

2. Processamento audiovisual sequencial

Sequencial

Análise semântica sem identificação de pessoas (transcrições de reuniões, vlogs)

Sem dados faciais; inadequado quando o rastreamento de identidade é necessário

3. Processamento paralelo de áudio e vídeo

Paralelo

Maioria dos cenários de ingestão de mídia — identificar quem aparece e o que é dito independentemente

Exige resolução de conflitos se for necessário mesclar os resultados de ambas as ramificações

4. Identificação paralela de pessoas e análise de quadros

Paralelo

Captura de identidade urgente junto com amostragem de quadros e análise de fala

Maior uso de recursos devido à execução simultânea

5. Análise multimodal orientada por quadros

Visual primeiro + fala opcional

Mineração de conteúdo visual — quadros de anúncios, extração de slides de PPT — com áudio opcional

Não otimizado para rastreamento de identidade

6. Processamento complexo com dependência cruzada entre modalidades

Sequencial com junções cruzadas entre modalidades

Fusão avançada — recuperar clipes em que uma pessoa específica aparece e diz uma palavra-chave

Configuração mais complexa; maior custo computacional

Cenário 1: Análise profunda sequencial de cadeia completa

  • Fluxo de trabalho:image

  • Caso de uso: Estruturação profunda de conteúdo de vídeo em que a saída de cada etapa alimenta a seguinte — análise visual, transcrição de áudio e análise semântica em sequência.

  • Vantagem: Pipeline linear e transparente, fácil de depurar. Oferece uma análise abrangente nas dimensões visual, de áudio e semântica em uma única tarefa.

Cenário 2: Processamento audiovisual sequencial

  • Fluxo de trabalho:image

  • Caso de uso: Análise focada em semântica sem identificação de pessoas — transcrições de reuniões, análise de conteúdo de vlogs — preservando quadros-chave e fala transcrita.

  • Vantagem: Processamento mais rápido com menor custo computacional. Adequado para arquivamento visual combinado com semântica de fala.

Cenário 3: Processamento paralelo de áudio e vídeo

  • Fluxo de trabalho:image

  • Caso de uso: Cenário mais comum de ingestão de mídia — identificar quem aparece no vídeo e o que é dito, com os dois fluxos processados independentemente (fan-out/fan-in).

  • Vantagem: Execução paralela de alta eficiência. Uma falha em uma ramificação (como reconhecimento facial) não bloqueia os resultados da outra (como extração de texto).

Cenário 4: Identificação paralela de pessoas e análise de quadros

  • Fluxo de trabalho:image

  • Caso de uso: Capture informações de identidade rapidamente enquanto executa simultaneamente amostragem de quadros e análise de fala.

  • Vantagem: Desacopla a identificação de pessoas da análise de conteúdo. Mais adequado para operações urgentes, em que a latência é crítica.

Cenário 5: Análise multimodal orientada por quadros

  • Fluxo de trabalho:image

  • Caso de uso: Mineração de conteúdo visual — extração de texto de quadros de anúncios ou reconhecimento de slides de PPT — com transcrição de fala opcional.

  • Vantagem: Maximiza a utilização de dados visuais. Ideal para conteúdo com foco visual, como tutoriais ou anúncios publicitários.

Cenário 6: Processamento complexo com dependência cruzada entre modalidades

  • Fluxo de trabalho:image

  • Caso de uso: Fusão multimodal avançada que exige condições conjuntas — por exemplo, recuperar clipes em que uma pessoa específica aparece e diz uma palavra-chave específica.

  • Vantagem: Captura o conjunto mais rico de correlações cruzadas entre modalidades, permitindo consultas semânticas e contextuais sofisticadas com base na identidade da pessoa, na fala e no conteúdo visual simultaneamente.