Configure fluxos de trabalho de processamento de vídeo com IA ao compor nós que executam detecção facial, transcrição de fala, amostragem de quadros e extração de texto.
Um fluxo de trabalho de IA encadeia vários nós em um pipeline de processamento de ponta a ponta. Cada nó realiza uma tarefa específica de IA — detecção facial, transcrição de fala, amostragem de quadros ou extração de texto. Combine-os para atender ao seu caso de uso.
Fluxos de trabalho de IA
Os fluxos de trabalho de IA dividem-se em dois tipos: fluxos de trabalho predefinidos e fluxos de trabalho personalizados.
Fluxos de trabalho predefinidos
Há três fluxos de trabalho predefinidos disponíveis. Cada um agrupa um conjunto fixo de nós otimizados para um cenário comum:
Face Extraction + Video Summary (OTT)
Frame Extraction & Analysis (Custom)
Speech Extraction + ASR + Text Content Extraction + Frame Extraction & Analysis (Custom)
1. Face Extraction + Video Summary (OTT)
Fluxo de trabalho:

Caso de uso: Extraia informações faciais do vídeo e gere um resumo conciso. Ideal para conteúdo Over-The-Top (OTT), como compilações de celebridades ou coletâneas de âncoras de telejornal.
Vantagem: Combina detecção facial e sumarização de conteúdo em uma única execução, o que reduz o esforço de filtragem manual.
2. Frame Extraction & Analysis (Custom)
Fluxo de trabalho:

Caso de uso: Análise de vídeo quadro a quadro — detecção de quadros de anúncios, moderação de conteúdo visual ou extração de quadros-chave.
Vantagem: Foca na inspeção de conteúdo no nível do quadro, adequada para análise visual de alta precisão.
3. Speech Extraction + ASR + Text Content Extraction + Frame Extraction & Analysis (Custom)
Fluxo de trabalho:

Caso de uso: Pipeline de ponta a ponta que combina transcrição de áudio, extração de texto e análise de quadros. Adequado para moderação de conteúdo em replays de transmissões ao vivo ou análise multidimensional de vídeos longos.
Vantagem: Abrange todo o pipeline de áudio → texto → visual em um único fluxo de trabalho, eliminando a necessidade de coordenar várias ferramentas.
Fluxos de trabalho personalizados
Com fluxos de trabalho personalizados, é possível combinar qualquer um dos cinco nós de processamento de IA disponíveis para atender ao seu caso de uso específico:
Face Recognition
Speech Extraction + ASR
Text Content Extraction
Video Summary (OTT)
Frame Extraction & Analysis (Custom)
Para conhecer as capacidades de cada nó, consulte:Descrição das Capacidades dos Nós
Use Speech Extraction + ASR (Reconhecimento Automático de Fala), Text Content Extraction e Frame Extraction & Analysis (Custom) em conjunto quando seu fluxo de trabalho exigir análise de texto proveniente da fala.
O nó Speech Extraction + ASR gera a transcrição necessária como entrada para o Text Content Extraction. Executar o Text Content Extraction sem um nó Speech Extraction + ASR anterior causará falha na tarefa.
Combinações recomendadas de fluxos de trabalho
Use a tabela a seguir para selecione uma combinação com base no seu cenário. Para obter detalhes sobre cada combinação, consulte as seções abaixo.
|
Cenário |
Padrão |
Mais indicado para |
Compensação |
|
1. Análise profunda sequencial de cadeia completa |
Sequencial |
Estruturação profunda passo a passo, em que cada etapa alimenta a seguinte |
Maior latência de ponta a ponta; falhas nas etapas iniciais bloqueiam as posteriores |
|
2. Processamento audiovisual sequencial |
Sequencial |
Análise semântica sem identificação de pessoas (transcrições de reuniões, vlogs) |
Sem dados faciais; inadequado quando o rastreamento de identidade é necessário |
|
3. Processamento paralelo de áudio e vídeo |
Paralelo |
Maioria dos cenários de ingestão de mídia — identificar quem aparece e o que é dito independentemente |
Exige resolução de conflitos se for necessário mesclar os resultados de ambas as ramificações |
|
4. Identificação paralela de pessoas e análise de quadros |
Paralelo |
Captura de identidade urgente junto com amostragem de quadros e análise de fala |
Maior uso de recursos devido à execução simultânea |
|
5. Análise multimodal orientada por quadros |
Visual primeiro + fala opcional |
Mineração de conteúdo visual — quadros de anúncios, extração de slides de PPT — com áudio opcional |
Não otimizado para rastreamento de identidade |
|
6. Processamento complexo com dependência cruzada entre modalidades |
Sequencial com junções cruzadas entre modalidades |
Fusão avançada — recuperar clipes em que uma pessoa específica aparece e diz uma palavra-chave |
Configuração mais complexa; maior custo computacional |
Cenário 1: Análise profunda sequencial de cadeia completa
Fluxo de trabalho:

Caso de uso: Estruturação profunda de conteúdo de vídeo em que a saída de cada etapa alimenta a seguinte — análise visual, transcrição de áudio e análise semântica em sequência.
Vantagem: Pipeline linear e transparente, fácil de depurar. Oferece uma análise abrangente nas dimensões visual, de áudio e semântica em uma única tarefa.
Cenário 2: Processamento audiovisual sequencial
Fluxo de trabalho:

Caso de uso: Análise focada em semântica sem identificação de pessoas — transcrições de reuniões, análise de conteúdo de vlogs — preservando quadros-chave e fala transcrita.
Vantagem: Processamento mais rápido com menor custo computacional. Adequado para arquivamento visual combinado com semântica de fala.
Cenário 3: Processamento paralelo de áudio e vídeo
Fluxo de trabalho:

Caso de uso: Cenário mais comum de ingestão de mídia — identificar quem aparece no vídeo e o que é dito, com os dois fluxos processados independentemente (fan-out/fan-in).
Vantagem: Execução paralela de alta eficiência. Uma falha em uma ramificação (como reconhecimento facial) não bloqueia os resultados da outra (como extração de texto).
Cenário 4: Identificação paralela de pessoas e análise de quadros
Fluxo de trabalho:

Caso de uso: Capture informações de identidade rapidamente enquanto executa simultaneamente amostragem de quadros e análise de fala.
Vantagem: Desacopla a identificação de pessoas da análise de conteúdo. Mais adequado para operações urgentes, em que a latência é crítica.
Cenário 5: Análise multimodal orientada por quadros
Fluxo de trabalho:

Caso de uso: Mineração de conteúdo visual — extração de texto de quadros de anúncios ou reconhecimento de slides de PPT — com transcrição de fala opcional.
Vantagem: Maximiza a utilização de dados visuais. Ideal para conteúdo com foco visual, como tutoriais ou anúncios publicitários.
Cenário 6: Processamento complexo com dependência cruzada entre modalidades
Fluxo de trabalho:

Caso de uso: Fusão multimodal avançada que exige condições conjuntas — por exemplo, recuperar clipes em que uma pessoa específica aparece e diz uma palavra-chave específica.
Vantagem: Captura o conjunto mais rico de correlações cruzadas entre modalidades, permitindo consultas semânticas e contextuais sofisticadas com base na identidade da pessoa, na fala e no conteúdo visual simultaneamente.