Todos os produtos
Search
Central de documentação

Alibaba Cloud Model Studio:Vídeo de Canto e Atuação a Partir de Imagem – EMO

Última atualização: Jun 29, 2026

O EMO gera vídeos dinâmicos de retratos a partir de uma imagem de retrato e um arquivo de áudio com fala humana. Ele é composto por dois modelos: o EMO-detect verifique se a imagem de entrada atende aos requisitos, e o EMO gera o vídeo.

Importante

Este documento aplica-se apenas à região China Continental (Beijing). Para utilizar o modelo, é necessário usar a chave de API da região China Continental (Beijing).

Visão geral do modelo

Sobre os modelos

  • O EMO-detect é um modelo de detecção de imagens que verifique se as imagens de entrada atendem aos requisitos de retrato do EMO.

  • O EMO é um modelo de geração de vídeos de retratos que cria vídeos dinâmicos a partir de uma imagem de retrato e um arquivo de áudio com fala humana.

Exemplos de saída

Entrada: imagem de retrato + arquivo de áudio

Saída: vídeo dinâmico de retrato

Retrato:

Sample audio: Spring Mountain song

Áudio: Consulte o vídeo à direita

Vídeo:

Intensidade do estilo: Ativo ("style_level": "active")

Retrato:

Sample 15 - Original image

Áudio: Consulte o vídeo à direita

Vídeo:

Intensidade do estilo: Normal ("style_level": "normal")

Retrato:

Wahaha

Áudio: Consulte o vídeo à direita

Vídeo:

Intensidade do estilo: Calmo ("style_level": "calm")

Nota

Os exemplos acima foram gerados pelo aplicativo Qwen, que integra o EMO.

Preços e limites de taxa

Modo

Nome do modelo

Preço unitário

Limite de QPS para envio de tarefas

Máximo de tarefas simultâneas

Chamada de modelo

emo-detect-v1

Pagamento conforme o uso:

USD 0,000574 por imagem

5

Sem limite para chamadas síncronas

emo-v1

Pagamento conforme o uso:

  • Vídeo com proporção 1:1: USD 0,011469 por segundo

  • Vídeo com proporção 3:4: USD 0,022937 por segundo

1

Apenas uma tarefa é executada por vez. As demais aguardam na fila.

Pré-requisitos

Ative o serviço e obtenha sua chave de API: Obter sua chave de API e host de API.

Chamar os modelos

  • Para chamar os modelos (pagamento conforme o uso):

    1. Chame o EMO-detect para verifique se sua imagem de entrada atende aos requisitos. Consulte Detecção de imagem EMO para obter detalhes.

    2. Chame o EMO com a imagem original, os parâmetros de região do EMO-detect e um arquivo de áudio com fala humana clara para gerar o vídeo. Consulte Geração de vídeo EMO para obter detalhes.