O EMO gera vídeos dinâmicos de retratos a partir de uma imagem de retrato e um arquivo de áudio com fala humana. Ele é composto por dois modelos: o EMO-detect verifique se a imagem de entrada atende aos requisitos, e o EMO gera o vídeo.
ImportanteEste documento aplica-se apenas à região China Continental (Beijing). Para utilizar o modelo, é necessário usar a chave de API da região China Continental (Beijing).
Visão geral do modelo
Sobre os modelos
- O EMO-detect é um modelo de detecção de imagens que verifique se as imagens de entrada atendem aos requisitos de retrato do EMO.
- O EMO é um modelo de geração de vídeos de retratos que cria vídeos dinâmicos a partir de uma imagem de retrato e um arquivo de áudio com fala humana.
Exemplos de saída
| Entrada: imagem de retrato + arquivo de áudio | Saída: vídeo dinâmico de retrato |
|---|---|
Retrato: ![]() Áudio: Consulte o vídeo à direita | Vídeo: Intensidade do estilo: Ativo ("style_level": "active") |
Retrato: ![]() Áudio: Consulte o vídeo à direita | Vídeo: Intensidade do estilo: Normal ("style_level": "normal") |
Retrato: ![]() Áudio: Consulte o vídeo à direita | Vídeo: Intensidade do estilo: Calmo ("style_level": "calm") |
ObservaçãoOs exemplos acima foram gerados pelo aplicativo Qwen, que integra o EMO.
Preços e limites de taxa
Modo | Nome do modelo | Preço unitário | Limite de QPS para envio de tarefas | Máximo de tarefas simultâneas |
|---|---|---|---|---|
Chamada de modelo | emo-detect-v1 | Pagamento conforme o uso: USD 0,000574 por imagem | 5 | Sem limite para chamadas síncronas |
emo-v1 | Pagamento conforme o uso:
| 1 Apenas uma tarefa é executada por vez. As demais aguardam na fila. |
Pré-requisitos
Ative o serviço e obtenha sua chave de API: Obter sua chave de API e host de API.
Chamar os modelos
-
Para chamar os modelos (pagamento conforme o uso):
- Chame o EMO-detect para verifique se sua imagem de entrada atende aos requisitos. Consulte Detecção de imagem EMO para obter detalhes.
- Chame o EMO com a imagem original, os parâmetros de região do EMO-detect e um arquivo de áudio com fala humana clara para gerar o vídeo. Consulte Geração de vídeo EMO para obter detalhes.


