すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:画像から歌唱・演技動画を生成 – EMO

最終更新日:May 19, 2026

EMO は、1 枚のポートレート画像と人間の音声ファイルから動的ポートレート動画を生成します。EMO は、EMO-detect と EMO の 2 つのモデルで構成されます。EMO-detect は入力画像の要件を検証し、EMO は動画を生成します。

重要

このドキュメントは、中国本土 (北京) リージョンにのみ適用されます。モデルを使用するには、中国本土 (北京) リージョンの API キー を使用する必要があります。

モデル概要

モデルについて

  • EMO-detect は、入力画像が EMO のポートレート要件を満たしているかどうかを検証する画像検出モデルです。

  • EMO は、1 枚のポートレート画像と人間の音声ファイルから動的ポートレート動画を生成するポートレート動画生成モデルです。

出力例

入力:ポートレート画像 + 音声ファイル

出力:動的ポートレート動画

ポートレート:

Sample audio: Spring Mountain song

音声:右の動画をご参照ください

動画:

スタイルの強度:アクティブ ("style_level": "active")

ポートレート:

Sample 15 - Original image

音声:右の動画をご参照ください

動画:

スタイルの強度:ノーマル ("style_level": "normal")

ポートレート:

娃哈哈

音声:右の動画をご参照ください

動画:

スタイルの強度:カーム ("style_level": "calm")

説明

上記の例は、EMO を統合した Qwen アプリが生成しました。

料金とレート制限

モード

モデル名

単価

ジョブ送信の QPS 制限

最大同時タスク数

モデルの呼び出し

emo-detect-v1

従量課金:

0.000574 USD/画像

5

同期呼び出しの制限なし

emo-v1

従量課金:

  • アスペクト比 1:1 の動画:0.011469 USD/秒

  • アスペクト比 3:4 の動画:0.022937 USD/秒

1

一度に 1 つのタスクのみが実行されます。他のタスクはキューで待機します。

前提条件

サービスを有効化し、API キーを取得してください:API キーと API ホストの取得

モデルの呼び出し

  • モデルを呼び出すには (従量課金):

    1. EMO-detect を呼び出して、入力画像が要件を満たしていることを確認します。詳細については、「EMO 画像検出」をご参照ください。

    2. 元の画像、EMO-detect からの領域パラメータ、およびクリアな人間の音声ファイルを使用して EMO を呼び出し、動画を生成します。詳細については、「EMO 動画生成」をご参照ください。