すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:Wan - ビデオ編集 (2.1)

最終更新日:Sep 02, 2026

Wan 2.1 統合ビデオ編集モデルは、テキスト、画像、ビデオなどの複数の入力モダリティをサポートし、幅広いビデオ生成および編集タスクに対応します。

関連ドキュメント:ユーザーガイド

適用範囲

呼び出しを成功させるには、モデル、エンドポイント URL、API キーが同じリージョンにある必要があります。リージョンをまたいだ呼び出しは失敗します。

  • モデルの選択:モデルのリージョンを確認します。
  • URL の選択:モデルのリージョンに対応するエンドポイント URL を選択します。HTTP URL がサポートされています。
  • API キーの設定:リージョンを選択し、API キーを取得し、環境変数に設定します。

注記このトピックのサンプルコードは、シンガポールリージョン向けです。

重要Alibaba Cloud Model Studio は、中国 (北京) およびシンガポールリージョン向けにワークスペース固有のドメインをリリースしました。新しい専用ドメインは、推論リクエストに対して優れたパフォーマンスと高い安定性を提供します。新しいドメインへの移行を推奨します:

  • 中国 (北京):https://dashscope.aliyuncs.com から https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com
  • シンガポール:https://dashscope-intl.aliyuncs.com から https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com

{WorkspaceId} はワークスペース ID であり、Alibaba Cloud Model Studio コンソールの [ワークスペース詳細] ページで確認できます。既存のドメインも引き続き完全に機能します。

HTTP 呼び出し

統合ビデオ編集モデルの処理には 5〜10 分かかるため、API は非同期プロセスを使用します。これには、「タスクの作成 -> 結果のポーリング」という 2 つのコアステップが含まれます。

ステップ 1:タスクの作成

シンガポール

POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis

{WorkspaceId} を実際のワークスペース ID に置き換えてください。

北京

POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis

{WorkspaceId} を実際のワークスペース ID に置き換えてください。

リクエストパラメーター

リクエストヘッダー

Content-Type string (必須)

リクエストのコンテンツタイプ。 application/json である必要があります。

Authorization string (必須)

Model Studio API キーでリクエストを認証します。例:Bearer sk-xxxx。

X-DashScope-Async string (必須)

非同期処理を有効にします。HTTP リクエストは非同期呼び出しのみをサポートします。enable に設定する必要があります。

重要このリクエストヘッダーがない場合、「current user api does not support synchronous calls」というエラーが返されます。

リクエストボディ

複数画像参照

model string (必須)

モデル名。例:wan2.1-vace-plus。

input object (必須)

プロンプトなどの基本入力。

プロパティ

promptstring(必須)

生成されるビデオに含める要素や視覚的特徴を記述します。

中国語と英語の両方をサポートします。最大長は 800 文字で、各漢字または英字は 1 文字としてカウントされます。この制限を超えたテキストは自動的に切り捨てられます。

プロンプトのテクニックについては、「テキストからビデオ/画像からビデオへのプロンプトガイド」をご参照ください。

functionstring(必須)

機能名。複数画像参照は image_reference に設定されます。

複数画像参照機能は、最大 3 つの参照画像をサポートします。画像には、人物、動物、衣服、風景などのエンティティや背景を含めることができます。prompt を使用して目的のビデオコンテンツを記述すると、モデルは複数の画像を組み合わせて一貫性のあるビデオコンテンツを生成できます。

ref_images_urlarray[string] (必須)

参照画像の URL の配列。

  1. パブリック URL:

1〜3 枚の参照画像を提供できます。3 枚を超えて提供した場合、最初の 3 枚のみが使用されます。

画像要件:

  • フォーマット:JPG、JPEG、PNG、BMP、TIFF、または WEBP。
  • 解像度:幅と高さは [360, 2000] ピクセルの範囲内である必要があります。
  • サイズ:最大 10 MB。
  • URL には中国語文字を含めることはできません。

推奨事項:

  • エンティティに参照画像を使用する場合、各画像には 1 つのエンティティのみを含めることを推奨します。背景は、エンティティをより際立たせるために単色 (例:白) にすることを推奨します。
  • 参照画像から背景を使用する場合、最大で 1 枚の背景画像を提供でき、その画像にはエンティティオブジェクトを含めることはできません。

parameters object (任意)

ウォーターマーク設定など、ビデオ処理用のパラメーター。

プロパティ

obj_or_bg array[string] (任意)

このパラメーターは、各参照画像の目的を識別するために使用され、ref_images_url パラメーターと 1 対 1 で対応します。配列の各要素は、対応する位置の画像が「主題」か「背景」かを指定します:

  • obj:画像が参照エンティティであることを示します。
  • bg:画像を背景参照として指定します (最大 1 つまで許可)。

使用上の注意:

  • このパラメーターを渡すことを推奨します。その長さは ref_images_url と同じでなければならず、そうでなければエラーが報告されます。
  • このパラメーターは省略可能で、ref_images_url が単一要素の配列である場合にのみ、デフォルトで ["obj"] になります。

例:["obj", "obj", "bg"]。

size string (任意)

生成されるビデオの解像度 (幅*高さ)。モデルは 720p ビデオの生成をサポートします。有効な値:

  • 1280*720 (デフォルト):ビデオのアスペクト比は 16:9 で、1280 が幅、720 が高さです。
  • 720*1280:ビデオのアスペクト比は 9:16 です。
  • 960*960:ビデオのアスペクト比は 1:1 です。
  • 832*1088:ビデオのアスペクト比は 3:4 です。
  • 1088*832:ビデオのアスペクト比は 4:3 です。

duration integer (任意)

生成されるビデオの長さ (秒単位)。この値は 5 に固定されています。

prompt_extendbool (任意)

プロンプトリライトを有効にするかどうかを指定します。有効にすると、大規模言語モデル (LLM) が入力プロンプトを書き換えます。これにより、短いプロンプトの結果が大幅に向上する可能性がありますが、処理時間が増加します。

  • true (デフォルト):プロンプトリライトを有効にします。
  • false:プロンプトリライトを無効にします。

seedinteger(任意)

乱数シードは、モデルによって生成されるコンテンツのランダム性を制御します。seed パラメーターの値の範囲は [0, 2147483647] です。

シードを指定しない場合、自動的に生成されます。再現可能な結果を得るには、複数のリクエストで同じシード値を使用してください。

watermark bool(任意)

画像の右下隅に「AI 生成」のウォーターマークを追加するかどうかを指定します。

  • false (デフォルト):ウォーターマークを追加しません。
  • true:ウォーターマークを追加します。

ビデオ再描画

model string (必須)

モデル名。例:wan2.1-vace-plus。

input object (必須)

プロンプトなどの基本入力。

プロパティ

promptstring(必須)

生成されるビデオに含める要素や視覚的特徴を記述します。

中国語と英語の両方をサポートします。最大長は 800 文字で、各漢字または英字は 1 文字としてカウントされます。この制限を超えたテキストは自動的に切り捨てられます。

プロンプトのテクニックについては、「テキストからビデオ/画像からビデオへのプロンプトガイド」をご参照ください。

functionstring(必須)

機能名。ビデオ再描画は video_repainting に設定されます。

ビデオ再描画機能は、入力ビデオからエンティティのポーズとアクション、構図、モーション輪郭、線画構造を抽出します。その後、これらをテキストプロンプトと組み合わせて、同じ動的特性を持つ新しいビデオを生成します。この機能は、参照画像を使用して元のビデオのエンティティを置き換えることもサポートしており、例えば、元のアクションを保持したままキャラクターの外見を変更することができます。

video_urlstring (必須)

入力ビデオの URL。

  1. パブリック URL:

ビデオ要件:

  • フォーマット:MP4。
  • フレームレート:16 FPS 以上。
  • サイズ:最大 50 MB。
  • 長さ:最大 5 秒。長いビデオは最初の 5 秒に切り捨てられます。
  • URL には中国語文字を含めることはできません。

出力ビデオの解像度:

  • 入力ビデオの解像度が 720p 以下の場合、出力解像度は入力と同じになります。
  • 入力ビデオの解像度が 720p を超える場合、元のアスペクト比を維持しながら 720p の解像度に収まるようにダウンスケールされます。

出力ビデオの長さ:

  • 出力ビデオの長さは入力ビデオと一致し、最大 5 秒です。
  • 例:入力ビデオが 3 秒の場合、出力も 3 秒です。入力が 6 秒の場合、出力は入力の最初の 5 秒になります。

ref_images_urlarray[string] (任意)

参照画像の URL の配列。

  1. パブリック URL:

1 枚の参照画像のみがサポートされています。この画像は、入力ビデオのエンティティコンテンツを置き換えるためのエンティティ画像として使用することを推奨します。

画像要件:

  • フォーマット:JPG、JPEG、PNG、BMP、TIFF、または WEBP。
  • 解像度:幅と高さは [360, 2000] ピクセルの範囲内である必要があります。
  • サイズ:最大 10 MB。
  • URL には中国語文字を含めることはできません。

推奨事項:

  • エンティティに参照画像を使用する場合、画像には 1 つのエンティティのみを含めることを推奨します。背景は、エンティティをより際立たせるために単色 (例:白) にすることを推奨します。

parameters object (必須)

ウォーターマーク設定など、ビデオ処理用のパラメーター。

プロパティ

control_condition string (必須)

ビデオの特徴抽出方法。

  • posebodyface:入力ビデオからエンティティの表情と体の動きを抽出します。これは、エンティティの表情の詳細を保持する必要があるシナリオに適しています。
  • posebody:入力ビデオからエンティティの体の動きを抽出します (表情は除く)。これは、エンティティの体の動きのみを制御する必要があるシナリオに適しています。
  • depth:入力ビデオの構図とモーション輪郭を抽出します。
  • scribble:入力ビデオから線画構造を抽出します。

strength float (任意)

control_condition で指定されたビデオ特徴抽出方法が生成ビデオに与える制御の強さを調整します。

値は [0.0, 1.0] の範囲内である必要があります。デフォルト値は 1.0 です。

値が大きいほど、生成されるビデオは元のビデオのアクションと構図に忠実になります。値が小さいほど、より創造的な自由度が高まります。

prompt_extendbool (任意)

プロンプトリライトを有効にするかどうかを指定します。有効にすると、大規模言語モデル (LLM) が入力プロンプトを書き換えます。これにより、短いプロンプトの結果が大幅に向上する可能性がありますが、処理時間が増加します。

  • true (デフォルト):プロンプトリライトを有効にします。
  • false:プロンプトリライトを無効にします。(推奨)

テキスト記述がビデオコンテンツと一致しない場合、モデルが入力を誤解する可能性があります。一貫性と精度を向上させるために、インテリジェントな拡張を手動で無効にし、prompt で明確かつ具体的なシーン記述を提供することを推奨します。

seedinteger(任意)

乱数シードは、モデルによって生成されるコンテンツのランダム性を制御します。seed パラメーターの値の範囲は [0, 2147483647] です。

シードを指定しない場合、自動的に生成されます。再現可能な結果を得るには、複数のリクエストで同じシード値を使用してください。

watermark bool(任意)

画像の右下隅に「AI 生成」のウォーターマークを追加するかどうかを指定します。

  • false (デフォルト):ウォーターマークを追加しません。
  • true:ウォーターマークを追加します。

ローカル編集

model string (必須)

モデル名。例:wan2.1-vace-plus。

input object (必須)

プロンプトなどの基本入力。

プロパティ

promptstring(必須)

生成されるビデオに含める要素や視覚的特徴を記述します。

中国語と英語の両方をサポートします。最大長は 800 文字で、各漢字または英字は 1 文字としてカウントされます。この制限を超えたテキストは自動的に切り捨てられます。

プロンプトのテクニックについては、「テキストからビデオ/画像からビデオへのプロンプトガイド」をご参照ください。

functionstring(必須)

機能名:ローカル編集は video_edit に設定されます。

ローカル編集機能を使用すると、入力ビデオの指定された領域内の要素を追加、変更、または削除できます。また、編集領域内のエンティティや背景を置き換えて、詳細なビデオ編集を行うこともできます。

video_urlstring (必須)

入力ビデオの URL。

  1. パブリック URL:

ビデオ要件:

  • フォーマット:MP4。
  • フレームレート:16 FPS 以上。
  • サイズ:最大 50 MB。
  • 長さ:最大 5 秒。長いビデオは最初の 5 秒に切り捨てられます。
  • URL には中国語文字を含めることはできません。

出力ビデオの解像度:

  • 入力ビデオの解像度が 720p 以下の場合、出力解像度は入力と同じになります。
  • 入力ビデオの解像度が 720p を超える場合、元のアスペクト比を維持しながら 720p の解像度に収まるようにダウンスケールされます。

出力ビデオの長さ:

  • 出力ビデオの長さは入力ビデオと一致し、最大 5 秒です。
  • 例:入力ビデオが 3 秒の場合、出力も 3 秒です。入力が 6 秒の場合、出力は入力の最初の 5 秒になります。

ref_images_urlarray[string] (任意)

参照画像の URL の配列。

  1. パブリック URL:

現在、1 枚の参照画像のみがサポートされています。この画像は、入力ビデオの対応するコンテンツを置き換えるためのエンティティまたは背景として使用できます。

画像要件:

  • フォーマット:JPG、JPEG、PNG、BMP、TIFF、または WEBP。
  • 解像度:幅と高さは [360, 2000] ピクセルの範囲内である必要があります。
  • サイズ:最大 10 MB。
  • URL には中国語文字を含めることはできません。

推奨事項:

  • エンティティに参照画像を使用する場合、画像には 1 つのエンティティのみを含めることを推奨します。背景は、エンティティをより際立たせるために単色 (例:白) にすることを推奨します。
  • 参照画像から背景を使用する場合、背景画像にはエンティティオブジェクトを含めることはできません。

mask_image_urlstring (任意)

マスク画像の URL。

  1. パブリック URL:

このパラメーターは、ビデオの編集領域を指定します。このパラメーターまたは mask_video_url パラメーターのいずれかを指定できます。このパラメーターを優先することを推奨します。

マスク画像では、白い領域 (ピクセル値 [255, 255, 255]) が編集対象領域を定義し、黒い領域 (ピクセル値 [0, 0, 0]) が保持対象領域を定義します。

画像要件:

  • フォーマット:JPG、JPEG、PNG、BMP、TIFF、または WEBP。
  • 画像解像度:入力ビデオ (video_url) の解像度と同じである必要があります。
  • サイズ:最大 10 MB。
  • URL には中国語文字を含めることはできません。

mask_frame_idinteger (任意)

このパラメーターは、mask_image_url が空でない場合に有効になり、マスクターゲットが表示されるビデオ内のフレームの ID を指定します。

デフォルト値は 1 で、ビデオの最初のフレームを示します。

値の範囲は [1, max_frame_id] で、max_frame_id = 入力ビデオのフレームレート * 入力ビデオの長さ + 1 です。

例えば、入力ビデオ (video_url) のフレームレートが 16 FPS (1 秒あたりのフレーム数) で、長さが 5 秒の場合、総フレーム数は 16 × 5 + 1 = 81 です。したがって、max_frame_id = 81 となります。

mask_video_urlstring (任意)

マスクビデオの URL。

  1. パブリック URL:

このパラメーターは、ビデオの編集領域を指定するために使用されます。このパラメーターまたは mask_image_url パラメーターのいずれかを指定する必要があります。

マスクビデオのビデオフォーマット、フレームレート、解像度、および長さは、入力ビデオ (video_url) と同一である必要があります。

マスクビデオでは、白い領域 (ピクセル値 [255, 255, 255]) が編集対象領域を定義し、黒い領域 (ピクセル値 [0, 0, 0]) が保持対象領域を定義します。

parameters object (任意)

ウォーターマーク設定など、ビデオ処理用のパラメーター。

プロパティ

control_condition string (任意)

ビデオの特徴抽出方法。デフォルト値は "" で、特徴が抽出されないことを意味します。

  • posebodyface:入力ビデオからエンティティの表情と体の動きを抽出します。これは、エンティティの顔がフレームの大部分を占め、その特徴がはっきりと見えるシナリオに適しています。
  • depth:入力ビデオから構図とモーション輪郭を抽出します。

mask_type string (任意)

mask_image_url が空でない場合、このパラメーターは編集領域の動作を指定するために有効になります。

  • tracking (デフォルト):編集領域はターゲットオブジェクトの動きの軌跡を動的に追跡します。これは、被写体が動いているシナリオに適しています。
  • fixed:編集領域は固定され、画面コンテンツに応じて変化しません。

expand_ratio float (任意)

mask_type が tracking の場合、このパラメーターはマスク領域を外側に拡張する比率を指定するために有効になります。

値は [0.0, 1.0] の範囲内である必要があります。デフォルト値は 0.05 で、推奨されます。

値が小さいほどマスク領域はターゲットオブジェクトに密着し、大きいほどマスク領域はより広く拡張されます。

expand_mode string (任意)

mask_type が tracking の場合、このパラメーターはマスク領域の形状を指定するために有効になります。

アルゴリズムは、選択された expand_mode に基づいて、入力マスク画像から対応する形状のマスクビデオを生成します。サポートされている値は次のとおりです:

  • hull (デフォルト):ポリゴンモード。このモードは、ポリゴンを使用してマスクされたオブジェクトを囲みます。
  • bbox:バウンディングボックスモード。このモードは、長方形を使用してマスクされたオブジェクトを囲みます。
  • original:オリジナルモード。元のマスクターゲットの形状を保持しようとします。

size string (任意)

生成されるビデオの解像度 (幅*高さ)。モデルは 720p ビデオの生成をサポートします。有効な値:

  • 1280*720 (デフォルト):ビデオのアスペクト比は 16:9 で、1280 が幅、720 が高さです。
  • 720*1280:ビデオのアスペクト比は 9:16 です。
  • 960*960:ビデオのアスペクト比は 1:1 です。
  • 832*1088:ビデオのアスペクト比は 3:4 です。
  • 1088*832:ビデオのアスペクト比は 4:3 です。

duration integer (任意)

生成されるビデオの長さ (秒単位)。この値は 5 に固定されています。

prompt_extendbool (任意)

プロンプトリライトを有効にするかどうかを指定します。有効にすると、大規模言語モデル (LLM) が入力プロンプトを書き換えます。これにより、短いプロンプトの結果が大幅に向上する可能性がありますが、処理時間が増加します。

  • true (デフォルト):プロンプトリライトを有効にします。
  • false:プロンプトリライトを無効にします。(推奨)

テキスト記述がビデオコンテンツと一致しない場合、モデルが入力を誤解する可能性があります。一貫性と精度を向上させるために、インテリジェントな拡張を手動で無効にし、prompt で明確かつ具体的なシーン記述を提供することを推奨します。

seedinteger(任意)

乱数シードは、モデルによって生成されるコンテンツのランダム性を制御します。seed パラメーターの値の範囲は [0, 2147483647] です。

シードを指定しない場合、自動的に生成されます。再現可能な結果を得るには、複数のリクエストで同じシード値を使用してください。

watermark bool(任意)

画像の右下隅に「AI 生成」のウォーターマークを追加するかどうかを指定します。

  • false (デフォルト):ウォーターマークを追加しません。
  • true:ウォーターマークを追加します。

ビデオ拡張

model string (必須)

モデル名。例:wan2.1-vace-plus。

input object (必須)

プロンプトなどの基本入力。

プロパティ

promptstring(必須)

生成されるビデオに含める要素や視覚的特徴を記述します。

中国語と英語の両方をサポートします。最大長は 800 文字で、各漢字または英字は 1 文字としてカウントされます。この制限を超えたテキストは自動的に切り捨てられます。

プロンプトのテクニックについては、「テキストからビデオ/画像からビデオへのプロンプトガイド」をご参照ください。

functionstring(必須)

機能名。ビデオ拡張は video_extension に設定されます。

ビデオ拡張機能は、画像またはビデオから連続したコンテンツを生成します。また、参照ビデオからアクションや構図などの動的特徴を抽出し、同様の動きを持つビデオの生成をガイドすることもできます。

生成されるビデオの合計時間は 5 秒です。これは最終的な出力時間であり、元のコンテンツに追加される 5 秒の拡張ではありません。

first_frame_urlstring (任意)

最初のフレーム画像の URL。

  1. パブリック URL:

画像要件:

  • フォーマット:JPG、JPEG、PNG、BMP、TIFF、または WEBP。
  • 解像度:幅と高さは [360, 2000] ピクセルの範囲内である必要があります。
  • サイズ:最大 10 MB。
  • URL には中国語文字を含めることはできません。

last_frame_urlstring(任意)

最後のフレーム画像の URL。

  1. パブリック URL:

画像要件:

  • フォーマット:JPG、JPEG、PNG、BMP、TIFF、または WEBP。
  • 解像度:幅と高さは [360, 2000] ピクセルの範囲内である必要があります。
  • サイズ:最大 10 MB。
  • URL には中国語文字を含めることはできません。

first_clip_urlstring (任意)

最初のビデオクリップの URL。

  1. パブリック URL:

ビデオ要件:

  • フォーマット:MP4。
  • ビデオフレームレート:16 FPS 以上。first_clip_url と last_clip_url を一緒に使用する場合、2 つのクリップのフレームレートが同じであることを推奨します。
  • サイズ:最大 50 MB。
  • ビデオの長さ:ビデオは 3 秒を超えることはできません。超える場合、ビデオの最初の 3 秒が使用されます。first_clip_url と last_clip_url の両方を指定する場合、2 つのビデオクリップの合計時間は 3 秒を超えることはできません。
  • URL には中国語文字を含めることはできません。

出力ビデオの解像度:

  • 入力ビデオの解像度が 720p 以下の場合、出力解像度は入力と同じになります。
  • 入力ビデオの解像度が 720p を超える場合、元のアスペクト比を維持しながら 720p の解像度に収まるようにダウンスケールされます。

last_clip_urlstring(任意)

最後のビデオクリップの URL。

  1. パブリック URL:

ビデオ要件:

  • フォーマット:MP4。
  • ビデオフレームレート:16 FPS 以上。first_clip_url と last_clip_url を一緒に使用する場合、2 つのクリップのフレームレートが同じであることを推奨します。
  • サイズ:最大 50 MB。
  • ビデオの長さ:長さは 3 秒を超えることはできません。ビデオが長い場合、最初の 3 秒のみが使用されます。first_clip_url と last_clip_url の両方を指定する場合、それらの合計時間は 3 秒を超えることはできません。
  • URL には中国語文字を含めることはできません。

出力ビデオの解像度:

  • 入力ビデオの解像度が 720p 以下の場合、出力解像度は入力と同じになります。
  • 入力ビデオの解像度が 720p を超える場合、元のアスペクト比を維持しながら 720p の解像度に収まるようにダウンスケールされます。

video_urlstring (任意)

入力ビデオの URL。

  1. パブリック URL:

このビデオは主に、first_frame_url、last_frame_url、first_clip_url、および last_clip_url パラメーターと連携してモーション特徴を抽出し、同様のモーションパフォーマンスを持つ拡張ビデオの生成をガイドするために使用されます。

ビデオ要件:

  • フォーマット:MP4。
  • フレームレート:16 FPS 以上で、先行および後続のクリップと一致していること。
  • 解像度:先行および後続のフレームおよびクリップと一致していること。
  • サイズ:最大 50 MB。
  • 長さ:最大 5 秒。長いビデオは最初の 5 秒に切り捨てられます。
  • URL には中国語文字を含めることはできません。

parameters object (任意)

出力ビデオの解像度設定など、ビデオ処理用のパラメーター。

プロパティ

control_condition string (任意)

ビデオの特徴抽出方法。このパラメーターは video_url が指定されている場合に必須です。デフォルト値は "" で、特徴が抽出されないことを意味します。

  • posebodyface:入力ビデオ内のエンティティの表情と体の動きを抽出します。
  • depth:入力ビデオの構図とモーション輪郭を抽出します。

duration integer (任意)

生成されるビデオの長さ (秒単位)。この値は 5 に固定されています。

prompt_extendbool (任意)

プロンプトリライトを有効にするかどうかを指定します。有効にすると、大規模言語モデル (LLM) が入力プロンプトを書き換えます。これにより、短いプロンプトの結果が大幅に向上する可能性がありますが、処理時間が増加します。

  • true (デフォルト):プロンプトリライトを有効にします。
  • false:プロンプトリライトを無効にします。(推奨)

テキスト記述がビデオコンテンツと一致しない場合、モデルが入力を誤解する可能性があります。一貫性と精度を向上させるために、インテリジェントな拡張を手動で無効にし、prompt で明確かつ具体的なシーン記述を提供することを推奨します。

seedinteger(任意)

乱数シードは、モデルによって生成されるコンテンツのランダム性を制御します。seed パラメーターの値の範囲は [0, 2147483647] です。

シードを指定しない場合、自動的に生成されます。再現可能な結果を得るには、複数のリクエストで同じシード値を使用してください。

watermark bool(任意)

画像の右下隅に「AI 生成」のウォーターマークを追加するかどうかを指定します。

  • false (デフォルト):ウォーターマークを追加しません。
  • true:ウォーターマークを追加します。

ビデオアウトペインティング

model string (必須)

モデル名。例:wan2.1-vace-plus。

input object (必須)

プロンプトなどの基本入力。

プロパティ

promptstring(必須)

生成されるビデオに含める要素や視覚的特徴を記述します。

中国語と英語の両方をサポートします。最大長は 800 文字で、各漢字または英字は 1 文字としてカウントされます。この制限を超えたテキストは自動的に切り捨てられます。

プロンプトのテクニックについては、「テキストからビデオ/画像からビデオへのプロンプトガイド」をご参照ください。

functionstring(必須)

機能名。ビデオアウトペインティングの値は video_outpainting です。

ビデオアウトペインティング機能は、ビデオフレームを上下左右の方向に比例して拡張します。

video_urlstring (必須)

入力ビデオの URL。

  1. パブリック URL:

ビデオ要件:

  • フォーマット:MP4。
  • フレームレート:16 FPS 以上。
  • サイズ:最大 50 MB。
  • 長さ:最大 5 秒。長いビデオは最初の 5 秒に切り捨てられます。
  • URL には中国語文字を含めることはできません。

出力ビデオの解像度:

  • 入力ビデオの解像度が 720p 以下の場合、出力解像度は入力と同じになります。
  • 入力ビデオの解像度が 720p を超える場合、元のアスペクト比を維持しながら 720p の解像度に収まるようにダウンスケールされます。

出力ビデオの長さ:

  • 出力ビデオの長さは入力ビデオと一致し、最大 5 秒です。
  • 例:入力ビデオが 3 秒の場合、出力も 3 秒です。入力が 6 秒の場合、出力は入力の最初の 5 秒になります。

parameters object (任意)

拡張率の設定など、ビデオ処理用のパラメーター。

プロパティ

top_scale float (任意)

ビデオフレームを中央に配置し、指定された比率で上方に拡張します。

値は [1.0, 2.0] の範囲内である必要があります。デフォルト値は 1.0 で、拡張しないことを示します。

bottom_scale float (任意)

ビデオフレームを中央に配置し、指定された比率で下方に拡張します。

値は [1.0, 2.0] の範囲内である必要があります。デフォルト値は 1.0 で、拡張しないことを示します。

left_scale float (任意)

ビデオフレームを中央に配置し、指定された比率で左に拡張します。

値は [1.0, 2.0] の範囲内である必要があります。デフォルト値は 1.0 で、拡張しないことを示します。

right_scale float (任意)

ビデオフレームを中央に配置し、指定された比率で右に拡張します。

値は [1.0, 2.0] の範囲内である必要があります。デフォルト値は 1.0 で、拡張しないことを示します。

duration integer (任意)

生成されるビデオの長さ (秒単位)。この値は 5 に固定されています。

prompt_extendbool (任意)

プロンプトリライトを有効にするかどうかを指定します。有効にすると、大規模言語モデル (LLM) が入力プロンプトを書き換えます。これにより、短いプロンプトの結果が大幅に向上する可能性がありますが、処理時間が増加します。

  • true (デフォルト):プロンプトリライトを有効にします。
  • false:プロンプトリライトを無効にします。(推奨)

テキスト記述がビデオコンテンツと一致しない場合、モデルが入力を誤解する可能性があります。一貫性と精度を向上させるために、インテリジェントな拡張を手動で無効にし、prompt で明確かつ具体的なシーン記述を提供することを推奨します。

seedinteger(任意)

乱数シードは、モデルによって生成されるコンテンツのランダム性を制御します。seed パラメーターの値の範囲は [0, 2147483647] です。

シードを指定しない場合、自動的に生成されます。再現可能な結果を得るには、複数のリクエストで同じシード値を使用してください。

watermark bool(任意)

画像の右下隅に「AI 生成」のウォーターマークを追加するかどうかを指定します。

  • false (デフォルト):ウォーターマークを追加しません。
  • true:ウォーターマークを追加します。

複数画像参照

シンガポールと中国 (北京) リージョンの API キーは異なります。API キーの取得

以下の URL はシンガポールリージョン用です。中国 (北京) リージョンの場合は、代わりに次の URL を使用してください:https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis

# 以下の URL はシンガポールリージョン用です。呼び出し時に、{WorkspaceId} を実際のワークスペース ID に置き換えてください。URL はリージョンによって異なります。
curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
--header 'X-DashScope-Async: enable' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "model": "wan2.1-vace-plus",
    "input": {
        "function": "image_reference",
        "prompt": "In the video, a girl gracefully emerges from a misty, ancient forest. Her steps are light, and the camera captures her every nimble moment. When she stops to look at the lush woods around her, a smile of surprise and joy blossoms on her face. This scene, frozen in an interplay of light and shadow, records her wonderful encounter with nature.",
        "ref_images_url": [
            "http://wanx.alicdn.com/material/20250318/image_reference_2_5_16.png",
            "http://wanx.alicdn.com/material/20250318/image_reference_1_5_16.png"
        ]
    },
    "parameters": {
        "prompt_extend": true,
        "obj_or_bg": ["obj","bg"],
        "size": "1280*720"
    }
}'

ビデオ再描画

シンガポールと中国 (北京) リージョンの API キーは異なります。API キーの取得

以下の URL はシンガポールリージョン用です。中国 (北京) リージョンの場合は、代わりに次の URL を使用してください:https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis

# 以下の URL はシンガポールリージョン用です。呼び出し時に、{WorkspaceId} を実際のワークスペース ID に置き換えてください。URL はリージョンによって異なります。
curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
--header 'X-DashScope-Async: enable' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "model": "wan2.1-vace-plus",
    "input": {
        "function": "video_repainting",
        "prompt": "The video shows a black steampunk-style car driven by a gentleman, adorned with gears and copper pipes. The background is a steam-powered candy factory with retro elements, creating a vintage and fun scene.",
        "video_url": "http://wanx.alicdn.com/material/20250318/video_repainting_1.mp4"
    },
    "parameters": {
        "prompt_extend": false,
        "control_condition": "depth"
    }
}'

ローカル編集

シンガポールと中国 (北京) リージョンの API キーは異なります。API キーの取得

以下の URL はシンガポールリージョン用です。中国 (北京) リージョンの場合は、代わりに次の URL を使用してください:https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis

# 以下の URL はシンガポールリージョン用です。呼び出し時に、{WorkspaceId} を実際のワークスペース ID に置き換えてください。URL はリージョンによって異なります。
curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
--header 'X-DashScope-Async: enable' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "model": "wan2.1-vace-plus",
    "input": {
        "function": "video_edit",
        "prompt": "The video shows a Parisian-style French cafe where a lion in a suit elegantly sips coffee. It holds a coffee cup in one hand, taking a gentle sip with a relaxed expression. The cafe is tastefully decorated, with soft hues and warm lighting illuminating the lion's area.",
        "mask_image_url": "http://wanx.alicdn.com/material/20250318/video_edit_1_mask.png",
        "video_url": "http://wanx.alicdn.com/material/20250318/video_edit_2.mp4",
        "mask_frame_id": 1
    },
    "parameters": {
        "prompt_extend": false,
        "mask_type": "tracking",
        "expand_ratio": 0.05
    }
}'

ビデオ拡張

シンガポールと中国 (北京) リージョンの API キーは異なります。API キーの取得

以下の URL はシンガポールリージョン用です。中国 (北京) リージョンの場合は、代わりに次の URL を使用してください:https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis

# 以下の URL はシンガポールリージョン用です。呼び出し時に、{WorkspaceId} を実際のワークスペース ID に置き換えてください。URL はリージョンによって異なります。
curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
--header 'X-DashScope-Async: enable' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "model": "wan2.1-vace-plus",
    "input": {
        "function": "video_extension",
        "prompt": "A dog wearing sunglasses skateboarding on the street, 3D cartoon.",
        "first_clip_url": "http://wanx.alicdn.com/material/20250318/video_extension_1.mp4"
    },
    "parameters": {
        "prompt_extend": false
    }
}'

ビデオアウトペインティング

シンガポールと中国 (北京) リージョンの API キーは異なります。API キーの取得

以下の URL はシンガポールリージョン用です。中国 (北京) リージョンの場合は、代わりに次の URL を使用してください:https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis

# 以下の URL はシンガポールリージョン用です。呼び出し時に、{WorkspaceId} を実際のワークスペース ID に置き換えてください。URL はリージョンによって異なります。
curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
--header 'X-DashScope-Async: enable' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "model": "wan2.1-vace-plus",
    "input": {
        "function": "video_outpainting",
        "prompt": "An elegant woman passionately plays the violin, with a full symphony orchestra behind her.",
        "video_url": "http://wanx.alicdn.com/material/20250318/video_outpainting_1.mp4"
    },
    "parameters": {
        "prompt_extend": false,
        "top_scale": 1.5,
        "bottom_scale": 1.5,
        "left_scale": 1.5,
        "right_scale": 1.5
    }
}'

レスポンスパラメーター

output object

非同期タスクの出力。

プロパティ

task_id string

タスク ID。24 時間クエリに有効です。

task_status string

タスクのステータス。

列挙値

  • PENDING
  • RUNNING
  • SUCCEEDED
  • FAILED
  • CANCELED
  • UNKNOWN:タスクが存在しないか、ステータスが不明です。

request_id string

トレースとトラブルシューティングのための一意なリクエスト識別子。

code string

エラーコード。失敗したリクエストに対してのみ返されます。「エラーコード」をご参照ください。

message string

詳細なエラーメッセージ。失敗したリクエストに対してのみ返されます。「エラーコード」をご参照ください。

成功レスポンス

task_id を保存して、タスクのステータスと結果をクエリします。

{
    "output": {
        "task_status": "PENDING",
        "task_id": "0385dc79-5ff8-4d82-bcb6-xxxxxx"
    },
    "request_id": "4909100c-7b5a-9f92-bfe5-xxxxxx"
}

エラーレスポンス

タスクの作成に失敗しました。「エラーコード」をご参照ください。

{
    "code": "InvalidApiKey",
    "message": "No API-key provided.",
    "request_id": "7438d53d-6eb8-4596-8835-xxxxxx"
}

ステップ 2:タスク ID による結果のクエリ

シンガポール

GET https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/tasks/{task_id}

{WorkspaceId} を実際のワークスペース ID に置き換えてください。

中国 (北京)

GET https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/tasks/{task_id}

{WorkspaceId} を実際のワークスペース ID に置き換えてください。

リクエストパラメーター

リクエストヘッダー

Authorization string (必須)

Model Studio API キーでリクエストを認証します。例:Bearer sk-xxxx。

URL パスパラメーター

task_id string (必須)

タスクの ID。

タスク結果のクエリ

{task_id} を、前の API 呼び出しで返された task_id の値に置き換えます。task_id は 24 時間クエリに有効です。{WorkspaceId} を実際のワークスペース ID に置き換えてください。

curl -X GET https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/tasks/{task_id} \
--header "Authorization: Bearer $DASHSCOPE_API_KEY"

レスポンスパラメーター

outputobject

タスクの出力に関する情報。

プロパティ

task_id string

タスク ID。24 時間クエリに有効です。

task_status string

タスクのステータス。

列挙値

  • PENDING
  • RUNNING
  • SUCCEEDED
  • FAILED
  • CANCELED
  • UNKNOWN:タスクが存在しないか、ステータスが不明です。

submit_time string

タスクが送信された時刻。時刻は UTC+8 で、フォーマットは YYYY-MM-DD HH:mm:ss.SSS です。

scheduled_time string

タスクが実行された時刻。時刻は UTC+8 で、フォーマットは YYYY-MM-DD HH:mm:ss.SSS です。

end_time string

タスクが完了した時刻。時刻は UTC+8 で、フォーマットは YYYY-MM-DD HH:mm:ss.SSS です。

video_urlstring

生成された MP4 (H.264) ビデオの URL。このリンクは 24 時間有効です。

orig_prompt string

元の入力プロンプト。

actual_prompt string

プロンプトリライト後に生成に使用されたプロンプト。このフィールドは、プロンプトリライトが有効な場合にのみ返されます。

code string

エラーコード。失敗したリクエストに対してのみ返されます。「エラーコード」をご参照ください。

message string

詳細なエラーメッセージ。失敗したリクエストに対してのみ返されます。「エラーコード」をご参照ください。

usage object

タスク出力の統計。これは成功したタスクに対してのみ提供されます。

プロパティ

video_duration integer

生成されたビデオの長さ (秒単位)。

video_ratio string

生成されたビデオのアスペクト比。値は常に standard です。

video_count integer

生成されたビデオの数。

request_id string

トレースとトラブルシューティングのための一意なリクエスト識別子。

タスク成功

タスクデータ (タスクステータスやビデオ URL を含む) は 24 時間利用可能で、その後自動的に削除されます。生成されたビデオは速やかに保存してください。

{
    "request_id": "851985d0-fbba-9d8d-a17a-xxxxxx",
    "output": {
        "task_id": "208e2fd1-fcb4-4adf-9fcc-xxxxxx",
        "task_status": "SUCCEEDED",
        "submit_time": "2025-05-15 16:14:44.723",
        "scheduled_time": "2025-05-15 16:14:44.750",
        "end_time": "2025-05-15 16:20:09.389",
        "video_url": "https://dashscope-result-wlcb.oss-cn-wulanchabu.aliyuncs.com/xxx.mp4?xxxxxx",
        "orig_prompt": "In the video, a girl gracefully walks out from a misty, ancient forest. Her steps are light, and the camera captures her every nimble moment. When the girl stops and looks around at the lush woods, a smile of surprise and joy blossoms on her face. This scene, frozen in a moment of interplay between light and shadow, records her wonderful encounter with nature.",
        "actual_prompt": "A girl in a light-colored long dress slowly walks out from a misty, ancient forest, her steps as light as a dance. She has slightly curly long hair, a delicate face, and bright eyes. The camera follows her movements, capturing every nimble moment. When she stops, turns, and looks around at the lush woods, a smile of surprise and joy blossoms on her face. Sunlight filters through the leaves, casting mottled shadows and freezing this beautiful moment of harmony between human and nature. The style is a fresh and natural portrait, combining medium and full shots with a level perspective and slight camera movement."
    },
    "usage": {
        "video_duration": 5,
        "video_ratio": "standard",
        "video_count": 1
    }
}

タスク失敗

タスクが失敗すると、task_status は FAILED になり、エラーコードとメッセージが表示されます。「エラーコード」をご参照ください。

{
    "request_id": "e5d70b02-ebd3-98ce-9fe8-759d7d7b107d",
    "output": {
        "task_id": "86ecf553-d340-4e21-af6e-a0c6a421c010",
        "task_status": "FAILED",
        "code": "InvalidParameter",
        "message": "The size is not match xxxxxx"
    }
}

制限事項

  • データ保持期間:タスク ID task_id とビデオ URL video_url は 24 時間のみ保持されます。有効期限が切れると、クエリやダウンロードはできなくなります。
  • 音声サポート:この機能は現在、無音のビデオのみを生成します。音声を生成するには、音声合成を使用してください。

エラーコード

モデルの呼び出しがエラーメッセージで失敗した場合は、「エラーコード」を参照してトラブルシューティングを行ってください。

よくある質問

Q:ビデオストレージドメインをホワイトリストに登録する方法は?

A:モデルによって生成されたビデオは OSS に保存されます。API は一時的なパブリック URL を返します。このダウンロード URL のファイアウォールホワイトリストを設定するには、次の点にご注意ください:基盤となるストレージは動的に変更される可能性があります。このトピックでは、古い情報によるアクセス問題を避けるため、固定の OSS ドメイン名ホワイトリストは提供していません。セキュリティ管理要件がある場合は、アカウントマネージャーに連絡して最新の OSS ドメイン名リストを入手してください。