モデルデプロイ管理 API です。 テキスト、画像、動画、音声など、すべてのモデルタイプに対応しています 。デプロイメントのステータスと一覧の照会、スロットリングとスケーリングの変更、デプロイメントの削除が可能です。
前提条件
- 対応リージョン: このドキュメントで説明する機能は、シンガポール リージョンでのみ利用可能で、そのリージョンの API キー を使用する必要があります。
- API キーの取得と環境変数としての設定が完了していること。
- モデルデプロイとAPI を使用したモデルのデプロイを読み、モデルデプロイの基本的な手順を理解していること。
モデルデプロイステータスの取得
指定されたモデルデプロイの詳細と実行ステータスを照会します。この API をポーリングできます。status が RUNNING になった場合、モデルが正常にデプロイされたことを示します。
注記モデルデプロイには 5 ~ 10 分かかる見込みです。
エンドポイント
GET https://dashscope-intl.aliyuncs.com/api/v1/deployments/{deployed_model}
リクエスト例
サンプルリクエスト:
curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments/qwen-plus-202305099980-fac9-sample" \
--header "Authorization: Bearer ${DASHSCOPE_API_KEY}" \
--header 'Content-Type: application/json'
リクエストパラメーター
パラメーター | タイプ | 場所 | 必須 | 説明 |
|---|---|---|---|---|
deployed_model | 文字列 | パス | はい | モデルデプロイの一意の識別子。モデルデプロイの作成またはモデルデプロイの一覧表示によって返されます。 |
レスポンス例
status フィールドにご注意ください。ステータスが RUNNING になると、モデルは正常にデプロイされ、呼び出し可能になります。
{
"request_id": "66a855f0-a6fe-4b05-9786-fb30c7c6782d",
"output": {
"deployed_model": "qwen-plus-202305099980-fac9-sample",
"gmt_create": "2025-06-17T11:00:38",
"gmt_modified": "2025-06-17T11:06:13",
"status": "RUNNING",
"model_name": "emo",
"base_model": "emo",
"base_capacity": 1,
"capacity": 1,
"ready_capacity": 1,
"workspace_id": "llm-v71tlv3***",
"charge_type": "post_paid",
"creator": "175805416***",
"modifier": "175805416***"
}
}
レスポンスパラメーター
フィールド | タイプ | 説明 |
|---|---|---|
request_id | 文字列 | リクエストの一意の識別子。 |
output | オブジェクト | ジョブの詳細。 |
output.deployed_model | 文字列 | モデルデプロイの一意の識別子。モデルデプロイのステータスのクエリとモデルの呼び出しに使用されます。 |
output.model_name | 文字列 | モデルの識別子名。 |
output.base_model | 文字列 | 使用されているベースモデル。 |
output.status | 文字列 | モデルデプロイのステータス:
|
output.base_capacity | 数値 | ベースキャパシティのリソースユニット数。 |
output.capacity | 数値 | 現在のリソースユニット数。 |
output.ready_capacity | 数値 | レディキャパシティのリソースユニット数。 |
output.workspace_id | 文字列 | Alibaba Cloud Model Studio API キーに関連付けられたワークスペース ID。ワークスペース ID の取得をご参照ください。 |
output.charge_type | 文字列 | 課金モード。post_paid は従量課金を示します。 |
output.gmt_create | 文字列 | モデルデプロイの作成時刻。 |
output.gmt_modified | 文字列 | モデルデプロイの最終更新時刻。 |
output.creator | 文字列 | 作成者の Alibaba Cloud アカウント ID。 |
output.modifier | 文字列 | 更新者の Alibaba Cloud アカウント ID。 |
output.plan | String | Deployment plan. |
デプロイ可能なモデルの一覧
Model Studio プラットフォームでデプロイ可能なモデル、つまりデプロイメントの作成に使用できるモデルのリストを取得します。
エンドポイント
GET https://dashscope-intl.aliyuncs.com/api/v1/deployments/models
リクエスト例
次のコマンドを使用して、デプロイ可能なモデルをクエリします。デプロイメントプランとテンプレート情報を含む完全なレスポンスを取得するには、version=v1.0 を使用することを推奨します。
curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments/models?page_no=1&page_size=100&version=v1.0&model_source=base" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json'
ユーザーがファインチューニングしたモデルのクエリ:
curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments/models?page_no=1&page_size=100&version=v1.0&model_source=custom" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json'
リクエストパラメーター
パラメーター | タイプ | 必須 | 説明 |
|---|---|---|---|
page_no | Number | いいえ | ページ番号。デフォルト値:1。 |
page_size | Number | いいえ | ページサイズ。デフォルト値:50。最大値:100。最小値:1。 |
model_source | String | いいえ | モデルソース。 |
version | String | いいえ | API バージョン。 |
レスポンス例
コマンドが実行されると、次の結果が返されます。
{
"request_id": "f7da015c-ea90-4d96-af89-2f8d7604026a",
"output": {
"page_no": 1,
"page_size": 100,
"total": 5,
"models": [
{
"model_name": "qwen3-8b",
"plans": [
{
"plan": "mu",
"templates": [
{
"template_id": "MU1",
"template_name": "Single-node deployment - Standard inference",
"template_type": "COUPLED",
"template_version": "v1",
"template_desc": "Suitable for standard inference scenarios",
"roles": {
"unified": {
"model_unit_spec": "MU1",
"capacity_unit_per_instance": 4
}
}
},
{
"template_id": "MU1-PD",
"template_name": "PD-separated deployment - Standard inference",
"template_type": "SEPERATED",
"template_version": "v1",
"template_desc": "Suitable for PD-separated inference scenarios",
"roles": {
"prefill": {
"model_unit_spec": "MU1",
"capacity_unit_per_instance": 4
},
"decode": {
"model_unit_spec": "MU1",
"capacity_unit_per_instance": 4
}
}
}
]
},
{
"plan": "lora"
}
]
}
]
}
}
レスポンスパラメーター
パラメーター | タイプ | 説明 |
|---|---|---|
models | Array | デプロイ可能なモデルのリスト。 |
models[].model_name | String | モデル名。 |
models[].plans | Array | モデルがサポートするデプロイメントプランのリスト。 |
models[].plans[].plan | String | デプロイメントプランのタイプ: |
models[].plans[].templates | Array | デプロイメントテンプレートのリスト ( |
models[].plans[].templates[].template_id | String | テンプレート ID。デプロイメントの作成時に |
models[].plans[].templates[].template_name | String | テンプレートの表示名。 |
models[].plans[].templates[].template_type | String | テンプレートタイプ: |
models[].plans[].templates[].template_version | String | テンプレートのバージョン。 |
models[].plans[].templates[].template_desc | String | テンプレートの説明。 |
models[].plans[].templates[].roles | Object | ノードロールの設定。COUPLED モードには |
models[].plans[].templates[].roles.{role}.model_unit_spec | String | モデルユニットの仕様。 |
models[].plans[].templates[].roles.{role}.capacity_unit_per_instance | Number | インスタンスあたりのキャパシティーユニット数、つまり base_capacity です。デプロイメントを作成する際、 |
page_no | Number | クエリのページ番号。 |
page_size | Number | クエリのページサイズ。 |
total | Long | クエリ条件に一致するモデルの総数。 |
デプロイ済みモデルの一覧表示
デプロイ済みインスタンス (現在のワークスペースで実行中またはデプロイ済みのモデルサービス) の一覧を取得します。
エンドポイント
GET https://dashscope-intl.aliyuncs.com/api/v1/deployments
リクエスト例
次のコマンドを実行して、専用サービスの一覧を取得します。
curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments?page_no=1&page_size=100" \
--header "Authorization: Bearer ${DASHSCOPE_API_KEY}" \
--header 'Content-Type: application/json'
リクエストパラメーター
パラメーター | タイプ | 場所 | 必須 | 説明 |
|---|---|---|---|---|
page_no | 数値 | クエリ | いいえ | ページ番号。デフォルト値:1。 |
page_size | 数値 | クエリ | いいえ | ページサイズ。デフォルト値:50。最大値:200。最小値:1。 |
レスポンス例
以下はレスポンスの例です。
{
"request_id": "7efdd3a7-a90d-96c6-b477-70055d59edf7",
"output": {
"page_no": 1,
"page_size": 100,
"total": 1,
"deployments": [
{
"deployed_model": "emo-35b3f106-sample01",
"gmt_create": "2025-06-17T11:00:38",
"gmt_modified": "2025-06-17T11:06:13",
"status": "RUNNING",
"model_name": "emo",
"base_model": "emo",
"base_capacity": 1,
"capacity": 1,
"ready_capacity": 1,
"workspace_id": "llm-v71tlv3d***",
"charge_type": "post_paid",
"creator": "175805416***",
"modifier": "175805416***"
}
]
}
}
レスポンスパラメーター
フィールド | タイプ | 説明 |
|---|---|---|
request_id | 文字列 | リクエストの一意の識別子です。 |
output.page_no | 数値 | 現在のページ番号です。 |
output.page_size | 数値 | 1 ページあたりの要素数です。 |
output.total | 数値 | デプロイメントの総数です。 |
output.deployments | 配列 | モデルデプロイの一覧です。各要素は モデルデプロイの取得 の出力と同じフィールドを持ちます。 |
デプロイメントのスロットリング更新
指定されたモデルデプロイの RPM (1 分あたりのリクエスト数) と TPM (1 分あたりのトークン数) のスロットリング設定を変更します。
注記モデルユニットを使用してデプロイされた一部のモデルのみが、RPM と TPM の設定変更をサポートしています。
エンドポイント
PUT https://dashscope-intl.aliyuncs.com/api/v1/deployments/{deployed_model}/update
リクエスト例
指定されたデプロイメントのスロットリング設定を変更するには、次のコマンドを実行します。
curl -X PUT "https://dashscope-intl.aliyuncs.com/api/v1/deployments/{deployed_model}/update" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"rpm_limit": 1000,
"tpm_limit": 200
}'
リクエストパラメーター
パラメーター | タイプ | 場所 | 必須 | 説明 |
|---|---|---|---|---|
deployed_model | 文字列 | パス | はい | モデルデプロイの一意の識別子。デプロイメントの作成またはデプロイメントの一覧表示操作から取得できます。 |
rpm_limit | 数値 | body | 少なくとも 1 つのパラメーター | 1 分あたりのリクエスト数の上限 (RPM)。 |
tpm_limit | 数値 | body | 1 分あたりのトークン数の上限 (TPM)。 |
レスポンス例
レスポンスの例:
{
"request_id": "1d121fd9-876c-40ad-bc40-a9e68ef3b986",
"output":
{
"deployed_model": "qwen-plus-2025-12-01-b6d61c71",
"gmt_create": "2026-01-07T13:52:44",
"gmt_modified": "2026-01-07T14:01:41",
"status": "PENDING",
"model_name": "qwen-plus-2025-12-01",
"base_model": "qwen-plus-2025-12-01",
"base_capacity": 4,
"capacity": 4,
"ready_capacity": 0,
"workspace_id": "llm-8v53e*******",
"charge_type": "post_paid",
"creator": "16542902******",
"modifier": "16542902********",
"plan": "mu",
"model_unit_spec": "MU1",
"enable_thinking": true,
"max_context_length": 1,
"rpm_limit": 1000,
"tpm_limit": 200
}
}
レスポンスパラメーター
モデルデプロイの取得に記載されている基本フィールドに加えて、レスポンスには次のフィールドも含まれる場合があります。
フィールド | タイプ | 説明 |
|---|---|---|
output.plan | 文字列 | デプロイメントプラン。 |
output.model_unit_spec | 文字列 | モデルユニットのデプロイメントテンプレート (例: MU1)。 |
output.enable_thinking | ブール値 | 思考モードが有効かどうか。 |
output.max_context_length | 数値 | 最大コンテキスト長。 |
output.rpm_limit | 数値 | 1 分あたりのリクエスト数の上限。 |
output.tpm_limit | 数値 | 1 分あたりのトークン数の上限。 |
デプロイメントのスケーリング
更新操作を実行して、専用サービスが使用するリソースユニットの数を調整します。
エンドポイント
PUT https://dashscope-intl.aliyuncs.com/api/v1/deployments/{deployed_model}/scale
リクエスト例
次のコマンドを実行して、指定のサービスをスケーリングします。
curl --request PUT "https://dashscope-intl.aliyuncs.com/api/v1/deployments/emo-35b3f106-sample01/scale" \
--header "Authorization: Bearer ${DASHSCOPE_API_KEY}" \
--header 'Content-Type: application/json' \
--data '{
"capacity":2
}'
リクエストパラメーター
パラメーター | タイプ | 場所 | 必須 | 説明 | |
|---|---|---|---|---|---|
deployed_model | String | path | はい | モデルのデプロイメントの一意の識別子。デプロイメントの作成 API またはデプロイメントの一覧表示操作から取得できます。 | |
capacity | Number | body | 条件付きで必須 |
詳細については、「モデルユニットデプロイメントの機能サポート」をご参照ください。 | 更新後のモデルが使用するリソースユニット。 |
ptu_capacity | Object | body | 条件付きで必須 |
詳細については、「PTU デプロイメントの機能サポート」をご参照ください。 |
例: |
ptu_capacity.input_tpm | Number | body | すべてのモデルでサポートされています。入力トークン/分。デプロイ済みモデルがサポートする1分あたりの最大入力トークン数。 | ||
ptu_capacity.output_tpm | Number | body | すべてのモデルでサポートされています。出力トークン/分。デプロイ済みモデルがサポートする1分あたりの最大出力トークン数。 | ||
ptu_capacity.thinking_output_tpm | Number | body | 一部のモデルでサポートされています。思考出力トークン/分。デプロイ済みモデルがサポートする1分あたりの最大思考出力トークン数。 | ||
レスポンス例
レスポンス例:
{
"request_id": "6c6b7676-3fea-423b-bc26-c9e2337e1142",
"output": {
"deployed_model": "emo-35b3f106-sample01",
"gmt_create": "2025-06-17T11:00:38",
"gmt_modified": "2025-06-17T11:42:02.311",
"status": "UPDATING",
"model_name": "emo",
"base_model": "emo",
"base_capacity": 1,
"capacity": 2,
"ready_capacity": 1,
"workspace_id": "llm-v71tlv3dezezp2en",
"charge_type": "post_paid",
"creator": "17580541***",
"modifier": "17580541***"
}
}
レスポンスパラメーター
レスポンスパラメーターは「モデルのデプロイメントの取得」と同じです。詳細については、同操作のレスポンスパラメーターをご参照ください。
デプロイメントの削除
指定のモデルデプロイメントを削除して、対応するコンピューティングリソースを解放します。
重要この操作を実行すると、モデルデプロイメントサービスは直ちにオフラインになり、復元できません。
- モデルは呼び出しできなくなります。
- デプロイメントサービスの課金が停止します。
エンドポイント
DELETE https://dashscope-intl.aliyuncs.com/api/v1/deployments/{deployed_model}
リクエスト例
次のコマンドを実行して、指定のデプロイメントを削除します。
curl --request DELETE "https://dashscope-intl.aliyuncs.com/api/v1/deployments/emo-35b3f106-sample01" \
--header "Authorization: Bearer ${DASHSCOPE_API_KEY}" \
--header 'Content-Type: application/json'
リクエストパラメーター
パラメーター | タイプ | 場所 | 必須 | 説明 |
|---|---|---|---|---|
deployed_model | 文字列 | パス | はい | モデルデプロイメントの一意の識別子で、デプロイメントの作成 API またはデプロイメント一覧表示 API から取得できます。 |
レスポンス例
status フィールドに注目してください。ステータスが DELETING になると、デプロイメントが削除中であることを示します。
{
"request_id": "5378b78b-8564-481f-a3e0-580e551df22c",
"output": {
"deployed_model": "emo-35b3f106-sample01",
"gmt_create": "2025-06-17T11:00:38",
"gmt_modified": "2025-06-17T11:42:02",
"status": "DELETING",
"model_name": "emo",
"base_model": "emo",
"base_capacity": 1,
"capacity": 2,
"ready_capacity": 1,
"workspace_id": "llm-v71tlv3***",
"charge_type": "post_paid",
"creator": "175805416***",
"modifier": "175805416***"
}
}
次に、モデルデプロイメントの取得 API を呼び出して削除を確認します。次のレスポンスが返された場合、デプロイメントサービスは存在せず、正常に削除されたことを意味します。
{
"request_id": "eb619064-0c4f-4d29-aa49-xxxxxx",
"message": "Not found.",
"code": "NotFound"
}
レスポンスパラメーター
レスポンスパラメーターは モデルデプロイメントの取得 と同じです。詳細については、「モデルデプロイメントの取得」のレスポンスパラメーターをご参照ください。
エラーレスポンス
レスポンス例
{
"request_id": "ca218d57-b91b-46b2-bd35-c41c6287bcf4",
"message": "Model: qwen-plus-20230703-cx7f not found!",
"code": "NotFound"
}
レスポンスパラメータ
フィールド | タイプ | 説明 |
|---|---|---|
request_id | 文字列 | リクエストの一意の ID です。 |
code | 文字列 | エラーコードです。 |
message | 文字列 | エラーメッセージです。 |
考えられるエラー:
エラーコード | エラーメッセージ | エラーの理由 |
|---|---|---|
NotFound | Model: xxx not found! |
|
Conflict | Deployed model xxx already exists, please specify a suffix. | 同じ名前のモデルが既にデプロイされています。デプロイメントを区別するために、サフィックスを指定する必要があります。 |
InvalidParameter | Invalid capacity (xx), capacity must be larger than or equal to 0 and multiples of 1 and less than 1000! | デプロイメントの作成または更新時に、無効なキャパシティユニットが指定されました。 |