すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:デプロイメント詳細の取得

最終更新日:Sep 02, 2026

モデルデプロイ管理 API です。 テキスト、画像、動画、音声など、すべてのモデルタイプに対応しています 。デプロイメントのステータスと一覧の照会、スロットリングとスケーリングの変更、デプロイメントの削除が可能です。

前提条件

  • 対応リージョン: このドキュメントで説明する機能は、シンガポール リージョンでのみ利用可能で、そのリージョンの API キー を使用する必要があります。
  • API キーの取得環境変数としての設定が完了していること。
  • モデルデプロイとAPI を使用したモデルのデプロイを読み、モデルデプロイの基本的な手順を理解していること。

モデルデプロイステータスの取得

指定されたモデルデプロイの詳細と実行ステータスを照会します。この API をポーリングできます。statusRUNNING になった場合、モデルが正常にデプロイされたことを示します。

注記モデルデプロイには 5 ~ 10 分かかる見込みです。

エンドポイント

GET https://dashscope-intl.aliyuncs.com/api/v1/deployments/{deployed_model}

リクエスト例

サンプルリクエスト:

curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments/qwen-plus-202305099980-fac9-sample" \
    --header "Authorization: Bearer ${DASHSCOPE_API_KEY}" \
    --header 'Content-Type: application/json'

リクエストパラメーター

パラメーター

タイプ

場所

必須

説明

deployed_model

文字列

パス

はい

モデルデプロイの一意の識別子。モデルデプロイの作成またはモデルデプロイの一覧表示によって返されます。

レスポンス例

status フィールドにご注意ください。ステータスが RUNNING になると、モデルは正常にデプロイされ、呼び出し可能になります。

{
  "request_id": "66a855f0-a6fe-4b05-9786-fb30c7c6782d",
  "output": {
    "deployed_model": "qwen-plus-202305099980-fac9-sample",
    "gmt_create": "2025-06-17T11:00:38",
    "gmt_modified": "2025-06-17T11:06:13",
    "status": "RUNNING",
    "model_name": "emo",
    "base_model": "emo",
    "base_capacity": 1,
    "capacity": 1,
    "ready_capacity": 1,
    "workspace_id": "llm-v71tlv3***",
    "charge_type": "post_paid",
    "creator": "175805416***",
    "modifier": "175805416***"
  }
}

レスポンスパラメーター

フィールド

タイプ

説明

request_id

文字列

リクエストの一意の識別子。

output

オブジェクト

ジョブの詳細。

output.deployed_model

文字列

モデルデプロイの一意の識別子。モデルデプロイのステータスのクエリとモデルの呼び出しに使用されます。

output.model_name

文字列

モデルの識別子名。

output.base_model

文字列

使用されているベースモデル。

output.status

文字列

モデルデプロイのステータス:

  • PENDING: モデルデプロイを作成中です。

  • RUNNING: モデルデプロイが実行中で、モデルは正常にリクエストを処理できます。

  • UPDATING: 設定変更が進行中です。

  • UPDATING_FAILED: 設定変更が失敗しました。

  • DELETING: モデルデプロイを削除中です。

  • DELETED: モデルデプロイが削除されました。

  • FAILED: モデルデプロイの作成または更新が失敗しました。

  • STOPPED: モデルデプロイが停止され、課金されません。

  • ARREARS_DOWN: 支払い遅延によりサービスが停止されました。

  • ARREARS_RECOVERING: 支払い停止から復旧中です。

  • OFFLINING: サービスをオフライン化中です。

output.base_capacity

数値

ベースキャパシティのリソースユニット数。

output.capacity

数値

現在のリソースユニット数。

output.ready_capacity

数値

レディキャパシティのリソースユニット数。

output.workspace_id

文字列

Alibaba Cloud Model Studio API キーに関連付けられたワークスペース ID。ワークスペース ID の取得をご参照ください。

output.charge_type

文字列

課金モード。post_paid は従量課金を示します。

output.gmt_create

文字列

モデルデプロイの作成時刻。

output.gmt_modified

文字列

モデルデプロイの最終更新時刻。

output.creator

文字列

作成者の Alibaba Cloud アカウント ID。

output.modifier

文字列

更新者の Alibaba Cloud アカウント ID。

output.plan

String

Deployment plan.

デプロイ可能なモデルの一覧

Model Studio プラットフォームでデプロイ可能なモデル、つまりデプロイメントの作成に使用できるモデルのリストを取得します。

エンドポイント

GET https://dashscope-intl.aliyuncs.com/api/v1/deployments/models

リクエスト例

次のコマンドを使用して、デプロイ可能なモデルをクエリします。デプロイメントプランとテンプレート情報を含む完全なレスポンスを取得するには、version=v1.0 を使用することを推奨します。

curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments/models?page_no=1&page_size=100&version=v1.0&model_source=base" \
    --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
    --header 'Content-Type: application/json'

ユーザーがファインチューニングしたモデルのクエリ:

curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments/models?page_no=1&page_size=100&version=v1.0&model_source=custom" \
    --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
    --header 'Content-Type: application/json'

リクエストパラメーター

パラメーター

タイプ

必須

説明

page_no

Number

いいえ

ページ番号。デフォルト値:1。

page_size

Number

いいえ

ページサイズ。デフォルト値:50。最大値:100。最小値:1。

model_source

String

いいえ

モデルソース。base はシステムモデル (デフォルト) を表し、custom はユーザーがファインチューニングしたモデルを表します。

version

String

いいえ

API バージョン。v1.0 の使用を推奨します。v1.0 を指定すると、レスポンスに完全なデプロイメントプランとテンプレート情報が含まれます。

レスポンス例

コマンドが実行されると、次の結果が返されます。

{
    "request_id": "f7da015c-ea90-4d96-af89-2f8d7604026a",
    "output": {
        "page_no": 1,
        "page_size": 100,
        "total": 5,
        "models": [
            {
                "model_name": "qwen3-8b",
                "plans": [
                    {
                        "plan": "mu",
                        "templates": [
                            {
                                "template_id": "MU1",
                                "template_name": "Single-node deployment - Standard inference",
                                "template_type": "COUPLED",
                                "template_version": "v1",
                                "template_desc": "Suitable for standard inference scenarios",
                                "roles": {
                                    "unified": {
                                        "model_unit_spec": "MU1",
                                        "capacity_unit_per_instance": 4
                                    }
                                }
                            },
                            {
                                "template_id": "MU1-PD",
                                "template_name": "PD-separated deployment - Standard inference",
                                "template_type": "SEPERATED",
                                "template_version": "v1",
                                "template_desc": "Suitable for PD-separated inference scenarios",
                                "roles": {
                                    "prefill": {
                                        "model_unit_spec": "MU1",
                                        "capacity_unit_per_instance": 4
                                    },
                                    "decode": {
                                        "model_unit_spec": "MU1",
                                        "capacity_unit_per_instance": 4
                                    }
                                }
                            }
                        ]
                    },
                    {
                        "plan": "lora"
                    }
                ]
            }
        ]
    }
}

レスポンスパラメーター

パラメーター

タイプ

説明

models

Array

デプロイ可能なモデルのリスト。

models[].model_name

String

モデル名。

models[].plans

Array

モデルがサポートするデプロイメントプランのリスト。version=v1.0 が指定された場合に返されます。

models[].plans[].plan

String

デプロイメントプランのタイプ:mu (モデルユニット)、cu (コンピュートユニット)、ptu (プロビジョニングされたスループットユニット)、lora (LoRA 共有デプロイメント)。

models[].plans[].templates

Array

デプロイメントテンプレートのリスト (plan=mu の場合に返されます)。

models[].plans[].templates[].template_id

String

テンプレート ID。デプロイメントの作成時に deploy_spec パラメーターとして渡されます。

models[].plans[].templates[].template_name

String

テンプレートの表示名。

models[].plans[].templates[].template_type

String

テンプレートタイプ:COUPLED (Prefill/Decode 分離なし、capacity パラメーターを使用)、SEPERATED (Prefill/Decode 分離あり、prefill_capacity および decode_capacity パラメーターを使用)。

models[].plans[].templates[].template_version

String

テンプレートのバージョン。

models[].plans[].templates[].template_desc

String

テンプレートの説明。

models[].plans[].templates[].roles

Object

ノードロールの設定。COUPLED モードには unified ノードが含まれ、SEPERATED モードには prefilldecode のノードが含まれます。

models[].plans[].templates[].roles.{role}.model_unit_spec

String

モデルユニットの仕様。

models[].plans[].templates[].roles.{role}.capacity_unit_per_instance

Number

インスタンスあたりのキャパシティーユニット数、つまり base_capacity です。デプロイメントを作成する際、capacity はこの値の整数倍である必要があります。

page_no

Number

クエリのページ番号。

page_size

Number

クエリのページサイズ。

total

Long

クエリ条件に一致するモデルの総数。

デプロイ済みモデルの一覧表示

デプロイ済みインスタンス (現在のワークスペースで実行中またはデプロイ済みのモデルサービス) の一覧を取得します。

エンドポイント

GET https://dashscope-intl.aliyuncs.com/api/v1/deployments

リクエスト例

次のコマンドを実行して、専用サービスの一覧を取得します。

curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments?page_no=1&page_size=100" \
    --header "Authorization: Bearer ${DASHSCOPE_API_KEY}" \
    --header 'Content-Type: application/json'

リクエストパラメーター

パラメーター

タイプ

場所

必須

説明

page_no

数値

クエリ

いいえ

ページ番号。デフォルト値:1。

page_size

数値

クエリ

いいえ

ページサイズ。デフォルト値:50。最大値:200。最小値:1。

レスポンス例

以下はレスポンスの例です。

{
  "request_id": "7efdd3a7-a90d-96c6-b477-70055d59edf7",
  "output": {
    "page_no": 1,
    "page_size": 100,
    "total": 1,
    "deployments": [
      {
        "deployed_model": "emo-35b3f106-sample01",
        "gmt_create": "2025-06-17T11:00:38",
        "gmt_modified": "2025-06-17T11:06:13",
        "status": "RUNNING",
        "model_name": "emo",
        "base_model": "emo",
        "base_capacity": 1,
        "capacity": 1,
        "ready_capacity": 1,
        "workspace_id": "llm-v71tlv3d***",
        "charge_type": "post_paid",
        "creator": "175805416***",
        "modifier": "175805416***"
      }
    ]
  }
}

レスポンスパラメーター

フィールド

タイプ

説明

request_id

文字列

リクエストの一意の識別子です。

output.page_no

数値

現在のページ番号です。

output.page_size

数値

1 ページあたりの要素数です。

output.total

数値

デプロイメントの総数です。

output.deployments

配列

モデルデプロイの一覧です。各要素は モデルデプロイの取得 の出力と同じフィールドを持ちます。

デプロイメントのスロットリング更新

指定されたモデルデプロイの RPM (1 分あたりのリクエスト数) と TPM (1 分あたりのトークン数) のスロットリング設定を変更します。

注記モデルユニットを使用してデプロイされた一部のモデルのみが、RPM と TPM の設定変更をサポートしています。

エンドポイント

PUT https://dashscope-intl.aliyuncs.com/api/v1/deployments/{deployed_model}/update

リクエスト例

指定されたデプロイメントのスロットリング設定を変更するには、次のコマンドを実行します。

curl -X PUT "https://dashscope-intl.aliyuncs.com/api/v1/deployments/{deployed_model}/update" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "rpm_limit": 1000,
    "tpm_limit": 200
}'

リクエストパラメーター

パラメーター

タイプ

場所

必須

説明

deployed_model

文字列

パス

はい

モデルデプロイの一意の識別子。デプロイメントの作成またはデプロイメントの一覧表示操作から取得できます。

rpm_limit

数値

body

少なくとも 1 つのパラメーター

1 分あたりのリクエスト数の上限 (RPM)。

tpm_limit

数値

body

1 分あたりのトークン数の上限 (TPM)。

レスポンス例

レスポンスの例:

{
    "request_id": "1d121fd9-876c-40ad-bc40-a9e68ef3b986",
    "output":
    {
        "deployed_model": "qwen-plus-2025-12-01-b6d61c71",
        "gmt_create": "2026-01-07T13:52:44",
        "gmt_modified": "2026-01-07T14:01:41",
        "status": "PENDING",
        "model_name": "qwen-plus-2025-12-01",
        "base_model": "qwen-plus-2025-12-01",
        "base_capacity": 4,
        "capacity": 4,
        "ready_capacity": 0,
        "workspace_id": "llm-8v53e*******",
        "charge_type": "post_paid",
        "creator": "16542902******",
        "modifier": "16542902********",
        "plan": "mu",
        "model_unit_spec": "MU1",
        "enable_thinking": true,
        "max_context_length": 1,
        "rpm_limit": 1000,
        "tpm_limit": 200
    }
}

レスポンスパラメーター

モデルデプロイの取得に記載されている基本フィールドに加えて、レスポンスには次のフィールドも含まれる場合があります。

フィールド

タイプ

説明

output.plan

文字列

デプロイメントプラン。

output.model_unit_spec

文字列

モデルユニットのデプロイメントテンプレート (例: MU1)。

output.enable_thinking

ブール値

思考モードが有効かどうか。

output.max_context_length

数値

最大コンテキスト長。

output.rpm_limit

数値

1 分あたりのリクエスト数の上限。

output.tpm_limit

数値

1 分あたりのトークン数の上限。

デプロイメントのスケーリング

更新操作を実行して、専用サービスが使用するリソースユニットの数を調整します。

エンドポイント

PUT https://dashscope-intl.aliyuncs.com/api/v1/deployments/{deployed_model}/scale

リクエスト例

次のコマンドを実行して、指定のサービスをスケーリングします。

curl --request PUT "https://dashscope-intl.aliyuncs.com/api/v1/deployments/emo-35b3f106-sample01/scale" \
    --header "Authorization: Bearer ${DASHSCOPE_API_KEY}" \
    --header 'Content-Type: application/json' \
    --data '{
                "capacity":2
            }'

リクエストパラメーター

パラメーター

タイプ

場所

必須

説明

deployed_model

String

path

はい

モデルのデプロイメントの一意の識別子。デプロイメントの作成 API またはデプロイメントの一覧表示操作から取得できます。

capacity

Number

body

条件付きで必須

"plan": "mu" の場合にのみ利用可能です。

詳細については、「モデルユニットデプロイメントの機能サポート」をご参照ください。

更新後のモデルが使用するリソースユニット。base_capacity の整数倍である必要があります。

ptu_capacity

Object

body

条件付きで必須

"plan": "ptu" の場合にのみ利用可能です。

詳細については、「PTU デプロイメントの機能サポート」をご参照ください。

"plan": "ptu" が設定されている場合にのみ有効です。

例: "ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }

ptu_capacity.input_tpm

Number

body

すべてのモデルでサポートされています。入力トークン/分。デプロイ済みモデルがサポートする1分あたりの最大入力トークン数。

ptu_capacity.output_tpm

Number

body

すべてのモデルでサポートされています。出力トークン/分。デプロイ済みモデルがサポートする1分あたりの最大出力トークン数。

ptu_capacity.thinking_output_tpm

Number

body

一部のモデルでサポートされています。思考出力トークン/分。デプロイ済みモデルがサポートする1分あたりの最大思考出力トークン数。

レスポンス例

レスポンス例:

{
  "request_id": "6c6b7676-3fea-423b-bc26-c9e2337e1142",
  "output": {
    "deployed_model": "emo-35b3f106-sample01",
    "gmt_create": "2025-06-17T11:00:38",
    "gmt_modified": "2025-06-17T11:42:02.311",
    "status": "UPDATING",
    "model_name": "emo",
    "base_model": "emo",
    "base_capacity": 1,
    "capacity": 2,
    "ready_capacity": 1,
    "workspace_id": "llm-v71tlv3dezezp2en",
    "charge_type": "post_paid",
    "creator": "17580541***",
    "modifier": "17580541***"
  }
}

レスポンスパラメーター

レスポンスパラメーターは「モデルのデプロイメントの取得」と同じです。詳細については、同操作のレスポンスパラメーターをご参照ください。

デプロイメントの削除

指定のモデルデプロイメントを削除して、対応するコンピューティングリソースを解放します。

重要この操作を実行すると、モデルデプロイメントサービスは直ちにオフラインになり、復元できません

  1. モデルは呼び出しできなくなります。
  2. デプロイメントサービスの課金が停止します。

エンドポイント

DELETE https://dashscope-intl.aliyuncs.com/api/v1/deployments/{deployed_model}

リクエスト例

次のコマンドを実行して、指定のデプロイメントを削除します。

curl --request DELETE "https://dashscope-intl.aliyuncs.com/api/v1/deployments/emo-35b3f106-sample01" \
    --header "Authorization: Bearer ${DASHSCOPE_API_KEY}" \
    --header 'Content-Type: application/json'

リクエストパラメーター

パラメーター

タイプ

場所

必須

説明

deployed_model

文字列

パス

はい

モデルデプロイメントの一意の識別子で、デプロイメントの作成 API またはデプロイメント一覧表示 API から取得できます。

レスポンス例

status フィールドに注目してください。ステータスが DELETING になると、デプロイメントが削除中であることを示します。

{
  "request_id": "5378b78b-8564-481f-a3e0-580e551df22c",
  "output": {
    "deployed_model": "emo-35b3f106-sample01",
    "gmt_create": "2025-06-17T11:00:38",
    "gmt_modified": "2025-06-17T11:42:02",
    "status": "DELETING",
    "model_name": "emo",
    "base_model": "emo",
    "base_capacity": 1,
    "capacity": 2,
    "ready_capacity": 1,
    "workspace_id": "llm-v71tlv3***",
    "charge_type": "post_paid",
    "creator": "175805416***",
    "modifier": "175805416***"
  }
}

次に、モデルデプロイメントの取得 API を呼び出して削除を確認します。次のレスポンスが返された場合、デプロイメントサービスは存在せず、正常に削除されたことを意味します。

{
    "request_id": "eb619064-0c4f-4d29-aa49-xxxxxx",
    "message": "Not found.",
    "code": "NotFound"
}

レスポンスパラメーター

レスポンスパラメーターは モデルデプロイメントの取得 と同じです。詳細については、「モデルデプロイメントの取得」のレスポンスパラメーターをご参照ください。

エラーレスポンス

レスポンス例

{
    "request_id": "ca218d57-b91b-46b2-bd35-c41c6287bcf4",
    "message": "Model: qwen-plus-20230703-cx7f not found!",
    "code": "NotFound"
}

レスポンスパラメータ

フィールド

タイプ

説明

request_id

文字列

リクエストの一意の ID です。

code

文字列

エラーコードです。

message

文字列

エラーメッセージです。

考えられるエラー:

エラーコード

エラーメッセージ

エラーの理由

NotFound

Model: xxx not found!

  • 新しいデプロイメントに指定したモデルが存在しません。

  • 指定したデプロイメントに関連付けられているモデルが存在しません。

Conflict

Deployed model xxx already exists, please specify a suffix.

同じ名前のモデルが既にデプロイされています。デプロイメントを区別するために、サフィックスを指定する必要があります。

InvalidParameter

Invalid capacity (xx), capacity must be larger than or equal to 0 and multiples of 1 and less than 1000!

デプロイメントの作成または更新時に、無効なキャパシティユニットが指定されました。