すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:デプロイメントの作成

最終更新日:Sep 09, 2026

モデルデプロイ タスクを作成します。

前提条件

  • モデルデプロイの概要」および「API を使用したモデルのデプロイ」を読み、Alibaba Cloud Model Studio (Model Studio) でのモデルデプロイの仕組みと基本的なワークフローを理解している必要があります。
  • Model Studio 用の API キーを設定している必要があります。詳細については、「API キーの取得」をご参照ください。

モデルデプロイ

エンドポイント

POST https://dashscope-intl.aliyuncs.com/api/v1/deployments

リクエスト例

プロビジョニングされたスループット (PTU)

注記デプロイコマンドを実行すると、サービスが正常にデプロイされた直後から、使用していなくても課金が開始されます。続行する前に、サービスの課金ルールを確認することを推奨します。

プロビジョニングされたスループット課金方式は、使用時間に基づいて課金されます。この方法は、安定したスループット、高い同時実行数、低レイテンシー、予測可能なトラフィックを必要とするシナリオに適しています。このモードでは、プラットフォームがスループット/同時実行数生成速度の両方をプロビジョニングしますが、これらを調整することはできません。

curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "name": "my_qwen3_8b_ft_ptu",
    "model_name": "qwen3-8b-ft-202511132025-0260",
    "plan": "ptu",
    "ptu_capacity": {
        "input_tpm": 10000,
	"output_tpm": 1000
    }
}'

モデルユニット

注記

  • デプロイコマンドを実行すると、サービスが正常にデプロイされた直後から、使用していなくても課金が開始されます。続行する前に、サービスの課金ルールを確認することを推奨します。
  • 後払いのモデルユニットプランのコンピューティングリソースは、先着順で割り当てられます。購入が失敗した場合、全額が返金されます。

モデルユニット課金方式は、使用時間に基づいて課金されます。この課金方法は、モデルのファインチューニング後の大規模な推論タスクに最適で、柔軟なパフォーマンスとコスト調整が可能な専用リソースを提供します。スループット/同時実行数と生成速度の両方をカスタマイズできます。

curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "name": "my_qwen3_8b_ft_mu",
    "model_name": "qwen3-8b-ft-202511132025-0260",
    "plan": "mu",
    "deploy_spec": "MU1",
    "enable_thinking": true,
    "capacity": 4,
    "max_context_length": 10000,
    "rpm_limit": 500,
    "tpm_limit": 1000
}'

モデルユニットのデプロイモードでは、以下の追加設定がサポートされています:

設定項目

設定詳細

サービス名

デプロイサービスのカスタム名。

モデルの選択

プラットフォーム組み込みモデルやファインチューニング済みモデルなど、デプロイするモデルを選択します。

モデルユニットタイプ

デプロイ仕様を選択します。仕様が異なると、コンピューティング能力とパフォーマンスも異なります。

デプロイレプリカ数

デプロイレプリカの初期数を設定します。これはサービスの同時実行能力に影響します。

デプロイテンプレート

デプロイテンプレート (「シングルノードデプロイ」など) を選択します。テンプレートが異なると、リソース設定スキームも異なります。モデルユニット課金モードでのみ利用可能です。

モデル推論モードの設定

モデルユニット モードでデプロイされた一部のモデルでは、推論モード、最大コンテキスト長などを設定できます。

  • Instruct - デプロイ後、モデルはノンシンキングモードで推論を実行します。

  • Thinking - デプロイ後、モデルは思考モードで推論を実行します。

最大コンテキスト長

一部のモデルの モデルユニット デプロイモードでは、この設定がサポートされています。最大コンテキスト長はモデルタイプによって異なります。

サービスレート制限

一部のモデルの モデルユニット デプロイモードでは、この設定がサポートされています。モデル呼び出しの RPM と TPM を制限できます。

API を使用してこれらの設定を構成する方法については、「API を使用したモデルデプロイメントタスクの作成」をご参照ください。

トークン使用量課金

トークン使用量課金では、トークンの使用量に基づいて課金されます。この方法は、同時実行数やレイテンシーの要件が重要でない、コスト重視のシナリオに適しています。このモードは最高の価格優位性を提供します。プラットフォームがスループット/同時実行数と生成速度をプロビジョニングしますが、これらを調整することはできません。

curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "model_name": "qwen3-8b-ft-202511132025-0260",
    "plan": "lora",
    "capacity": 1,
    "name": "my_qwen3_8b_ft_lora"
}'

capacity パラメーターは必須ですが、現在は効果がありません。スケーリングをリクエストするには、モデルデプロイコンソールに移動してフォームを送信してください。

リクエストパラメータ

パラメーター

タイプ

場所

必須

説明

model_name

文字列

body

はい

デプロイするモデルの名前です。これは [マイモデル] のモデル ID に対応します。この ID は、Create Training Job API または Create Import Job API の出力からも取得できます。

plan

文字列

body

はい

デプロイプランです。以下の課金方法がサポートされています:

課金方法

プラン設定

モデルユニットによる課金

"plan": "mu"

コンピューティングユニットによる課金

"plan": "cu"

プロビジョニングされたスループット

"plan": "ptu"

LoRA 共有デプロイ (トークン使用量による課金)

"plan": "lora"

ファインチューニングされたモデルでサポートされているデプロイプランは、[マイモデル] で簡単に確認できます。

現在、ファインチューニングされた CosyVoice モデルは "plan": "mu" のみをサポートしています。

name

文字列

body

はい

コンソールでのモデルの表示名です。

capacity

整数

body

いいえ

"plan": "mu" が指定されている場合にのみ必須です。デプロイのリソースユニット数を指定します。値は base_capacity の整数倍である必要があります。制約は deploy_spec の値によって異なります。たとえば、MU2 の場合、値は 8 の倍数である必要がありますが、MU5 の場合は 1 にすることができます。例:"capacity": 1

現在、CosyVoice モデルは、対応する capacity 制約を持つ以下の 2 つのデプロイテンプレートを提供しています:

  • シングルノードデプロイ:capacity は 1 の整数倍 (1、2、3、4、5 など) である必要があります。

  • シングルノードデプロイ - flagship complex inference edition:capacity は 8 の整数倍 (8、16、24、32 など) である必要があります。

billing_method

文字列

body

いいえ

"plan": "mu" が指定されている場合にのみ必須です。現在、"POST_PAY" (後払い) のみがサポートされています。例:"billing_method": "POST_PAY"

deploy_spec

文字列

body

はい

この設定は "plan": "mu" が指定されている場合にのみ適用されます。

機能のサポート状況の詳細については、「モデルユニットデプロイの機能サポート」をご参照ください。

このパラメーターは、"plan": "mu" が指定されている場合は 必須 です。例:"deploy_spec": "MU1"

この値は、Get Deployable Model List API が返す template_id フィールドから取得できます。

enable_thinking

ブール値

body

いいえ

一部のモデルでサポートされています。true または false に設定できます。

max_context_length

数値

body

いいえ

一部のモデルでサポートされています。例:"max_context_length": 131072

rpm_limit

数値

body

いいえ

一部のモデルでサポートされています。1 分あたりの最大リクエスト数 (RPM) を指定します。

tpm_limit

数値

body

いいえ

一部のモデルでサポートされています。1 分あたりの最大トークン数 (TPM) を指定します。

ptu_capacity

オブジェクト

body

いいえ

この設定は "plan": "ptu" が指定されている場合にのみ適用されます。

機能のサポート状況の詳細については、「PTU デプロイの機能サポート」をご参照ください。

このパラメーターを指定しない場合、システムはデフォルトで 10,000 input_tpm1,000 output_tpm になります。

例:"ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }

例: "ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }

ptu_capacity.input_tpm

数値

body

いいえ

1 分あたりの最大入力トークン数 (TPM) を指定します。

ptu_capacity.output_tpm

数値

body

いいえ

1 分あたりの最大出力トークン数 (TPM) を指定します。

ptu_capacity.thinking_output_tpm

数値

body

いいえ

一部のモデルでサポートされています。プロビジョニングされた思考出力の 1 分あたりの最大トークン数 (TPM) を指定します。

suffix

文字列

body

いいえ

モデルがデプロイされると、新しいモデル名が生成されます。suffix パラメーターは、この新しい名前のサフィックスを指定します。これはグローバルに一意である必要があります。最大長は 8 文字です。モデルの最初のデプロイではサフィックスを省略できます。同じモデルを複数回デプロイする場合は、デプロイごとに一意のサフィックスを指定する必要があります。

詳細については、出力パラメーター deployed_model をご参照ください。

対応モデル

対応機能 と請求情報を表示します。

使用期間による課金 (プロビジョニング済みスループット)

コスト = 使用期間 × (入力 TPM 単価 × 入力 TPM + 出力 TPM 単価 × 出力 TPM)

後払いは時間単位で計算されます:使用期間の単位は時間で、単価は以下の表の「1 時間連続」の列を取ります。前払いは日単位で計算されます:使用期間の単位は日で、単価は以下の表の「1 日連続」の列を取ります。

  • 前払い注文は支払い後すぐに有効になり、N 日目の 23:59 まで N 日間有効です。22:00 以降に注文した場合、有効期限は自動的に 1 日延長されます。
  • 前払い注文の有効期限が切れた後、サービスは 2 時間の遅延をもって停止され、リソースは停止後 14 時間保持された後に解放されます。
  • 前払い注文は早期に終了することはできません。
  • 後払い課金の場合、アカウントが支払い遅延状態になると、デプロイされたリソースは 24 時間保持され、課金されます。この間、サービスは通常通り使用できます。24 時間後、システムは課金を停止し、モデルデプロイは支払い遅延状態に入り、基盤となるリソースは削除されますが、モデルデプロイタスクは保持されます。支払い遅延を解消すると、システムはリソースを再割り当てし、使用を再開します (再開後も料金は発生し続けます)。料金の発生を継続したくない場合は、モデルデプロイタスクを削除できます。正常に削除されると、課金は停止します。

モデルの入力が最大入力トークンを超えた場合、関連する呼び出しは自動的に現在のモデルの従量課金モードに切り替わります。購入した TPM を超えた場合は、作成時に選択したオーバーフローポリシー (「自動オーバーフロー」は従量課金に切り替え、「PTU 容量のみ」は 429 を返す) に従って処理されます。このとき、推論パフォーマンスが低下する可能性があり、ワークスペース内の現在のスナップショットモデルのパブリックトラフィックによって管理され、料金はモデル呼び出し (従量課金) の基準に従って請求されます。

  • このとき (「自動オーバーフロー」ポリシーの場合のみ)、呼び出し API 応答ヘッダーには x-dashscope-ptu-overflow:true が含まれます。
  • TPM の統計については、モデルモニタリングをご参照ください。

スケールイン (スペックダウン) シナリオの具体的な料金削減および返金ルールについては、「設定スペックダウンの返金ルール」をご参照ください。

注記PTU デプロイは、段階的容量係数と長い入力に対するキャッシュ割引をサポートしています。詳細については、「プロビジョニング済みスループットの長い入力とキャッシュ」をご参照ください。

シンガポール

Qwen

モデル名

モデルコード

最大入力トークン

後払い入力

10K TPM/時間あたり

後払い出力

1K TPM/時間あたり

前払い入力

10K TPM/日あたり

前払い出力

1K TPM/日あたり

Qwen3.8-Max

qwen3.8-max

1M

$4.8

$1.44

$57.6

$17.28

Qwen3.7-Max-2026-05-20

qwen3.7-max-2026-05-20

256K

$1.92

$1.8

$72

$21.6

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

256K

$0.96

$0.384

$11.52

$4.608

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128K

$1.2

$0.72

$14.4

$8.64

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128K

$0.96

$0.576

$11.52

$6.912

DeepSeek

モデル名

モデルコード

最大入力トークン

後払い入力

10K TPM/時間あたり

後払い出力

1K TPM/時間あたり

前払い入力

10K TPM/日あたり

前払い出力

1K TPM/日あたり

DeepSeek-v4-Flash

deepseek-v4-flash

256K

$0.72

$0.144

$8.64

$1.728

DeepSeek-v4-Pro

deepseek-v4-pro

256K

$0.96

$1.728

$103.68

$20.736

DeepSeek-v3.2

deepseek-v3.2

64K

$2.05

$0.616

$24.62

$7.387

GLM

モデル名

モデルコード

最大入力トークン

後払い入力

10K TPM/時間あたり

後払い出力

1K TPM/時間あたり

前払い入力

10K TPM/日あたり

前払い出力

1K TPM/日あたり

GLM-5.2

glm-5.2

1M

$5.04

$1.584

$60.48

$19.008

GLM-5.1

glm-5.1

64K

$5.04

$1.584

$64.8

$19.008

Qwen-VL

モデル名

モデルコード

最大入力トークン

後払い入力

10K TPM/時間あたり

後払い出力

1K TPM/時間あたり

前払い入力

10K TPM/日あたり

前払い出力

1K TPM/日あたり

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

128K

$0.48

$0.384

$5.76

$4.608

中国北部 2 (北京)

Qwen

モデル名

モデルコード

最大入力トークン

後払い入力

10K TPM/時間あたり

後払い出力

1K TPM/時間あたり

サブスクリプション入力

10K TPM/日あたり

サブスクリプション出力

1K TPM/日あたり

Qwen3.8-Max

qwen3.8-max

1M

$3.96

$1.188

$47.53

$14.258

Qwen3.7-Max-2026-05-20

qwen3.7-max-2026-05-20

256K

$3.96

$1.188

$47.53

$14.258

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

256K

$0.66

$0.264

$7.92

$3.168

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128K

$0.67

$0.066

$7.93

$4.753

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128K

$0.26

$0.16

$3.17

$1.9

Qwen3-Max-2025-09-23

qwen3-max-2025-09-23

128K

$1.11

$0.45

$13.32

$5.4

Qwen-Flash-2025-07-28

qwen-flash-2025-07-28

128K

$0.06

$0.06

$0.72

$0.72

Qwen-Plus-2025-12-01

qwen-plus-2025-12-01

128K

$0.28

ノンシンキング:$0.07

思考:$0.28

$3.36

ノンシンキング:$0.84

思考:$3.36

DeepSeek

モデル名

モデルコード

最大入力トークン

後払い入力

10K TPM/時間あたり

後払い出力

1K TPM/時間あたり

サブスクリプション入力

10K TPM/日あたり

サブスクリプション出力

1K TPM/日あたり

DeepSeek-v4-Flash

deepseek-v4-flash

256K

$0.5

$0.099

$5.94

$1.188

DeepSeek-v4-Pro

deepseek-v4-pro

256K

$5.94

$1.188

$71.3

$14.26

DeepSeek-v3.2

deepseek-v3.2

64K

$1.04

$0.16

$12.48

$1.92

DeepSeek-v3

deepseek-v3

64K

$0.99

$0.396

$11.9

$4.75

GLM

モデル名

モデルコード

最大入力トークン

後払い入力

10K TPM/時間あたり

後払い出力

1K TPM/時間あたり

サブスクリプション入力

10K TPM/日あたり

サブスクリプション出力

1K TPM/日あたり

GLM-5.2

glm-5.2

1M

$3.96

$1.386

$47.53

$16.635

GLM-5.1

glm-5.1

64K

$2.97

$1.19

$35.65

$14.26

Qwen-VL

モデル名

モデルコード

最大入力トークン

後払い入力

10K TPM/時間あたり

後払い出力

1K TPM/時間あたり

サブスクリプション入力

10K TPM/日あたり

サブスクリプション出力

1K TPM/日あたり

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

128K

$0.35

$0.35

$4.2

$4.2

使用期間による課金 (モデルユニット)

コスト = 使用期間 (時間) × モデルユニット数 × モデルユニット単価

「モデルユニット単価」は、従量課金シナリオでは以下の表の「時間単位価格」の列を取ります。月次前払い課金の場合、数式は月数 × モデルユニット数 × 月単位価格になります。

  • 前払い購入の最初の 1 か月について、最初の 1 か月以内に早期にキャンセルした場合、日単位の単価 (≈ 月単位価格 / 30) が 1.2 倍で請求されます (1 日未満は 1 日として請求されます)

注記モデルユニットの従量課金方法によるコンピューティングリソースは先着順です。購入に失敗した場合、全額返金されます。

シンガポール

テキスト生成

モデル名

モデルコード

モデルユニット仕様

時間単位価格 (USD)

最小課金単位:分

月単位価格 (USD)

最小課金単位:日

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

MU1 x 8

$88

$41,832

Qwen3.5-397B-A17B

qwen3.5-397b-a17b

MU2 x 8

$112

$52,392

Qwen3.5-122B-A10B

qwen3.5-122b-a10b

MU2 x 8

$112

$52,392

Qwen3.5-27B

qwen3.5-27b

MU1 x 2

$22

$10,458

Qwen3.5-9B

qwen3.5-9b

MU1 x 2

$22

$10,458

GLM-5.1

glm-5.1

MU2 x 8

$112

$52,392

MU3 x 8

$216

$102,696

DeepSeek-v4-Flash

deepseek-v4-flash

MU2 x 8

$112

$52,392

Qwen-Plus-Character-2025-11-06

qwen-plus-character-2025-11-06

MU1 x 4

$44

$20,916

マルチモーダル

モデル名

モデルコード

モデルユニット仕様

時間単位価格 (USD)

最小課金単位:分

月単位価格 (USD)

最小課金単位:日

Qwen3-VL-32B-Instruct

qwen3-vl-32b-instruct

MU2 x 8

$112

$52,392

モデルタイプ:

  • Instruct - モデルデプロイ後、推論はノンシンキングモードで実行されます。

中国北部 2 (北京)

テキスト生成

Qwen

モデル名

モデルコード

モデルユニット仕様

時間単位価格 (USD)

最小課金単位:分

月単位価格 (USD)

最小課金単位:日

Qwen3.6-35B-A3B

qwen3.6-35b-a3b

MU1 x 8

$59.408

$28,734.256

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

MU9 x 1

$7.014

$3,383.024

Qwen3.6-27B

qwen3.6-27b

MU9 x 1

$7.014

$3,383.024

Qwen3.6-Flash-2026-04-16

qwen3.6-flash-2026-04-16

MU1 x 2

$14.852

$7,183.564

MU3 x 8

$150.72

$72,577.152

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

MU1 x 8

MU1 x 16(PD 分離モード)

$59.408

PD 分離モード:$118.816

$28,734.256

PD 分離モード:$57,468.512

Qwen3.5-397B-A17B

qwen3.5-397b-a17b

MU3 x 8

MU3 x 16(PD 分離モード)

$150.72

PD 分離モード:$301.44

$72,577.152

PD 分離モード:$145,154.304

MU6 x 16

$55.008

$26,599.92

Qwen3.5-122B-A10B

qwen3.5-122b-a10b

MU1 x 4

$29.704

$14,367.128

MU6 x 16

$55.008

$26,599.92

Qwen3.5-35B-A3B

qwen3.5-35b-a3b

MU1 x 2

$14.852

$7,183.564

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

MU9 x 1

$7.014

$3,383.024

Qwen3.5-27B

qwen3.5-27b

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

MU8 x 1

$6.464

$3,080.477

MU9 x 1

$7.014

$3,383.024

Qwen3.5-9B

qwen3.5-9b

MU2 x 2

$17.328

$8,261.18

Qwen3.5-Flash-2026-02-23

qwen3.5-flash-2026-02-23

MU1 x 2

$14.852

$7,183.564

Qwen3.5-Plus-2026-02-15

qwen3.5-plus-2026-02-15

MU1 x 8

MU1 x 16(PD 分離モード)

$59.408

PD 分離モード:$118.816

$28,734.256

PD 分離モード:$57,468.512

MU2 x 8

$69.312

$33,044.72

MU3 x 8

MU3 x 16(PD 分離モード)

$150.72

PD 分離モード:$301.44

$72,577.152

PD 分離モード:$145,154.304

Qwen3-235B-A22B-Instruct-2507

qwen3-235b-a22b-instruct-2507

MU1 x 4

$29.704

$14,367.128

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

Qwen3-32B

qwen3-32b

MU6 x 16

$55.008

$26,599.92

Qwen3-30B-A3B-Thinking-2507

qwen3-30b-a3b-thinking-2507

MU1 x 2

$14.852

$7,183.564

Qwen3-8B

qwen3-8b

MU1 x 2

$14.852

$7,183.564

MU2 x 2

$17.328

$8,261.18

Qwen3-4B

qwen3-4b

MU1 x 2

$14.852

$7,183.564

MU5 x 1

$2.888

$1,394.329

Qwen3-Embedding-0.6B

qwen3-embedding-0.6b

MU5 x 1

$2.888

$1,394.329

MU6 x 1

$3.438

$1,662.495

Qwen3-MoE-Rerank-0.6B

qwen3-moe-rerank-0.6b

MU5 x 1

$2.888

$1,394.329

Qwen3-Rerank-0.6B

qwen3-rerank-0.6b

MU5 x 1

$2.888

$1,394.329

MU6 x 1

$3.438

$1,662.495

Qwen3-Max-2025-09-23

qwen3-max-2025-09-23

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

Qwen3-Rerank

qwen3-rerank

MU5 x 1

$2.888

$1,394.329

Qwen2.5-Open-Source-72B

qwen2.5-72b-instruct

MU1 x 8

$59.408

$28,734.256

Qwen2.5-Open-Source-14B

qwen2.5-14b-instruct

MU1 x 2

$14.852

$7,183.564

Qwen2.5-Open-Source-7B

qwen2.5-7b-instruct

MU1 x 2

$14.852

$7,183.564

MU5 x 1

$2.888

$1,394.329

Qwen-Plus-2025-07-28

qwen-plus-2025-07-28

MU1 x 4

MU1 x 16(PD 分離モード)

$29.704

PD 分離モード:$118.816

$14,367.128

PD 分離モード:$57,468.512

Qwen-Plus-2025-12-01

qwen-plus-2025-12-01

MU1 x 4

$29.704

$14,367.128

Qwen-Plus-Character-2025-11-06

qwen-plus-character-2025-11-06

MU1 x 4

$29.704

$14,367.128

GLM

モデル名

モデルコード

モデルユニット仕様

時間単位価格 (USD)

最小課金単位:分

月単位価格 (USD)

最小課金単位:日

GLM-5.1

glm-5.1

MU2 x 8

$69.312

$33,044.72

MU3 x 16(PD 分離モード)

PD 分離モード:$301.44

PD 分離モード:$145,154.304

MU6 x 16

$55.008

$26,599.92

GLM-5

glm-5

MU3 x 16(PD 分離モード)

PD 分離モード:$301.44

PD 分離モード:$145,154.304

GLM-4.7

glm-4.7

MU6 x 32(PD 分離モード)

PD 分離モード:$110.016

PD 分離モード:$53,199.84

DeepSeek

モデル名

モデルコード

モデルユニット仕様

時間単位価格 (USD)

最小課金単位:分

月単位価格 (USD)

最小課金単位:日

DeepSeek-v4-Flash

deepseek-v4-flash

MU1 x 8

$59.408

$28,734.256

MU3 x 8

$150.72

$72,577.152

DeepSeek-v3.2

deepseek-v3.2

MU2 x 16 (PD 分離モード)

PD 分離モード: $138.624

PD 分離モード: $66,089.44

その他のモデル

モデル名

モデルコード

モデルユニット仕様

時間単位価格 ($)

最小課金単位:分

月単位価格 ($)

最小課金単位:日

Kimi-K2.5

kimi-k2.5

MU2 x 8

$69.312

$33,044.72

マルチモーダル

Qwen-VL

モデル名

モデルコード

モデルユニット仕様

時間単位価格 ($)

最小課金単位:分

月単位価格 ($)

最小課金単位:日

Qwen3-VL-235B-A22B-Thinking

qwen3-vl-235b-a22b-thinking

MU1 x 8

$59.408

$28,734.256

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

Qwen3-VL-32B-Instruct

qwen3-vl-32b-instruct

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

Qwen3-VL-8B-Instruct

qwen3-vl-8b-instruct

MU1 x 2

$14.852

$7,183.564

MU5 x 1

$2.888

$1,394.329

Qwen3-VL-4B-Instruct

qwen3-vl-4b-instruct

MU1 x 2

$14.852

$7,183.564

Qwen3-VL-2B-Instruct

qwen3-vl-2b-instruct

MU5 x 1

$2.888

$1,394.329

Qwen3-VL-Embedding-2B

qwen3-vl-embedding-2b

MU5 x 1

$2.888

$1,394.329

Qwen3-VL-Flash-2025-10-15

qwen3-vl-flash-2025-10-15

MU1 x 4

$29.704

$14,367.128

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

MU1 x 4

$29.704

$14,367.128

Qwen-VL-Max-2025-08-13

qwen-vl-max-2025-08-13

MU6 x 4

$13.752

$6,649.98

Qwen-Omni

モデル名

モデルコード

モデルユニット仕様

時間単位価格 ($)

最小課金単位:分

月単位価格 ($)

最小課金単位:日

Qwen3.5-Omni-Flash

qwen3.5-omni-flash

MU9 x 1

$7.014

$3,383.024

モデルタイプ:

  • Instruct - デプロイ後、モデルはノンシンキングモードで推論を実行します。
  • Thinking - デプロイ後、モデルは思考モードで推論を実行します。

モデルのトークン使用量による

料金 = モデル入力トークン数 × モデル入力単価 + モデル出力トークン数 × モデル出力単価 (最小課金単位:1 トークン)

  • モデルのトークン使用量による課金は、以下のベースモデルで SFT 効率的なトレーニングを完了し、カスタムモデルを取得した後にのみサポートされます。

シンガポール

ベースモデル

モデルコード

入力

$/100万トークン

出力

$/100万トークン

Qwen3-14B

qwen3-14b

ノンシンキングモード:$0.35

思考モード:$0.35

ノンシンキングモード:$1.4

思考モード:$4.2

北京

ベースモデル

モデルコード

入力

$/100万トークン

出力

$/100万トークン

Qwen3.5-27B

qwen3.5-27b

<128K $0.086

128K-256K $0.258

<128K $0.688

128K-256K $2.064

Qwen3-32B

qwen3-32b

ノンシンキングモード:$0.287

思考モード:$0.287

ノンシンキングモード:$1.147

思考モード:$2.868

Qwen3-14B

qwen3-14b

ノンシンキングモード:$0.144

思考モード:$0.144

ノンシンキングモード:$0.574

思考モード:$1.434

Qwen3-8B

qwen3-8b

ノンシンキングモード:$0.072

思考モード:$0.072

ノンシンキングモード:$0.287

思考モード:$0.717

Qwen3-VL-8B-Instruct

qwen3-vl-8b-instruct

$0.072

$0.287

レスポンスの例

コマンドは次の内容を返します。

{
  "request_id": "f2ae64f7-83cc-410c-bc0b-840443f7eb86",
  "output": {
    "deployed_model": "emo-35b3f106-sample01",
    "gmt_create": "2025-06-17T11:00:38.68",
    "gmt_modified": "2025-06-17T11:00:38.68",
    "status": "PENDING",
    "model_name": "emo",
    "base_model": "emo",
    "base_capacity": 1,
    "capacity": 1,
    "ready_capacity": 0,
    "workspace_id": "llm-v71tlv3d***",
    "charge_type": "post_paid",
    "creator": "175805416***",
    "modifier": "175805416***"
  }
}

応答パラメーター

パラメータータイプ説明

request_id

文字列

リクエストの ID。

output

オブジェクト

デプロイメントタスクの詳細。

deployed_model

文字列

デプロイ済みモデルの一意な識別子。この ID は、デプロイメント詳細のクエリデプロイメントのレート制限の変更デプロイメントのスケーリングデプロイメントの削除などの API 操作で使用されるほか、モデル呼び出し時に SDK パラメーターとしても渡されます。

gmt_create

文字列

デプロイメントタスクの作成時刻。

gmt_modified

文字列

デプロイメントタスクの最終更新時刻。

status

文字列

デプロイメントタスクのステータス。

  • PENDING:作成中です。
  • UPDATING:更新中です。
  • RUNNING:実行中です。デプロイ済みモデルはリクエストを処理できます。
  • STOPPED:停止中です。課金は発生しません。
  • DELETING:削除中です。
  • FAILED:タスクの作成または更新に失敗しました。

model_name

文字列

デプロイメントタスクで使用されるモデル名。

base_model

文字列

デプロイメントタスクで使用されるベースモデルの ID。

base_capacity

数値

ベースモデルの実行に必要な最小リソースユニット数。

capacity

数値

デプロイメントタスクが使用するリソースユニット数。

ready_capacity

数値

即座にリクエストを処理できる、準備が完了したリソースユニット数。リソースの初期化速度やハードウェアのステータスによって、この値は制限されることがあります。

workspace_id

文字列

デプロイメントタスクのワークスペース ID。

charge_type

文字列

デプロイメントタスクの課金方法。

post_paid:後払い。

creator

文字列

デプロイメントタスクを作成したユーザーの UID。

modifier

文字列

デプロイメントタスクを最終更新したユーザーの UID。

plan

文字列

デプロイメントタスクの課金モデル。一部の課金モデルでは、このパラメーターは返されません。

[モデルユニット] デプロイメントの場合のみ返されます。

model_unit_spec

文字列

Model Unit の仕様。

enable_thinking

ブーリアン

思考モードが有効になっているかどうかを示します。この機能は、特定のモデルでのみ利用できます。

max_context_length

数値

最大コンテキスト長。

rpm_limit

数値

1 分あたりの最大リクエスト数 (RPM)。

tpm_limit

数値

1 分あたりの最大トークン数 (TPM)。

プロビジョニングされたスループット (PTU) デプロイメントの場合のみ返されます。

ptu_capacity

オブジェクト

このパラメーターは、"plan": "ptu" が設定されている場合にのみ有効です。

例:"ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }

ptu_capacity.input_tpm

数値

デプロイ済みモデルの1 分あたりの最大入力トークン数 (TPM)。この機能はすべてのモデルでサポートされています。

ptu_capacity.output_tpm

数値

デプロイ済みモデルの1 分あたりの最大出力トークン数 (TPM)。この機能はすべてのモデルでサポートされています。

ptu_capacity.thinking_output_tpm

数値

デプロイ済みモデルの1 分あたりの最大思考出力トークン数 (TPM)。この機能は、特定のモデルでのみ利用できます。

エラーレスポンス

レスポンス例

{
    "request_id": "ca218d57-b91b-46b2-bd35-c41c6287bcf4",
    "message": "Model: qwen-plus-20230703-cx7f not found!",
    "code": "NotFound"
}

レスポンスパラメーター

パラメーター

タイプ

説明

request_id

文字列

リクエストの一意の ID。

code

文字列

エラーコード。

message

文字列

エラーメッセージ。

リクエストが失敗した場合、次のエラーが発生することがあります。

エラーコード

エラーメッセージ

原因

NotFound

Model: xxx not found!

  • 存在しないモデルでデプロイメントタスクを作成しようとしました。

  • 存在しないモデルでデプロイメントタスクのクエリ、更新、または削除を行おうとしました。

Conflict

Deployed model xxx already exists, please specify a suffix.

既に使用されているサフィックスでデプロイメントタスクを作成しようとしました。

InvalidParameter

Invalid capacity (xx), capacity must be larger than or equal to 0 and multiples of 1 and less than 1000!

無効なキャパシティーユニット数でデプロイメントタスクを作成または更新しようとしました。キャパシティーユニット数は、0 以上、1000 未満の 1 の倍数である必要があります。