すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:デプロイメントの作成

最終更新日:Jul 06, 2026

モデルデプロイ タスクを作成します。

前提条件

モデルデプロイ

エンドポイント

POST https://dashscope-intl.aliyuncs.com/api/v1/deployments

リクエスト例

プロビジョニングされたスループット (PTU)

説明

デプロイコマンドを実行すると、サービスが正常にデプロイされた直後から、使用していなくても課金が開始されます。続行する前に、サービスの課金ルールを確認することを推奨します。

プロビジョニングされたスループット課金方式は、使用時間に基づいて課金されます。この方法は、安定したスループット、高い同時実行数、低レイテンシー、予測可能なトラフィックを必要とするシナリオに適しています。このモードでは、プラットフォームがスループット/同時実行数生成速度の両方をプロビジョニングしますが、これらを調整することはできません。

curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "name": "my_qwen3_8b_ft_ptu",
    "model_name": "qwen3-8b-ft-202511132025-0260",
    "plan": "ptu",
    "ptu_capacity": {
        "input_tpm": 10000,
	"output_tpm": 1000
    }
}'

モデルユニット

説明
  • デプロイコマンドを実行すると、サービスが正常にデプロイされた直後から、使用していなくても課金が開始されます。続行する前に、サービスの課金ルールを確認することを推奨します。

  • 後払いのモデルユニットプランのコンピューティングリソースは、先着順で割り当てられます。購入が失敗した場合、全額が返金されます。

モデルユニット課金方式は、使用時間に基づいて課金されます。この課金方法は、モデルのファインチューニング後の大規模な推論タスクに最適で、柔軟なパフォーマンスとコスト調整が可能な専用リソースを提供します。スループット/同時実行数と生成速度の両方をカスタマイズできます。

curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "name": "my_qwen3_8b_ft_mu",
    "model_name": "qwen3-8b-ft-202511132025-0260",
    "plan": "mu",
    "deploy_spec": "MU1",
    "enable_thinking": true,
    "capacity": 4,
    "max_context_length": 10000,
    "rpm_limit": 500,
    "tpm_limit": 1000
}'

モデルユニットのデプロイモードでは、以下の追加設定がサポートされています:

設定

詳細

サービス名

デプロイサービスに付けるカスタム名です。

モデルの選択

デプロイするモデルを選択します。事前学習済みのプラットフォームモデルやファインチューニング済みのモデルが含まれます。

モデルユニットタイプ

デプロイ仕様を選択します。仕様によって、コンピューティング能力とパフォーマンスが異なります。

レプリカ数

デプロイの初期レプリカ数を設定します。この設定は、サービスの並行処理能力に影響します。

デプロイテンプレート

「単一マシンデプロイ」などのデプロイテンプレートを選択します。テンプレートによって、リソース設定プランが異なります。この設定は、モデルユニット課金モードでのみ利用可能です。

モデル推論モードの設定

一部のモデルを モデルユニット 方式でデプロイする場合、推論モードや最大コンテキスト長などの設定が可能です。

  • Instruct - デプロイされたモデルはノンシンキングモードで推論を実行します。

  • Thinking - デプロイされたモデルは思考モードで推論を実行します。

最大コンテキスト

一部のモデルの モデルユニット デプロイモードでサポートされています。最大コンテキスト長はモデルタイプに基づきます。

サービススロットリング

一部のモデルの モデルユニット デプロイモードでサポートされています。モデル呼び出しの RPM と TPM を制限できます。

API を使用してこれらの設定を構成する方法については、「API を使用したモデルデプロイメントタスクの作成」をご参照ください。

トークン使用量課金

トークン使用量課金では、トークンの使用量に基づいて課金されます。この方法は、同時実行数やレイテンシーの要件が重要でない、コスト重視のシナリオに適しています。このモードは最高の価格優位性を提供します。プラットフォームがスループット/同時実行数と生成速度をプロビジョニングしますが、これらを調整することはできません。

curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "model_name": "qwen3-8b-ft-202511132025-0260",
    "plan": "lora",
    "capacity": 1,
    "name": "my_qwen3_8b_ft_lora"
}'
capacity パラメーターは必須ですが、現在は効果がありません。スケーリングをリクエストするには、モデルデプロイコンソールに移動してフォームを送信してください。

リクエストパラメータ

パラメーター

タイプ

場所

必須

説明

model_name

文字列

body

はい

デプロイするモデルの名前です。これは [マイモデル] のモデル ID に対応します。この ID は、Create Training Job API または Create Import Job API の出力からも取得できます。

plan

文字列

body

はい

デプロイプランです。以下の課金方法がサポートされています:

課金方法

プラン設定

モデルユニットによる課金

"plan": "mu"

コンピューティングユニットによる課金

"plan": "cu"

プロビジョニングされたスループット

"plan": "ptu"

LoRA 共有デプロイ (トークン使用量による課金)

"plan": "lora"

ファインチューニングされたモデルでサポートされているデプロイプランは、[マイモデル] で簡単に確認できます。

説明

現在、ファインチューニングされた CosyVoice モデルは "plan": "mu" のみをサポートしています。

name

文字列

body

はい

コンソールでのモデルの表示名です。

capacity

整数

body

いいえ

"plan": "mu" が指定されている場合にのみ必須です。デプロイのリソースユニット数を指定します。値は base_capacity の整数倍である必要があります。制約は deploy_spec の値によって異なります。たとえば、MU2 の場合、値は 8 の倍数である必要がありますが、MU5 の場合は 1 にすることができます。例:"capacity": 1

説明

現在、CosyVoice モデルは、対応する capacity 制約を持つ以下の 2 つのデプロイテンプレートを提供しています:

  • シングルノードデプロイ:capacity は 1 の整数倍 (1、2、3、4、5 など) である必要があります。

  • シングルノードデプロイ - flagship complex inference edition:capacity は 8 の整数倍 (8、16、24、32 など) である必要があります。

billing_method

文字列

body

いいえ

"plan": "mu" が指定されている場合にのみ必須です。現在、"POST_PAY" (後払い) のみがサポートされています。例:"billing_method": "POST_PAY"

deploy_spec

文字列

body

はい

この設定は "plan": "mu" が指定されている場合にのみ適用されます。

機能のサポート状況の詳細については、「モデルユニットデプロイの機能サポート」をご参照ください。

このパラメーターは、"plan": "mu" が指定されている場合は 必須 です。例:"deploy_spec": "MU1"

説明

この値は、Get Deployable Model List API が返す template_id フィールドから取得できます。

enable_thinking

ブール値

body

いいえ

一部のモデルでサポートされています。true または false に設定できます。

max_context_length

数値

body

いいえ

一部のモデルでサポートされています。例:"max_context_length": 131072

rpm_limit

数値

body

いいえ

一部のモデルでサポートされています。1 分あたりの最大リクエスト数 (RPM) を指定します。

tpm_limit

数値

body

いいえ

一部のモデルでサポートされています。1 分あたりの最大トークン数 (TPM) を指定します。

ptu_capacity

オブジェクト

body

いいえ

この設定は "plan": "ptu" が指定されている場合にのみ適用されます。

機能のサポート状況の詳細については、「PTU デプロイの機能サポート」をご参照ください。

このパラメーターを指定しない場合、システムはデフォルトで 10,000 input_tpm1,000 output_tpm になります。

例:"ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }

例: "ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }

ptu_capacity.input_tpm

数値

body

いいえ

1 分あたりの最大入力トークン数 (TPM) を指定します。

ptu_capacity.output_tpm

数値

body

いいえ

1 分あたりの最大出力トークン数 (TPM) を指定します。

ptu_capacity.thinking_output_tpm

数値

body

いいえ

一部のモデルでサポートされています。プロビジョニングされた思考出力の 1 分あたりの最大トークン数 (TPM) を指定します。

suffix

文字列

body

いいえ

モデルがデプロイされると、新しいモデル名が生成されます。suffix パラメーターは、この新しい名前のサフィックスを指定します。これはグローバルに一意である必要があります。最大長は 8 文字です。モデルの最初のデプロイではサフィックスを省略できます。同じモデルを複数回デプロイする場合は、デプロイごとに一意のサフィックスを指定する必要があります。

詳細については、出力パラメーター deployed_model をご参照ください。

対応モデル

対応機能と請求情報を表示します。

時間ベースの課金 (プロビジョンドスループット)

コスト = 使用期間 × (入力 TPM 単価 × 入力 TPM + 出力 TPM 単価 × 出力 TPM)

従量課金方法では、使用量は時間単位で課金され、単価は以下の表の時間料金に基づきます。サブスクリプション方法では、使用量は日次で課金され、単価は以下の表の日次料金に基づきます。

  • サブスクリプション注文は支払い後すぐに有効になります。N 日間のサブスクリプションは、N 日目の 23:59 まで有効です。注文が 22:00 以降に行われた場合、有効期限は自動的に 1 日延長されます。

  • サブスクリプション注文の有効期限が切れた後、サービスは 2 時間の猶予期間後に停止されます。サービスが停止された後、リソースは 14 時間保持され、その後解放されます。

  • サブスクリプション注文は早期に終了することはできません。

  • 従量課金方法では、アカウントに支払い遅延がある場合、デプロイされたリソースは保持され、24 時間課金が継続され、その間サービスは利用可能です。24 時間後、システムは課金を停止し、モデルデプロイは支払い遅延状態になります。基盤となるリソースは削除されますが、モデルデプロイタスクは保持されます。遅延額を支払うと、システムはリソースを再割り当てし、サービスを復元し、課金を再開します。料金の発生を停止するには、モデルデプロイタスクを削除する必要があります。タスクが正常に削除されると、課金は停止します。

モデル入力が最大入力トークン数または購入した TPM を超えた場合、呼び出しは自動的に現在のモデルの従量課金モードに切り替わります。この場合、推論パフォーマンスが低下し、ワークスペース内の現在のスナップショットモデルのパブリックトラフィック制御の対象となります。コストは、モデル呼び出し (従量課金) の標準に基づいて請求されます。

  • この場合、API 呼び出しは x-dashscope-ptu-overflow:true を含むヘッダーを返します。

  • TPM 統計を表示するには、モデルモニタリングに移動します。

スケールインシナリオ (スペックダウン) の具体的な返金ルールについては、「スペックダウンの返金ルール」をご参照ください。

シンガポール
Qwen

モデル名

モデルコード

最大入力トークン数

従量課金入力

10k TPM/時間あたり

従量課金出力

1k TPM/時間あたり

サブスクリプション入力

10k TPM/日あたり

サブスクリプション出力

1k TPM/日あたり

Qwen3.7-Max-2026-05-20

qwen3.7-max-2026-05-20

256K

$6

$1.8

$72

$21.6

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

256K

$0.96

$0.384

$11.52

$4.608

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128K

$1.2

$0.72

$14.4

$8.64

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128K

$0.96

$0.576

$11.52

$6.912

DeepSeek

モデル名

モデルコード

最大入力トークン数

従量課金入力

10k TPM/時間あたり

従量課金出力

1k TPM/時間あたり

サブスクリプション入力

10k TPM/日あたり

サブスクリプション出力

1k TPM/日あたり

DeepSeek-v4-Flash

deepseek-v4-flash

256K

$0.72

$0.144

$8.64

$1.728

DeepSeek-v4-Pro

deepseek-v4-pro

256K

$8.64

$1.728

$103.68

$20.736

DeepSeek-v3.2

deepseek-v3.2

64K

$2.05

$0.616

$24.62

$7.387

Qwen-VL

モデル名

モデルコード

最大入力トークン数

従量課金入力

10k TPM/時間あたり

従量課金出力

1k TPM/時間あたり

サブスクリプション入力

10k TPM/日あたり

サブスクリプション出力

1k TPM/日あたり

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

128K

$0.48

$0.384

$5.76

$4.608

その他のモデル

モデル名

モデルコード

最大入力トークン数

従量課金入力

10k TPM/時間あたり

従量課金出力

1k TPM/時間あたり

サブスクリプション入力

10k TPM/日あたり

サブスクリプション出力

1k TPM/日あたり

GLM-5.1

glm-5.1

64K

$5.04

$1.584

$64.8

$19.008

中国 (北京)
Qwen

モデル名

モデルコード

最大入力トークン数

従量課金入力

10k TPM/時間あたり

従量課金出力

1k TPM/時間あたり

サブスクリプション入力

10k TPM/日あたり

サブスクリプション出力

1k TPM/日あたり

Qwen3.7-Max-2026-05-20

qwen3.7-max-2026-05-20

256K

$3.96

$1.188

$47.53

$14.258

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

256K

$0.66

$0.264

$7.92

$3.168

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128K

$0.67

$0.397

$7.93

$4.753

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128K

$0.26

$0.16

$3.17

$1.9

Qwen3-Max-2025-09-23

qwen3-max-2025-09-23

128K

$1.11

$0.45

$13.32

$5.4

Qwen-Flash-2025-07-28

qwen-flash-2025-07-28

128K

$0.06

$0.06

$0.72

$0.72

Qwen-Plus-2025-12-01

qwen-plus-2025-12-01

128K

$0.28

ノンシンキングモード: $0.07

思考モード: $0.28

$3.36

ノンシンキングモード: $0.84

思考モード: $3.36

DeepSeek

モデル名

モデルコード

最大入力トークン数

従量課金入力

10k TPM/時間あたり

従量課金出力

1k TPM/時間あたり

サブスクリプション入力

10k TPM/日あたり

サブスクリプション出力

1k TPM/日あたり

DeepSeek-v4-Flash

deepseek-v4-flash

256K

$0.5

$0.099

$5.94

$1.188

DeepSeek-v4-Pro

deepseek-v4-pro

256K

$5.94

$1.188

$71.3

$14.26

DeepSeek-v3.2

deepseek-v3.2

64K

$1.04

$0.16

$12.48

$1.92

DeepSeek-v3

deepseek-v3

64K

$0.99

$0.396

$11.9

$4.75

Qwen-VL

モデル名

モデルコード

最大入力トークン数

従量課金入力

10k TPM/時間あたり

従量課金出力

1k TPM/時間あたり

サブスクリプション入力

10k TPM/日あたり

サブスクリプション出力

1k TPM/日あたり

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

128K

$0.35

$0.35

$4.2

$4.2

その他のモデル

モデル名

モデルコード

最大入力トークン数

従量課金入力

10k TPM/時間あたり

従量課金出力

1k TPM/時間あたり

サブスクリプション入力

10k TPM/日あたり

サブスクリプション出力

1k TPM/日あたり

GLM-5.1

glm-5.1

64K

$2.97

$1.19

$35.65

$14.26

時間ベースの課金 (モデルユニット)

コスト = 使用期間 (時間) × モデルユニット数 × モデルユニット価格

従量課金方式の場合、「モデルユニット価格」は下表の「時間単位の料金」です。月額サブスクリプション方式の場合、計算式は月数 × モデルユニット数 × 月額料金です。

  • サブスクリプションの場合、最初の 1 か月以内に登録を解除すると、1 日あたりの単価 (≈ 月額単価 / 30) が標準料金の 1.2 倍で請求されます。1 日未満の利用は 1 日として請求されます。

説明

モデルユニットの従量課金方式では、コンピューティング能力リソースは先着順で割り当てられます。購入に失敗した場合は、全額返金されます。

シンガポール
テキスト生成

モデル名

モデルコード

モデルユニット仕様

時間単位の料金 ($)

最小課金単位:分

月額料金 ($)

最小課金単位:日

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

MU1 x 8

$88

$41,832

Qwen3.5-39B-A17B

qwen3.5-397b-a17b

MU2 x 8

$112

$52,392

Qwen3.5-35B-A3B

qwen3.5-35b-a3b

MU2 x 8

$112

$52,392

Qwen3-32B

qwen3-32b

MU1 x 4

$44

$20,916

MU2 x 8

$112

$52,392

Qwen3-14B

qwen3-14b

MU1 x 4

$44

$20,916

GLM-5.1

glm-5.1

MU2 x 8

$112

$52,392

DeepSeek-V4-Flash

deepseek-v4-flash

MU1 x 8

$88

$41,832

マルチモーダル

モデル名

モデルコード

モデルユニット仕様

時間単位の料金 ($)

最小課金単位:分

月額料金 ($)

最小課金単位:日

Qwen3-VL-32B-Instruct

qwen3-vl-32b-instruct

MU2 x 8

$112

$52,392

Qwen3-VL-8B-Instruct

qwen3-vl-8b-instruct

MU1 x 2

$22

$10,458

モデルタイプ:

  • Instruct - デプロイされたモデルはノンシンキングモードで推論を実行します。

中国 (北京)
テキスト生成
Qwen

モデル名

モデルコード

モデルユニット仕様

時間単位の料金 ($)

最小課金単位:分

月額料金 ($)

最小課金単位:日

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

MU3 x 8

$150.72

$72,577.152

Qwen3.6-35B-A3B

qwen3.6-35b-a3b

MU8 x 1

$6.464

$3,080.477

MU9 x 1

$7.014

$3,383.024

Qwen3.6-27B

qwen3.6-27b

MU9 x 1

$7.014

$3,383.024

Qwen3.6-Flash-2026-04-16

qwen3.6-flash-2026-04-16

MU1 x 2

$14.852

$7,183.564

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

MU1 x 8

$59.408

$28,734.256

Qwen3.5-397B-A17B

qwen3.5-397b-a17b

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

MU6 x 16

$55.008

$26,599.92

Qwen3.5-122B-A10B

qwen3.5-122b-a10b

MU1 x 4

$29.704

$14,367.128

MU2 x 8

$69.312

$33,044.72

MU6 x 16

$55.008

$26,599.92

MU9 x 2

$14.028

$6,766.048

Qwen3.5-35B-A3B

qwen3.5-35b-a3b

MU1 x 2

$14.852

$7,183.564

MU2 x 8

$69.312

$33,044.72

MU8 x 1

$6.464

$3,080.477

MU9 x 1

$7.014

$3,383.024

Qwen3.5-27B

qwen3.5-27b

MU9 x 1

$7.014

$3,383.024

Qwen3.5-9B

qwen3.5-9b

MU8 x 1

$6.464

$3,080.477

MU9 x 1

$7.014

$3,383.024

Qwen3.5-Flash-2026-02-23

qwen3.5-flash-2026-02-23

MU1 x 2

$14.852

$7,183.564

Qwen3.5-Plus-2026-02-15

qwen3.5-plus-2026-02-15

MU1 x 8

$59.408

$28,734.256

MU3 x 8

$150.72

$72,577.152

Qwen3-235B-A22B-Instruct

qwen3-235b-a22b-instruct-2507

MU1 x 4

$29.704

$14,367.128

MU2 x 8

$69.312

$33,044.72

Qwen3-Next-80B-A3B-Instruct

qwen3-next-80b-a3b-instruct

MU1 x 2

$14.852

$7,183.564

Qwen3-32B

qwen3-32b

MU1 x 4

$29.704

$14,367.128

MU6 x 4

$13.752

$6,649.98

Qwen3-30B-A3B

qwen3-30b-a3b

MU9 x 2

$14.028

$6,766.048

Qwen3-30B-A3B-Instruct-2507

qwen3-30b-a3b-instruct-2507

MU1 x 4

$29.704

$14,367.128

MU2 x 8

$69.312

$33,044.72

Qwen3-8B

qwen3-8b

MU1 x 2

$14.852

$7,183.564

MU2 x 2

$17.328

$8,261.18

MU5 x 1

$2.888

$1,394.329

Qwen3-4B

qwen3-4b

MU1 x 2

$14.852

$7,183.564

MU5 x 1

$2.888

$1,394.329

Qwen3-1.7B

qwen3-1.7b

MU1 x 2

$14.852

$7,183.564

MU5 x 1

$2.888

$1,394.329

Qwen3-Max-2025-09-23

qwen3-max-2025-09-23

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

Qwen2.5-72B

qwen2.5-72b-instruct

MU1 x 4

$29.704

$14,367.128

Qwen2.5-32B

qwen2.5-32b-instruct

MU1 x 4

$29.704

$14,367.128

Qwen2.5-14B

qwen2.5-14b-instruct

MU1 x 2

$14.852

$7,183.564

Qwen2.5-7B

qwen2.5-7b-instruct

MU1 x 2

$14.852

$7,183.564

MU5 x 1

$2.888

$1,394.329

Qwen2.5-3B-Instruct

qwen2.5-3b-instruct

MU5 x 1

$2.888

$1,394.329

Qwen-Flash-2025-07-28

qwen-flash-2025-07-28

MU1 x 4

$29.704

$14,367.128

Qwen-Plus-2025-07-28

qwen-plus-2025-07-28

MU1 x 4

$29.704

$14,367.128

Qwen-Plus-2025-12-01

qwen-plus-2025-12-01

MU1 x 4

$29.704

$14,367.128

GLM

モデル名

モデルコード

モデルユニット仕様

時間単位の料金 ($)

最小課金単位:分

月額料金 ($)

最小課金単位:日

GLM-5.1

glm-5.1

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

MU6 x 16

$55.008

$26,599.92

GLM-5

glm-5

MU3 x 8

$150.72

$72,577.152

GLM-4.7

glm-4.7

MU6 x 16

$55.008

$26,599.92

DeepSeek

モデル名

モデルコード

モデルユニット仕様

時間単位の料金 ($)

最小課金単位:分

月額料金 ($)

最小課金単位:日

DeepSeek-V4-Flash

deepseek-v4-flash

MU1 x 8

$59.408

$28,734.256

DeepSeek-V3.2

deepseek-v3.2

MU2 x 8

$69.312

$33,044.72

その他のモデル

モデル名

モデルコード

モデルユニット仕様

時間単位の料金 ($)

最小課金単位:分

月額料金 ($)

最小課金単位:日

MiniMax-M2.5

MiniMax-M2.5

MU1 x 8

$59.408

$28,734.256

Kimi-K2.5

kimi-k2.5

MU2 x 8

$69.312

$33,044.72

マルチモーダル
Qwen-VL

モデル名

モデルコード

モデルユニット仕様

時間単位の料金 ($)

最小課金単位:分

月額料金 ($)

最小課金単位:日

Qwen3-VL-235B-A22B-Instruct

qwen3-vl-235b-a22b-instruct

MU1 x 4

$29.704

$14,367.128

Qwen3-VL-235B-A22B-Thinking

qwen3-vl-235b-a22b-thinking

MU1 x 4

$29.704

$14,367.128

Qwen3-VL-32B-Instruct

qwen3-vl-32b-instruct

MU2 x 8

$69.312

$33,044.72

Qwen3-VL-8B-Instruct

qwen3-vl-8b-instruct

MU1 x 2

$14.852

$7,183.564

Qwen3-VL-Flash-2025-10-15

qwen3-vl-flash-2025-10-15

MU1 x 4

$29.704

$14,367.128

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

MU1 x 4

$29.704

$14,367.128

Qwen-VL-Max-2025-08-13

qwen-vl-max-2025-08-13

MU6 x 4

$13.752

$6,649.98

Qwen-VL-OCR-2025-11-20

qwen-vl-ocr-2025-11-20

MU6 x 4

$13.752

$6,649.98

Qwen Omni

モデル名

モデルコード

モデルユニット仕様

時間単位の料金 ($)

最小課金単位:分

月額料金 ($)

最小課金単位:日

Qwen3.5-Omni-Flash

qwen3.5-omni-flash

MU8 x 1

$6.464

$3,080.477

MU9 x 1

$7.014

$3,383.024

Qwen3.5-Omni-Plus

qwen3.5-omni-plus

MU9 x 8

$56.112

$27,064.192

モデルタイプ:

  • Instruct - デプロイされたモデルはノンシンキングモードで推論を実行します。

  • Thinking - デプロイされたモデルは思考モードで推論を実行します。

モデルのトークン使用量別

費用 = 入力トークン数 × 入力単価 + 出力トークン数 × 出力単価 (最小課金単位:1 トークン)

  • モデルのトークン使用量に応じた課金は、以下の基盤モデルに対して教師ありファインチューニング (SFT) を完了し、カスタムモデルを取得した後にのみサポートされます。

シンガポール

基盤モデル

モデルコード

入力

米ドル/1k トークン

出力

米ドル/1k トークン

Qwen3-14B

qwen3-14b

$0.00035

非思考モード: $0.0014

思考モード: $0.0042

レスポンスの例

コマンドは次の内容を返します。

{
  "request_id": "f2ae64f7-83cc-410c-bc0b-840443f7eb86",
  "output": {
    "deployed_model": "emo-35b3f106-sample01",
    "gmt_create": "2025-06-17T11:00:38.68",
    "gmt_modified": "2025-06-17T11:00:38.68",
    "status": "PENDING",
    "model_name": "emo",
    "base_model": "emo",
    "base_capacity": 1,
    "capacity": 1,
    "ready_capacity": 0,
    "workspace_id": "llm-v71tlv3d***",
    "charge_type": "post_paid",
    "creator": "175805416***",
    "modifier": "175805416***"
  }
}

応答パラメーター

パラメーター

タイプ

説明

request_id

文字列

リクエストの ID。

output

オブジェクト

デプロイメントタスクの詳細。

deployed_model

文字列

デプロイ済みモデルの一意な識別子。この ID は、デプロイメント詳細のクエリデプロイメントのレート制限の変更デプロイメントのスケーリングデプロイメントの削除などの API 操作で使用されるほか、モデル呼び出し時に SDK パラメーターとしても渡されます。

gmt_create

文字列

デプロイメントタスクの作成時刻。

gmt_modified

文字列

デプロイメントタスクの最終更新時刻。

status

文字列

デプロイメントタスクのステータス。

  • PENDING:作成中です。

  • UPDATING:更新中です。

  • RUNNING:実行中です。デプロイ済みモデルはリクエストを処理できます。

  • STOPPED:停止中です。課金は発生しません。

  • DELETING:削除中です。

  • FAILED:タスクの作成または更新に失敗しました。

model_name

文字列

デプロイメントタスクで使用されるモデル名。

base_model

文字列

デプロイメントタスクで使用されるベースモデルの ID。

base_capacity

数値

ベースモデルの実行に必要な最小リソースユニット数。

capacity

数値

デプロイメントタスクが使用するリソースユニット数。

ready_capacity

数値

即座にリクエストを処理できる、準備が完了したリソースユニット数。リソースの初期化速度やハードウェアのステータスによって、この値は制限されることがあります。

workspace_id

文字列

デプロイメントタスクのワークスペース ID。

charge_type

文字列

デプロイメントタスクの課金方法。

post_paid:後払い。

creator

文字列

デプロイメントタスクを作成したユーザーの UID。

modifier

文字列

デプロイメントタスクを最終更新したユーザーの UID。

plan

文字列

デプロイメントタスクの課金モデル。一部の課金モデルでは、このパラメーターは返されません。

[モデルユニット] デプロイメントの場合のみ返されます。

model_unit_spec

文字列

Model Unit の仕様。

enable_thinking

ブーリアン

思考モードが有効になっているかどうかを示します。この機能は、特定のモデルでのみ利用できます。

max_context_length

数値

最大コンテキスト長。

rpm_limit

数値

1 分あたりの最大リクエスト数 (RPM)。

tpm_limit

数値

1 分あたりの最大トークン数 (TPM)。

プロビジョニングされたスループット (PTU) デプロイメントの場合のみ返されます。

ptu_capacity

オブジェクト

このパラメーターは、"plan": "ptu" が設定されている場合にのみ有効です。

例:"ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }

ptu_capacity.input_tpm

数値

デプロイ済みモデルの1 分あたりの最大入力トークン数 (TPM)。この機能はすべてのモデルでサポートされています。

ptu_capacity.output_tpm

数値

デプロイ済みモデルの1 分あたりの最大出力トークン数 (TPM)。この機能はすべてのモデルでサポートされています。

ptu_capacity.thinking_output_tpm

数値

デプロイ済みモデルの1 分あたりの最大思考出力トークン数 (TPM)。この機能は、特定のモデルでのみ利用できます。

エラーレスポンス

レスポンス例

{
    "request_id": "ca218d57-b91b-46b2-bd35-c41c6287bcf4",
    "message": "Model: qwen-plus-20230703-cx7f not found!",
    "code": "NotFound"
}

レスポンスパラメーター

パラメーター

タイプ

説明

request_id

文字列

リクエストの一意の ID。

code

文字列

エラーコード。

message

文字列

エラーメッセージ。

リクエストが失敗した場合、次のエラーが発生することがあります。

エラーコード

エラーメッセージ

原因

NotFound

Model: xxx not found!

  • 存在しないモデルでデプロイメントタスクを作成しようとしました。

  • 存在しないモデルでデプロイメントタスクのクエリ、更新、または削除を行おうとしました。

Conflict

Deployed model xxx already exists, please specify a suffix.

既に使用されているサフィックスでデプロイメントタスクを作成しようとしました。

InvalidParameter

Invalid capacity (xx), capacity must be larger than or equal to 0 and multiples of 1 and less than 1000!

無効なキャパシティーユニット数でデプロイメントタスクを作成または更新しようとしました。キャパシティーユニット数は、0 以上、1000 未満の 1 の倍数である必要があります。