モデルデプロイ タスクを作成します。
前提条件
- 「モデルデプロイの概要」および「API を使用したモデルのデプロイ」を読み、Alibaba Cloud Model Studio (Model Studio) でのモデルデプロイの仕組みと基本的なワークフローを理解している必要があります。
- Model Studio 用の API キーを設定している必要があります。詳細については、「API キーの取得」をご参照ください。
モデルデプロイ
エンドポイント
POST https://dashscope-intl.aliyuncs.com/api/v1/deployments
リクエスト例
プロビジョニングされたスループット (PTU)
注記デプロイコマンドを実行すると、サービスが正常にデプロイされた直後から、使用していなくても課金が開始されます。続行する前に、サービスの課金ルールを確認することを推奨します。
プロビジョニングされたスループット課金方式は、使用時間に基づいて課金されます。この方法は、安定したスループット、高い同時実行数、低レイテンシー、予測可能なトラフィックを必要とするシナリオに適しています。このモードでは、プラットフォームがスループット/同時実行数と生成速度の両方をプロビジョニングしますが、これらを調整することはできません。
curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"name": "my_qwen3_8b_ft_ptu",
"model_name": "qwen3-8b-ft-202511132025-0260",
"plan": "ptu",
"ptu_capacity": {
"input_tpm": 10000,
"output_tpm": 1000
}
}'
モデルユニット
注記
- デプロイコマンドを実行すると、サービスが正常にデプロイされた直後から、使用していなくても課金が開始されます。続行する前に、サービスの課金ルールを確認することを推奨します。
- 後払いのモデルユニットプランのコンピューティングリソースは、先着順で割り当てられます。購入が失敗した場合、全額が返金されます。
モデルユニット課金方式は、使用時間に基づいて課金されます。この課金方法は、モデルのファインチューニング後の大規模な推論タスクに最適で、柔軟なパフォーマンスとコスト調整が可能な専用リソースを提供します。スループット/同時実行数と生成速度の両方をカスタマイズできます。
curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"name": "my_qwen3_8b_ft_mu",
"model_name": "qwen3-8b-ft-202511132025-0260",
"plan": "mu",
"deploy_spec": "MU1",
"enable_thinking": true,
"capacity": 4,
"max_context_length": 10000,
"rpm_limit": 500,
"tpm_limit": 1000
}'
モデルユニットのデプロイモードでは、以下の追加設定がサポートされています:
設定項目 | 設定詳細 |
|---|---|
サービス名 | デプロイサービスのカスタム名。 |
モデルの選択 | プラットフォーム組み込みモデルやファインチューニング済みモデルなど、デプロイするモデルを選択します。 |
モデルユニットタイプ | デプロイ仕様を選択します。仕様が異なると、コンピューティング能力とパフォーマンスも異なります。 |
デプロイレプリカ数 | デプロイレプリカの初期数を設定します。これはサービスの同時実行能力に影響します。 |
デプロイテンプレート | デプロイテンプレート (「シングルノードデプロイ」など) を選択します。テンプレートが異なると、リソース設定スキームも異なります。モデルユニット課金モードでのみ利用可能です。 |
モデル推論モードの設定 | モデルユニット モードでデプロイされた一部のモデルでは、推論モード、最大コンテキスト長などを設定できます。
|
最大コンテキスト長 | 一部のモデルの モデルユニット デプロイモードでは、この設定がサポートされています。最大コンテキスト長はモデルタイプによって異なります。 |
サービスレート制限 | 一部のモデルの モデルユニット デプロイモードでは、この設定がサポートされています。モデル呼び出しの RPM と TPM を制限できます。 |
API を使用してこれらの設定を構成する方法については、「API を使用したモデルデプロイメントタスクの作成」をご参照ください。
トークン使用量課金
トークン使用量課金では、トークンの使用量に基づいて課金されます。この方法は、同時実行数やレイテンシーの要件が重要でない、コスト重視のシナリオに適しています。このモードは最高の価格優位性を提供します。プラットフォームがスループット/同時実行数と生成速度をプロビジョニングしますが、これらを調整することはできません。
curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"model_name": "qwen3-8b-ft-202511132025-0260",
"plan": "lora",
"capacity": 1,
"name": "my_qwen3_8b_ft_lora"
}'
capacityパラメーターは必須ですが、現在は効果がありません。スケーリングをリクエストするには、モデルデプロイコンソールに移動してフォームを送信してください。
リクエストパラメータ
パラメーター | タイプ | 場所 | 必須 | 説明 | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
model_name | 文字列 | body | はい | デプロイするモデルの名前です。これは [マイモデル] のモデル ID に対応します。この ID は、Create Training Job API または Create Import Job API の出力からも取得できます。 | |||||||||||
plan | 文字列 | body | はい | デプロイプランです。以下の課金方法がサポートされています:
ファインチューニングされたモデルでサポートされているデプロイプランは、[マイモデル] で簡単に確認できます。 現在、ファインチューニングされた CosyVoice モデルは | |||||||||||
name | 文字列 | body | はい | コンソールでのモデルの表示名です。 | |||||||||||
capacity | 整数 | body | いいえ |
現在、CosyVoice モデルは、対応する
| |||||||||||
billing_method | 文字列 | body | いいえ |
| |||||||||||
deploy_spec | 文字列 | body | はい | この設定は 機能のサポート状況の詳細については、「モデルユニットデプロイの機能サポート」をご参照ください。 | このパラメーターは、 この値は、Get Deployable Model List API が返す | ||||||||||
enable_thinking | ブール値 | body | いいえ | 一部のモデルでサポートされています。 | |||||||||||
max_context_length | 数値 | body | いいえ | 一部のモデルでサポートされています。例: | |||||||||||
rpm_limit | 数値 | body | いいえ | 一部のモデルでサポートされています。1 分あたりの最大リクエスト数 (RPM) を指定します。 | |||||||||||
tpm_limit | 数値 | body | いいえ | 一部のモデルでサポートされています。1 分あたりの最大トークン数 (TPM) を指定します。 | |||||||||||
ptu_capacity | オブジェクト | body | いいえ | この設定は 機能のサポート状況の詳細については、「PTU デプロイの機能サポート」をご参照ください。 このパラメーターを指定しない場合、システムはデフォルトで | 例: 例: | ||||||||||
ptu_capacity.input_tpm | 数値 | body | いいえ | 1 分あたりの最大入力トークン数 (TPM) を指定します。 | |||||||||||
ptu_capacity.output_tpm | 数値 | body | いいえ | 1 分あたりの最大出力トークン数 (TPM) を指定します。 | |||||||||||
ptu_capacity.thinking_output_tpm | 数値 | body | いいえ | 一部のモデルでサポートされています。プロビジョニングされた思考出力の 1 分あたりの最大トークン数 (TPM) を指定します。 | |||||||||||
suffix | 文字列 | body | いいえ | モデルがデプロイされると、新しいモデル名が生成されます。suffix パラメーターは、この新しい名前のサフィックスを指定します。これはグローバルに一意である必要があります。最大長は 8 文字です。モデルの最初のデプロイではサフィックスを省略できます。同じモデルを複数回デプロイする場合は、デプロイごとに一意のサフィックスを指定する必要があります。 詳細については、出力パラメーター deployed_model をご参照ください。 | |||||||||||
対応モデル
対応機能 と請求情報を表示します。
使用期間による課金 (プロビジョニング済みスループット)
コスト = 使用期間 × (入力 TPM 単価 × 入力 TPM + 出力 TPM 単価 × 出力 TPM)
後払いは時間単位で計算されます:使用期間の単位は時間で、単価は以下の表の「1 時間連続」の列を取ります。前払いは日単位で計算されます:使用期間の単位は日で、単価は以下の表の「1 日連続」の列を取ります。
- 前払い注文は支払い後すぐに有効になり、N 日目の 23:59 まで N 日間有効です。22:00 以降に注文した場合、有効期限は自動的に 1 日延長されます。
- 前払い注文の有効期限が切れた後、サービスは 2 時間の遅延をもって停止され、リソースは停止後 14 時間保持された後に解放されます。
- 前払い注文は早期に終了することはできません。
- 後払い課金の場合、アカウントが支払い遅延状態になると、デプロイされたリソースは 24 時間保持され、課金されます。この間、サービスは通常通り使用できます。24 時間後、システムは課金を停止し、モデルデプロイは支払い遅延状態に入り、基盤となるリソースは削除されますが、モデルデプロイタスクは保持されます。支払い遅延を解消すると、システムはリソースを再割り当てし、使用を再開します (再開後も料金は発生し続けます)。料金の発生を継続したくない場合は、モデルデプロイタスクを削除できます。正常に削除されると、課金は停止します。
モデルの入力が最大入力トークンを超えた場合、関連する呼び出しは自動的に現在のモデルの従量課金モードに切り替わります。購入した TPM を超えた場合は、作成時に選択したオーバーフローポリシー (「自動オーバーフロー」は従量課金に切り替え、「PTU 容量のみ」は 429 を返す) に従って処理されます。このとき、推論パフォーマンスが低下する可能性があり、ワークスペース内の現在のスナップショットモデルのパブリックトラフィックによって管理され、料金はモデル呼び出し (従量課金) の基準に従って請求されます。
- このとき (「自動オーバーフロー」ポリシーの場合のみ)、呼び出し API 応答ヘッダーには
x-dashscope-ptu-overflow:trueが含まれます。 - TPM の統計については、モデルモニタリングをご参照ください。
スケールイン (スペックダウン) シナリオの具体的な料金削減および返金ルールについては、「設定スペックダウンの返金ルール」をご参照ください。
注記PTU デプロイは、段階的容量係数と長い入力に対するキャッシュ割引をサポートしています。詳細については、「プロビジョニング済みスループットの長い入力とキャッシュ」をご参照ください。
シンガポール
Qwen
モデル名 | モデルコード | 最大入力トークン | 後払い入力 10K TPM/時間あたり | 後払い出力 1K TPM/時間あたり | 前払い入力 10K TPM/日あたり | 前払い出力 1K TPM/日あたり |
|---|---|---|---|---|---|---|
Qwen3.8-Max | qwen3.8-max | 1M | $4.8 | $1.44 | $57.6 | $17.28 |
Qwen3.7-Max-2026-05-20 | qwen3.7-max-2026-05-20 | 256K | $1.92 | $1.8 | $72 | $21.6 |
Qwen3.7-Plus-2026-05-26 | qwen3.7-plus-2026-05-26 | 256K | $0.96 | $0.384 | $11.52 | $4.608 |
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | 128K | $1.2 | $0.72 | $14.4 | $8.64 |
Qwen3.5-Plus-2026-04-20 | qwen3.5-plus-2026-04-20 | 128K | $0.96 | $0.576 | $11.52 | $6.912 |
DeepSeek
モデル名 | モデルコード | 最大入力トークン | 後払い入力 10K TPM/時間あたり | 後払い出力 1K TPM/時間あたり | 前払い入力 10K TPM/日あたり | 前払い出力 1K TPM/日あたり |
|---|---|---|---|---|---|---|
DeepSeek-v4-Flash | deepseek-v4-flash | 256K | $0.72 | $0.144 | $8.64 | $1.728 |
DeepSeek-v4-Pro | deepseek-v4-pro | 256K | $0.96 | $1.728 | $103.68 | $20.736 |
DeepSeek-v3.2 | deepseek-v3.2 | 64K | $2.05 | $0.616 | $24.62 | $7.387 |
GLM
モデル名 | モデルコード | 最大入力トークン | 後払い入力 10K TPM/時間あたり | 後払い出力 1K TPM/時間あたり | 前払い入力 10K TPM/日あたり | 前払い出力 1K TPM/日あたり |
|---|---|---|---|---|---|---|
GLM-5.2 | glm-5.2 | 1M | $5.04 | $1.584 | $60.48 | $19.008 |
GLM-5.1 | glm-5.1 | 64K | $5.04 | $1.584 | $64.8 | $19.008 |
Qwen-VL
モデル名 | モデルコード | 最大入力トークン | 後払い入力 10K TPM/時間あたり | 後払い出力 1K TPM/時間あたり | 前払い入力 10K TPM/日あたり | 前払い出力 1K TPM/日あたり |
|---|---|---|---|---|---|---|
Qwen3-VL-Plus-2025-09-23 | qwen3-vl-plus-2025-09-23 | 128K | $0.48 | $0.384 | $5.76 | $4.608 |
中国北部 2 (北京)
Qwen
モデル名 | モデルコード | 最大入力トークン | 後払い入力 10K TPM/時間あたり | 後払い出力 1K TPM/時間あたり | サブスクリプション入力 10K TPM/日あたり | サブスクリプション出力 1K TPM/日あたり |
|---|---|---|---|---|---|---|
Qwen3.8-Max | qwen3.8-max | 1M | $3.96 | $1.188 | $47.53 | $14.258 |
Qwen3.7-Max-2026-05-20 | qwen3.7-max-2026-05-20 | 256K | $3.96 | $1.188 | $47.53 | $14.258 |
Qwen3.7-Plus-2026-05-26 | qwen3.7-plus-2026-05-26 | 256K | $0.66 | $0.264 | $7.92 | $3.168 |
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | 128K | $0.67 | $0.066 | $7.93 | $4.753 |
Qwen3.5-Plus-2026-04-20 | qwen3.5-plus-2026-04-20 | 128K | $0.26 | $0.16 | $3.17 | $1.9 |
Qwen3-Max-2025-09-23 | qwen3-max-2025-09-23 | 128K | $1.11 | $0.45 | $13.32 | $5.4 |
Qwen-Flash-2025-07-28 | qwen-flash-2025-07-28 | 128K | $0.06 | $0.06 | $0.72 | $0.72 |
Qwen-Plus-2025-12-01 | qwen-plus-2025-12-01 | 128K | $0.28 | ノンシンキング:$0.07 思考:$0.28 | $3.36 | ノンシンキング:$0.84 思考:$3.36 |
DeepSeek
モデル名 | モデルコード | 最大入力トークン | 後払い入力 10K TPM/時間あたり | 後払い出力 1K TPM/時間あたり | サブスクリプション入力 10K TPM/日あたり | サブスクリプション出力 1K TPM/日あたり |
|---|---|---|---|---|---|---|
DeepSeek-v4-Flash | deepseek-v4-flash | 256K | $0.5 | $0.099 | $5.94 | $1.188 |
DeepSeek-v4-Pro | deepseek-v4-pro | 256K | $5.94 | $1.188 | $71.3 | $14.26 |
DeepSeek-v3.2 | deepseek-v3.2 | 64K | $1.04 | $0.16 | $12.48 | $1.92 |
DeepSeek-v3 | deepseek-v3 | 64K | $0.99 | $0.396 | $11.9 | $4.75 |
GLM
モデル名 | モデルコード | 最大入力トークン | 後払い入力 10K TPM/時間あたり | 後払い出力 1K TPM/時間あたり | サブスクリプション入力 10K TPM/日あたり | サブスクリプション出力 1K TPM/日あたり |
|---|---|---|---|---|---|---|
GLM-5.2 | glm-5.2 | 1M | $3.96 | $1.386 | $47.53 | $16.635 |
GLM-5.1 | glm-5.1 | 64K | $2.97 | $1.19 | $35.65 | $14.26 |
Qwen-VL
モデル名 | モデルコード | 最大入力トークン | 後払い入力 10K TPM/時間あたり | 後払い出力 1K TPM/時間あたり | サブスクリプション入力 10K TPM/日あたり | サブスクリプション出力 1K TPM/日あたり |
|---|---|---|---|---|---|---|
Qwen3-VL-Plus-2025-09-23 | qwen3-vl-plus-2025-09-23 | 128K | $0.35 | $0.35 | $4.2 | $4.2 |
使用期間による課金 (モデルユニット)
コスト = 使用期間 (時間) × モデルユニット数 × モデルユニット単価
「モデルユニット単価」は、従量課金シナリオでは以下の表の「時間単位価格」の列を取ります。月次前払い課金の場合、数式は月数 × モデルユニット数 × 月単位価格になります。
- 前払い購入の最初の 1 か月について、最初の 1 か月以内に早期にキャンセルした場合、日単位の単価 (≈ 月単位価格 / 30) が 1.2 倍で請求されます (1 日未満は 1 日として請求されます)
注記モデルユニットの従量課金方法によるコンピューティングリソースは先着順です。購入に失敗した場合、全額返金されます。
シンガポール
テキスト生成
モデル名 | モデルコード | モデルユニット仕様 | 時間単位価格 (USD) 最小課金単位:分 | 月単位価格 (USD) 最小課金単位:日 |
|---|---|---|---|---|
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | MU1 x 8 | $88 | $41,832 |
Qwen3.5-397B-A17B | qwen3.5-397b-a17b | MU2 x 8 | $112 | $52,392 |
Qwen3.5-122B-A10B | qwen3.5-122b-a10b | MU2 x 8 | $112 | $52,392 |
Qwen3.5-27B | qwen3.5-27b | MU1 x 2 | $22 | $10,458 |
Qwen3.5-9B | qwen3.5-9b | MU1 x 2 | $22 | $10,458 |
GLM-5.1 | glm-5.1 | MU2 x 8 | $112 | $52,392 |
MU3 x 8 | $216 | $102,696 | ||
DeepSeek-v4-Flash | deepseek-v4-flash | MU2 x 8 | $112 | $52,392 |
Qwen-Plus-Character-2025-11-06 | qwen-plus-character-2025-11-06 | MU1 x 4 | $44 | $20,916 |
マルチモーダル
モデル名 | モデルコード | モデルユニット仕様 | 時間単位価格 (USD) 最小課金単位:分 | 月単位価格 (USD) 最小課金単位:日 |
|---|---|---|---|---|
Qwen3-VL-32B-Instruct | qwen3-vl-32b-instruct | MU2 x 8 | $112 | $52,392 |
モデルタイプ:
- Instruct - モデルデプロイ後、推論はノンシンキングモードで実行されます。
中国北部 2 (北京)
テキスト生成
Qwen
モデル名 | モデルコード | モデルユニット仕様 | 時間単位価格 (USD) 最小課金単位:分 | 月単位価格 (USD) 最小課金単位:日 |
|---|---|---|---|---|
Qwen3.6-35B-A3B | qwen3.6-35b-a3b | MU1 x 8 | $59.408 | $28,734.256 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 | $150.72 | $72,577.152 | ||
MU9 x 1 | $7.014 | $3,383.024 | ||
Qwen3.6-27B | qwen3.6-27b | MU9 x 1 | $7.014 | $3,383.024 |
Qwen3.6-Flash-2026-04-16 | qwen3.6-flash-2026-04-16 | MU1 x 2 | $14.852 | $7,183.564 |
MU3 x 8 | $150.72 | $72,577.152 | ||
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | MU1 x 8 MU1 x 16(PD 分離モード) | $59.408 PD 分離モード:$118.816 | $28,734.256 PD 分離モード:$57,468.512 |
Qwen3.5-397B-A17B | qwen3.5-397b-a17b | MU3 x 8 MU3 x 16(PD 分離モード) | $150.72 PD 分離モード:$301.44 | $72,577.152 PD 分離モード:$145,154.304 |
MU6 x 16 | $55.008 | $26,599.92 | ||
Qwen3.5-122B-A10B | qwen3.5-122b-a10b | MU1 x 4 | $29.704 | $14,367.128 |
MU6 x 16 | $55.008 | $26,599.92 | ||
Qwen3.5-35B-A3B | qwen3.5-35b-a3b | MU1 x 2 | $14.852 | $7,183.564 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 | $150.72 | $72,577.152 | ||
MU9 x 1 | $7.014 | $3,383.024 | ||
Qwen3.5-27B | qwen3.5-27b | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 8 | $150.72 | $72,577.152 | ||
MU8 x 1 | $6.464 | $3,080.477 | ||
MU9 x 1 | $7.014 | $3,383.024 | ||
Qwen3.5-9B | qwen3.5-9b | MU2 x 2 | $17.328 | $8,261.18 |
Qwen3.5-Flash-2026-02-23 | qwen3.5-flash-2026-02-23 | MU1 x 2 | $14.852 | $7,183.564 |
Qwen3.5-Plus-2026-02-15 | qwen3.5-plus-2026-02-15 | MU1 x 8 MU1 x 16(PD 分離モード) | $59.408 PD 分離モード:$118.816 | $28,734.256 PD 分離モード:$57,468.512 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 MU3 x 16(PD 分離モード) | $150.72 PD 分離モード:$301.44 | $72,577.152 PD 分離モード:$145,154.304 | ||
Qwen3-235B-A22B-Instruct-2507 | qwen3-235b-a22b-instruct-2507 | MU1 x 4 | $29.704 | $14,367.128 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 | $150.72 | $72,577.152 | ||
Qwen3-32B | qwen3-32b | MU6 x 16 | $55.008 | $26,599.92 |
Qwen3-30B-A3B-Thinking-2507 | qwen3-30b-a3b-thinking-2507 | MU1 x 2 | $14.852 | $7,183.564 |
Qwen3-8B | qwen3-8b | MU1 x 2 | $14.852 | $7,183.564 |
MU2 x 2 | $17.328 | $8,261.18 | ||
Qwen3-4B | qwen3-4b | MU1 x 2 | $14.852 | $7,183.564 |
MU5 x 1 | $2.888 | $1,394.329 | ||
Qwen3-Embedding-0.6B | qwen3-embedding-0.6b | MU5 x 1 | $2.888 | $1,394.329 |
MU6 x 1 | $3.438 | $1,662.495 | ||
Qwen3-MoE-Rerank-0.6B | qwen3-moe-rerank-0.6b | MU5 x 1 | $2.888 | $1,394.329 |
Qwen3-Rerank-0.6B | qwen3-rerank-0.6b | MU5 x 1 | $2.888 | $1,394.329 |
MU6 x 1 | $3.438 | $1,662.495 | ||
Qwen3-Max-2025-09-23 | qwen3-max-2025-09-23 | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 8 | $150.72 | $72,577.152 | ||
Qwen3-Rerank | qwen3-rerank | MU5 x 1 | $2.888 | $1,394.329 |
Qwen2.5-Open-Source-72B | qwen2.5-72b-instruct | MU1 x 8 | $59.408 | $28,734.256 |
Qwen2.5-Open-Source-14B | qwen2.5-14b-instruct | MU1 x 2 | $14.852 | $7,183.564 |
Qwen2.5-Open-Source-7B | qwen2.5-7b-instruct | MU1 x 2 | $14.852 | $7,183.564 |
MU5 x 1 | $2.888 | $1,394.329 | ||
Qwen-Plus-2025-07-28 | qwen-plus-2025-07-28 | MU1 x 4 MU1 x 16(PD 分離モード) | $29.704 PD 分離モード:$118.816 | $14,367.128 PD 分離モード:$57,468.512 |
Qwen-Plus-2025-12-01 | qwen-plus-2025-12-01 | MU1 x 4 | $29.704 | $14,367.128 |
Qwen-Plus-Character-2025-11-06 | qwen-plus-character-2025-11-06 | MU1 x 4 | $29.704 | $14,367.128 |
GLM
モデル名 | モデルコード | モデルユニット仕様 | 時間単位価格 (USD) 最小課金単位:分 | 月単位価格 (USD) 最小課金単位:日 |
|---|---|---|---|---|
GLM-5.1 | glm-5.1 | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 16(PD 分離モード) | PD 分離モード:$301.44 | PD 分離モード:$145,154.304 | ||
MU6 x 16 | $55.008 | $26,599.92 | ||
GLM-5 | glm-5 | MU3 x 16(PD 分離モード) | PD 分離モード:$301.44 | PD 分離モード:$145,154.304 |
GLM-4.7 | glm-4.7 | MU6 x 32(PD 分離モード) | PD 分離モード:$110.016 | PD 分離モード:$53,199.84 |
DeepSeek
モデル名 | モデルコード | モデルユニット仕様 | 時間単位価格 (USD) 最小課金単位:分 | 月単位価格 (USD) 最小課金単位:日 |
|---|---|---|---|---|
DeepSeek-v4-Flash | deepseek-v4-flash | MU1 x 8 | $59.408 | $28,734.256 |
MU3 x 8 | $150.72 | $72,577.152 | ||
DeepSeek-v3.2 | deepseek-v3.2 | MU2 x 16 (PD 分離モード) | PD 分離モード: $138.624 | PD 分離モード: $66,089.44 |
その他のモデル
モデル名 | モデルコード | モデルユニット仕様 | 時間単位価格 ($) 最小課金単位:分 | 月単位価格 ($) 最小課金単位:日 |
|---|---|---|---|---|
Kimi-K2.5 | kimi-k2.5 | MU2 x 8 | $69.312 | $33,044.72 |
マルチモーダル
Qwen-VL
モデル名 | モデルコード | モデルユニット仕様 | 時間単位価格 ($) 最小課金単位:分 | 月単位価格 ($) 最小課金単位:日 |
|---|---|---|---|---|
Qwen3-VL-235B-A22B-Thinking | qwen3-vl-235b-a22b-thinking | MU1 x 8 | $59.408 | $28,734.256 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 | $150.72 | $72,577.152 | ||
Qwen3-VL-32B-Instruct | qwen3-vl-32b-instruct | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 8 | $150.72 | $72,577.152 | ||
Qwen3-VL-8B-Instruct | qwen3-vl-8b-instruct | MU1 x 2 | $14.852 | $7,183.564 |
MU5 x 1 | $2.888 | $1,394.329 | ||
Qwen3-VL-4B-Instruct | qwen3-vl-4b-instruct | MU1 x 2 | $14.852 | $7,183.564 |
Qwen3-VL-2B-Instruct | qwen3-vl-2b-instruct | MU5 x 1 | $2.888 | $1,394.329 |
Qwen3-VL-Embedding-2B | qwen3-vl-embedding-2b | MU5 x 1 | $2.888 | $1,394.329 |
Qwen3-VL-Flash-2025-10-15 | qwen3-vl-flash-2025-10-15 | MU1 x 4 | $29.704 | $14,367.128 |
Qwen3-VL-Plus-2025-09-23 | qwen3-vl-plus-2025-09-23 | MU1 x 4 | $29.704 | $14,367.128 |
Qwen-VL-Max-2025-08-13 | qwen-vl-max-2025-08-13 | MU6 x 4 | $13.752 | $6,649.98 |
Qwen-Omni
モデル名 | モデルコード | モデルユニット仕様 | 時間単位価格 ($) 最小課金単位:分 | 月単位価格 ($) 最小課金単位:日 |
|---|---|---|---|---|
Qwen3.5-Omni-Flash | qwen3.5-omni-flash | MU9 x 1 | $7.014 | $3,383.024 |
モデルタイプ:
- Instruct - デプロイ後、モデルはノンシンキングモードで推論を実行します。
- Thinking - デプロイ後、モデルは思考モードで推論を実行します。
モデルのトークン使用量による
料金 = モデル入力トークン数 × モデル入力単価 + モデル出力トークン数 × モデル出力単価 (最小課金単位:1 トークン)
- モデルのトークン使用量による課金は、以下のベースモデルで SFT 効率的なトレーニングを完了し、カスタムモデルを取得した後にのみサポートされます。
シンガポール
ベースモデル | モデルコード | 入力 $/100万トークン | 出力 $/100万トークン |
|---|---|---|---|
Qwen3-14B | qwen3-14b | ノンシンキングモード:$0.35 思考モード:$0.35 | ノンシンキングモード:$1.4 思考モード:$4.2 |
北京
ベースモデル | モデルコード | 入力 $/100万トークン | 出力 $/100万トークン |
|---|---|---|---|
Qwen3.5-27B | qwen3.5-27b | <128K $0.086 128K-256K $0.258 | <128K $0.688 128K-256K $2.064 |
Qwen3-32B | qwen3-32b | ノンシンキングモード:$0.287 思考モード:$0.287 | ノンシンキングモード:$1.147 思考モード:$2.868 |
Qwen3-14B | qwen3-14b | ノンシンキングモード:$0.144 思考モード:$0.144 | ノンシンキングモード:$0.574 思考モード:$1.434 |
Qwen3-8B | qwen3-8b | ノンシンキングモード:$0.072 思考モード:$0.072 | ノンシンキングモード:$0.287 思考モード:$0.717 |
Qwen3-VL-8B-Instruct | qwen3-vl-8b-instruct | $0.072 | $0.287 |
レスポンスの例
コマンドは次の内容を返します。
{
"request_id": "f2ae64f7-83cc-410c-bc0b-840443f7eb86",
"output": {
"deployed_model": "emo-35b3f106-sample01",
"gmt_create": "2025-06-17T11:00:38.68",
"gmt_modified": "2025-06-17T11:00:38.68",
"status": "PENDING",
"model_name": "emo",
"base_model": "emo",
"base_capacity": 1,
"capacity": 1,
"ready_capacity": 0,
"workspace_id": "llm-v71tlv3d***",
"charge_type": "post_paid",
"creator": "175805416***",
"modifier": "175805416***"
}
}
応答パラメーター
| パラメーター | タイプ | 説明 |
|---|---|---|
request_id | 文字列 | リクエストの ID。 |
output | オブジェクト | デプロイメントタスクの詳細。 |
deployed_model | 文字列 | デプロイ済みモデルの一意な識別子。この ID は、デプロイメント詳細のクエリ、デプロイメントのレート制限の変更、デプロイメントのスケーリング、デプロイメントの削除などの API 操作で使用されるほか、モデル呼び出し時に SDK パラメーターとしても渡されます。 |
gmt_create | 文字列 | デプロイメントタスクの作成時刻。 |
gmt_modified | 文字列 | デプロイメントタスクの最終更新時刻。 |
status | 文字列 | デプロイメントタスクのステータス。
|
model_name | 文字列 | デプロイメントタスクで使用されるモデル名。 |
base_model | 文字列 | デプロイメントタスクで使用されるベースモデルの ID。 |
base_capacity | 数値 | ベースモデルの実行に必要な最小リソースユニット数。 |
capacity | 数値 | デプロイメントタスクが使用するリソースユニット数。 |
ready_capacity | 数値 | 即座にリクエストを処理できる、準備が完了したリソースユニット数。リソースの初期化速度やハードウェアのステータスによって、この値は制限されることがあります。 |
workspace_id | 文字列 | デプロイメントタスクのワークスペース ID。 |
charge_type | 文字列 | デプロイメントタスクの課金方法。
|
creator | 文字列 | デプロイメントタスクを作成したユーザーの UID。 |
modifier | 文字列 | デプロイメントタスクを最終更新したユーザーの UID。 |
plan | 文字列 | デプロイメントタスクの課金モデル。一部の課金モデルでは、このパラメーターは返されません。 |
[モデルユニット] デプロイメントの場合のみ返されます。 | ||
model_unit_spec | 文字列 | Model Unit の仕様。 |
enable_thinking | ブーリアン | 思考モードが有効になっているかどうかを示します。この機能は、特定のモデルでのみ利用できます。 |
max_context_length | 数値 | 最大コンテキスト長。 |
rpm_limit | 数値 | 1 分あたりの最大リクエスト数 (RPM)。 |
tpm_limit | 数値 | 1 分あたりの最大トークン数 (TPM)。 |
プロビジョニングされたスループット (PTU) デプロイメントの場合のみ返されます。 | ||
ptu_capacity | オブジェクト | このパラメーターは、 例: |
ptu_capacity.input_tpm | 数値 | デプロイ済みモデルの1 分あたりの最大入力トークン数 (TPM)。この機能はすべてのモデルでサポートされています。 |
ptu_capacity.output_tpm | 数値 | デプロイ済みモデルの1 分あたりの最大出力トークン数 (TPM)。この機能はすべてのモデルでサポートされています。 |
ptu_capacity.thinking_output_tpm | 数値 | デプロイ済みモデルの1 分あたりの最大思考出力トークン数 (TPM)。この機能は、特定のモデルでのみ利用できます。 |
エラーレスポンス
レスポンス例
{
"request_id": "ca218d57-b91b-46b2-bd35-c41c6287bcf4",
"message": "Model: qwen-plus-20230703-cx7f not found!",
"code": "NotFound"
}
レスポンスパラメーター
パラメーター | タイプ | 説明 |
|---|---|---|
request_id | 文字列 | リクエストの一意の ID。 |
code | 文字列 | エラーコード。 |
message | 文字列 | エラーメッセージ。 |
リクエストが失敗した場合、次のエラーが発生することがあります。
エラーコード | エラーメッセージ | 原因 |
|---|---|---|
NotFound | Model: xxx not found! |
|
Conflict | Deployed model xxx already exists, please specify a suffix. | 既に使用されているサフィックスでデプロイメントタスクを作成しようとしました。 |
InvalidParameter | Invalid capacity (xx), capacity must be larger than or equal to 0 and multiples of 1 and less than 1000! | 無効なキャパシティーユニット数でデプロイメントタスクを作成または更新しようとしました。キャパシティーユニット数は、0 以上、1000 未満の 1 の倍数である必要があります。 |