デプロイを通じて独立した専用リソースの推論サービスを取得し、高い同時実行性や低遅延など、さまざまなパフォーマンスレベルに対するビジネスニーズを満たすことができます。
課金方法
デプロイ前に、モデルデプロイコンソールで、さまざまなモデルの時間単位の推定コストを確認できます。
注記サービスの作成後に課金方法を変更することはできません。切り替えるには、デプロイしたモデルをオフラインにしてから再デプロイする必要があります。
プロビジョニング済みスループット (PTU, Provisioned Throughput Unit) (高スループット、高性能) | モデルユニット (カスタムパフォーマンスメトリクス、リソース分離) | トークンベースの使用量 (ファインチューニング/効果検証後の従量課金) | |||
|---|---|---|---|---|---|
定義 | プラットフォームリソースを予約して特定の TPM スループット容量を保証するモデルデプロイ方法です。保証されたクォータ内ではレート制限はありません。 | 使用期間とモデルユニット数に基づいてコンピューティング能力を設定し、専用リソースを使用するモデルデプロイ方法です。 | 呼び出しごとに生成される入力トークンと出力トークンを使用量の計測基準とするモデルデプロイ方法です。 | ||
メリット |
|
| 使用しない場合は課金されません。 | ||
サポート対象モデル | 一部の事前設定済みモデル | 一部の事前設定済みモデルとすべてのファインチューニング済みモデル | LoRA でファインチューニングされた一部のモデル | ||
利用シーン |
|
| ファインチューニング済みモデルの効果検証 | ||
課金図 |
|
|
| ||
課金方法 | 使用期間とプロビジョニング済みスループットによる 従量課金、日次パッケージ | 使用期間とモデルユニット数による 従量課金、月次パッケージ | モデルのトークン使用量による 従量課金 | ||
スケーリング方法 | スループットのセルフサービスによる増減 | モデルユニットのセルフサービスによる増減 | コンソールで申請を送信し、手動レビューを待ちます。 | ||
製品の制約 |
| 前払い購入後、最初の 1 か月以内に早期解約した場合、日割り単価 (≈ 月額単価 / 30) が 1.2 倍で請求されます。 |
| ||
各呼び出しのトークン使用量と呼び出し回数の履歴統計を表示するには、モデルモニタリングに移動します。
課金の詳細
使用期間による課金 (プロビジョニング済みスループット)
料金 = 使用期間 × (入力 TPM 単価 × 入力 TPM + 出力 TPM 単価 × 出力 TPM)
後払いは時間単位で計算されます。使用期間の単位は時間で、単価は以下の表の「連続 1 時間」の列から取得されます。前払いは日単位で計算されます。使用期間の単位は日で、単価は以下の表の「連続 1 日」の列から取得されます。
- 前払い注文は支払い後すぐに有効になり、有効期間は N 日目の 23:59 に終了します。注文が 22:00 以降に行われた場合、有効期限は自動的に 1 日延長されます。
- 前払い注文の有効期限が切れた後、サービスは 2 時間の遅延で停止され、リソースは停止後 14 時間保持された後、リリースされます。
- 前払い注文では、サービスを早期に終了することはできません。
- 後払い課金の場合、アカウントが延滞状態になると、デプロイされたリソースは 24 時間保持され、課金が継続されます。この間、サービスは通常通り使用できます。24 時間後、システムは課金を停止し、モデルデプロイは延滞状態になり、基盤となるリソースは削除されますが、モデルデプロイタスクは保持されます。延滞料金が支払われると、システムはリソースを再割り当てして使用を復元します (復元後も料金は発生し続けます)。料金の発生を継続したくない場合は、モデルデプロイタスクを削除でき、削除が成功すると課金が停止します。
モデルの入力が最大入力トークンを超えた場合、関連する呼び出しは自動的に現在のモデルの従量課金モードに切り替わります。購入した TPM を超えた場合は、作成時に選択したオーバーフロー戦略 (「自動オーバーフロー」は従量課金に切り替え、「PTU 容量のみ使用」は 429 を返す) に従って処理されます。このとき、推論パフォーマンスが低下する可能性があり、ビジネススペース内の現在のスナップショットモデルのパブリックトラフィック制御の対象となり、料金はモデル呼び出し (従量課金) の基準に従って請求されます。
- この場合 (「自動オーバーフロー」戦略でのみ)、API レスポンスヘッダーには
x-dashscope-ptu-overflow:trueが含まれます。 - TPM 統計については、モデルモニタリングをご参照ください。
スケールダウン (スペックダウン) シナリオにおける具体的な料金削減および返金ルールについては、設定ダウングレードの返金ルールをご参照ください。
注記PTU デプロイは、長文入力の段階的容量係数とキャッシュ割引をサポートしています。詳細については、プロビジョニング済みスループットの長文入力とキャッシュをご参照ください。
シンガポール
Qwen
モデル名 | モデルコード | 最大入力トークン | 後払い入力 1 万 TPM/時間あたり | 後払い出力 1,000 TPM/時間あたり | 前払い入力 1 万 TPM/日あたり | 前払い出力 1,000 TPM/日あたり |
|---|---|---|---|---|---|---|
Qwen3.8-Max | qwen3.8-max | 1M | $4.8 | $1.44 | $57.6 | $17.28 |
Qwen3.7-Flash-2026-07-15 ビジネス担当者にご連絡の上、有効化してください | qwen3.7-flash-2026-07-15 | 128K | $0.072 | $0.031 | $0.864 | $0.374 |
Qwen3.7-Max-2026-05-20 | qwen3.7-max-2026-05-20 | 256K | $1.92 | $1.8 | $72 | $21.6 |
Qwen3.7-Plus-2026-05-26 | qwen3.7-plus-2026-05-26 | 256K | $0.96 | $0.384 | $11.52 | $4.608 |
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | 128K | $1.2 | $0.72 | $14.4 | $8.64 |
Qwen3.5-Plus-2026-04-20 | qwen3.5-plus-2026-04-20 | 128K | $0.96 | $0.576 | $11.52 | $6.912 |
DeepSeek
モデル名 | モデルコード | 最大入力トークン | 従量課金入力 1 万 TPM/時間あたり | 従量課金出力 1,000 TPM/時間あたり | 前払い入力 1 万 TPM/日あたり | 前払い出力 1,000 TPM/日あたり |
|---|---|---|---|---|---|---|
DeepSeek-v4-Flash | deepseek-v4-flash | 256K | $0.72 | $0.144 | $8.64 | $1.728 |
DeepSeek-v4-Flash-0731 | deepseek-v4-flash-0731 | 64K | $1.44 | $0.288 | $17.28 | $3.456 |
DeepSeek-v4-Pro | deepseek-v4-pro | 256K | $0.96 | $1.728 | $103.68 | $20.736 |
Qwen-VL
モデル名 | モデルコード | 最大入力トークン | 従量課金入力 1 万 TPM/時間あたり | 従量課金出力 1,000 TPM/時間あたり | 前払い入力 1 万 TPM/日あたり | 前払い出力 1,000 TPM/日あたり |
|---|---|---|---|---|---|---|
Qwen3-VL-Plus-2025-09-23 | qwen3-vl-plus-2025-09-23 | 128K | $0.48 | $0.384 | $5.76 | $4.608 |
GLM
モデル名 | モデルコード | 最大入力トークン | 従量課金入力 1 万 TPM/時間あたり | 従量課金出力 1,000 TPM/時間あたり | 前払い入力 1 万 TPM/日あたり | 前払い出力 1,000 TPM/日あたり |
|---|---|---|---|---|---|---|
GLM-5.2 | glm-5.2 | 1M | $5.04 | $1.584 | $60.48 | $19.008 |
中国北部 2 (北京)
Qwen
モデル名 | モデルコード | 最大入力トークン | 従量課金入力 1 万 TPM/時間あたり | 従量課金出力 1,000 TPM/時間あたり | 前払い入力 1 万 TPM/日あたり | 前払い出力 1,000 TPM/日あたり |
|---|---|---|---|---|---|---|
Qwen3.8-Max | qwen3.8-max | 1M | $3.96 | $1.188 | $47.53 | $14.258 |
Qwen3.7-Flash-2026-07-15 ビジネス担当者にご連絡の上、有効化してください | qwen3.7-flash-2026-07-15 | 128K | $0.066 | $0.026 | $0.792 | $0.317 |
Qwen3.7-Max-2026-05-20 | qwen3.7-max-2026-05-20 | 256K | $3.96 | $1.188 | $47.53 | $14.258 |
Qwen3.7-Plus-2026-05-26 | qwen3.7-plus-2026-05-26 | 256K | $0.66 | $0.264 | $7.92 | $3.168 |
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | 128K | $0.67 | $0.066 | $7.93 | $4.753 |
Qwen3.5-Plus-2026-04-20 | qwen3.5-plus-2026-04-20 | 128K | $0.26 | $0.16 | $3.17 | $1.9 |
Qwen3-Max-2025-09-23 | qwen3-max-2025-09-23 | 128K | $1.11 | $0.45 | $13.32 | $5.4 |
Qwen-Flash-2025-07-28 | qwen-flash-2025-07-28 | 128K | $0.06 | $0.06 | $0.72 | $0.72 |
Qwen-Plus-2025-12-01 | qwen-plus-2025-12-01 | 128K | $0.28 | ノンシンキング:$0.07 シンキング:$0.28 | $3.36 | ノンシンキング:$0.84 シンキング:$3.36 |
DeepSeek
モデル名 | モデルコード | 最大入力トークン | 後払い入力 1 万 TPM/時間あたり | 後払い出力 1,000 TPM/時間あたり | 前払い入力 1 万 TPM/日あたり | 前払い出力 1,000 TPM/日あたり |
|---|---|---|---|---|---|---|
DeepSeek-v4-Flash | deepseek-v4-flash | 256K | $0.5 | $0.099 | $5.94 | $1.188 |
DeepSeek-v4-Flash-0731 | deepseek-v4-flash-0731 | 64K | $0.99 | $0.198 | $11.88 | $2.376 |
DeepSeek-v4-Pro | deepseek-v4-pro | 256K | $5.94 | $1.188 | $71.3 | $14.26 |
DeepSeek-v3 | deepseek-v3 | 64K | $0.99 | $0.396 | $11.9 | $4.75 |
Qwen-VL
モデル名 | モデルコード | 最大入力トークン | 後払い入力 1 万 TPM/時間あたり | 後払い出力 1,000 TPM/時間あたり | 前払い入力 1 万 TPM/日あたり | 前払い出力 1,000 TPM/日あたり |
|---|---|---|---|---|---|---|
Qwen3-VL-Plus-2025-09-23 | qwen3-vl-plus-2025-09-23 | 128K | $0.35 | $0.35 | $4.2 | $4.2 |
GLM
モデル名 | モデルコード | 最大入力トークン | 後払い入力 1 万 TPM/時間あたり | 後払い出力 1,000 TPM/時間あたり | 前払い入力 1 万 TPM/日あたり | 前払い出力 1,000 TPM/日あたり |
|---|---|---|---|---|---|---|
GLM-5.2 | glm-5.2 | 1M | $3.96 | $1.386 | $47.53 | $16.635 |
利用時間に応じた課金 (モデルユニット)
コスト = 利用時間 (時間) × モデルユニット数 × モデルユニット単価
後払いシナリオの場合、「モデルユニット単価」には、以下の表の「時間単位の単価」列の価格が適用されます。月額サブスクリプションの前払い課金の場合、計算式は月額サブスクリプション数 × モデルユニット数 × 月額単価となります。
- サブスクリプションの最初の 1 か月以内に解約した場合、日単位の単価 (≈ 月額単価 / 30) の 1.2 倍の料金が請求されます (1 日未満の利用は 1 日として課金されます)。
注記モデルユニットの後払い方式の計算リソースは先着順で提供されます。購入に失敗した場合は、全額返金されます。
シンガポール
テキスト生成
モデル名 | モデルコード | モデルユニット仕様 | 時間単位の単価 (米ドル) 最小課金単位:分 | 月額サブスクリプション単価 (米ドル) 最小課金単位:日 |
|---|---|---|---|---|
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | MU1 x 8 | $88 | $41,832 |
Qwen3.5-397B-A17B | qwen3.5-397b-a17b | MU2 x 8 | $112 | $52,392 |
Qwen3.5-122B-A10B | qwen3.5-122b-a10b | MU2 x 8 | $112 | $52,392 |
Qwen3.5-27B | qwen3.5-27b | MU1 x 2 | $22 | $10,458 |
Qwen3.5-9B | qwen3.5-9b | MU1 x 2 | $22 | $10,458 |
GLM-5.1 | glm-5.1 | MU2 x 8 | $112 | $52,392 |
MU3 x 8 | $216 | $102,696 | ||
DeepSeek-v4-Flash | deepseek-v4-flash | MU2 x 8 | $112 | $52,392 |
Qwen-Plus-Character-2025-11-06 | qwen-plus-character-2025-11-06 | MU1 x 4 | $44 | $20,916 |
マルチモーダル
モデル名 | モデルコード | モデルユニット仕様 | 時間単位の単価 ($) 最小課金単位:分 | 月額サブスクリプション単価 ($) 最小課金単位:日 |
|---|---|---|---|---|
Qwen3-VL-32B-Instruct | qwen3-vl-32b-instruct | MU2 x 8 | $112 | $52,392 |
モデルタイプ:
- Instruct - モデルはデプロイ後、ノンシンキングモードで推論を実行します。
中国 (北京)
テキスト生成
Qwen
モデル名 | モデルコード | モデルユニット仕様 | 時間単位の単価 (米ドル) 最小課金単位:分 | 月額サブスクリプション単価 (米ドル) 最小課金単位:日 |
|---|---|---|---|---|
Qwen3.6-35B-A3B | qwen3.6-35b-a3b | MU1 x 8 | $59.408 | $28,734.256 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 | $150.72 | $72,577.152 | ||
MU8 x 1 | $6.464 | $3,080.477 | ||
MU9 x 1 | $7.014 | $3,383.024 | ||
Qwen3.6-27B | qwen3.6-27b | MU9 x 1 | $7.014 | $3,383.024 |
Qwen3.6-Flash-2026-04-16 | qwen3.6-flash-2026-04-16 | MU1 x 2 | $14.852 | $7,183.564 |
MU3 x 8 | $150.72 | $72,577.152 | ||
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | MU1 x 8 MU1 x 16 (PD 分離モード) | $59.408 PD 分離モード:$118.816 | $28,734.256 PD 分離モード:$57,468.512 |
Qwen3.5-397B-A17B | qwen3.5-397b-a17b | MU3 x 8 MU3 x 16 (PD 分離モード) | $150.72 PD 分離モード:$301.44 | $72,577.152 PD 分離モード:$145,154.304 |
MU6 x 16 | $55.008 | $26,599.92 | ||
Qwen3.5-122B-A10B | qwen3.5-122b-a10b | MU1 x 4 | $29.704 | $14,367.128 |
MU6 x 16 | $55.008 | $26,599.92 | ||
Qwen3.5-35B-A3B | qwen3.5-35b-a3b | MU1 x 2 | $14.852 | $7,183.564 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 | $150.72 | $72,577.152 | ||
MU9 x 1 | $7.014 | $3,383.024 | ||
Qwen3.5-27B | qwen3.5-27b | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 8 | $150.72 | $72,577.152 | ||
MU8 x 1 | $6.464 | $3,080.477 | ||
MU9 x 1 | $7.014 | $3,383.024 | ||
Qwen3.5-9B | qwen3.5-9b | MU1 x 2 | $14.852 | $7,183.564 |
MU2 x 8 | $69.312 | $33,044.72 | ||
Qwen3.5-Flash-2026-02-23 | qwen3.5-flash-2026-02-23 | MU1 x 2 | $14.852 | $7,183.564 |
Qwen3.5-Plus-2026-02-15 | qwen3.5-plus-2026-02-15 | MU1 x 8 MU1 x 16 (PD 分離モード) | $59.408 PD 分離モード:$118.816 | $28,734.256 PD 分離モード:$57,468.512 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 MU3 x 16 (PD 分離モード) | $150.72 PD 分離モード:$301.44 | $72,577.152 PD 分離モード:$145,154.304 | ||
Qwen3-235B-A22B-Instruct-2507 | qwen3-235b-a22b-instruct-2507 | MU1 x 4 | $29.704 | $14,367.128 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 | $150.72 | $72,577.152 | ||
Qwen3-32B | qwen3-32b | MU6 x 16 | $55.008 | $26,599.92 |
Qwen3-30B-A3B-Thinking-2507 | qwen3-30b-a3b-thinking-2507 | MU1 x 2 | $14.852 | $7,183.564 |
Qwen3-8B | qwen3-8b | MU1 x 2 | $14.852 | $7,183.564 |
MU2 x 2 | $17.328 | $8,261.18 | ||
Qwen3-4B | qwen3-4b | MU1 x 2 | $14.852 | $7,183.564 |
MU5 x 1 | $2.888 | $1,394.329 | ||
Qwen3-Embedding-0.6B | qwen3-embedding-0.6b | MU5 x 1 | $2.888 | $1,394.329 |
MU6 x 1 | $3.438 | $1,662.495 | ||
Qwen3-MoE-Rerank-0.6B | qwen3-moe-rerank-0.6b | MU5 x 1 | $2.888 | $1,394.329 |
Qwen3-Rerank-0.6B | qwen3-rerank-0.6b | MU5 x 1 | $2.888 | $1,394.329 |
MU6 x 1 | $3.438 | $1,662.495 | ||
Qwen3-Max-2025-09-23 | qwen3-max-2025-09-23 | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 8 | $150.72 | $72,577.152 | ||
Qwen3-Rerank | qwen3-rerank | MU5 x 1 | $2.888 | $1,394.329 |
Qwen2.5-Open-Source-72B | qwen2.5-72b-instruct | MU1 x 8 | $59.408 | $28,734.256 |
Qwen2.5-Open-Source-14B | qwen2.5-14b-instruct | MU1 x 2 | $14.852 | $7,183.564 |
Qwen2.5-Open-Source-7B | qwen2.5-7b-instruct | MU1 x 2 | $14.852 | $7,183.564 |
MU5 x 1 | $2.888 | $1,394.329 | ||
Qwen-Plus-2025-07-28 | qwen-plus-2025-07-28 | MU1 x 4 MU1 x 16 (PD 分離モード) | $29.704 PD 分離モード:$118.816 | $14,367.128 PD 分離モード:$57,468.512 |
Qwen-Plus-2025-12-01 | qwen-plus-2025-12-01 | MU1 x 4 | $29.704 | $14,367.128 |
Qwen-Plus-Character-2025-11-06 | qwen-plus-character-2025-11-06 | MU1 x 4 | $29.704 | $14,367.128 |
GLM
モデル名 | モデルコード | モデルユニット仕様 | 時間単位の単価 (米ドル) 最小課金単位:分 | 月額単価 (米ドル) 最小課金単位:日 |
|---|---|---|---|---|
GLM-5.1 | glm-5.1 | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 16 (PD 分離モード) | PD 分離モード:$301.44 | PD 分離モード:$145,154.304 | ||
MU6 x 16 | $55.008 | $26,599.92 | ||
GLM-5 | glm-5 | MU3 x 16 (PD 分離モード) | PD 分離モード:$301.44 | PD 分離モード:$145,154.304 |
GLM-4.7 | glm-4.7 | MU6 x 32 (PD 分離モード) | PD 分離モード:$110.016 | PD 分離モード:$53,199.84 |
DeepSeek
モデル名 | モデルコード | モデルユニット仕様 | 時間単位の単価 (米ドル) 最小課金単位:分 | 月額サブスクリプション価格 (米ドル) 最小課金単位:日 |
|---|---|---|---|---|
DeepSeek-v4-Flash | deepseek-v4-flash | MU1 x 8 | $59.408 | $28,734.256 |
MU3 x 8 | $150.72 | $72,577.152 | ||
DeepSeek-v3.2 | deepseek-v3.2 | MU2 x 16 (PD 分離モード) | PD 分離モード:$138.624 | PD 分離モード:$66,089.44 |
その他のモデル
モデル名 | モデルコード | モデルユニット仕様 | 時間単位の単価 (米ドル) 最小課金単位:分 | 月額サブスクリプション価格 (米ドル) 最小課金単位:日 |
|---|---|---|---|---|
Kimi-K2.5 | kimi-k2.5 | MU2 x 8 | $69.312 | $33,044.72 |
マルチモーダル
Qwen VL
モデル名 | モデルコード | モデルユニット仕様 | 時間単位の単価 (米ドル) 最小課金単位:分 | 月額サブスクリプション価格 (米ドル) 最小課金単位:日 |
|---|---|---|---|---|
Qwen3-VL-235B-A22B-Thinking | qwen3-vl-235b-a22b-thinking | MU1 x 8 | $59.408 | $28,734.256 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 | $150.72 | $72,577.152 | ||
Qwen3-VL-32B-Instruct | qwen3-vl-32b-instruct | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 8 | $150.72 | $72,577.152 | ||
Qwen3-VL-8B-Instruct | qwen3-vl-8b-instruct | MU1 x 2 | $14.852 | $7,183.564 |
MU5 x 1 | $2.888 | $1,394.329 | ||
Qwen3-VL-4B-Instruct | qwen3-vl-4b-instruct | MU1 x 2 | $14.852 | $7,183.564 |
Qwen3-VL-2B-Instruct | qwen3-vl-2b-instruct | MU5 x 1 | $2.888 | $1,394.329 |
Qwen3-VL-Embedding-2B | qwen3-vl-embedding-2b | MU5 x 1 | $2.888 | $1,394.329 |
Qwen3-VL-Flash-2025-10-15 | qwen3-vl-flash-2025-10-15 | MU1 x 4 | $29.704 | $14,367.128 |
Qwen3-VL-Plus-2025-09-23 | qwen3-vl-plus-2025-09-23 | MU1 x 4 | $29.704 | $14,367.128 |
Qwen-VL-Max-2025-08-13 | qwen-vl-max-2025-08-13 | MU6 x 4 | $13.752 | $6,649.98 |
Qwen Omni
モデル名 | モデルコード | モデルユニット仕様 | 時間単位の単価 (米ドル) 最小課金単位:分 | 月額サブスクリプション価格 (米ドル) 最小課金単位:日 |
|---|---|---|---|---|
Qwen3.5-Omni-Flash | qwen3.5-omni-flash | MU8 x 1 | $6.464 | $3,080.477 |
MU9 x 1 | $7.014 | $3,383.024 |
モデルタイプ:
- Instruct - モデルはデプロイ後、ノンシンキングモードで推論を実行します。
- Thinking - モデルはデプロイ後、思考モードで推論を実行します。
モデルのトークン使用量別
料金 = モデル入力トークン数 × モデル入力単価 + モデル出力トークン数 × モデル出力単価 (最小課金単位:1 トークン)
- モデルのトークン使用量に応じた課金は、以下のベースモデルで効率的な SFT トレーニングを完了し、カスタムモデルを取得した後にのみサポートされます。
シンガポール
ベースモデル | モデルコード | 入力 ドル/100 万トークン | 出力 ドル/100 万トークン |
|---|---|---|---|
Qwen3-14B | qwen3-14b | 非思考モード:$0.35 思考モード:$0.35 | 非思考モード:$1.4 思考モード:$4.2 |
北京
ベースモデル | モデルコード | 入力 ドル/100 万トークン | 出力 ドル/100 万トークン |
|---|---|---|---|
Qwen3.5-27B | qwen3.5-27b | <128K $0.086 128K-256K $0.258 | <128K $0.688 128K-256K $2.064 |
Qwen3-32B | qwen3-32b | 非思考モード:$0.287 思考モード:$0.287 | 非思考モード:$1.147 思考モード:$2.868 |
Qwen3-14B | qwen3-14b | 非思考モード:$0.144 思考モード:$0.144 | 非思考モード:$0.574 思考モード:$1.434 |
Qwen3-8B | qwen3-8b | 非思考モード:$0.072 思考モード:$0.072 | 非思考モード:$0.287 思考モード:$0.717 |
Qwen3-VL-8B-Instruct | qwen3-vl-8b-instruct | $0.072 | $0.287 |
より多くのモデルをデプロイするには、こちらのソリューションを参照し、ビジネス要件に基づいて最適なデプロイメントプランを選択してください。
デプロイ方法
コンソールでモデルをデプロイできます。次の手順をご参照ください。
「権限が不十分です」というプロンプトが表示された場合は、「デプロイ中に「権限が不十分です」と表示された場合の対処法
|
|
| |
モデルが正常にデプロイされると、料金が発生します。 |
デプロイ設定
モデルユニット
設定項目 | 設定詳細 |
|---|---|
サービス名 | デプロイサービス用のカスタム名です。 |
モデル | プラットフォームのプリセットモデルやファインチューニング済みモデルなど、デプロイするモデルを選択します。 |
モデルユニットタイプ | デプロイ仕様を選択します。仕様によって、コンピューティング能力とパフォーマンスが異なります。 |
レプリカ数 | デプロイレプリカの初期数を設定します。これは、サービスの並行処理能力に影響します。 |
デプロイテンプレート | デプロイテンプレート (例:「単一ノードデプロイ」) を選択します。テンプレートによって、リソース設定スキームが異なります。モデルユニット課金モードでのみ利用可能です。 |
モデル推論モード | 一部のモデルでは、モデルユニット モードでデプロイする際に、推論モードや最大コンテキストなどを設定できます。
|
最大コンテキスト | 一部のモデルのモデルユニット デプロイモードでは、この設定がサポートされています。最大コンテキスト長はモデルタイプによって異なります。 |
サービスのスロットリング | 一部のモデルのモデルユニット デプロイモードでは、この設定がサポートされており、モデル呼び出しの RPM と TPM を制限できます。 |
デプロイメントリストページ
デプロイメントが成功すると、デプロイメントリストページですべてのデプロイメントサービスを表示および管理できます。このリストページには、以下の情報が含まれます:
- サービス名:デプロイメントサービスの名前です。クリックすると、デプロイメントの詳細が表示されます。
- モデル名:デプロイメントに使用されるモデルです。
- モデルコード:モデルが正常にデプロイメントされた後に生成される一意の識別子で、API を呼び出す際にモデルを指定するために使用されます。
- デプロイメントステータス/イベントステータス:デプロイメント保留中、デプロイメント中、実行中、デプロイメント失敗、オフライン処理中、サービス一時停止、停止済み、削除中、サブスクリプション一時停止/支払い延滞による一時停止、サービス再開中、実行中 (設定変更中)、実行中 (変更失敗) などのステータスが含まれます。
- 課金方法:現在のデプロイメントサービスの課金方法です。
- デプロイメント詳細:モデルユニットタイプやレプリカ数などの構成情報です。
- スロットリング詳細:RPM (1分あたりのリクエスト数) や TPM (1分あたりのトークン数) など、現在のデプロイメントサービスのスロットリング構成が表示されます。
- サービス期間:デプロイメントサービスの作成時間と有効期限が表示されます。
- 操作:デプロイメントステータスと課金方法に応じて、更新、監視、スケール、延長、オフライン化、削除、試用などの操作を実行できます。
デプロイ後の呼び出し
モデルが正常にデプロイされると、OpenAI 互換、Dashscope、および Assistant SDK を介して呼び出すことができます。
デプロイ済みのモデルを呼び出す際、model の値は、デプロイが成功した後に生成されるモデルの code である必要があります。モデルデプロイコンソール に移動して モデルコード を取得します。
import os
import dashscope
messages = [
{"role": "system", "content": "あなたは役立つアシスタントです。"},
{"role": "user", "content": "あなたは誰ですか?"},
]
dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'
response = dashscope.Generation.call(
# 環境変数を設定していない場合は、次の行をご利用の Bailian API キーに置き換えてください: api_key="sk-xxx",
api_key=os.getenv("DASHSCOPE_API_KEY"),
model="qwen3-max-xxx-xxx", # モデルが正常にデプロイされた後に返されるコードに置き換えてください
messages=messages,
result_format="message",
enable_thinking=False,
)
print(response)
import os
from openai import OpenAI
client = OpenAI(
# 環境変数を設定していない場合は、次の行をご利用の Bailian API キーに置き換えてください: api_key="sk-xxx",
api_key=os.getenv('DASHSCOPE_API_KEY'),
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
completion = client.chat.completions.create(
model="qwen3-max-xxx-xxx", # モデルが正常にデプロイされた後に返されるコードに置き換えてください
messages=[
{"role": "system", "content": "あなたは役立つアシスタントです。"},
{"role": "user", "content": "あなたは誰ですか?"},
],
extra_body={"enable_thinking": False},
)
print(completion)
Deployment サービスのスケーリング
- 事前設定スループット (期間課金):Scaling ボタンをクリックしてセルフサービスでインスタンス数を手動で調整します。料金削減と返金の詳細ルールについては、「スペックダウンの返金ルール」をご参照ください。
- モデルユニット (期間課金):Scaling ボタンをクリックしてセルフサービスでインスタンス数を手動で調整します。
また、操作列のスケーリング設定ボタンから、自動スケーリングポリシー (スケーリングしきい値、最小/最大レプリカ数、スケジュールされたスケーリングなどを含む) を設定できます。
デプロイメントサービスのオフライン化
モデルデプロイメントコンソールに移動し、停止したいデプロイメントサービスを見つけ、課金タイプに応じて対応する操作をクリックします:
- モデルユニット (前払い): 非アクティブ化 をクリックして確認します。
- 後払い: 削除 をクリックして確認します。
操作完了後、追加の課金は発生しません。
その他の操作
デプロイメントリストページの [操作] 列では、オフラインにする操作に加えて、次の操作もサポートしています:
- 更新:デプロイ済みサービスのモデルバージョンを更新します。フルアップデートまたは一括更新 (カナリアリリース) に対応しています。
- 削除:従量課金サービスは、直接削除することで課金を停止できます。
- 更新:サブスクリプションサービスは、更新によってサービス時間を延長できます。自動更新にも対応しています。
- キャパシティパッケージの購入:プリセットスループットデプロイメント用にキャパシティパッケージを購入します。
よくある質問
独自のモデルのアップロードとデプロイは可能ですか?
現時点では、独自のモデルのアップロードとデプロイはサポートされていません。Alibaba Cloud Model Studio の最新情報を引き続きご確認ください。
また、Alibaba Cloud Artificial Intelligence Platform PAI は、独自のモデルをデプロイする機能を提供しています。デプロイ方法については、「PAI-LLM 大規模言語モデルのデプロイ」をご参照ください。
デプロイ中に「権限が不十分です」と表示された場合はどうすればよいですか?
-
「このモジュールに対する権限がありません」と表示された場合は、ご利用のアカウントがビジネススペースの権限管理ページで [モデルデプロイメント - 操作] 権限を持っていることを確認してください。
正常に操作できない場合は、所属する組織または IT 管理者に連絡して、関連する権限を追加してもらうか、権限の問題を確認してもらってください。
-
デプロイ中に「xx ビジネススペースには xx モデルをデプロイする権限がありません」というエラーが報告された場合は、Model Studio のビジネススペース管理ページに移動し、対応するビジネススペースに対応するモデルのデプロイメント権限を追加してください。
API 呼び出しエラー:
Workspace xxx does not have deployment privilege for model xxxx。
権限が不十分であると表示された場合は、所属する組織または IT 管理者に連絡して、関連する権限を追加してもらうか、代理で操作してもらってください。




