、独立した専用の推論サービスを取得できます。このサービスは、高い同時実行性、低レイテンシー、その他のパフォーマンス要件といったビジネスニーズを満たすように設計されています。
課金方法
モデルをデプロイする前に、モデルデプロイコンソールで、さまざまなモデルの時間単位の推定コストを確認できます。
サービス作成後に課金方法を変更することはできません。課金方法を切り替えるには、デプロイ済みのモデルを非公開にしてから再デプロイする必要があります。
|
プロビジョンドスループット (PTU) (高スループットと高性能) |
モデルユニット (カスタムパフォーマンスメトリクスとリソース分離) |
トークン使用量 (ファインチューニング済みモデルとパフォーマンス検証のための従量課金) |
|||
|
定義 |
プラットフォームリソースを予約して、特定の 1 分あたりのトークン数 (TPM) スループットを保証するモデルデプロイ方法です。保証されたクォータ内ではレート制限は適用されません。 |
使用期間とモデルユニット数に基づいて計算能力を割り当てるモデルデプロイ方法です。リソースは専用です。 |
各 API 呼び出しの入力および出力トークンに基づいて使用量が計測されるモデルデプロイ方法です。 |
||
|
メリット |
|
|
使用しない場合は課金されません。 |
||
|
サポート対象モデル |
一部の事前学習済みモデル |
一部の事前学習済みモデルとすべてのファインチューニング済みモデル |
LoRA でファインチューニングされた一部のモデル |
||
|
利用シーン |
|
|
ファインチューニング済みモデルのパフォーマンス検証 |
||
|
課金図 |
|
|
|
||
|
課金方法 |
使用期間とプロビジョンドスループットに基づいて課金されます。 従量課金と日次サブスクリプションをサポートします。 |
使用期間とモデルユニット数に基づいて課金されます。 従量課金と月次サブスクリプションをサポートします。 |
モデルごとのトークン使用量 従量課金をサポートします。 |
||
|
スケーリング方法 |
スループットを手動で増減できます。 |
モデルユニット数を手動で増減できます。 |
コンソールでリクエストを送信し、手動レビューを待ちます。 |
||
|
製品の制約 |
|
サブスクリプションの場合、最初の 1 か月以内に登録を解除すると、日次単価 (≈ 月次単価 / 30) が標準価格の 1.2 倍で請求されます。 |
|
||
単一の呼び出しのトークン使用量と呼び出し履歴を表示するには、モデルモニタリングに移動します。
課金詳細
時間ベースの課金 (プロビジョンドスループット)
コスト = 使用期間 × (入力 TPM 単価 × 入力 TPM + 出力 TPM 単価 × 出力 TPM)
従量課金方法では、使用量は時間単位で課金され、単価は以下の表の時間料金に基づきます。サブスクリプション方法では、使用量は日次で課金され、単価は以下の表の日次料金に基づきます。
-
サブスクリプション注文は支払い後すぐに有効になります。N 日間のサブスクリプションは、N 日目の 23:59 まで有効です。注文が 22:00 以降に行われた場合、有効期限は自動的に 1 日延長されます。
-
サブスクリプション注文の有効期限が切れた後、サービスは 2 時間の猶予期間後に停止されます。サービスが停止された後、リソースは 14 時間保持され、その後解放されます。
-
サブスクリプション注文は早期に終了することはできません。
-
従量課金方法では、アカウントに支払い遅延がある場合、デプロイされたリソースは保持され、24 時間課金が継続され、その間サービスは利用可能です。24 時間後、システムは課金を停止し、モデルデプロイは支払い遅延状態になります。基盤となるリソースは削除されますが、モデルデプロイタスクは保持されます。遅延額を支払うと、システムはリソースを再割り当てし、サービスを復元し、課金を再開します。料金の発生を停止するには、モデルデプロイタスクを削除する必要があります。タスクが正常に削除されると、課金は停止します。
モデル入力が最大入力トークン数または購入した TPM を超えた場合、呼び出しは自動的に現在のモデルの従量課金モードに切り替わります。この場合、推論パフォーマンスが低下し、ワークスペース内の現在のスナップショットモデルのパブリックトラフィック制御の対象となります。コストは、モデル呼び出し (従量課金) の標準に基づいて請求されます。
-
この場合、API 呼び出しは
x-dashscope-ptu-overflow:trueを含むヘッダーを返します。 -
TPM 統計を表示するには、モデルモニタリングに移動します。
スケールインシナリオ (スペックダウン) の具体的な返金ルールについては、「スペックダウンの返金ルール」をご参照ください。
シンガポール
Qwen
|
モデル名 |
モデルコード |
最大入力トークン数 |
従量課金入力 10k TPM/時間あたり |
従量課金出力 1k TPM/時間あたり |
サブスクリプション入力 10k TPM/日あたり |
サブスクリプション出力 1k TPM/日あたり |
|
Qwen3.7-Max-2026-05-20 |
qwen3.7-max-2026-05-20 |
256K |
$6 |
$1.8 |
$72 |
$21.6 |
|
Qwen3.7-Plus-2026-05-26 |
qwen3.7-plus-2026-05-26 |
256K |
$0.96 |
$0.384 |
$11.52 |
$4.608 |
|
Qwen3.6-Plus-2026-04-02 |
qwen3.6-plus-2026-04-02 |
128K |
$1.2 |
$0.72 |
$14.4 |
$8.64 |
|
Qwen3.5-Plus-2026-04-20 |
qwen3.5-plus-2026-04-20 |
128K |
$0.96 |
$0.576 |
$11.52 |
$6.912 |
DeepSeek
|
モデル名 |
モデルコード |
最大入力トークン数 |
従量課金入力 10k TPM/時間あたり |
従量課金出力 1k TPM/時間あたり |
サブスクリプション入力 10k TPM/日あたり |
サブスクリプション出力 1k TPM/日あたり |
|
DeepSeek-v4-Flash |
deepseek-v4-flash |
256K |
$0.72 |
$0.144 |
$8.64 |
$1.728 |
|
DeepSeek-v4-Pro |
deepseek-v4-pro |
256K |
$8.64 |
$1.728 |
$103.68 |
$20.736 |
|
DeepSeek-v3.2 |
deepseek-v3.2 |
64K |
$2.05 |
$0.616 |
$24.62 |
$7.387 |
Qwen-VL
|
モデル名 |
モデルコード |
最大入力トークン数 |
従量課金入力 10k TPM/時間あたり |
従量課金出力 1k TPM/時間あたり |
サブスクリプション入力 10k TPM/日あたり |
サブスクリプション出力 1k TPM/日あたり |
|
Qwen3-VL-Plus-2025-09-23 |
qwen3-vl-plus-2025-09-23 |
128K |
$0.48 |
$0.384 |
$5.76 |
$4.608 |
その他のモデル
|
モデル名 |
モデルコード |
最大入力トークン数 |
従量課金入力 10k TPM/時間あたり |
従量課金出力 1k TPM/時間あたり |
サブスクリプション入力 10k TPM/日あたり |
サブスクリプション出力 1k TPM/日あたり |
|
GLM-5.1 |
glm-5.1 |
64K |
$5.04 |
$1.584 |
$64.8 |
$19.008 |
中国 (北京)
Qwen
|
モデル名 |
モデルコード |
最大入力トークン数 |
従量課金入力 10k TPM/時間あたり |
従量課金出力 1k TPM/時間あたり |
サブスクリプション入力 10k TPM/日あたり |
サブスクリプション出力 1k TPM/日あたり |
|
Qwen3.7-Max-2026-05-20 |
qwen3.7-max-2026-05-20 |
256K |
$3.96 |
$1.188 |
$47.53 |
$14.258 |
|
Qwen3.7-Plus-2026-05-26 |
qwen3.7-plus-2026-05-26 |
256K |
$0.66 |
$0.264 |
$7.92 |
$3.168 |
|
Qwen3.6-Plus-2026-04-02 |
qwen3.6-plus-2026-04-02 |
128K |
$0.67 |
$0.397 |
$7.93 |
$4.753 |
|
Qwen3.5-Plus-2026-04-20 |
qwen3.5-plus-2026-04-20 |
128K |
$0.26 |
$0.16 |
$3.17 |
$1.9 |
|
Qwen3-Max-2025-09-23 |
qwen3-max-2025-09-23 |
128K |
$1.11 |
$0.45 |
$13.32 |
$5.4 |
|
Qwen-Flash-2025-07-28 |
qwen-flash-2025-07-28 |
128K |
$0.06 |
$0.06 |
$0.72 |
$0.72 |
|
Qwen-Plus-2025-12-01 |
qwen-plus-2025-12-01 |
128K |
$0.28 |
ノンシンキングモード: $0.07 思考モード: $0.28 |
$3.36 |
ノンシンキングモード: $0.84 思考モード: $3.36 |
DeepSeek
|
モデル名 |
モデルコード |
最大入力トークン数 |
従量課金入力 10k TPM/時間あたり |
従量課金出力 1k TPM/時間あたり |
サブスクリプション入力 10k TPM/日あたり |
サブスクリプション出力 1k TPM/日あたり |
|
DeepSeek-v4-Flash |
deepseek-v4-flash |
256K |
$0.5 |
$0.099 |
$5.94 |
$1.188 |
|
DeepSeek-v4-Pro |
deepseek-v4-pro |
256K |
$5.94 |
$1.188 |
$71.3 |
$14.26 |
|
DeepSeek-v3.2 |
deepseek-v3.2 |
64K |
$1.04 |
$0.16 |
$12.48 |
$1.92 |
|
DeepSeek-v3 |
deepseek-v3 |
64K |
$0.99 |
$0.396 |
$11.9 |
$4.75 |
Qwen-VL
|
モデル名 |
モデルコード |
最大入力トークン数 |
従量課金入力 10k TPM/時間あたり |
従量課金出力 1k TPM/時間あたり |
サブスクリプション入力 10k TPM/日あたり |
サブスクリプション出力 1k TPM/日あたり |
|
Qwen3-VL-Plus-2025-09-23 |
qwen3-vl-plus-2025-09-23 |
128K |
$0.35 |
$0.35 |
$4.2 |
$4.2 |
その他のモデル
|
モデル名 |
モデルコード |
最大入力トークン数 |
従量課金入力 10k TPM/時間あたり |
従量課金出力 1k TPM/時間あたり |
サブスクリプション入力 10k TPM/日あたり |
サブスクリプション出力 1k TPM/日あたり |
|
GLM-5.1 |
glm-5.1 |
64K |
$2.97 |
$1.19 |
$35.65 |
$14.26 |
時間ベースの課金 (モデルユニット)
コスト = 使用期間 (時間) × モデルユニット数 × モデルユニット価格
従量課金方式の場合、「モデルユニット価格」は下表の「時間単位の料金」です。月額サブスクリプション方式の場合、計算式は月数 × モデルユニット数 × 月額料金です。
-
サブスクリプションの場合、最初の 1 か月以内に登録を解除すると、1 日あたりの単価 (≈ 月額単価 / 30) が標準料金の 1.2 倍で請求されます。1 日未満の利用は 1 日として請求されます。
モデルユニットの従量課金方式では、コンピューティング能力リソースは先着順で割り当てられます。購入に失敗した場合は、全額返金されます。
シンガポール
テキスト生成
|
モデル名 |
モデルコード |
モデルユニット仕様 |
時間単位の料金 ($) 最小課金単位:分 |
月額料金 ($) 最小課金単位:日 |
|
Qwen3.6-Plus-2026-04-02 |
qwen3.6-plus-2026-04-02 |
MU1 x 8 |
$88 |
$41,832 |
|
Qwen3.5-39B-A17B |
qwen3.5-397b-a17b |
MU2 x 8 |
$112 |
$52,392 |
|
Qwen3.5-35B-A3B |
qwen3.5-35b-a3b |
MU2 x 8 |
$112 |
$52,392 |
|
Qwen3-32B |
qwen3-32b |
MU1 x 4 |
$44 |
$20,916 |
|
MU2 x 8 |
$112 |
$52,392 |
||
|
Qwen3-14B |
qwen3-14b |
MU1 x 4 |
$44 |
$20,916 |
|
GLM-5.1 |
glm-5.1 |
MU2 x 8 |
$112 |
$52,392 |
|
DeepSeek-V4-Flash |
deepseek-v4-flash |
MU1 x 8 |
$88 |
$41,832 |
マルチモーダル
|
モデル名 |
モデルコード |
モデルユニット仕様 |
時間単位の料金 ($) 最小課金単位:分 |
月額料金 ($) 最小課金単位:日 |
|
Qwen3-VL-32B-Instruct |
qwen3-vl-32b-instruct |
MU2 x 8 |
$112 |
$52,392 |
|
Qwen3-VL-8B-Instruct |
qwen3-vl-8b-instruct |
MU1 x 2 |
$22 |
$10,458 |
モデルタイプ:
-
Instruct - デプロイされたモデルはノンシンキングモードで推論を実行します。
中国 (北京)
テキスト生成
Qwen
|
モデル名 |
モデルコード |
モデルユニット仕様 |
時間単位の料金 ($) 最小課金単位:分 |
月額料金 ($) 最小課金単位:日 |
|
Qwen3.7-Plus-2026-05-26 |
qwen3.7-plus-2026-05-26 |
MU3 x 8 |
$150.72 |
$72,577.152 |
|
Qwen3.6-35B-A3B |
qwen3.6-35b-a3b |
MU8 x 1 |
$6.464 |
$3,080.477 |
|
MU9 x 1 |
$7.014 |
$3,383.024 |
||
|
Qwen3.6-27B |
qwen3.6-27b |
MU9 x 1 |
$7.014 |
$3,383.024 |
|
Qwen3.6-Flash-2026-04-16 |
qwen3.6-flash-2026-04-16 |
MU1 x 2 |
$14.852 |
$7,183.564 |
|
Qwen3.6-Plus-2026-04-02 |
qwen3.6-plus-2026-04-02 |
MU1 x 8 |
$59.408 |
$28,734.256 |
|
Qwen3.5-397B-A17B |
qwen3.5-397b-a17b |
MU2 x 8 |
$69.312 |
$33,044.72 |
|
MU3 x 8 |
$150.72 |
$72,577.152 |
||
|
MU6 x 16 |
$55.008 |
$26,599.92 |
||
|
Qwen3.5-122B-A10B |
qwen3.5-122b-a10b |
MU1 x 4 |
$29.704 |
$14,367.128 |
|
MU2 x 8 |
$69.312 |
$33,044.72 |
||
|
MU6 x 16 |
$55.008 |
$26,599.92 |
||
|
MU9 x 2 |
$14.028 |
$6,766.048 |
||
|
Qwen3.5-35B-A3B |
qwen3.5-35b-a3b |
MU1 x 2 |
$14.852 |
$7,183.564 |
|
MU2 x 8 |
$69.312 |
$33,044.72 |
||
|
MU8 x 1 |
$6.464 |
$3,080.477 |
||
|
MU9 x 1 |
$7.014 |
$3,383.024 |
||
|
Qwen3.5-27B |
qwen3.5-27b |
MU9 x 1 |
$7.014 |
$3,383.024 |
|
Qwen3.5-9B |
qwen3.5-9b |
MU8 x 1 |
$6.464 |
$3,080.477 |
|
MU9 x 1 |
$7.014 |
$3,383.024 |
||
|
Qwen3.5-Flash-2026-02-23 |
qwen3.5-flash-2026-02-23 |
MU1 x 2 |
$14.852 |
$7,183.564 |
|
Qwen3.5-Plus-2026-02-15 |
qwen3.5-plus-2026-02-15 |
MU1 x 8 |
$59.408 |
$28,734.256 |
|
MU3 x 8 |
$150.72 |
$72,577.152 |
||
|
Qwen3-235B-A22B-Instruct |
qwen3-235b-a22b-instruct-2507 |
MU1 x 4 |
$29.704 |
$14,367.128 |
|
MU2 x 8 |
$69.312 |
$33,044.72 |
||
|
Qwen3-Next-80B-A3B-Instruct |
qwen3-next-80b-a3b-instruct |
MU1 x 2 |
$14.852 |
$7,183.564 |
|
Qwen3-32B |
qwen3-32b |
MU1 x 4 |
$29.704 |
$14,367.128 |
|
MU6 x 4 |
$13.752 |
$6,649.98 |
||
|
Qwen3-30B-A3B |
qwen3-30b-a3b |
MU9 x 2 |
$14.028 |
$6,766.048 |
|
Qwen3-30B-A3B-Instruct-2507 |
qwen3-30b-a3b-instruct-2507 |
MU1 x 4 |
$29.704 |
$14,367.128 |
|
MU2 x 8 |
$69.312 |
$33,044.72 |
||
|
Qwen3-8B |
qwen3-8b |
MU1 x 2 |
$14.852 |
$7,183.564 |
|
MU2 x 2 |
$17.328 |
$8,261.18 |
||
|
MU5 x 1 |
$2.888 |
$1,394.329 |
||
|
Qwen3-4B |
qwen3-4b |
MU1 x 2 |
$14.852 |
$7,183.564 |
|
MU5 x 1 |
$2.888 |
$1,394.329 |
||
|
Qwen3-1.7B |
qwen3-1.7b |
MU1 x 2 |
$14.852 |
$7,183.564 |
|
MU5 x 1 |
$2.888 |
$1,394.329 |
||
|
Qwen3-Max-2025-09-23 |
qwen3-max-2025-09-23 |
MU2 x 8 |
$69.312 |
$33,044.72 |
|
MU3 x 8 |
$150.72 |
$72,577.152 |
||
|
Qwen2.5-72B |
qwen2.5-72b-instruct |
MU1 x 4 |
$29.704 |
$14,367.128 |
|
Qwen2.5-32B |
qwen2.5-32b-instruct |
MU1 x 4 |
$29.704 |
$14,367.128 |
|
Qwen2.5-14B |
qwen2.5-14b-instruct |
MU1 x 2 |
$14.852 |
$7,183.564 |
|
Qwen2.5-7B |
qwen2.5-7b-instruct |
MU1 x 2 |
$14.852 |
$7,183.564 |
|
MU5 x 1 |
$2.888 |
$1,394.329 |
||
|
Qwen2.5-3B-Instruct |
qwen2.5-3b-instruct |
MU5 x 1 |
$2.888 |
$1,394.329 |
|
Qwen-Flash-2025-07-28 |
qwen-flash-2025-07-28 |
MU1 x 4 |
$29.704 |
$14,367.128 |
|
Qwen-Plus-2025-07-28 |
qwen-plus-2025-07-28 |
MU1 x 4 |
$29.704 |
$14,367.128 |
|
Qwen-Plus-2025-12-01 |
qwen-plus-2025-12-01 |
MU1 x 4 |
$29.704 |
$14,367.128 |
GLM
|
モデル名 |
モデルコード |
モデルユニット仕様 |
時間単位の料金 ($) 最小課金単位:分 |
月額料金 ($) 最小課金単位:日 |
|
GLM-5.1 |
glm-5.1 |
MU2 x 8 |
$69.312 |
$33,044.72 |
|
MU3 x 8 |
$150.72 |
$72,577.152 |
||
|
MU6 x 16 |
$55.008 |
$26,599.92 |
||
|
GLM-5 |
glm-5 |
MU3 x 8 |
$150.72 |
$72,577.152 |
|
GLM-4.7 |
glm-4.7 |
MU6 x 16 |
$55.008 |
$26,599.92 |
DeepSeek
|
モデル名 |
モデルコード |
モデルユニット仕様 |
時間単位の料金 ($) 最小課金単位:分 |
月額料金 ($) 最小課金単位:日 |
|
DeepSeek-V4-Flash |
deepseek-v4-flash |
MU1 x 8 |
$59.408 |
$28,734.256 |
|
DeepSeek-V3.2 |
deepseek-v3.2 |
MU2 x 8 |
$69.312 |
$33,044.72 |
その他のモデル
|
モデル名 |
モデルコード |
モデルユニット仕様 |
時間単位の料金 ($) 最小課金単位:分 |
月額料金 ($) 最小課金単位:日 |
|
MiniMax-M2.5 |
MiniMax-M2.5 |
MU1 x 8 |
$59.408 |
$28,734.256 |
|
Kimi-K2.5 |
kimi-k2.5 |
MU2 x 8 |
$69.312 |
$33,044.72 |
マルチモーダル
Qwen-VL
|
モデル名 |
モデルコード |
モデルユニット仕様 |
時間単位の料金 ($) 最小課金単位:分 |
月額料金 ($) 最小課金単位:日 |
|
Qwen3-VL-235B-A22B-Instruct |
qwen3-vl-235b-a22b-instruct |
MU1 x 4 |
$29.704 |
$14,367.128 |
|
Qwen3-VL-235B-A22B-Thinking |
qwen3-vl-235b-a22b-thinking |
MU1 x 4 |
$29.704 |
$14,367.128 |
|
Qwen3-VL-32B-Instruct |
qwen3-vl-32b-instruct |
MU2 x 8 |
$69.312 |
$33,044.72 |
|
Qwen3-VL-8B-Instruct |
qwen3-vl-8b-instruct |
MU1 x 2 |
$14.852 |
$7,183.564 |
|
Qwen3-VL-Flash-2025-10-15 |
qwen3-vl-flash-2025-10-15 |
MU1 x 4 |
$29.704 |
$14,367.128 |
|
Qwen3-VL-Plus-2025-09-23 |
qwen3-vl-plus-2025-09-23 |
MU1 x 4 |
$29.704 |
$14,367.128 |
|
Qwen-VL-Max-2025-08-13 |
qwen-vl-max-2025-08-13 |
MU6 x 4 |
$13.752 |
$6,649.98 |
|
Qwen-VL-OCR-2025-11-20 |
qwen-vl-ocr-2025-11-20 |
MU6 x 4 |
$13.752 |
$6,649.98 |
Qwen Omni
|
モデル名 |
モデルコード |
モデルユニット仕様 |
時間単位の料金 ($) 最小課金単位:分 |
月額料金 ($) 最小課金単位:日 |
|
Qwen3.5-Omni-Flash |
qwen3.5-omni-flash |
MU8 x 1 |
$6.464 |
$3,080.477 |
|
MU9 x 1 |
$7.014 |
$3,383.024 |
||
|
Qwen3.5-Omni-Plus |
qwen3.5-omni-plus |
MU9 x 8 |
$56.112 |
$27,064.192 |
モデルタイプ:
-
Instruct - デプロイされたモデルはノンシンキングモードで推論を実行します。
-
Thinking - デプロイされたモデルは思考モードで推論を実行します。
モデルのトークン使用量別
費用 = 入力トークン数 × 入力単価 + 出力トークン数 × 出力単価 (最小課金単位:1 トークン)
-
モデルのトークン使用量に応じた課金は、以下の基盤モデルに対して教師ありファインチューニング (SFT) を完了し、カスタムモデルを取得した後にのみサポートされます。
シンガポール
|
基盤モデル |
モデルコード |
入力 米ドル/1k トークン |
出力 米ドル/1k トークン |
|
Qwen3-14B |
qwen3-14b |
$0.00035 |
非思考モード: $0.0014 思考モード: $0.0042 |
より多くのモデルをデプロイするには、こちらのソリューションを参照し、ビジネスニーズに最も適したデプロイメントプランを選択してください。
デプロイ方法
コンソールでモデルをデプロイするには、次の手順を実行します。
デプロイ中に権限エラーが発生した場合は、「デプロイ中に権限エラーが発生した場合の対処法
|
|
|
|
重要
モデルのデプロイが成功すると、料金が発生します。 |
デプロイ設定
モデルユニット
|
設定 |
詳細 |
|
サービス名 |
デプロイサービスに付けるカスタム名です。 |
|
モデルの選択 |
デプロイするモデルを選択します。事前学習済みのプラットフォームモデルやファインチューニング済みのモデルが含まれます。 |
|
モデルユニットタイプ |
デプロイ仕様を選択します。仕様によって、コンピューティング能力とパフォーマンスが異なります。 |
|
レプリカ数 |
デプロイの初期レプリカ数を設定します。この設定は、サービスの並行処理能力に影響します。 |
|
デプロイテンプレート |
「単一マシンデプロイ」などのデプロイテンプレートを選択します。テンプレートによって、リソース設定プランが異なります。この設定は、モデルユニット課金モードでのみ利用可能です。 |
|
モデル推論モードの設定 |
一部のモデルを モデルユニット 方式でデプロイする場合、推論モードや最大コンテキスト長などの設定が可能です。
|
|
最大コンテキスト |
一部のモデルの モデルユニット デプロイモードでサポートされています。最大コンテキスト長はモデルタイプに基づきます。 |
|
サービススロットリング |
一部のモデルの モデルユニット デプロイモードでサポートされています。モデル呼び出しの RPM と TPM を制限できます。 |
デプロイメントリストページ
デプロイメントが成功すると、デプロイメントリストページで、デプロイ済みのすべてのサービスを表示および管理できます。このページには、次の情報が含まれています:
-
サービス名: デプロイメントサービスの名前です。名前をクリックすると、デプロイメント詳細が表示されます。
-
モデル名: デプロイメントに使用されるモデルです。
-
モデルコード: モデルが正常にデプロイされた後に生成される一意の識別子です。API 呼び出しでモデルを指定するために使用されます。
-
デプロイメントステータス/イベントステータス: `デプロイメント保留中`、`デプロイメント中`、`実行中`、`デプロイメント失敗`、`公開停止中`、`サービス一時停止中`、`停止済み`、`削除中`、`サブスクリプション解除/期限切れ`、`再開中`、`実行中 (アップグレード/ダウングレード中)`、`実行中 (アップグレード/ダウングレード失敗)` などのステータスが含まれます。
-
課金方法: デプロイメントサービスの現在の課金方法です。
-
デプロイメント詳細: モデルユニットタイプやレプリカ数などの設定情報です。
-
レート制限詳細: 現在のデプロイメントサービスに設定されている、1 分あたりのリクエスト数 (RPM) や 1 分あたりのトークン数 (TPM) などのレート制限設定が表示されます。
-
サービス期間: デプロイメントサービスの作成日時と有効期限が表示されます。
-
操作: デプロイメントのステータスと課金方法に応じて、`更新`、`モニタリング`、`スケーリング`、`更新`、`公開停止`、`削除`、`体験` などの操作を実行できます。
デプロイ後の呼び出し
モデルが正常にデプロイされると、OpenAI 互換、Dashscope、および Assistant SDK を使用して呼び出すことができます。
デプロイ済みのモデルを呼び出す際、model の値には、モデルが正常にデプロイされた後に生成されるモデルの code を設定する必要があります。モデルデプロイメントコンソールにアクセスし、モデルコード を取得してください。

DashScope
import os
import dashscope
messages = [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Who are you?"},
]
dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'
response = dashscope.Generation.call(
# 環境変数が設定されていない場合は、次の行を api_key="sk-xxx" に置き換えてください。
api_key=os.getenv("DASHSCOPE_API_KEY"),
model="qwen3-max-xxx-xxx", # モデルが正常にデプロイされた後に生成されたコードに置き換えてください
messages=messages,
result_format="message",
enable_thinking=False,
)
print(response)
OpenAI 互換インターフェイス
import os
from openai import OpenAI
client = OpenAI(
# 環境変数が設定されていない場合は、次の行を api_key="sk-xxx" に置き換えてください。
api_key=os.getenv('DASHSCOPE_API_KEY'),
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
completion = client.chat.completions.create(
model="qwen3-max-xxx-xxx", # モデルが正常にデプロイされた後に生成されたコードに置き換えてください
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Who are you?"},
],
extra_body={"enable_thinking": False},
)
print(completion)
デプロイメントサービスのスケーリング
-
プロビジョニングされたスループット (時間ベース):Scaling ボタンをクリックして、インスタンス数を手動で調整します。スペックダウンに関する具体的な返金ルールについては、「スペックダウンの返金ルール」をご参照ください。
-
モデルユニット (時間ベース): Scaling ボタンをクリックして、インスタンス数を手動で調整します。
また、[操作] 列の [スケーリング設定] ボタンをクリックして、スケーリングのしきい値、最小/最大レプリカ数、スケジュールされたスケーリングなどの自動スケーリングポリシーを設定することもできます。
サービスの公開停止
モデルデプロイメントコンソールに移動し、停止するデプロイメントサービスを見つけ、課金方法に応じて対応する操作をクリックします:
-
モデルユニット (サブスクリプション): 非アクティブ化 をクリックして確認します。
-
従量課金: 削除 をクリックして確認します。
操作が完了すると、課金は停止します。

その他の操作
デプロイメントリストページの [操作] 列では、非公開にする操作に加えて、以下の操作を実行できます。
-
[更新]:デプロイ済みのサービスのモデルバージョンを更新します。一括またはバッチ (カナリアリリース) で更新できます。
-
[削除]:従量課金制サービスは直接削除して課金を停止できます。
-
[更新]:サブスクリプションサービスは更新してサービス時間を延長できます。自動更新もサポートされています。
-
[容量パッケージの購入]:プロビジョニングされたスループットのデプロイメント向けに、容量パッケージを購入できます。
よくある質問
独自のモデルをアップロードしてデプロイできますか?
現在、独自のモデルのアップロードとデプロイはサポートされていません。Alibaba Cloud Model Studio の最新情報を確認することを推奨します。
さらに、Alibaba Cloud Platform for AI (PAI) は、独自のモデルをデプロイする機能を提供します。詳細については、「PAI-LLM 大規模言語モデルのデプロイ」をご参照ください。
デプロイメント中に権限エラーが発生した場合はどうすればよいですか?
-
「You do not have the required permissions for this module」というメッセージが表示された場合は、ご利用のアカウントがワークスペースの権限管理ページで「Model Deployment - Operation」権限を持っていることを確認してください。

操作を実行できない場合は、組織または IT 管理者に連絡して、必要な権限を追加するか、権限の問題を確認してもらってください。
-
「Workspace xxx does not have deployment privilege for model xxxx」というエラーでデプロイメントが失敗した場合は、Model Studio の ワークスペース管理ページに移動し、対応するモデルのデプロイメント権限をワークスペースに追加します。
API 呼び出しエラー:
Workspace xxx does not have deployment privilege for model xxxx。

権限エラーが発生した場合は、組織または IT 管理者に連絡して、必要な権限を追加するか、操作を代行してもらってください。




