すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:モデルデプロイ

最終更新日:Sep 09, 2026

デプロイを通じて独立した専用リソースの推論サービスを取得し、高い同時実行性や低遅延など、さまざまなパフォーマンスレベルに対するビジネスニーズを満たすことができます。

課金方法

デプロイ前に、モデルデプロイコンソールで、さまざまなモデルの時間単位の推定コストを確認できます。

注記サービスの作成後に課金方法を変更することはできません。切り替えるには、デプロイしたモデルをオフラインにしてから再デプロイする必要があります。

プロビジョニング済みスループット (PTU, Provisioned Throughput Unit)

(高スループット、高性能)

モデルユニット

(カスタムパフォーマンスメトリクス、リソース分離)

トークンベースの使用量

(ファインチューニング/効果検証後の従量課金)

定義

プラットフォームリソースを予約して特定の TPM スループット容量を保証するモデルデプロイ方法です。保証されたクォータ内ではレート制限はありません。

使用期間とモデルユニット数に基づいてコンピューティング能力を設定し、専用リソースを使用するモデルデプロイ方法です。

呼び出しごとに生成される入力トークンと出力トークンを使用量の計測基準とするモデルデプロイ方法です。

メリット

  1. 高負荷の本番環境に対して、安定したスループット容量、低遅延、およびより強力なリソースの確実性を提供します。

  2. トークンベースの課金と比較して、TPS (1 秒あたりに生成されるトークン数) は通常、約 1.5 倍から 2.0 倍に増加します。

  3. 自動更新設定をサポートします。

  1. 遅延/スループットなどのパフォーマンスメトリクスをカスタマイズ可能です。

  2. 自動更新設定をサポートします。

使用しない場合は課金されません

サポート対象モデル

一部の事前設定済みモデル

一部の事前設定済みモデルとすべてのファインチューニング済みモデル

LoRA でファインチューニングされた一部のモデル

利用シーン

  1. 銀行アプリのインテリジェントカスタマーサービス (安定したトラフィック、保証された同時実行エクスペリエンスが必要)。

  2. ソーシャルプラットフォームのリアルタイムコンテンツモデレーション (予測可能なパイプラインタスクの安定した処理が必要)。

  3. パブリッククラウド翻訳 API (標準パッケージユーザーにベースラインのサービス保証を提供)。

  1. E コマース専用のファインチューニング済み大規模モデル (プライベートモデルをデプロイし、大規模なプロモーション中に手動でスケールアップ)。

  2. 製薬会社の分子スクリーニングモデル (長時間実行タスクに専用リソースが必要)。

  3. 自動運転シミュレーション (長期間の連続コンピューティングが必要)。

ファインチューニング済みモデルの効果検証

課金図

image

image

image

課金方法

使用期間とプロビジョニング済みスループットによる

従量課金、日次パッケージ

使用期間とモデルユニット数による

従量課金、月次パッケージ

モデルのトークン使用量による

従量課金

スケーリング方法

スループットのセルフサービスによる増減

モデルユニットのセルフサービスによる増減

コンソールで申請を送信し、手動レビューを待ちます。

製品の制約

  1. 前払いは日割りで課金されます。早期返金は利用できません。

  2. 単位時間内の使用量が購入したスループットを超えた場合、作成時に選択したオーバーフロー戦略に従って処理されます。「自動オーバーフロー」はそのモデルのモデル呼び出しの従量課金に切り替わり、「PTU 容量のみ使用」は 429 を返します。

前払い購入後、最初の 1 か月以内に早期解約した場合、日割り単価 (≈ 月額単価 / 30) が 1.2 倍で請求されます。

  1. 効率的なファインチューニング (LoRA) 後のモデルのみをサポートします。

  2. 1 か月以内に使用されない場合、自動的にリリースされます。

各呼び出しのトークン使用量と呼び出し回数の履歴統計を表示するには、モデルモニタリングに移動します。

課金の詳細

使用期間による課金 (プロビジョニング済みスループット)

料金 = 使用期間 × (入力 TPM 単価 × 入力 TPM + 出力 TPM 単価 × 出力 TPM)

後払いは時間単位で計算されます。使用期間の単位は時間で、単価は以下の表の「連続 1 時間」の列から取得されます。前払いは日単位で計算されます。使用期間の単位は日で、単価は以下の表の「連続 1 日」の列から取得されます。

  • 前払い注文は支払い後すぐに有効になり、有効期間は N 日目の 23:59 に終了します。注文が 22:00 以降に行われた場合、有効期限は自動的に 1 日延長されます。
  • 前払い注文の有効期限が切れた後、サービスは 2 時間の遅延で停止され、リソースは停止後 14 時間保持された後、リリースされます。
  • 前払い注文では、サービスを早期に終了することはできません。
  • 後払い課金の場合、アカウントが延滞状態になると、デプロイされたリソースは 24 時間保持され、課金が継続されます。この間、サービスは通常通り使用できます。24 時間後、システムは課金を停止し、モデルデプロイは延滞状態になり、基盤となるリソースは削除されますが、モデルデプロイタスクは保持されます。延滞料金が支払われると、システムはリソースを再割り当てして使用を復元します (復元後も料金は発生し続けます)。料金の発生を継続したくない場合は、モデルデプロイタスクを削除でき、削除が成功すると課金が停止します。

モデルの入力が最大入力トークンを超えた場合、関連する呼び出しは自動的に現在のモデルの従量課金モードに切り替わります。購入した TPM を超えた場合は、作成時に選択したオーバーフロー戦略 (「自動オーバーフロー」は従量課金に切り替え、「PTU 容量のみ使用」は 429 を返す) に従って処理されます。このとき、推論パフォーマンスが低下する可能性があり、ビジネススペース内の現在のスナップショットモデルのパブリックトラフィック制御の対象となり、料金はモデル呼び出し (従量課金) の基準に従って請求されます。

  • この場合 (「自動オーバーフロー」戦略でのみ)、API レスポンスヘッダーには x-dashscope-ptu-overflow:true が含まれます。
  • TPM 統計については、モデルモニタリングをご参照ください。

スケールダウン (スペックダウン) シナリオにおける具体的な料金削減および返金ルールについては、設定ダウングレードの返金ルールをご参照ください。

注記PTU デプロイは、長文入力の段階的容量係数とキャッシュ割引をサポートしています。詳細については、プロビジョニング済みスループットの長文入力とキャッシュをご参照ください。

シンガポール

Qwen

モデル名

モデルコード

最大入力トークン

後払い入力

1 万 TPM/時間あたり

後払い出力

1,000 TPM/時間あたり

前払い入力

1 万 TPM/日あたり

前払い出力

1,000 TPM/日あたり

Qwen3.8-Max

qwen3.8-max

1M

$4.8

$1.44

$57.6

$17.28

Qwen3.7-Flash-2026-07-15 ビジネス担当者にご連絡の上、有効化してください

qwen3.7-flash-2026-07-15

128K

$0.072

$0.031

$0.864

$0.374

Qwen3.7-Max-2026-05-20

qwen3.7-max-2026-05-20

256K

$1.92

$1.8

$72

$21.6

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

256K

$0.96

$0.384

$11.52

$4.608

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128K

$1.2

$0.72

$14.4

$8.64

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128K

$0.96

$0.576

$11.52

$6.912

DeepSeek

モデル名

モデルコード

最大入力トークン

従量課金入力

1 万 TPM/時間あたり

従量課金出力

1,000 TPM/時間あたり

前払い入力

1 万 TPM/日あたり

前払い出力

1,000 TPM/日あたり

DeepSeek-v4-Flash

deepseek-v4-flash

256K

$0.72

$0.144

$8.64

$1.728

DeepSeek-v4-Flash-0731

deepseek-v4-flash-0731

64K

$1.44

$0.288

$17.28

$3.456

DeepSeek-v4-Pro

deepseek-v4-pro

256K

$0.96

$1.728

$103.68

$20.736

Qwen-VL

モデル名

モデルコード

最大入力トークン

従量課金入力

1 万 TPM/時間あたり

従量課金出力

1,000 TPM/時間あたり

前払い入力

1 万 TPM/日あたり

前払い出力

1,000 TPM/日あたり

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

128K

$0.48

$0.384

$5.76

$4.608

GLM

モデル名

モデルコード

最大入力トークン

従量課金入力

1 万 TPM/時間あたり

従量課金出力

1,000 TPM/時間あたり

前払い入力

1 万 TPM/日あたり

前払い出力

1,000 TPM/日あたり

GLM-5.2

glm-5.2

1M

$5.04

$1.584

$60.48

$19.008

中国北部 2 (北京)

Qwen

モデル名

モデルコード

最大入力トークン

従量課金入力

1 万 TPM/時間あたり

従量課金出力

1,000 TPM/時間あたり

前払い入力

1 万 TPM/日あたり

前払い出力

1,000 TPM/日あたり

Qwen3.8-Max

qwen3.8-max

1M

$3.96

$1.188

$47.53

$14.258

Qwen3.7-Flash-2026-07-15 ビジネス担当者にご連絡の上、有効化してください

qwen3.7-flash-2026-07-15

128K

$0.066

$0.026

$0.792

$0.317

Qwen3.7-Max-2026-05-20

qwen3.7-max-2026-05-20

256K

$3.96

$1.188

$47.53

$14.258

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

256K

$0.66

$0.264

$7.92

$3.168

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128K

$0.67

$0.066

$7.93

$4.753

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128K

$0.26

$0.16

$3.17

$1.9

Qwen3-Max-2025-09-23

qwen3-max-2025-09-23

128K

$1.11

$0.45

$13.32

$5.4

Qwen-Flash-2025-07-28

qwen-flash-2025-07-28

128K

$0.06

$0.06

$0.72

$0.72

Qwen-Plus-2025-12-01

qwen-plus-2025-12-01

128K

$0.28

ノンシンキング:$0.07

シンキング:$0.28

$3.36

ノンシンキング:$0.84

シンキング:$3.36

DeepSeek

モデル名

モデルコード

最大入力トークン

後払い入力

1 万 TPM/時間あたり

後払い出力

1,000 TPM/時間あたり

前払い入力

1 万 TPM/日あたり

前払い出力

1,000 TPM/日あたり

DeepSeek-v4-Flash

deepseek-v4-flash

256K

$0.5

$0.099

$5.94

$1.188

DeepSeek-v4-Flash-0731

deepseek-v4-flash-0731

64K

$0.99

$0.198

$11.88

$2.376

DeepSeek-v4-Pro

deepseek-v4-pro

256K

$5.94

$1.188

$71.3

$14.26

DeepSeek-v3

deepseek-v3

64K

$0.99

$0.396

$11.9

$4.75

Qwen-VL

モデル名

モデルコード

最大入力トークン

後払い入力

1 万 TPM/時間あたり

後払い出力

1,000 TPM/時間あたり

前払い入力

1 万 TPM/日あたり

前払い出力

1,000 TPM/日あたり

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

128K

$0.35

$0.35

$4.2

$4.2

GLM

モデル名

モデルコード

最大入力トークン

後払い入力

1 万 TPM/時間あたり

後払い出力

1,000 TPM/時間あたり

前払い入力

1 万 TPM/日あたり

前払い出力

1,000 TPM/日あたり

GLM-5.2

glm-5.2

1M

$3.96

$1.386

$47.53

$16.635

利用時間に応じた課金 (モデルユニット)

コスト = 利用時間 (時間) × モデルユニット数 × モデルユニット単価

後払いシナリオの場合、「モデルユニット単価」には、以下の表の「時間単位の単価」列の価格が適用されます。月額サブスクリプションの前払い課金の場合、計算式は月額サブスクリプション数 × モデルユニット数 × 月額単価となります。

  • サブスクリプションの最初の 1 か月以内に解約した場合、日単位の単価 (≈ 月額単価 / 30) の 1.2 倍の料金が請求されます (1 日未満の利用は 1 日として課金されます)。

注記モデルユニットの後払い方式の計算リソースは先着順で提供されます。購入に失敗した場合は、全額返金されます。

シンガポール

テキスト生成

モデル名

モデルコード

モデルユニット仕様

時間単位の単価 (米ドル)

最小課金単位:分

月額サブスクリプション単価 (米ドル)

最小課金単位:日

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

MU1 x 8

$88

$41,832

Qwen3.5-397B-A17B

qwen3.5-397b-a17b

MU2 x 8

$112

$52,392

Qwen3.5-122B-A10B

qwen3.5-122b-a10b

MU2 x 8

$112

$52,392

Qwen3.5-27B

qwen3.5-27b

MU1 x 2

$22

$10,458

Qwen3.5-9B

qwen3.5-9b

MU1 x 2

$22

$10,458

GLM-5.1

glm-5.1

MU2 x 8

$112

$52,392

MU3 x 8

$216

$102,696

DeepSeek-v4-Flash

deepseek-v4-flash

MU2 x 8

$112

$52,392

Qwen-Plus-Character-2025-11-06

qwen-plus-character-2025-11-06

MU1 x 4

$44

$20,916

マルチモーダル

モデル名

モデルコード

モデルユニット仕様

時間単位の単価 ($)

最小課金単位:分

月額サブスクリプション単価 ($)

最小課金単位:日

Qwen3-VL-32B-Instruct

qwen3-vl-32b-instruct

MU2 x 8

$112

$52,392

モデルタイプ:

  • Instruct - モデルはデプロイ後、ノンシンキングモードで推論を実行します。

中国 (北京)

テキスト生成

Qwen

モデル名

モデルコード

モデルユニット仕様

時間単位の単価 (米ドル)

最小課金単位:分

月額サブスクリプション単価 (米ドル)

最小課金単位:日

Qwen3.6-35B-A3B

qwen3.6-35b-a3b

MU1 x 8

$59.408

$28,734.256

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

MU8 x 1

$6.464

$3,080.477

MU9 x 1

$7.014

$3,383.024

Qwen3.6-27B

qwen3.6-27b

MU9 x 1

$7.014

$3,383.024

Qwen3.6-Flash-2026-04-16

qwen3.6-flash-2026-04-16

MU1 x 2

$14.852

$7,183.564

MU3 x 8

$150.72

$72,577.152

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

MU1 x 8

MU1 x 16 (PD 分離モード)

$59.408

PD 分離モード:$118.816

$28,734.256

PD 分離モード:$57,468.512

Qwen3.5-397B-A17B

qwen3.5-397b-a17b

MU3 x 8

MU3 x 16 (PD 分離モード)

$150.72

PD 分離モード:$301.44

$72,577.152

PD 分離モード:$145,154.304

MU6 x 16

$55.008

$26,599.92

Qwen3.5-122B-A10B

qwen3.5-122b-a10b

MU1 x 4

$29.704

$14,367.128

MU6 x 16

$55.008

$26,599.92

Qwen3.5-35B-A3B

qwen3.5-35b-a3b

MU1 x 2

$14.852

$7,183.564

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

MU9 x 1

$7.014

$3,383.024

Qwen3.5-27B

qwen3.5-27b

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

MU8 x 1

$6.464

$3,080.477

MU9 x 1

$7.014

$3,383.024

Qwen3.5-9B

qwen3.5-9b

MU1 x 2

$14.852

$7,183.564

MU2 x 8

$69.312

$33,044.72

Qwen3.5-Flash-2026-02-23

qwen3.5-flash-2026-02-23

MU1 x 2

$14.852

$7,183.564

Qwen3.5-Plus-2026-02-15

qwen3.5-plus-2026-02-15

MU1 x 8

MU1 x 16 (PD 分離モード)

$59.408

PD 分離モード:$118.816

$28,734.256

PD 分離モード:$57,468.512

MU2 x 8

$69.312

$33,044.72

MU3 x 8

MU3 x 16 (PD 分離モード)

$150.72

PD 分離モード:$301.44

$72,577.152

PD 分離モード:$145,154.304

Qwen3-235B-A22B-Instruct-2507

qwen3-235b-a22b-instruct-2507

MU1 x 4

$29.704

$14,367.128

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

Qwen3-32B

qwen3-32b

MU6 x 16

$55.008

$26,599.92

Qwen3-30B-A3B-Thinking-2507

qwen3-30b-a3b-thinking-2507

MU1 x 2

$14.852

$7,183.564

Qwen3-8B

qwen3-8b

MU1 x 2

$14.852

$7,183.564

MU2 x 2

$17.328

$8,261.18

Qwen3-4B

qwen3-4b

MU1 x 2

$14.852

$7,183.564

MU5 x 1

$2.888

$1,394.329

Qwen3-Embedding-0.6B

qwen3-embedding-0.6b

MU5 x 1

$2.888

$1,394.329

MU6 x 1

$3.438

$1,662.495

Qwen3-MoE-Rerank-0.6B

qwen3-moe-rerank-0.6b

MU5 x 1

$2.888

$1,394.329

Qwen3-Rerank-0.6B

qwen3-rerank-0.6b

MU5 x 1

$2.888

$1,394.329

MU6 x 1

$3.438

$1,662.495

Qwen3-Max-2025-09-23

qwen3-max-2025-09-23

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

Qwen3-Rerank

qwen3-rerank

MU5 x 1

$2.888

$1,394.329

Qwen2.5-Open-Source-72B

qwen2.5-72b-instruct

MU1 x 8

$59.408

$28,734.256

Qwen2.5-Open-Source-14B

qwen2.5-14b-instruct

MU1 x 2

$14.852

$7,183.564

Qwen2.5-Open-Source-7B

qwen2.5-7b-instruct

MU1 x 2

$14.852

$7,183.564

MU5 x 1

$2.888

$1,394.329

Qwen-Plus-2025-07-28

qwen-plus-2025-07-28

MU1 x 4

MU1 x 16 (PD 分離モード)

$29.704

PD 分離モード:$118.816

$14,367.128

PD 分離モード:$57,468.512

Qwen-Plus-2025-12-01

qwen-plus-2025-12-01

MU1 x 4

$29.704

$14,367.128

Qwen-Plus-Character-2025-11-06

qwen-plus-character-2025-11-06

MU1 x 4

$29.704

$14,367.128

GLM

モデル名

モデルコード

モデルユニット仕様

時間単位の単価 (米ドル)

最小課金単位:分

月額単価 (米ドル)

最小課金単位:日

GLM-5.1

glm-5.1

MU2 x 8

$69.312

$33,044.72

MU3 x 16 (PD 分離モード)

PD 分離モード:$301.44

PD 分離モード:$145,154.304

MU6 x 16

$55.008

$26,599.92

GLM-5

glm-5

MU3 x 16 (PD 分離モード)

PD 分離モード:$301.44

PD 分離モード:$145,154.304

GLM-4.7

glm-4.7

MU6 x 32 (PD 分離モード)

PD 分離モード:$110.016

PD 分離モード:$53,199.84

DeepSeek

モデル名

モデルコード

モデルユニット仕様

時間単位の単価 (米ドル)

最小課金単位:分

月額サブスクリプション価格 (米ドル)

最小課金単位:日

DeepSeek-v4-Flash

deepseek-v4-flash

MU1 x 8

$59.408

$28,734.256

MU3 x 8

$150.72

$72,577.152

DeepSeek-v3.2

deepseek-v3.2

MU2 x 16 (PD 分離モード)

PD 分離モード:$138.624

PD 分離モード:$66,089.44

その他のモデル

モデル名

モデルコード

モデルユニット仕様

時間単位の単価 (米ドル)

最小課金単位:分

月額サブスクリプション価格 (米ドル)

最小課金単位:日

Kimi-K2.5

kimi-k2.5

MU2 x 8

$69.312

$33,044.72

マルチモーダル

Qwen VL

モデル名

モデルコード

モデルユニット仕様

時間単位の単価 (米ドル)

最小課金単位:分

月額サブスクリプション価格 (米ドル)

最小課金単位:日

Qwen3-VL-235B-A22B-Thinking

qwen3-vl-235b-a22b-thinking

MU1 x 8

$59.408

$28,734.256

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

Qwen3-VL-32B-Instruct

qwen3-vl-32b-instruct

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

Qwen3-VL-8B-Instruct

qwen3-vl-8b-instruct

MU1 x 2

$14.852

$7,183.564

MU5 x 1

$2.888

$1,394.329

Qwen3-VL-4B-Instruct

qwen3-vl-4b-instruct

MU1 x 2

$14.852

$7,183.564

Qwen3-VL-2B-Instruct

qwen3-vl-2b-instruct

MU5 x 1

$2.888

$1,394.329

Qwen3-VL-Embedding-2B

qwen3-vl-embedding-2b

MU5 x 1

$2.888

$1,394.329

Qwen3-VL-Flash-2025-10-15

qwen3-vl-flash-2025-10-15

MU1 x 4

$29.704

$14,367.128

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

MU1 x 4

$29.704

$14,367.128

Qwen-VL-Max-2025-08-13

qwen-vl-max-2025-08-13

MU6 x 4

$13.752

$6,649.98

Qwen Omni

モデル名

モデルコード

モデルユニット仕様

時間単位の単価 (米ドル)

最小課金単位:分

月額サブスクリプション価格 (米ドル)

最小課金単位:日

Qwen3.5-Omni-Flash

qwen3.5-omni-flash

MU8 x 1

$6.464

$3,080.477

MU9 x 1

$7.014

$3,383.024

モデルタイプ:

  • Instruct - モデルはデプロイ後、ノンシンキングモードで推論を実行します。
  • Thinking - モデルはデプロイ後、思考モードで推論を実行します。

モデルのトークン使用量別

料金 = モデル入力トークン数 × モデル入力単価 + モデル出力トークン数 × モデル出力単価 (最小課金単位:1 トークン)

  • モデルのトークン使用量に応じた課金は、以下のベースモデルで効率的な SFT トレーニングを完了し、カスタムモデルを取得した後にのみサポートされます。

シンガポール

ベースモデル

モデルコード

入力

ドル/100 万トークン

出力

ドル/100 万トークン

Qwen3-14B

qwen3-14b

非思考モード:$0.35

思考モード:$0.35

非思考モード:$1.4

思考モード:$4.2

北京

ベースモデル

モデルコード

入力

ドル/100 万トークン

出力

ドル/100 万トークン

Qwen3.5-27B

qwen3.5-27b

<128K $0.086

128K-256K $0.258

<128K $0.688

128K-256K $2.064

Qwen3-32B

qwen3-32b

非思考モード:$0.287

思考モード:$0.287

非思考モード:$1.147

思考モード:$2.868

Qwen3-14B

qwen3-14b

非思考モード:$0.144

思考モード:$0.144

非思考モード:$0.574

思考モード:$1.434

Qwen3-8B

qwen3-8b

非思考モード:$0.072

思考モード:$0.072

非思考モード:$0.287

思考モード:$0.717

Qwen3-VL-8B-Instruct

qwen3-vl-8b-instruct

$0.072

$0.287

より多くのモデルをデプロイするには、こちらのソリューションを参照し、ビジネス要件に基づいて最適なデプロイメントプランを選択してください。

デプロイ方法

コンソールでモデルをデプロイできます。次の手順をご参照ください。

「権限が不十分です」というプロンプトが表示された場合は、「デプロイ中に「権限が不十分です」と表示された場合の対処法

  1. モデルデプロイコンソールに移動します。

image

image

  1. サービス名を入力し、モデルと課金方法を選択します。他の設定はデフォルトのままにして、[OK] をクリックします。

  1. デプロイステータスが実行中 になると、モデルは正常にデプロイされています。

モデルが正常にデプロイされると、料金が発生します。

デプロイ設定

モデルユニット

設定項目

設定詳細

サービス名

デプロイサービス用のカスタム名です。

モデル

プラットフォームのプリセットモデルやファインチューニング済みモデルなど、デプロイするモデルを選択します。

モデルユニットタイプ

デプロイ仕様を選択します。仕様によって、コンピューティング能力とパフォーマンスが異なります。

レプリカ数

デプロイレプリカの初期数を設定します。これは、サービスの並行処理能力に影響します。

デプロイテンプレート

デプロイテンプレート (例:「単一ノードデプロイ」) を選択します。テンプレートによって、リソース設定スキームが異なります。モデルユニット課金モードでのみ利用可能です。

モデル推論モード

一部のモデルでは、モデルユニット モードでデプロイする際に、推論モードや最大コンテキストなどを設定できます。

  • Instruct - デプロイ後、モデルはノンシンキングモードで推論を実行します。

  • Thinking - デプロイ後、モデルは思考モードで推論を実行します。

最大コンテキスト

一部のモデルのモデルユニット デプロイモードでは、この設定がサポートされています。最大コンテキスト長はモデルタイプによって異なります。

サービスのスロットリング

一部のモデルのモデルユニット デプロイモードでは、この設定がサポートされており、モデル呼び出しの RPM と TPM を制限できます。

デプロイメントリストページ

デプロイメントが成功すると、デプロイメントリストページですべてのデプロイメントサービスを表示および管理できます。このリストページには、以下の情報が含まれます:

  • サービス名:デプロイメントサービスの名前です。クリックすると、デプロイメントの詳細が表示されます。
  • モデル名:デプロイメントに使用されるモデルです。
  • モデルコード:モデルが正常にデプロイメントされた後に生成される一意の識別子で、API を呼び出す際にモデルを指定するために使用されます。
  • デプロイメントステータス/イベントステータス:デプロイメント保留中、デプロイメント中、実行中、デプロイメント失敗、オフライン処理中、サービス一時停止、停止済み、削除中、サブスクリプション一時停止/支払い延滞による一時停止、サービス再開中、実行中 (設定変更中)、実行中 (変更失敗) などのステータスが含まれます。
  • 課金方法:現在のデプロイメントサービスの課金方法です。
  • デプロイメント詳細:モデルユニットタイプやレプリカ数などの構成情報です。
  • スロットリング詳細:RPM (1分あたりのリクエスト数) や TPM (1分あたりのトークン数) など、現在のデプロイメントサービスのスロットリング構成が表示されます。
  • サービス期間:デプロイメントサービスの作成時間と有効期限が表示されます。
  • 操作:デプロイメントステータスと課金方法に応じて、更新、監視、スケール、延長、オフライン化、削除、試用などの操作を実行できます。

デプロイ後の呼び出し

モデルが正常にデプロイされると、OpenAI 互換Dashscope、および Assistant SDK を介して呼び出すことができます。

デプロイ済みのモデルを呼び出す際、model の値は、デプロイが成功した後に生成されるモデルの code である必要があります。モデルデプロイコンソール に移動して モデルコード を取得します。

image
import os
import dashscope

messages = [
    {"role": "system", "content": "あなたは役立つアシスタントです。"},
    {"role": "user", "content": "あなたは誰ですか?"},
]
dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'
response = dashscope.Generation.call(
    # 環境変数を設定していない場合は、次の行をご利用の Bailian API キーに置き換えてください: api_key="sk-xxx",
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    model="qwen3-max-xxx-xxx",  # モデルが正常にデプロイされた後に返されるコードに置き換えてください
    messages=messages,
    result_format="message",
    enable_thinking=False,
)
print(response)
import os
from openai import OpenAI

client = OpenAI(
    # 環境変数を設定していない場合は、次の行をご利用の Bailian API キーに置き換えてください: api_key="sk-xxx",
    api_key=os.getenv('DASHSCOPE_API_KEY'),
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="qwen3-max-xxx-xxx",  # モデルが正常にデプロイされた後に返されるコードに置き換えてください
    messages=[
        {"role": "system", "content": "あなたは役立つアシスタントです。"},
        {"role": "user", "content": "あなたは誰ですか?"},
    ],
    extra_body={"enable_thinking": False},
)
print(completion)

Deployment サービスのスケーリング

  • 事前設定スループット (期間課金):Scaling ボタンをクリックしてセルフサービスでインスタンス数を手動で調整します。料金削減と返金の詳細ルールについては、「スペックダウンの返金ルール」をご参照ください。
  • モデルユニット (期間課金):Scaling ボタンをクリックしてセルフサービスでインスタンス数を手動で調整します。

また、操作列のスケーリング設定ボタンから、自動スケーリングポリシー (スケーリングしきい値、最小/最大レプリカ数、スケジュールされたスケーリングなどを含む) を設定できます。

デプロイメントサービスのオフライン化

モデルデプロイメントコンソールに移動し、停止したいデプロイメントサービスを見つけ、課金タイプに応じて対応する操作をクリックします:

  • モデルユニット (前払い): 非アクティブ化 をクリックして確認します。
  • 後払い: 削除 をクリックして確認します。

操作完了後、追加の課金は発生しません。

image

その他の操作

デプロイメントリストページの [操作] 列では、オフラインにする操作に加えて、次の操作もサポートしています:

  • 更新:デプロイ済みサービスのモデルバージョンを更新します。フルアップデートまたは一括更新 (カナリアリリース) に対応しています。
  • 削除:従量課金サービスは、直接削除することで課金を停止できます。
  • 更新:サブスクリプションサービスは、更新によってサービス時間を延長できます。自動更新にも対応しています。
  • キャパシティパッケージの購入:プリセットスループットデプロイメント用にキャパシティパッケージを購入します。

よくある質問

独自のモデルのアップロードとデプロイは可能ですか?

現時点では、独自のモデルのアップロードとデプロイはサポートされていません。Alibaba Cloud Model Studio の最新情報を引き続きご確認ください。

また、Alibaba Cloud Artificial Intelligence Platform PAI は、独自のモデルをデプロイする機能を提供しています。デプロイ方法については、「PAI-LLM 大規模言語モデルのデプロイ」をご参照ください。

デプロイ中に「権限が不十分です」と表示された場合はどうすればよいですか?

  1. 「このモジュールに対する権限がありません」と表示された場合は、ご利用のアカウントがビジネススペースの権限管理ページで [モデルデプロイメント - 操作] 権限を持っていることを確認してください。

    PixPin_2025-11-27_15-09-44

    正常に操作できない場合は、所属する組織または IT 管理者に連絡して、関連する権限を追加してもらうか、権限の問題を確認してもらってください。

  2. デプロイ中に「xx ビジネススペースには xx モデルをデプロイする権限がありません」というエラーが報告された場合は、Model Studio のビジネススペース管理ページに移動し、対応するビジネススペースに対応するモデルのデプロイメント権限を追加してください。

    API 呼び出しエラー: Workspace xxx does not have deployment privilege for model xxxx

    PixPin_2025-11-27_15-03-57 PixPin_2025-11-27_15-06-41

    権限が不十分であると表示された場合は、所属する組織または IT 管理者に連絡して、関連する権限を追加してもらうか、代理で操作してもらってください。