すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:モデルデプロイ

最終更新日:Jul 02, 2026

、独立した専用の推論サービスを取得できます。このサービスは、高い同時実行性、低レイテンシー、その他のパフォーマンス要件といったビジネスニーズを満たすように設計されています。

課金方法

モデルをデプロイする前に、モデルデプロイコンソールで、さまざまなモデルの時間単位の推定コストを確認できます。
説明

サービス作成後に課金方法を変更することはできません。課金方法を切り替えるには、デプロイ済みのモデルを非公開にしてから再デプロイする必要があります。

プロビジョンドスループット (PTU)

(高スループットと高性能)

モデルユニット

(カスタムパフォーマンスメトリクスとリソース分離)

トークン使用量

(ファインチューニング済みモデルとパフォーマンス検証のための従量課金)

定義

プラットフォームリソースを予約して、特定の 1 分あたりのトークン数 (TPM) スループットを保証するモデルデプロイ方法です。保証されたクォータ内ではレート制限は適用されません。

使用期間とモデルユニット数に基づいて計算能力を割り当てるモデルデプロイ方法です。リソースは専用です。

各 API 呼び出しの入力および出力トークンに基づいて使用量が計測されるモデルデプロイ方法です。

メリット

  1. 高負荷の本番環境に対して、安定したスループット容量、低レイテンシー、およびリソースの確実性を提供します。

  2. トークン使用量課金と比較して、1 秒あたりのトークン数 (TPS) は通常 1.5~2.0 倍高くなります。

  3. 自動更新をサポートします。

  1. レイテンシーやスループットなどのパフォーマンスメトリクスをカスタマイズできます。

  2. 自動更新をサポートします。

使用しない場合は課金されません

サポート対象モデル

一部の事前学習済みモデル

一部の事前学習済みモデルとすべてのファインチューニング済みモデル

LoRA でファインチューニングされた一部のモデル

利用シーン

  1. 銀行アプリのインテリジェントカスタマーサービス (安定したトラフィック、保証された同時実行エクスペリエンスが必要)。

  2. ソーシャルメディアプラットフォームのリアルタイムコンテンツモデレーション (予測可能なパイプラインタスクの安定した処理が必要)。

  3. パブリッククラウド翻訳 API (標準プランユーザーにベースラインサービス保証を提供)。

  1. E コマース専用のファインチューニング済み大規模モデル (プライベートモデルをデプロイし、販売促進中に手動でスケールアウト)。

  2. 製薬会社の分子スクリーニングモデル (長時間実行タスクに専用リソースが必要)。

  3. 自動運転シミュレーション (長期的な連続計算が必要)。

ファインチューニング済みモデルのパフォーマンス検証

課金図

image

image

image

課金方法

使用期間とプロビジョンドスループットに基づいて課金されます。

従量課金と日次サブスクリプションをサポートします。

使用期間とモデルユニット数に基づいて課金されます。

従量課金と月次サブスクリプションをサポートします。

モデルごとのトークン使用量

従量課金をサポートします。

スケーリング方法

スループットを手動で増減できます。

モデルユニット数を手動で増減できます。

コンソールでリクエストを送信し、手動レビューを待ちます。

製品の制約

  1. サブスクリプションは日次で課金されます。早期解約による返金は利用できません。

  2. 時間単位内で購入したスループットを超えて使用した場合、サービスは自動的に Model Studio が提供するモデル呼び出しサービスに切り替わります。

サブスクリプションの場合、最初の 1 か月以内に登録を解除すると、日次単価 (≈ 月次単価 / 30) が標準価格の 1.2 倍で請求されます。

  1. LoRA でファインチューニングされた一部のモデルのみをサポートします。

  2. 1 か月間使用されない場合、リソースは自動的に解放されます。

単一の呼び出しのトークン使用量と呼び出し履歴を表示するには、モデルモニタリングに移動します。

課金詳細

時間ベースの課金 (プロビジョンドスループット)

コスト = 使用期間 × (入力 TPM 単価 × 入力 TPM + 出力 TPM 単価 × 出力 TPM)

従量課金方法では、使用量は時間単位で課金され、単価は以下の表の時間料金に基づきます。サブスクリプション方法では、使用量は日次で課金され、単価は以下の表の日次料金に基づきます。

  • サブスクリプション注文は支払い後すぐに有効になります。N 日間のサブスクリプションは、N 日目の 23:59 まで有効です。注文が 22:00 以降に行われた場合、有効期限は自動的に 1 日延長されます。

  • サブスクリプション注文の有効期限が切れた後、サービスは 2 時間の猶予期間後に停止されます。サービスが停止された後、リソースは 14 時間保持され、その後解放されます。

  • サブスクリプション注文は早期に終了することはできません。

  • 従量課金方法では、アカウントに支払い遅延がある場合、デプロイされたリソースは保持され、24 時間課金が継続され、その間サービスは利用可能です。24 時間後、システムは課金を停止し、モデルデプロイは支払い遅延状態になります。基盤となるリソースは削除されますが、モデルデプロイタスクは保持されます。遅延額を支払うと、システムはリソースを再割り当てし、サービスを復元し、課金を再開します。料金の発生を停止するには、モデルデプロイタスクを削除する必要があります。タスクが正常に削除されると、課金は停止します。

モデル入力が最大入力トークン数または購入した TPM を超えた場合、呼び出しは自動的に現在のモデルの従量課金モードに切り替わります。この場合、推論パフォーマンスが低下し、ワークスペース内の現在のスナップショットモデルのパブリックトラフィック制御の対象となります。コストは、モデル呼び出し (従量課金) の標準に基づいて請求されます。

  • この場合、API 呼び出しは x-dashscope-ptu-overflow:true を含むヘッダーを返します。

  • TPM 統計を表示するには、モデルモニタリングに移動します。

スケールインシナリオ (スペックダウン) の具体的な返金ルールについては、「スペックダウンの返金ルール」をご参照ください。

シンガポール

Qwen

モデル名

モデルコード

最大入力トークン数

従量課金入力

10k TPM/時間あたり

従量課金出力

1k TPM/時間あたり

サブスクリプション入力

10k TPM/日あたり

サブスクリプション出力

1k TPM/日あたり

Qwen3.7-Max-2026-05-20

qwen3.7-max-2026-05-20

256K

$6

$1.8

$72

$21.6

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

256K

$0.96

$0.384

$11.52

$4.608

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128K

$1.2

$0.72

$14.4

$8.64

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128K

$0.96

$0.576

$11.52

$6.912

DeepSeek

モデル名

モデルコード

最大入力トークン数

従量課金入力

10k TPM/時間あたり

従量課金出力

1k TPM/時間あたり

サブスクリプション入力

10k TPM/日あたり

サブスクリプション出力

1k TPM/日あたり

DeepSeek-v4-Flash

deepseek-v4-flash

256K

$0.72

$0.144

$8.64

$1.728

DeepSeek-v4-Pro

deepseek-v4-pro

256K

$8.64

$1.728

$103.68

$20.736

DeepSeek-v3.2

deepseek-v3.2

64K

$2.05

$0.616

$24.62

$7.387

Qwen-VL

モデル名

モデルコード

最大入力トークン数

従量課金入力

10k TPM/時間あたり

従量課金出力

1k TPM/時間あたり

サブスクリプション入力

10k TPM/日あたり

サブスクリプション出力

1k TPM/日あたり

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

128K

$0.48

$0.384

$5.76

$4.608

その他のモデル

モデル名

モデルコード

最大入力トークン数

従量課金入力

10k TPM/時間あたり

従量課金出力

1k TPM/時間あたり

サブスクリプション入力

10k TPM/日あたり

サブスクリプション出力

1k TPM/日あたり

GLM-5.1

glm-5.1

64K

$5.04

$1.584

$64.8

$19.008

中国 (北京)

Qwen

モデル名

モデルコード

最大入力トークン数

従量課金入力

10k TPM/時間あたり

従量課金出力

1k TPM/時間あたり

サブスクリプション入力

10k TPM/日あたり

サブスクリプション出力

1k TPM/日あたり

Qwen3.7-Max-2026-05-20

qwen3.7-max-2026-05-20

256K

$3.96

$1.188

$47.53

$14.258

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

256K

$0.66

$0.264

$7.92

$3.168

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128K

$0.67

$0.397

$7.93

$4.753

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128K

$0.26

$0.16

$3.17

$1.9

Qwen3-Max-2025-09-23

qwen3-max-2025-09-23

128K

$1.11

$0.45

$13.32

$5.4

Qwen-Flash-2025-07-28

qwen-flash-2025-07-28

128K

$0.06

$0.06

$0.72

$0.72

Qwen-Plus-2025-12-01

qwen-plus-2025-12-01

128K

$0.28

ノンシンキングモード: $0.07

思考モード: $0.28

$3.36

ノンシンキングモード: $0.84

思考モード: $3.36

DeepSeek

モデル名

モデルコード

最大入力トークン数

従量課金入力

10k TPM/時間あたり

従量課金出力

1k TPM/時間あたり

サブスクリプション入力

10k TPM/日あたり

サブスクリプション出力

1k TPM/日あたり

DeepSeek-v4-Flash

deepseek-v4-flash

256K

$0.5

$0.099

$5.94

$1.188

DeepSeek-v4-Pro

deepseek-v4-pro

256K

$5.94

$1.188

$71.3

$14.26

DeepSeek-v3.2

deepseek-v3.2

64K

$1.04

$0.16

$12.48

$1.92

DeepSeek-v3

deepseek-v3

64K

$0.99

$0.396

$11.9

$4.75

Qwen-VL

モデル名

モデルコード

最大入力トークン数

従量課金入力

10k TPM/時間あたり

従量課金出力

1k TPM/時間あたり

サブスクリプション入力

10k TPM/日あたり

サブスクリプション出力

1k TPM/日あたり

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

128K

$0.35

$0.35

$4.2

$4.2

その他のモデル

モデル名

モデルコード

最大入力トークン数

従量課金入力

10k TPM/時間あたり

従量課金出力

1k TPM/時間あたり

サブスクリプション入力

10k TPM/日あたり

サブスクリプション出力

1k TPM/日あたり

GLM-5.1

glm-5.1

64K

$2.97

$1.19

$35.65

$14.26

時間ベースの課金 (モデルユニット)

コスト = 使用期間 (時間) × モデルユニット数 × モデルユニット価格

従量課金方式の場合、「モデルユニット価格」は下表の「時間単位の料金」です。月額サブスクリプション方式の場合、計算式は月数 × モデルユニット数 × 月額料金です。

  • サブスクリプションの場合、最初の 1 か月以内に登録を解除すると、1 日あたりの単価 (≈ 月額単価 / 30) が標準料金の 1.2 倍で請求されます。1 日未満の利用は 1 日として請求されます。

説明

モデルユニットの従量課金方式では、コンピューティング能力リソースは先着順で割り当てられます。購入に失敗した場合は、全額返金されます。

シンガポール

テキスト生成

モデル名

モデルコード

モデルユニット仕様

時間単位の料金 ($)

最小課金単位:分

月額料金 ($)

最小課金単位:日

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

MU1 x 8

$88

$41,832

Qwen3.5-39B-A17B

qwen3.5-397b-a17b

MU2 x 8

$112

$52,392

Qwen3.5-35B-A3B

qwen3.5-35b-a3b

MU2 x 8

$112

$52,392

Qwen3-32B

qwen3-32b

MU1 x 4

$44

$20,916

MU2 x 8

$112

$52,392

Qwen3-14B

qwen3-14b

MU1 x 4

$44

$20,916

GLM-5.1

glm-5.1

MU2 x 8

$112

$52,392

DeepSeek-V4-Flash

deepseek-v4-flash

MU1 x 8

$88

$41,832

マルチモーダル

モデル名

モデルコード

モデルユニット仕様

時間単位の料金 ($)

最小課金単位:分

月額料金 ($)

最小課金単位:日

Qwen3-VL-32B-Instruct

qwen3-vl-32b-instruct

MU2 x 8

$112

$52,392

Qwen3-VL-8B-Instruct

qwen3-vl-8b-instruct

MU1 x 2

$22

$10,458

モデルタイプ:

  • Instruct - デプロイされたモデルはノンシンキングモードで推論を実行します。

中国 (北京)

テキスト生成

Qwen

モデル名

モデルコード

モデルユニット仕様

時間単位の料金 ($)

最小課金単位:分

月額料金 ($)

最小課金単位:日

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

MU3 x 8

$150.72

$72,577.152

Qwen3.6-35B-A3B

qwen3.6-35b-a3b

MU8 x 1

$6.464

$3,080.477

MU9 x 1

$7.014

$3,383.024

Qwen3.6-27B

qwen3.6-27b

MU9 x 1

$7.014

$3,383.024

Qwen3.6-Flash-2026-04-16

qwen3.6-flash-2026-04-16

MU1 x 2

$14.852

$7,183.564

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

MU1 x 8

$59.408

$28,734.256

Qwen3.5-397B-A17B

qwen3.5-397b-a17b

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

MU6 x 16

$55.008

$26,599.92

Qwen3.5-122B-A10B

qwen3.5-122b-a10b

MU1 x 4

$29.704

$14,367.128

MU2 x 8

$69.312

$33,044.72

MU6 x 16

$55.008

$26,599.92

MU9 x 2

$14.028

$6,766.048

Qwen3.5-35B-A3B

qwen3.5-35b-a3b

MU1 x 2

$14.852

$7,183.564

MU2 x 8

$69.312

$33,044.72

MU8 x 1

$6.464

$3,080.477

MU9 x 1

$7.014

$3,383.024

Qwen3.5-27B

qwen3.5-27b

MU9 x 1

$7.014

$3,383.024

Qwen3.5-9B

qwen3.5-9b

MU8 x 1

$6.464

$3,080.477

MU9 x 1

$7.014

$3,383.024

Qwen3.5-Flash-2026-02-23

qwen3.5-flash-2026-02-23

MU1 x 2

$14.852

$7,183.564

Qwen3.5-Plus-2026-02-15

qwen3.5-plus-2026-02-15

MU1 x 8

$59.408

$28,734.256

MU3 x 8

$150.72

$72,577.152

Qwen3-235B-A22B-Instruct

qwen3-235b-a22b-instruct-2507

MU1 x 4

$29.704

$14,367.128

MU2 x 8

$69.312

$33,044.72

Qwen3-Next-80B-A3B-Instruct

qwen3-next-80b-a3b-instruct

MU1 x 2

$14.852

$7,183.564

Qwen3-32B

qwen3-32b

MU1 x 4

$29.704

$14,367.128

MU6 x 4

$13.752

$6,649.98

Qwen3-30B-A3B

qwen3-30b-a3b

MU9 x 2

$14.028

$6,766.048

Qwen3-30B-A3B-Instruct-2507

qwen3-30b-a3b-instruct-2507

MU1 x 4

$29.704

$14,367.128

MU2 x 8

$69.312

$33,044.72

Qwen3-8B

qwen3-8b

MU1 x 2

$14.852

$7,183.564

MU2 x 2

$17.328

$8,261.18

MU5 x 1

$2.888

$1,394.329

Qwen3-4B

qwen3-4b

MU1 x 2

$14.852

$7,183.564

MU5 x 1

$2.888

$1,394.329

Qwen3-1.7B

qwen3-1.7b

MU1 x 2

$14.852

$7,183.564

MU5 x 1

$2.888

$1,394.329

Qwen3-Max-2025-09-23

qwen3-max-2025-09-23

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

Qwen2.5-72B

qwen2.5-72b-instruct

MU1 x 4

$29.704

$14,367.128

Qwen2.5-32B

qwen2.5-32b-instruct

MU1 x 4

$29.704

$14,367.128

Qwen2.5-14B

qwen2.5-14b-instruct

MU1 x 2

$14.852

$7,183.564

Qwen2.5-7B

qwen2.5-7b-instruct

MU1 x 2

$14.852

$7,183.564

MU5 x 1

$2.888

$1,394.329

Qwen2.5-3B-Instruct

qwen2.5-3b-instruct

MU5 x 1

$2.888

$1,394.329

Qwen-Flash-2025-07-28

qwen-flash-2025-07-28

MU1 x 4

$29.704

$14,367.128

Qwen-Plus-2025-07-28

qwen-plus-2025-07-28

MU1 x 4

$29.704

$14,367.128

Qwen-Plus-2025-12-01

qwen-plus-2025-12-01

MU1 x 4

$29.704

$14,367.128

GLM

モデル名

モデルコード

モデルユニット仕様

時間単位の料金 ($)

最小課金単位:分

月額料金 ($)

最小課金単位:日

GLM-5.1

glm-5.1

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

MU6 x 16

$55.008

$26,599.92

GLM-5

glm-5

MU3 x 8

$150.72

$72,577.152

GLM-4.7

glm-4.7

MU6 x 16

$55.008

$26,599.92

DeepSeek

モデル名

モデルコード

モデルユニット仕様

時間単位の料金 ($)

最小課金単位:分

月額料金 ($)

最小課金単位:日

DeepSeek-V4-Flash

deepseek-v4-flash

MU1 x 8

$59.408

$28,734.256

DeepSeek-V3.2

deepseek-v3.2

MU2 x 8

$69.312

$33,044.72

その他のモデル

モデル名

モデルコード

モデルユニット仕様

時間単位の料金 ($)

最小課金単位:分

月額料金 ($)

最小課金単位:日

MiniMax-M2.5

MiniMax-M2.5

MU1 x 8

$59.408

$28,734.256

Kimi-K2.5

kimi-k2.5

MU2 x 8

$69.312

$33,044.72

マルチモーダル

Qwen-VL

モデル名

モデルコード

モデルユニット仕様

時間単位の料金 ($)

最小課金単位:分

月額料金 ($)

最小課金単位:日

Qwen3-VL-235B-A22B-Instruct

qwen3-vl-235b-a22b-instruct

MU1 x 4

$29.704

$14,367.128

Qwen3-VL-235B-A22B-Thinking

qwen3-vl-235b-a22b-thinking

MU1 x 4

$29.704

$14,367.128

Qwen3-VL-32B-Instruct

qwen3-vl-32b-instruct

MU2 x 8

$69.312

$33,044.72

Qwen3-VL-8B-Instruct

qwen3-vl-8b-instruct

MU1 x 2

$14.852

$7,183.564

Qwen3-VL-Flash-2025-10-15

qwen3-vl-flash-2025-10-15

MU1 x 4

$29.704

$14,367.128

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

MU1 x 4

$29.704

$14,367.128

Qwen-VL-Max-2025-08-13

qwen-vl-max-2025-08-13

MU6 x 4

$13.752

$6,649.98

Qwen-VL-OCR-2025-11-20

qwen-vl-ocr-2025-11-20

MU6 x 4

$13.752

$6,649.98

Qwen Omni

モデル名

モデルコード

モデルユニット仕様

時間単位の料金 ($)

最小課金単位:分

月額料金 ($)

最小課金単位:日

Qwen3.5-Omni-Flash

qwen3.5-omni-flash

MU8 x 1

$6.464

$3,080.477

MU9 x 1

$7.014

$3,383.024

Qwen3.5-Omni-Plus

qwen3.5-omni-plus

MU9 x 8

$56.112

$27,064.192

モデルタイプ:

  • Instruct - デプロイされたモデルはノンシンキングモードで推論を実行します。

  • Thinking - デプロイされたモデルは思考モードで推論を実行します。

モデルのトークン使用量別

費用 = 入力トークン数 × 入力単価 + 出力トークン数 × 出力単価 (最小課金単位:1 トークン)

  • モデルのトークン使用量に応じた課金は、以下の基盤モデルに対して教師ありファインチューニング (SFT) を完了し、カスタムモデルを取得した後にのみサポートされます。

シンガポール

基盤モデル

モデルコード

入力

米ドル/1k トークン

出力

米ドル/1k トークン

Qwen3-14B

qwen3-14b

$0.00035

非思考モード: $0.0014

思考モード: $0.0042

より多くのモデルをデプロイするには、こちらのソリューションを参照し、ビジネスニーズに最も適したデプロイメントプランを選択してください。

デプロイ方法

コンソールでモデルをデプロイするには、次の手順を実行します。

デプロイ中に権限エラーが発生した場合は、「デプロイ中に権限エラーが発生した場合の対処法
  1. モデルデプロイコンソールに移動します。

image

image

  1. サービス名を入力し、モデルと課金方法を選択します。その他の設定はデフォルト値のままにして、[確認] をクリックします。

  1. デプロイステータスが 実行中 になると、モデルのデプロイは成功です。

重要

モデルのデプロイが成功すると、料金が発生します。

デプロイ設定

モデルユニット

設定

詳細

サービス名

デプロイサービスに付けるカスタム名です。

モデルの選択

デプロイするモデルを選択します。事前学習済みのプラットフォームモデルやファインチューニング済みのモデルが含まれます。

モデルユニットタイプ

デプロイ仕様を選択します。仕様によって、コンピューティング能力とパフォーマンスが異なります。

レプリカ数

デプロイの初期レプリカ数を設定します。この設定は、サービスの並行処理能力に影響します。

デプロイテンプレート

「単一マシンデプロイ」などのデプロイテンプレートを選択します。テンプレートによって、リソース設定プランが異なります。この設定は、モデルユニット課金モードでのみ利用可能です。

モデル推論モードの設定

一部のモデルを モデルユニット 方式でデプロイする場合、推論モードや最大コンテキスト長などの設定が可能です。

  • Instruct - デプロイされたモデルはノンシンキングモードで推論を実行します。

  • Thinking - デプロイされたモデルは思考モードで推論を実行します。

最大コンテキスト

一部のモデルの モデルユニット デプロイモードでサポートされています。最大コンテキスト長はモデルタイプに基づきます。

サービススロットリング

一部のモデルの モデルユニット デプロイモードでサポートされています。モデル呼び出しの RPM と TPM を制限できます。

デプロイメントリストページ

デプロイメントが成功すると、デプロイメントリストページで、デプロイ済みのすべてのサービスを表示および管理できます。このページには、次の情報が含まれています:

  • サービス名: デプロイメントサービスの名前です。名前をクリックすると、デプロイメント詳細が表示されます。

  • モデル名: デプロイメントに使用されるモデルです。

  • モデルコード: モデルが正常にデプロイされた後に生成される一意の識別子です。API 呼び出しでモデルを指定するために使用されます。

  • デプロイメントステータス/イベントステータス: `デプロイメント保留中`、`デプロイメント中`、`実行中`、`デプロイメント失敗`、`公開停止中`、`サービス一時停止中`、`停止済み`、`削除中`、`サブスクリプション解除/期限切れ`、`再開中`、`実行中 (アップグレード/ダウングレード中)`、`実行中 (アップグレード/ダウングレード失敗)` などのステータスが含まれます。

  • 課金方法: デプロイメントサービスの現在の課金方法です。

  • デプロイメント詳細: モデルユニットタイプやレプリカ数などの設定情報です。

  • レート制限詳細: 現在のデプロイメントサービスに設定されている、1 分あたりのリクエスト数 (RPM) や 1 分あたりのトークン数 (TPM) などのレート制限設定が表示されます。

  • サービス期間: デプロイメントサービスの作成日時と有効期限が表示されます。

  • 操作: デプロイメントのステータスと課金方法に応じて、`更新`、`モニタリング`、`スケーリング`、`更新`、`公開停止`、`削除`、`体験` などの操作を実行できます。

デプロイ後の呼び出し

モデルが正常にデプロイされると、OpenAI 互換Dashscope、および Assistant SDK を使用して呼び出すことができます。

デプロイ済みのモデルを呼び出す際、model の値には、モデルが正常にデプロイされた後に生成されるモデルの code を設定する必要があります。モデルデプロイメントコンソールにアクセスし、モデルコード を取得してください。

image

DashScope

import os
import dashscope

messages = [
    {"role": "system", "content": "You are a helpful assistant."},
    {"role": "user", "content": "Who are you?"},
]
dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'
response = dashscope.Generation.call(
    # 環境変数が設定されていない場合は、次の行を api_key="sk-xxx" に置き換えてください。
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    model="qwen3-max-xxx-xxx",  # モデルが正常にデプロイされた後に生成されたコードに置き換えてください
    messages=messages,
    result_format="message",
    enable_thinking=False,
)
print(response)

OpenAI 互換インターフェイス

import os
from openai import OpenAI


client = OpenAI(
    # 環境変数が設定されていない場合は、次の行を api_key="sk-xxx" に置き換えてください。
    api_key=os.getenv('DASHSCOPE_API_KEY'),
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="qwen3-max-xxx-xxx",  # モデルが正常にデプロイされた後に生成されたコードに置き換えてください
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Who are you?"},
    ],
    extra_body={"enable_thinking": False},
)
print(completion)

デプロイメントサービスのスケーリング

  • プロビジョニングされたスループット (時間ベース):Scaling ボタンをクリックして、インスタンス数を手動で調整します。スペックダウンに関する具体的な返金ルールについては、「スペックダウンの返金ルール」をご参照ください。

  • モデルユニット (時間ベース): Scaling ボタンをクリックして、インスタンス数を手動で調整します。

また、[操作] 列の [スケーリング設定] ボタンをクリックして、スケーリングのしきい値、最小/最大レプリカ数、スケジュールされたスケーリングなどの自動スケーリングポリシーを設定することもできます。

サービスの公開停止

モデルデプロイメントコンソールに移動し、停止するデプロイメントサービスを見つけ、課金方法に応じて対応する操作をクリックします:

  • モデルユニット (サブスクリプション): 非アクティブ化 をクリックして確認します。

  • 従量課金: 削除 をクリックして確認します。

操作が完了すると、課金は停止します。

image

その他の操作

デプロイメントリストページの [操作] 列では、非公開にする操作に加えて、以下の操作を実行できます。

  • [更新]:デプロイ済みのサービスのモデルバージョンを更新します。一括またはバッチ (カナリアリリース) で更新できます。

  • [削除]:従量課金制サービスは直接削除して課金を停止できます。

  • [更新]:サブスクリプションサービスは更新してサービス時間を延長できます。自動更新もサポートされています。

  • [容量パッケージの購入]:プロビジョニングされたスループットのデプロイメント向けに、容量パッケージを購入できます。

よくある質問

独自のモデルをアップロードしてデプロイできますか?

現在、独自のモデルのアップロードとデプロイはサポートされていません。Alibaba Cloud Model Studio の最新情報を確認することを推奨します。

さらに、Alibaba Cloud Platform for AI (PAI) は、独自のモデルをデプロイする機能を提供します。詳細については、「PAI-LLM 大規模言語モデルのデプロイ」をご参照ください。

デプロイメント中に権限エラーが発生した場合はどうすればよいですか?

  1. You do not have the required permissions for this module」というメッセージが表示された場合は、ご利用のアカウントがワークスペースの権限管理ページで「Model Deployment - Operation」権限を持っていることを確認してください。

    PixPin_2025-11-27_15-09-44

    操作を実行できない場合は、組織または IT 管理者に連絡して、必要な権限を追加するか、権限の問題を確認してもらってください。

  2. Workspace xxx does not have deployment privilege for model xxxx」というエラーでデプロイメントが失敗した場合は、Model Studio の ワークスペース管理ページに移動し、対応するモデルのデプロイメント権限をワークスペースに追加します。

    API 呼び出しエラー: Workspace xxx does not have deployment privilege for model xxxx

    PixPin_2025-11-27_15-03-57

    PixPin_2025-11-27_15-06-41

    権限エラーが発生した場合は、組織または IT 管理者に連絡して、必要な権限を追加するか、操作を代行してもらってください。