全部產品
Search
文件中心

Alibaba Cloud Model Studio:文本產生-部署模型

更新時間:Sep 16, 2026

將訓練好的文本模型發布為線上 API 服務。

適用範圍

部署模型

新加坡

POST https://dashscope-intl.aliyuncs.com/api/v1/deployments

Windows CMD 請將$DASHSCOPE_API_KEY替換為%DASHSCOPE_API_KEY%,PowerShell請替換為 $env:DASHSCOPE_API_KEY

請求參數

要求標頭(Headers)

Content-Type string (必選)

固定值:application/json

Authorization string (必選)

API Key鑒權,格式為Bearer sk-xxxx。

請求體(Request Body)

model_name string (必選)

待部署的模型名稱,對應我的模型中的模型 ID。也可通過建立訓練任務介面的輸出擷取。

plan string (必選)

部署方案。可選值:

  • mu:按模型單元計費。
  • lora:LoRA 共用部署(按 Token 用量計費)。
  • ptu:按預置輸送量計費。

deploy_spec string (條件必填)

部署模板。當 plan 為 mu 時必須填寫。範例:"deploy_spec": "MU1"。

可通過擷取可部署模型列表介面返回的 template_id 欄位擷取。

capacity integer (條件必填)

部署使用的資源單元數量,需為 base_capacity 的整數倍。不同 deploy_spec 的取值約束不同,例如 MU2 必須為 8 的倍數,MU5 可填 1。

billing_method string (條件必填)

計費方式。當 plan 為 mu 時必須填寫。當前支援 "POST_PAY"(後付費)。

enable_thinking boolean (可選)

僅 plan 為 mu 時可設定。部分模型支援,可設定為 true 或 false。

max_context_length number (可選)

僅 plan 為 mu 時可設定。部分模型支援。範例:"max_context_length": 131072。

rpm_limit number (可選)

僅 plan 為 mu 時可設定。部分模型支援,requests per minute,每分鐘請求數。

tpm_limit number (可選)

僅 plan 為 mu 時可設定。部分模型支援,token per minute,每分鐘 Token 使用量。

ptu_capacity object (可選)

僅 plan 為 ptu 時生效。如果不填寫該參數,將預設按照 10,000 input_tpm 和 1,000 output_tpm 進行設定。

ptu_capacity 屬性

input_tpm number

部署的模型每分鐘支援的最大輸入 Token 量。

output_tpm number

部署的模型每分鐘支援的最大輸出 Token 量。

thinking_output_tpm number

部分模型支援,部署的模型每分鐘支援的預置思考最大輸出 Token 量。

name string (可選)

模型的控制台顯示名稱。如果不傳該參數,將自動使用 model_name 的值作為部署名稱。

suffix string (可選)

模型部署後,將產生新的模型名稱,suffix 用於指定新模型名稱的尾碼,最大長度為8個字元且需全域唯一。每個模型在首次部署時,可以不指定尾碼。如果需要對同一模型進行多次部署,則必須設定尾碼以便於區分。

按模型單元計費

選擇按模型單元計費,計費模式為按模型單元的使用時間長度收費,適用於模型調優後的大規模推理業務,資源專屬,效能和成本靈活可調。

執行以下部署命令後,即便您還沒有調用模型,模型部署服務仍將在部署成功後開始計費。建議您先確認服務計費規則,再執行部署命令。

curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "name": "my_qwen_plus",
    "model_name": "qwen-plus-2025-12-01",
    "plan": "mu",
    "deploy_spec": "MU1",
    "enable_thinking": true,
    "capacity": 4,
    "billing_method": "POST_PAY",
    "max_context_length": 10000,
    "rpm_limit": 500,
    "tpm_limit": 1000
}'

按Token用量計費

選擇按 Token 用量計費,適用於高性價比訴求且對並發和延遲要求不高的情境。該模式價格優勢最高,吞吐/並發和產生速度均由平台預置,使用者不可調。

curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "model_name": "qwen3-8b-ft-202511132025-0260",
    "plan": "lora",
    "capacity": 1,
    "name": "qwen3-8b-ft"
}'

按預置吞吐計費

按預置吞吐計費模式按預置吞吐的使用時間長度收費,適用於追求穩定吞吐保障和高並發低延遲、且流量可預估的情境。該模式下,吞吐/並發和產生速度均為平台預置,使用者不可調。

執行以下部署命令後,即便您還沒有調用模型,模型部署服務仍將在部署成功後開始計費。建議您先確認服務計費規則,再執行部署命令。

curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "name": "my_qwen_flash",
    "model_name": "qwen-flash-2025-07-28",
    "plan": "ptu",
    "ptu_capacity": {
        "input_tpm": 10000,
        "output_tpm": 1000
    }
}'

部署排障與效能調優

max-num-seqs 參數不可配置

百鍊模型部署在按預置吞吐計費和按模型單元計費兩種計費方式下,吞吐、並發和產生速度均為平台預置,不支援直接調整 vLLM 內部的 max-num-seqs 等推理引擎參數,本介面的請求參數中也不存在該參數。

按模型單元計費方式下,可通過選擇模型單元類型(對應請求參數 deploy_spec)和調整部署副本數(對應請求參數 capacity)間接控制吞吐能力。

部署模板與資源隔離

當前部署模板僅支援單機部署(單機部署-增強型通用推理),不支援多卡執行個體隔離。如需資源隔離,請使用按模型單元計費方式,該方式下算力資源為業務專屬。

限流錯誤處理

當並發請求超出限流閾值時,介面返回 HTTP 429,錯誤碼為 Throttling.RateQuota,錯誤資訊為 Requests rate limit exceeded, please try again later。處理方式:

  • 按預置吞吐計費:調整 ptu_capacity 中的 input_tpm 和 output_tpm(控制台對應 Input kTPM 和 Output kTPM),或降低請求頻率。該方式下溢出策略可選自動溢出(切換為隨用隨付)或僅使用 PTU 容量(超出容量的請求直接返回 429)。
  • 按模型單元計費:調整 rpm_limit 和 tpm_limit,或降低請求頻率。

上下文長度調優

按模型單元計費方式下可通過請求參數 max_context_length 配置最長上下文,取值範圍 1~262144(實際上限取決於所部署模型的能力)。該參數限制單次請求的上下文規模,從而限制單請求的記憶體佔用,可降低 OOM 風險。

處理大量圖片任務時,請結合圖片尺寸和單請求圖片數量設定該參數。

響應參數

request_id string

請求的唯一識別碼。

output object

任務詳情。

屬性

deployed_model string

部署模型的唯一標識。用於查詢模型部署狀態和調用模型。

model_name string

模型標識名。

status string

部署狀態:

  • PENDING:正在建立部署任務。
  • UPDATING:正在更新部署任務。
  • RUNNING:部署任務正在運行,此時已部署的模型可以正常處理請求。
  • STOPPED:部署任務已經停止,此時的部署任務不會被計費。
  • DELETING:正在刪除部署任務。
  • FAILED:部署任務建立或更新失敗。

base_model string

使用的基準模型。

gmt_create string

部署任務建立時間。

gmt_modified string

部署任務更新時間。

workspace_id string

阿里雲百鍊API Key所屬的業務空間ID。請參見擷取Workspace ID。

charge_type string

付費模式。post_paid表示後付費。

creator string

建立人的阿里雲帳號ID。

modifier string

修改人的阿里雲帳號ID。

plan string

部署方式。

base_capacity number

基本模型運行所需的最小資源單元數量。

ready_capacity number

已就緒並可立即處理請求的資源單元數量。

model_unit_spec string

模型單元規格。僅 plan 為 mu 時返回。

enable_thinking boolean

是否開啟思考模式。僅 plan 為 mu 時返回。

max_context_length number

最大上下文長度限制。僅 plan 為 mu 時返回。

rpm_limit number

每分鐘請求數。僅 plan 為 mu 時返回。

tpm_limit number

每分鐘 Token 使用量。僅 plan 為 mu 時返回。

ptu_capacity object

預置輸送量配置。僅 plan 為 ptu 時返回。

ptu_capacity 屬性

input_tpm number

部署的模型每分鐘支援的最大輸入 Token 量。

output_tpm number

部署的模型每分鐘支援的最大輸出 Token 量。

thinking_output_tpm number

部分模型支援,部署的模型每分鐘支援的預置思考最大輸出 Token 量。

code string

錯誤碼。調用失敗時返回。

message string

錯誤詳情描述。調用失敗時返回。

成功響應樣本

重點關註:output.deployed_model(部署模型的唯一標識)、output.status(部署狀態)。

{
    "request_id": "f2ae64f7-83cc-410c-bc0b-840443f7eb86",
    "output": {
        "deployed_model": "qwen-plus-2025-12-01-mu-xxxx",
        "gmt_create": "2025-06-17T11:00:38.68",
        "gmt_modified": "2025-06-17T11:00:38.68",
        "status": "PENDING",
        "model_name": "qwen-plus-2025-12-01",
        "base_model": "qwen-plus",
        "model_unit_spec": "MU1",
        "enable_thinking": true,
        "max_context_length": 10000,
        "rpm_limit": 500,
        "tpm_limit": 1000,
        "base_capacity": 1,
        "ready_capacity": 0,
        "workspace_id": "llm-v71tlv3d***",
        "charge_type": "post_paid",
        "creator": "175805416***",
        "modifier": "175805416***",
        "plan": "mu"
    }
}

錯誤響應樣本

{
    "code": "InvalidParameter",
    "request_id": "BE213CDD-8A5C-59EE-9A67-055EAB0CB59B",
    "message": "The model xxx does not exist or is not deployable"
}

下一步

部署為非同步作業,調用本介面後可通過查詢和管理部署介面查詢部署狀態。