將訓練好的文本模型發布為線上 API 服務。
適用範圍
部署模型
新加坡
POST https://dashscope-intl.aliyuncs.com/api/v1/deployments
Windows CMD 請將$DASHSCOPE_API_KEY替換為%DASHSCOPE_API_KEY%,PowerShell請替換為 $env:DASHSCOPE_API_KEY
請求參數 要求標頭(Headers) Content-Type string (必選) 固定值:application/json Authorization string (必選) API Key鑒權,格式為Bearer sk-xxxx。 請求體(Request Body) model_name string (必選) 待部署的模型名稱,對應我的模型中的模型 ID。也可通過建立訓練任務介面的輸出擷取。 plan string (必選) 部署方案。可選值:
mu:按模型單元計費。
lora:LoRA 共用部署(按 Token 用量計費)。
ptu:按預置輸送量計費。
deploy_spec string (條件必填) 部署模板。當 plan 為 mu 時必須填寫。範例:"deploy_spec": "MU1"。 可通過擷取可部署模型列表介面返回的 template_id 欄位擷取。 capacity integer (條件必填) 部署使用的資源單元數量,需為 base_capacity 的整數倍。不同 deploy_spec 的取值約束不同,例如 MU2 必須為 8 的倍數,MU5 可填 1。 billing_method string (條件必填) 計費方式。當 plan 為 mu 時必須填寫。當前支援 "POST_PAY"(後付費)。 enable_thinking boolean (可選) 僅 plan 為 mu 時可設定。部分模型支援,可設定為 true 或 false。 max_context_length number (可選) 僅 plan 為 mu 時可設定。部分模型支援。範例:"max_context_length": 131072。 rpm_limit number (可選) 僅 plan 為 mu 時可設定。部分模型支援,requests per minute,每分鐘請求數。 tpm_limit number (可選) 僅 plan 為 mu 時可設定。部分模型支援,token per minute,每分鐘 Token 使用量。 ptu_capacity object (可選) 僅 plan 為 ptu 時生效。如果不填寫該參數,將預設按照 10,000 input_tpm 和 1,000 output_tpm 進行設定。 ptu_capacity 屬性 input_tpm number 部署的模型每分鐘支援的最大輸入 Token 量。 output_tpm number 部署的模型每分鐘支援的最大輸出 Token 量。 thinking_output_tpm number 部分模型支援,部署的模型每分鐘支援的預置思考最大輸出 Token 量。 name string (可選) 模型的控制台顯示名稱。如果不傳該參數,將自動使用 model_name 的值作為部署名稱。 suffix string (可選) 模型部署後,將產生新的模型名稱,suffix 用於指定新模型名稱的尾碼,最大長度為8個字元且需全域唯一。每個模型在首次部署時,可以不指定尾碼。如果需要對同一模型進行多次部署,則必須設定尾碼以便於區分。 | 按模型單元計費選擇按模型單元計費,計費模式為按模型單元的使用時間長度收費,適用於模型調優後的大規模推理業務,資源專屬,效能和成本靈活可調。
執行以下部署命令後,即便您還沒有調用模型,模型部署服務仍將在部署成功後開始計費。建議您先確認服務計費規則,再執行部署命令。
curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"name": "my_qwen_plus",
"model_name": "qwen-plus-2025-12-01",
"plan": "mu",
"deploy_spec": "MU1",
"enable_thinking": true,
"capacity": 4,
"billing_method": "POST_PAY",
"max_context_length": 10000,
"rpm_limit": 500,
"tpm_limit": 1000
}'
按Token用量計費選擇按 Token 用量計費,適用於高性價比訴求且對並發和延遲要求不高的情境。該模式價格優勢最高,吞吐/並發和產生速度均由平台預置,使用者不可調。 curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"model_name": "qwen3-8b-ft-202511132025-0260",
"plan": "lora",
"capacity": 1,
"name": "qwen3-8b-ft"
}'
按預置吞吐計費按預置吞吐計費模式按預置吞吐的使用時間長度收費,適用於追求穩定吞吐保障和高並發低延遲、且流量可預估的情境。該模式下,吞吐/並發和產生速度均為平台預置,使用者不可調。
執行以下部署命令後,即便您還沒有調用模型,模型部署服務仍將在部署成功後開始計費。建議您先確認服務計費規則,再執行部署命令。
curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"name": "my_qwen_flash",
"model_name": "qwen-flash-2025-07-28",
"plan": "ptu",
"ptu_capacity": {
"input_tpm": 10000,
"output_tpm": 1000
}
}'
|
部署排障與效能調優
max-num-seqs 參數不可配置
百鍊模型部署在按預置吞吐計費和按模型單元計費兩種計費方式下,吞吐、並發和產生速度均為平台預置,不支援直接調整 vLLM 內部的 max-num-seqs 等推理引擎參數,本介面的請求參數中也不存在該參數。
按模型單元計費方式下,可通過選擇模型單元類型(對應請求參數 deploy_spec)和調整部署副本數(對應請求參數 capacity)間接控制吞吐能力。
部署模板與資源隔離
當前部署模板僅支援單機部署(單機部署-增強型通用推理),不支援多卡執行個體隔離。如需資源隔離,請使用按模型單元計費方式,該方式下算力資源為業務專屬。
限流錯誤處理
當並發請求超出限流閾值時,介面返回 HTTP 429,錯誤碼為 Throttling.RateQuota,錯誤資訊為 Requests rate limit exceeded, please try again later。處理方式:
- 按預置吞吐計費:調整
ptu_capacity 中的 input_tpm 和 output_tpm(控制台對應 Input kTPM 和 Output kTPM),或降低請求頻率。該方式下溢出策略可選自動溢出(切換為隨用隨付)或僅使用 PTU 容量(超出容量的請求直接返回 429)。
- 按模型單元計費:調整
rpm_limit 和 tpm_limit,或降低請求頻率。
上下文長度調優
按模型單元計費方式下可通過請求參數 max_context_length 配置最長上下文,取值範圍 1~262144(實際上限取決於所部署模型的能力)。該參數限制單次請求的上下文規模,從而限制單請求的記憶體佔用,可降低 OOM 風險。
處理大量圖片任務時,請結合圖片尺寸和單請求圖片數量設定該參數。
響應參數 request_id string 請求的唯一識別碼。 output object 任務詳情。 屬性 deployed_model string 部署模型的唯一標識。用於查詢模型部署狀態和調用模型。 model_name string 模型標識名。 status string 部署狀態:
PENDING:正在建立部署任務。
UPDATING:正在更新部署任務。
RUNNING:部署任務正在運行,此時已部署的模型可以正常處理請求。
STOPPED:部署任務已經停止,此時的部署任務不會被計費。
DELETING:正在刪除部署任務。
FAILED:部署任務建立或更新失敗。
base_model string 使用的基準模型。 gmt_create string 部署任務建立時間。 gmt_modified string 部署任務更新時間。 workspace_id string 阿里雲百鍊API Key所屬的業務空間ID。請參見擷取Workspace ID。 charge_type string 付費模式。post_paid表示後付費。 creator string 建立人的阿里雲帳號ID。 modifier string 修改人的阿里雲帳號ID。 plan string 部署方式。 base_capacity number 基本模型運行所需的最小資源單元數量。 ready_capacity number 已就緒並可立即處理請求的資源單元數量。 model_unit_spec string 模型單元規格。僅 plan 為 mu 時返回。 enable_thinking boolean 是否開啟思考模式。僅 plan 為 mu 時返回。 max_context_length number 最大上下文長度限制。僅 plan 為 mu 時返回。 rpm_limit number 每分鐘請求數。僅 plan 為 mu 時返回。 tpm_limit number 每分鐘 Token 使用量。僅 plan 為 mu 時返回。 ptu_capacity object 預置輸送量配置。僅 plan 為 ptu 時返回。 ptu_capacity 屬性 input_tpm number 部署的模型每分鐘支援的最大輸入 Token 量。 output_tpm number 部署的模型每分鐘支援的最大輸出 Token 量。 thinking_output_tpm number 部分模型支援,部署的模型每分鐘支援的預置思考最大輸出 Token 量。 code string 錯誤碼。調用失敗時返回。 message string 錯誤詳情描述。調用失敗時返回。 | 成功響應樣本重點關註:output.deployed_model(部署模型的唯一標識)、output.status(部署狀態)。 {
"request_id": "f2ae64f7-83cc-410c-bc0b-840443f7eb86",
"output": {
"deployed_model": "qwen-plus-2025-12-01-mu-xxxx",
"gmt_create": "2025-06-17T11:00:38.68",
"gmt_modified": "2025-06-17T11:00:38.68",
"status": "PENDING",
"model_name": "qwen-plus-2025-12-01",
"base_model": "qwen-plus",
"model_unit_spec": "MU1",
"enable_thinking": true,
"max_context_length": 10000,
"rpm_limit": 500,
"tpm_limit": 1000,
"base_capacity": 1,
"ready_capacity": 0,
"workspace_id": "llm-v71tlv3d***",
"charge_type": "post_paid",
"creator": "175805416***",
"modifier": "175805416***",
"plan": "mu"
}
}
錯誤響應樣本{
"code": "InvalidParameter",
"request_id": "BE213CDD-8A5C-59EE-9A67-055EAB0CB59B",
"message": "The model xxx does not exist or is not deployable"
}
|
下一步
部署為非同步作業,調用本介面後可通過查詢和管理部署介面查詢部署狀態。