ACK Auto Mode叢集支援Auto Mode節點池,結合 Knative Serving 的按需彈效能力,可將 Qwen3.5-4B 大模型部署為按需使用的 Serverless 推理服務。部署後,無需手動營運管理 GPU 資源,適用於對 GPU 成本敏感和營運複雜度有要求的模型推理情境。
整體鏈路如下:
-
ACK Auto Mode叢集:負責 GPU 節點的建立與釋放,節點生命週期由Auto Mode節點池管理。
-
Knative Serving:支援按請求並發數(
concurrency)或每秒請求數(rps)擴縮 Pod
步驟一:建立 ACK Auto Mode 叢集並配置 GPU 節點池
1. 建立叢集
-
登入Container Service管理主控台,在左側導覽列選擇叢集列表。
在叢集列表頁面,單擊建立叢集,在ACK 託管叢集頁面,啟用Auto Mode。

-
按照頁面指引確認配置後,單擊建立叢集。
如需瞭解詳細說明,請參見建立ACK Auto Mode 叢集
2. 建立GPU節點池
3. 部署 Knative 組件
參見部署 Knative 組件完成部署。
步驟二:準備模型檔案並上傳 OSS
本步驟使用一台臨時 ECS 執行個體從 ModelScope 下載 Qwen3.5-4B 模型檔案,再通過ossutil 將檔案上傳至 OSS Bucket,後續通過儲存卷掛載到推理容器,避免每次啟動推理容器時重複下載模型。
開始前,請確認已完成以下準備工作:
-
已在臨時 ECS 執行個體上完成 ossutil 的安裝與配置。
1. 下載 Qwen3.5-4B 模型檔案
在臨時 ECS 執行個體上執行以下操作,從 ModelScope 下載模型檔案。
-
安裝 Git。
# 可執行 yum install git 或 apt install git 安裝 sudo yum install git -
安裝 Git LFS(Large File Storage)外掛程式。
# 可執行 yum install git-lfs 或 apt install git-lfs 安裝 sudo yum install git-lfs -
從 ModelScope 複製 Qwen3.5-4B 倉庫到本地(跳過 LFS 大檔案,避免重複下載)。
GIT_LFS_SKIP_SMUDGE=1 git clone https://www.modelscope.cn/qwen/Qwen3.5-4B.git -
進入目錄,拉取 LFS 管理的大檔案。
cd Qwen3.5-4B git lfs pull
2. 上傳模型檔案到 OSS
-
在 OSS Bucket中建立存放模型的目錄。
將
<Your-Bucket-Name>替換為實際名稱。ossutil mkdir oss://<Your-Bucket-Name>/models/Qwen3.5-4B -
將本地模型檔案上傳至 OSS。
ossutil cp -r ./Qwen3.5-4B oss://<Your-Bucket-Name>/models/Qwen3.5-4B
3. 配置 OSS 儲存卷
-
選擇鑒權方式(RRSA或AccessKey)並準備訪問憑證,以確保叢集能夠安全、合規地訪問OSS Bucket資源。
本樣本以AccessKey鑒權為例。兩種方式略有不同,詳見使用ossfs 2.0靜態儲存卷。
-
將此前擷取的AccessKey儲存為Secret,供PV使用。
將
<yourAccessKeyID>和<yourAccessKeySecret>替換為真實憑證。Secret的Namespace需要和應用Namespace一致。kubectl create -n default secret generic oss-secret --from-literal='akId=<yourAccessKeyID>' --from-literal='akSecret=<yourAccessKeySecret>' -
為目的地組群建立 PV 和 PVC,將 OSS 中的模型目錄以唯讀方式掛載。以下樣本使用ossfs 2.0靜態儲存卷。
步驟三:部署 Knative 服務並驗證
1. 建立 Knative Service
-
在ACK叢集列表頁面,單擊目的地組群名稱,在叢集詳情頁左側導覽列,選擇。
-
在服務管理頁簽,單擊使用模板建立,然後選擇樣本模板為自訂,按照頁面指引完成 Knative Service 的部署。
參數
說明
autoscaling.knative.dev/metric擴縮容指標。可取值:
-
concurrency(預設):並發數。 -
rps:每秒請求數。
autoscaling.knative.dev/target擴縮容閾值,觸發擴縮容的指標目標值。
autoscaling.knative.dev/minScale最小副本數,需為 ≥ 0 的整數。KPA 支援設定為 0(即允許縮容至零)。
autoscaling.knative.dev/maxScale最大副本數,限制擴容上限。
-
2. 驗證服務部署
-
在服務管理頁簽,確認服務就緒,並擷取預設網域名稱和訪問網關地址。
頁面提示:服務訪問前需將網域名稱與訪問網關進行 Host 綁定。訪問網關地址形如
alb-xxx.aliyuncsslb.com,服務預設網域名稱形如qwen.default.example.com。 -
向推理服務發送測試請求。
將
xx.40.85.xx替換為實際訪問網關地址,qwen.default.example.com替換為實際預設網域名稱。curl http://xx.40.85.xx:80/v1/chat/completions \ -H "Host: qwen.default.example.com" \ -H "Content-Type: application/json" \ -d '{ "model": "Qwen3.5-4B", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "介紹杭州" } ] } ], "max_tokens": 200 }'預期輸出如下:
{ "id": "chatcmpl-20dfb4c8-d1ab-48bc-9f1a-78b84c6c8adf", "object": "chat.completion", "created": 1772602897, "model": "Qwen3.5-4B", "choices": [ { "index": 0, "message": { "role": "assistant", "content": "杭州(Hangzhou),簡稱"杭",是位於中國浙江省的副省級城市..." }, "finish_reason": "length" } ], "usage": { "prompt_tokens": 14, "completion_tokens": 200, "total_tokens": 214 } }