MaxCompute 模型計算服務是 MaxCompute 為滿足客戶使用大模型進行資料處理或離線推理提供的一種開箱即用、隨用隨付的新功能。本文介紹模型計算服務的計費規則。
功能介紹
MaxCompute 模型計算服務是 MaxCompute 提供的大模型推理能力,支援在 SQL/MaxFrame 作業中通過內建 AI Function 直接調用 MaxCompute 提供的開箱即用的模型。系統將根據實際用量如模型輸入、模型輸出 Token 量計費,使用者按 Token 實際使用量付費。
支援地區:當前僅以下地區支援開通模型計算服務。
中國內地:華北2(北京)、華東2(上海)、華東1(杭州)、華南1(深圳)、華北6(烏蘭察布)
國際:新加坡
支援模型:必須先在目標地區(如華北2-北京)開通模型計算服務,才可以使用如下模型。
模型
支援類型
說明
qwen3.8-max支援多模態資料輸入
千問3.8系列旗艦模型,2.4萬億參數MoE旗艦,編程與辦公能力全面躍升,可自主編程十數天交付完整專案。適用於自主編程、複雜辦公自動化、科學研究及長周期任務等高難度情境。
qwen3.7-max僅支援文本輸入
千問3.7系列旗艦模型,在推理、代碼產生、多語言理解等方面全面升級,適用於高複雜度任務情境。
qwen3.7-plus支援多模態資料輸入
千問 3.7 系列均衡型模型,兼顧效能與成本,適用於企業級長文本分析及多輪對話等綜合情境。
qwen3.7-flash支援多模態資料輸入
千問3.7系列原生視覺語言輕量高速模型,全面提升多模態理解與Agent執行能力,適用於高並發、低延遲的線上服務及輕量級多模態任務情境。
qwen3.7-text-embedding僅支援文本輸入
基於千問3.7訓練的多語言文本統一向量模型,相較text-embedding-v4版本在文本檢索、聚類、分類效能大幅提升。
qwen3-vl-embedding支援多模態資料輸入
千問多模態向量化模型,支援圖文混合輸入的向量表示,適用於跨模態檢索、圖文匹配等情境。
text-embedding-v4僅支援文本輸入
高精度文本向量化模型,適用於語義檢索、聚類、相似性計算等情境。
qwen3.6-plus支援多模態資料輸入
千問3.6系列均衡型模型,兼顧效能與成本,適用於對話、摘要、分析等通用業務情境。
qwen3.6-flash支援多模態資料輸入
千問3.6系列輕量高速模型,響應速度快、成本低,適用於高並發、低延遲的線上服務情境。
deepseek-v4-pro僅支援文本輸入
DeepSeek第四代旗艦推理模型,擅長數學、代碼、複雜邏輯推理等高難度任務情境。
deepseek-v4-flash僅支援文本輸入
DeepSeek第四代輕量模型,推理速度快、性價比高,適用於日常對話、輕量推理等情境。
qwen3.5-397b-a17b支援多模態資料輸入
千問 3.5 系列MoE 架構模型,啟用參數高效,兼具海量知識儲備與多步推理能力,專為高難度邏輯推演、全棧代碼產生及深度知識問答設計。
qwen3.5-omni-plus支援多模態資料輸入
Qwen3.5-Omni是Qwen最新一代全模態大模型,適用於文本創作、語音助手、多媒體分析等情境,提供自然流暢的多模態理解與互動體驗。
qwen3-asr-flash支援多模態資料輸入
千問 3 系列輕量級語音辨識模型,具備低延遲、高並發的即時轉寫能力,適用於會議記錄、直播字幕產生及語音互動指令識別等即時音頻處理情境。
tongyi-embedding-vision-plus支援多模態資料輸入
Tongyi-Embedding-Vision是基於LLM底座的視覺多模態表徵模型,適用於以圖搜圖、以文搜圖、以文搜視頻、以視頻搜視頻、以文搜文、以文搜圖文等下遊多樣化任務情境。
qwen3-max(即將下線)僅支援文本輸入
千問系列高效能大語言模型,適用於複雜推理、內容產生等情境。
重要qwen3-max 即將下線,請儘快將相關業務切換至新模型,以免影響服務連續性。詳見模型下線機制說明。
目前僅MaxFrame概述、SQL作業通過AI Function使用上述公用模型時,會產生模型計算服務費用。僅成功作業計費,失敗作業不產生模型計算服務費用。
計費規則
模型計算服務採用按 Token 用量計費,計費維度包括:
地區(Region)
模型類型(ModelName)
Token 類型(TokenType):含輸入或輸出 Token,以及使用量所處的階梯區間。
定價說明
單個 SQL/MaxFrame 作業可能存在多次模型調用,當使用的模型存在定價階梯時,系統會獨立統計每次模型調用時的輸入 Token 數以判定計費階梯(Token類型),不同 Token 類型的用量會分別統計和出賬。
qwen3.7-max
中國內地
服務部署範圍為中國地區時,模型推理計算資源僅限於中國內地;待用資料儲存於所選地區。
支援地區:
中國內地:華北2(北京)、華東2(上海)、華東1(杭州)、華南1(深圳)、華北6(烏蘭察布)
單次推理輸入 Token 數 | 使用情境 | Token 類型 | 單價(每百萬Token) |
0<Token≤1048576 | 模型輸入 |
| 1.98 USD |
模型輸入 (命中隱式緩衝) |
| 0.396 USD | |
模型輸入 (命中顯示緩衝) |
| 0.198 USD | |
模型輸入 (建立顯示緩衝) |
| 2.475 USD | |
模型輸出(非思考) |
| 5.9412 USD | |
模型輸出(思考模式) |
| 5.9412 USD |
國際
服務部署範圍為國際地區時,模型推理計算資源在全球範圍內動態調度(不含中國內地);待用資料儲存於所選地區。
支援地區:新加坡
單次推理輸入 Token 數 | 使用情境 | Token 類型 | 單價(每百萬Token) |
0<Token≤1048576 | 模型輸入 |
| 3 USD |
模型輸入 (命中隱式緩衝) |
| 0.6 USD | |
模型輸入 (命中顯示緩衝) |
| 0.3 USD | |
模型輸入 (建立顯示緩衝) |
| 3.75 USD | |
模型輸出(非思考) |
| 9 USD | |
模型輸出(思考模式) |
| 9 USD |
qwen3.7-plus
中國內地
服務部署範圍為中國地區時,模型推理計算資源僅限於中國內地;待用資料儲存於所選地區。
支援地區:
中國內地:華北2(北京)、華東2(上海)、華東1(杭州)、華南1(深圳)、華北6(烏蘭察布)
單次推理輸入 Token 數 | 使用情境 | Token 類型 | 單價(每百萬Token) |
0<Token≤262144 | 模型輸入 |
| 0.3312 USD |
模型輸入 (命中隱式緩衝) |
| 0.06624 USD | |
模型輸入 (命中顯示緩衝) |
| 0.03312 USD | |
模型輸入 (建立顯示緩衝) |
| 0.414 USD | |
模型輸出(非思考) |
| 1.3212 USD | |
模型輸出(思考模式) |
| 1.3212 USD | |
262144<Token≤1048576 | 模型輸入 |
| 0.9912 USD |
模型輸入 (命中隱式緩衝) |
| 0.19824 USD | |
模型輸入 (命中顯示緩衝) |
| 0.09912 USD | |
模型輸入 (建立顯示緩衝) |
| 1.239 USD | |
模型輸出(非思考) |
| 3.9612 USD | |
模型輸出(思考模式) |
| 3.9612 USD |
國際
服務部署範圍為國際地區時,模型推理計算資源在全球範圍內動態調度(不含中國內地);待用資料儲存於所選地區。
支援地區:新加坡
單次推理輸入 Token 數 | 使用情境 | Token 類型 | 單價(每百萬Token) |
0<Token≤262144 | 模型輸入 |
| 0.48 USD |
模型輸入 (命中隱式緩衝) |
| 0.096 USD | |
模型輸入 (命中顯示緩衝) |
| 0.048 USD | |
模型輸入 (建立顯示緩衝) |
| 0.6 USD | |
模型輸出(非思考) |
| 1.92 USD | |
模型輸出(思考模式) |
| 1.92 USD | |
262144<Token≤1048576 | 模型輸入 |
| 1.44 USD |
模型輸入 (命中隱式緩衝) |
| 0.288 USD | |
模型輸入 (命中顯示緩衝) |
| 0.144 USD | |
模型輸入 (建立顯示緩衝) |
| 1.8 USD | |
模型輸出(非思考) |
| 5.76 USD | |
模型輸出(思考模式) |
| 5.76 USD |
qwen3-vl-embedding
服務部署範圍為中國地區時,模型推理計算資源僅限於中國內地;待用資料儲存於所選地區。
支援地區:
中國內地:華北2(北京)、華東2(上海)、華東1(杭州)、華南1(深圳)、華北6(烏蘭察布)
階梯區間 | 使用情境 | Token 類型 | 單價(每百萬Token) |
文本 | 模型輸入 |
| 0.12 USD |
圖片&視頻 | 模型輸入 |
| 0.3096 USD |
text-embedding-v4
text-embedding-v4 僅產生模型輸入Token費用,無模型輸出費用,且不設階梯,統一按 input_token_tier1 計費。
中國內地
服務部署範圍為中國地區時,模型推理計算資源僅限於中國內地;待用資料儲存於所選地區。
支援地區:
中國內地:華北2(北京)、華東2(上海)、華東1(杭州)、華南1(深圳)、華北6(烏蘭察布)
階梯區間 | 使用情境 | Token 類型 | 單價(每百萬Token) |
無階梯 | 模型輸入 |
| 0.0864 USD |
國際
服務部署範圍為國際地區時,模型推理計算資源在全球範圍內動態調度(不含中國內地);待用資料儲存於所選地區。
支援地區:新加坡
階梯區間 | 使用情境 | Token 類型 | 單價(每百萬Token) |
無階梯 | 模型輸入 |
| 0.084 USD |
qwen3.6-plus
中國內地
服務部署範圍為中國地區時,模型推理計算資源僅限於中國內地;待用資料儲存於所選地區。
支援地區:
中國內地:華北2(北京)、華東2(上海)、華東1(杭州)、華南1(深圳)、華北6(烏蘭察布)
單次推理輸入 Token 數 | 使用情境 | Token 類型 | 單價(每百萬Token) |
0<Token≤262144 | 模型輸入 |
| 0.3312 USD |
模型輸入 (命中隱式緩衝) |
| 0.06624 USD | |
模型輸入 (命中顯示緩衝) |
| 0.03312 USD | |
模型輸入 (建立顯示緩衝) |
| 0.414 USD | |
模型輸出(非思考) |
| 1.9812 USD | |
模型輸出(思考模式) |
| 1.9812 USD | |
262144<Token≤1048576 | 模型輸入 |
| 1.3212 USD |
模型輸入 (命中隱式緩衝) |
| 0.26424 USD | |
模型輸入 (命中顯示緩衝) |
| 0.13212 USD | |
模型輸入 (建立顯示緩衝) |
| 1.6515 USD | |
模型輸出(非思考) |
| 7.9224 USD | |
模型輸出(思考模式) |
| 7.9224 USD |
國際
服務部署範圍為國際地區時,模型推理計算資源在全球範圍內動態調度(不含中國內地);待用資料儲存於所選地區。
支援地區:新加坡
單次推理輸入 Token 數 | 使用情境 | Token 類型 | 單價(每百萬Token) |
0<Token≤262144 | 模型輸入 |
| 0.6 USD |
模型輸入 (命中隱式緩衝) |
| 0.12 USD | |
模型輸入 (命中顯示緩衝) |
| 0.06 USD | |
模型輸入 (建立顯示緩衝) |
| 0.75 USD | |
模型輸出(非思考) |
| 3.6 USD | |
模型輸出(思考模式) |
| 3.6 USD | |
262144<Token≤1048576 | 模型輸入 |
| 2.4 USD |
模型輸入 (命中隱式緩衝) |
| 0.48 USD | |
模型輸入 (命中顯示緩衝) |
| 0.24 USD | |
模型輸入 (建立顯示緩衝) |
| 3 USD | |
模型輸出(非思考) |
| 7.2 USD | |
模型輸出(思考模式) |
| 7.2 USD |
qwen3.6-flash
中國內地
服務部署範圍為中國地區時,模型推理計算資源僅限於中國內地;待用資料儲存於所選地區。
支援地區:
中國內地:華北2(北京)、華東2(上海)、華東1(杭州)、華南1(深圳)、華北6(烏蘭察布)
單次推理輸入 Token 數 | 使用情境 | Token 類型 | 單價(每百萬Token) |
0<Token≤262144 | 模型輸入 |
| 0.198 USD |
模型輸入 (命中隱式緩衝) |
| 0.0396 USD | |
模型輸入 (命中顯示緩衝) |
| 0.0198 USD | |
模型輸入 (建立顯示緩衝) |
| 0.2475 USD | |
模型輸出(非思考) |
| 1.188 USD | |
模型輸出(思考模式) |
| 1.188 USD | |
262144<Token≤1048576 | 模型輸入 |
| 0.792 USD |
模型輸入 (命中隱式緩衝) |
| 0.1584 USD | |
模型輸入 (命中顯示緩衝) |
| 0.0792 USD | |
模型輸入 (建立顯示緩衝) |
| 0.99 USD | |
模型輸出(非思考) |
| 4.7532 USD | |
模型輸出(思考模式) |
| 4.7532 USD |
國際
服務部署範圍為國際地區時,模型推理計算資源在全球範圍內動態調度(不含中國內地);待用資料儲存於所選地區。
支援地區:新加坡
單次推理輸入 Token 數 | 使用情境 | Token 類型 | 單價(每百萬Token) |
0<Token≤262144 | 模型輸入 |
| 0.3 USD |
模型輸入 (命中隱式緩衝) |
| 0.06 USD | |
模型輸入 (命中顯示緩衝) |
| 0.03 USD | |
模型輸入 (建立顯示緩衝) |
| 0.375 USD | |
模型輸出(非思考) |
| 1.8 USD | |
模型輸出(思考模式) |
| 1.8 USD | |
262144<Token≤1048576 | 模型輸入 |
| 1.2 USD |
模型輸入 (命中隱式緩衝) |
| 0.24 USD | |
模型輸入 (命中顯示緩衝) |
| 0.12 USD | |
模型輸入 (建立顯示緩衝) |
| 1.5 USD | |
模型輸出(非思考) |
| 4.8 USD | |
模型輸出(思考模式) |
| 4.8 USD |
deepseek-v4-pro
中國內地
服務部署範圍為中國地區時,模型推理計算資源僅限於中國內地;待用資料儲存於所選地區。
支援地區:
中國內地:華北2(北京)、華東2(上海)、華東1(杭州)、華南1(深圳)、華北6(烏蘭察布)
階梯區間 | 使用情境 | Token 類型 | 單價(每百萬Token) |
無階梯 | 模型輸入 |
| 1.98 USD |
模型輸入 (命中隱式緩衝) |
| 0.396 USD | |
模型輸入 (命中顯示緩衝) |
| 0.198 USD | |
模型輸入 (建立顯示緩衝) |
| 2.475 USD | |
模型輸出(非思考) |
| 3.9612 USD | |
模型輸出(思考模式) |
| 3.9612 USD |
國際
服務部署範圍為國際地區時,模型推理計算資源在全球範圍內動態調度(不含中國內地);待用資料儲存於所選地區。
支援地區:新加坡
單次推理輸入 Token 數 | 使用情境 | Token 類型 | 單價(每百萬Token) |
0<Token≤1048576 | 模型輸入 |
| 2.88 USD |
模型輸入 (命中隱式緩衝) |
| 0.576 USD | |
模型輸入 (命中顯示緩衝) |
| 0.288 USD | |
模型輸入 (建立顯示緩衝) |
| 3.6 USD | |
模型輸出(非思考) |
| 5.76 USD | |
模型輸出(思考模式) |
| 5.76 USD |
deepseek-v4-flash
中國內地
服務部署範圍為中國地區時,模型推理計算資源僅限於中國內地;待用資料儲存於所選地區。
支援地區:
中國內地:華北2(北京)、華東2(上海)、華東1(杭州)、華南1(深圳)、華北6(烏蘭察布)
階梯區間 | 使用情境 | Token 類型 | 單價(每百萬Token) |
無階梯 | 模型輸入 |
| 0.1656 USD |
模型輸入 (命中隱式緩衝) |
| 0.03312 USD | |
模型輸入 (命中顯示緩衝) |
| 0.01656 USD | |
模型輸入 (建立顯示緩衝) |
| 0.207 USD | |
模型輸出(非思考) |
| 0.33 USD | |
模型輸出(思考模式) |
| 0.33 USD |
國際
服務部署範圍為國際地區時,模型推理計算資源在全球範圍內動態調度(不含中國內地);待用資料儲存於所選地區。
支援地區:新加坡
階梯區間 | 使用情境 | Token 類型 | 單價(每百萬Token) |
0<Token≤1048576 | 模型輸入 |
| 0.24 USD |
模型輸入 (命中隱式緩衝) |
| 0.048 USD | |
模型輸入 (命中顯示緩衝) |
| 0.024 USD | |
模型輸入 (建立顯示緩衝) |
| 0.3 USD | |
模型輸出(非思考) |
| 0.48 USD | |
模型輸出(思考模式) |
| 0.48 USD |
qwen3.5-397b-a17b
服務部署範圍為中國地區時,模型推理計算資源僅限於中國內地;待用資料儲存於所選地區。
支援地區:
中國內地:華北2(北京)、華東2(上海)、華東1(杭州)、華南1(深圳)、華北6(烏蘭察布)
單次推理輸入 Token 數 | 使用情境 | Token 類型 | 單價(每百萬Token) |
0<Token≤131,072 | 模型輸入 |
| 0.2064 USD |
模型輸入 (命中隱式緩衝) |
| 0.04128 USD | |
模型輸入 (命中顯示緩衝) |
| 0.02064 USD | |
模型輸入 (建立顯示緩衝) |
| 0.258 USD | |
模型輸出(非思考) |
| 1.2384 USD | |
模型輸出(思考模式) |
| 1.2384 USD | |
131,072<Token≤262144 | 模型輸入 |
| 0.516 USD |
模型輸入 (命中隱式緩衝) |
| 0.1032 USD | |
模型輸入 (命中顯示緩衝) |
| 0.0516 USD | |
模型輸入 (建立顯示緩衝) |
| 0.645 USD | |
模型輸出(非思考) |
| 3.096 USD | |
模型輸出(思考模式) |
| 3.096 USD |
qwen3-asr-flash
qwen3-asr-flash 僅產生模型輸入Token費用,無模型輸出費用,且不設階梯,統一按 input_token_tier1 計費。
中國內地
服務部署範圍為中國地區時,模型推理計算資源僅限於中國內地;待用資料儲存於所選地區。
支援地區:
中國內地:華北2(北京)、華東2(上海)、華東1(杭州)、華南1(深圳)、華北6(烏蘭察布)
階梯區間 | 使用情境 | Token 類型 | 單價(每百萬Token) |
無階梯 | 模型輸入 |
| 1.536 USD |
國際
服務部署範圍為國際地區時,模型推理計算資源在全球範圍內動態調度(不含中國內地);待用資料儲存於所選地區。
支援地區:新加坡
階梯區間 | 使用情境 | Token 類型 | 單價(每百萬Token) |
無階梯 | 模型輸入 |
| 1.68 USD |
qwen3-max(即將下線)
中國內地
服務部署範圍為中國地區時,模型推理計算資源僅限於中國內地;待用資料儲存於所選地區。
支援地區:
中國內地:華北2(北京)、華東2(上海)、華東1(杭州)、華南1(深圳)、華北6(烏蘭察布)
單次推理輸入 Token 數 | 使用情境 | 對應Token 類型 | 單價(每百萬Token) |
0 < Token ≤ 32,768 | 模型輸入 |
| 0.4308 USD |
模型輸入 (命中隱式緩衝) |
| 0.08616 USD | |
模型輸入 (命中顯示緩衝) |
| 0.04308 USD | |
模型輸入 (建立顯示緩衝) |
| 0.5385 USD | |
模型輸出(非思考) |
| 1.7208 USD | |
模型輸出(思考模式) |
| 1.7208 USD | |
32,768 < Token ≤ 131,072 | 模型輸入 |
| 0.6888 USD |
模型輸入 (命中隱式緩衝) |
| 0.13776 USD | |
模型輸入 (命中顯示緩衝) |
| 0.06888 USD | |
模型輸入 (建立顯示緩衝) |
| 0.861 USD | |
模型輸出(非思考) |
| 2.7528 USD | |
模型輸出(思考模式) |
| 2.7528 USD | |
131,072 < Token ≤ 258,048 | 模型輸入 |
| 1.2048 USD |
模型輸入 (命中隱式緩衝) |
| 0.24096 USD | |
模型輸入 (命中顯示緩衝) |
| 0.12048 USD | |
模型輸入 (建立顯示緩衝) |
| 1.506 USD | |
模型輸出(非思考) |
| 4.8168 USD | |
模型輸出(思考模式) |
| 4.8168 USD |
國際
服務部署範圍為國際地區時,模型推理計算資源在全球範圍內動態調度(不含中國內地);待用資料儲存於所選地區。
支援地區:新加坡
單次推理輸入 Token 數 | 使用情境 | 對應Token 類型 | 單價(每百萬Token) |
0 < Token ≤ 32,768 | 模型輸入 |
| 1.44 USD |
模型輸入 (命中隱式緩衝) |
| 0.288 USD | |
模型輸入 (命中顯示緩衝) |
| 0.144 USD | |
模型輸入 (建立顯示緩衝) |
| 1.8 USD | |
模型輸出(非思考) |
| 7.2 USD | |
模型輸出(思考模式) |
| 7.2 USD | |
32,768 < Token ≤ 131,072 | 模型輸入 |
| 2.88 USD |
模型輸入 (命中隱式緩衝) |
| 0.576 USD | |
模型輸入 (命中顯示緩衝) |
| 0.288 USD | |
模型輸入 (建立顯示緩衝) |
| 3.6 USD | |
模型輸出(非思考) |
| 14.4 USD | |
模型輸出(思考模式) |
| 14.4 USD | |
131,072 < Token ≤ 258,048 | 模型輸入 |
| 3.6 USD |
模型輸入 (命中隱式緩衝) |
| 0.72 USD | |
模型輸入 (命中顯示緩衝) |
| 0.36 USD | |
模型輸入 (建立顯示緩衝) |
| 4.5 USD | |
模型輸出(非思考) |
| 18 USD | |
模型輸出(思考模式) |
| 18 USD |
賬單說明
出賬頻率:按小時出賬
由於資料匯總需要,作業完成到推理費用賬單產出通常存在數小時延遲,最終以阿里雲費用中心為準。
賬單查看路徑
登入阿里雲費用與成本控制台。
在左側導覽列選擇。
在账单详情頁面,产品名称選擇雲原生MaxCompute MaxCompute,商品名称選擇MaxCompute 模型計算服務,即可擷取詳細賬單。
常見問題
Q:如何預估推理成本?
A:可使用上述定價表結合預期輸入/輸出長度估算。例如,若平均每次調用輸入2K Token、輸出 1K Token,每個作業需要使用qwen3-max模型執行1000次推理,則單作業的模型計算費用目錄價約為 18元。Q:是否支援免費額度或試用?
A:當前模型計算服務為純隨用隨付,無免費額度,建議先在小規模資料上測試,以驗證效果並確定成本。Q:能否設定消費上限防止超額?
A:暫不支援設定用量上限,請結合賬單合理控制使用量。