全部產品
Search
文件中心

Alibaba Cloud Model Studio:deepseek-v4-flash

更新時間:Aug 26, 2026

高效輕量化MoE模型,總參284B,啟用13B,原生支援百萬超長上下文能力。推理速度快、延遲低、調用成本低廉,綜合能力均衡,主打高並發、輕量化任務,適合日常對話、內容創作、基礎 RAG、批量文案處理等普惠剛需情境。

推理服務供應商

deepseek-v4-flash模型的推理服務供應商為阿里雲百鍊。

模型能力

華北2(北京)

能力項支援情況能力項支援情況

輸入模態

Text

輸出模態

Text

模型體驗

支援

Function Calling

支援

結構化輸出

支援

連網搜尋

支援

首碼續寫

不支援

上下文緩衝

支援

批量推理

不支援

模型調優

不支援

新加坡

部署範圍:國際

能力項支援情況能力項支援情況

輸入模態

Text

輸出模態

Text

模型體驗

支援

Function Calling

支援

結構化輸出

支援

連網搜尋

支援

首碼續寫

不支援

上下文緩衝

支援

批量推理

不支援

模型調優

不支援

德國(法蘭克福)

部署範圍:全球

能力項支援情況能力項支援情況

輸入模態

Text

輸出模態

Text

模型體驗

支援

Function Calling

支援

結構化輸出

支援

連網搜尋

不支援

首碼續寫

不支援

上下文緩衝

支援

批量推理

不支援

模型調優

不支援

美國(維吉尼亞)

部署範圍:全球

能力項支援情況能力項支援情況

輸入模態

Text

輸出模態

Text

模型體驗

支援

Function Calling

支援

結構化輸出

支援

連網搜尋

不支援

首碼續寫

不支援

上下文緩衝

支援

批量推理

不支援

模型調優

不支援

日本(東京)

部署範圍:全球

能力項支援情況能力項支援情況

輸入模態

Text

輸出模態

Text

模型體驗

支援

Function Calling

支援

結構化輸出

支援

連網搜尋

支援

首碼續寫

不支援

上下文緩衝

支援

批量推理

不支援

模型調優

不支援

上下文限制

參數參數

最大輸入長度

1000000

最大輸出長度

393216

上下文長度

1000000

模型價格

本文僅展示模型調用原價,不包含限時優惠等活動資訊,請前往百鍊控制台查看活動優惠。

華北2(北京)

計費項目價格(美元)單位

輸入

0.138

每百萬tokens

輸出

0.275

每百萬tokens

輸入(快取命中)

0.028

每百萬tokens

新加坡

部署範圍:國際

計費項目價格(美元)單位

輸入

0.2

每百萬tokens

輸出

0.4

每百萬tokens

輸入(快取命中)

0.04

每百萬tokens

德國(法蘭克福)

部署範圍:全球

計費項目價格(美元)單位

輸入

0.138

每百萬tokens

輸出

0.275

每百萬tokens

輸入(快取命中)

0.028

每百萬tokens

美國(維吉尼亞)

部署範圍:全球

計費項目價格(美元)單位

輸入

0.138

每百萬tokens

輸出

0.275

每百萬tokens

輸入(快取命中)

0.028

每百萬tokens

日本(東京)

部署範圍:全球

計費項目價格(美元)單位

輸入

0.138

每百萬tokens

輸出

0.275

每百萬tokens

輸入(快取命中)

0.028

每百萬tokens

限流

華北2(北京)

參數

RPM(每分鐘請求數)

15000

TPM(每分鐘tokens)

1,200,000

新加坡

部署範圍:國際

參數

RPM(每分鐘請求數)

10000

TPM(每分鐘tokens)

1,200,000

德國(法蘭克福)

部署範圍:全球

參數

RPM(每分鐘請求數)

15000

TPM(每分鐘tokens)

1,200,000

美國(維吉尼亞)

部署範圍:全球

參數

RPM(每分鐘請求數)

10000

TPM(每分鐘tokens)

1,200,000

日本(東京)

部署範圍:全球

參數

RPM(每分鐘請求數)

10000

TPM(每分鐘tokens)

1,200,000

快照版本

deepseek-v4-flash-0731

高效輕量化MoE模型,總參284B,啟用13B,原生支援百萬超長上下文能力。推理速度快、延遲低、調用成本低廉,綜合能力均衡,主打高並發、輕量化任務,適合日常對話、內容創作、基礎 RAG、批量文案處理等普惠剛需情境。

推理服務供應商

deepseek-v4-flash-0731模型的推理服務供應商為阿里雲百鍊。

模型能力

能力項支援情況能力項支援情況

輸入模態

Text

輸出模態

Text

模型體驗

支援

Function Calling

支援

結構化輸出

不支援

連網搜尋

支援

首碼續寫

不支援

上下文緩衝

支援

批量推理

不支援

模型調優

不支援

上下文限制

參數參數

最大輸入長度

1000000

最大輸出長度

393216

上下文長度

1000000

模型價格

本文僅展示模型調用原價,不包含限時優惠等活動資訊,請前往百鍊控制台查看活動優惠。

華北2(北京)

計費項目價格(美元)單位

輸入

0.212

每百萬tokens

輸入

0.424

每百萬tokens

輸出

0.636

每百萬tokens

輸出

1.272

每百萬tokens

輸入(快取命中)

0.021

每百萬tokens

輸入(快取命中)

0.042

每百萬tokens

新加坡

部署範圍:國際

計費項目價格(美元)單位

輸入

0.22

每百萬tokens

輸入

0.44

每百萬tokens

輸出

0.66

每百萬tokens

輸出

1.32

每百萬tokens

輸入(快取命中)

0.022

每百萬tokens

輸入(快取命中)

0.044

每百萬tokens

德國(法蘭克福)

部署範圍:全球

計費項目價格(美元)單位

輸入

0.212

每百萬tokens

輸入

0.424

每百萬tokens

輸出

0.636

每百萬tokens

輸出

1.272

每百萬tokens

輸入(快取命中)

0.021

每百萬tokens

輸入(快取命中)

0.042

每百萬tokens

美國(維吉尼亞)

部署範圍:全球

計費項目價格(美元)單位

輸入

0.212

每百萬tokens

輸入

0.424

每百萬tokens

輸出

0.636

每百萬tokens

輸出

1.272

每百萬tokens

輸入(快取命中)

0.021

每百萬tokens

輸入(快取命中)

0.042

每百萬tokens

日本(東京)

部署範圍:全球

計費項目價格(美元)單位

輸入

0.212

每百萬tokens

輸入

0.424

每百萬tokens

輸出

0.636

每百萬tokens

輸出

1.272

每百萬tokens

輸入(快取命中)

0.021

每百萬tokens

輸入(快取命中)

0.042

每百萬tokens

中國香港

部署範圍:全球

計費項目價格(美元)單位

輸入

0.212

每百萬tokens

輸入

0.424

每百萬tokens

輸出

0.636

每百萬tokens

輸出

1.272

每百萬tokens

輸入(快取命中)

0.021

每百萬tokens

輸入(快取命中)

0.042

每百萬tokens

限流

華北2(北京)

參數

RPM(每分鐘請求數)

15000

TPM(每分鐘tokens)

1,200,000

新加坡

部署範圍:國際

參數

RPM(每分鐘請求數)

15000

TPM(每分鐘tokens)

1,200,000

德國(法蘭克福)

部署範圍:全球

參數

RPM(每分鐘請求數)

15000

TPM(每分鐘tokens)

1,200,000

日本(東京)

部署範圍:全球

參數

RPM(每分鐘請求數)

15000

TPM(每分鐘tokens)

1,200,000

中國香港

部署範圍:全球

參數

RPM(每分鐘請求數)

15000

TPM(每分鐘tokens)

1,200,000