开通Flink AI服务后,使用内置模型进行推理调用将产生模型调用费用。该费用按Token用量计费,独立于工作空间的CU计算资源费用。
计费概览
计算资源(CU):作业运行所需的计算资源,与现有CU计费方式相同。
AI服务调用费:调用内置模型产生的费用,按Token用量独立计费。
相关联云产品计费,详情请参见计费项。
计费规则
计费单位:美元/千tokens,输入tokens与输出tokens分别计费。
计费周期:每分钟结算一次(以UTC+8时间为准),生成账单并扣费。
计费维度:按
地域 × 模型 × 输入用量阶梯 × Token类型组合计费,每分钟请求费用 = Σ(各Token类型用量 × 对应单价)。免费额度:每个主账号每个地域每个自然月(以 UTC+8 时间为准)前100万tokens免费(输入与输出合计)。超出部分按定价计费。
Token类型说明
每次推理请求产生的Token按以下类型分别计量:
标准输入Token:按基础输入单价计费。
标准输出Token:按基础输出单价计费。
隐式缓存命中的输入Token:按基础输入价的20%计费。
显式缓存创建的输入Token:按基础输入价的125%计费。
显式缓存命中的输入Token:按基础输入价的10%计费。
每分钟请求费用 = Σ(各Token类型用量 × 对应单价)。缓存类Token的单价 = 基础输入单价 × 计费系数。
定价表
实际价格请以计费账单为准。
基础定价
以下为标准输入Token和标准输出Token的基础单价。缓存类Token按此基础价乘以对应系数计费,详见缓存Token计费系数。
中国内地:如华东1(杭州)、华北2(北京)等。
非中国内地:包括中国香港、新加坡、美国等所有非中国内地地域。
地域列表详见:Flink AI 支持地域。
千问
中国内地
模型 | 输入用量阶梯(千tokens) | 输入(美元/千tokens) | 输出(美元/千tokens) |
qwen3.8-max | 0~1,000 | 0.00198 | 0.005941 |
qwen3.7-max | 0~1,000 | 0.00198 | 0.005941 |
qwen3.7-plus | 0~256 | 0.00033 | 0.00132 |
256~1,000 | 0.00099 | 0.003961 | |
qwen3.6-plus | 0~256 | 0.00033 | 0.00198 |
256~1,000 | 0.00132 | 0.007921 | |
qwen3.5-plus | 0~128 | 0.000132 | 0.000792 |
128~256 | 0.00033 | 0.00198 | |
256~1,000 | 0.00066 | 0.003961 | |
qwen3.7-flash | 0~32 | 0.000033 | 0.000132 |
32~256 | 0.000099 | 0.000396 | |
256~1,000 | 0.000198 | 0.000792 | |
qwen3.6-flash | 0~256 | 0.000198 | 0.001188 |
256~1,000 | 0.000792 | 0.004753 | |
qwen3.5-flash | 0~128 | 0.000033 | 0.00033 |
128~256 | 0.000132 | 0.00132 | |
256~1,000 | 0.000198 | 0.00198 | |
qwen3.5-ocr | 0~1,000 | 0.000083 | 0.00033 |
qwen-vl-ocr | 0~1,000 | 0.00005 | 0.000083 |
qwen-mt-plus | 0~1,000 | 0.000297 | 0.000891 |
qwen-mt-flash | 0~1,000 | 0.000116 | 0.000322 |
非中国内地
模型 | 输入用量阶梯(千tokens) | 输入(美元/千tokens) | 输出(美元/千tokens) |
qwen3.8-max | 0~1,000 | 0.002473 | 0.00742 |
qwen3.7-max | 0~1,000 | 0.003093 | 0.009276 |
qwen3.7-plus | 0~256 | 0.000495 | 0.001979 |
256~1,000 | 0.001484 | 0.005936 | |
qwen3.6-plus | 0~256 | 0.000619 | 0.00371 |
256~1,000 | 0.002474 | 0.007421 | |
qwen3.5-plus | 0~128 | 0.000485 | 0.002906 |
128~256 | 0.000485 | 0.002906 | |
256~1,000 | 0.000606 | 0.003634 | |
qwen3.7-flash | 0~32 | 0.000037 | 0.000161 |
32~256 | 0.000124 | 0.000495 | |
256~1,000 | 0.000247 | 0.000989 | |
qwen3.6-flash | 0~256 | 0.000309 | 0.001855 |
256~1,000 | 0.001236 | 0.004947 | |
qwen3.5-flash | 0~128 | 0.00012 | 0.000485 |
128~256 | 0.00012 | 0.000485 | |
256~1,000 | 0.000198 | 0.000485 | |
qwen-vl-ocr | 0~1,000 | 0.000085 | 0.000194 |
qwen-mt-plus | 0~1,000 | 0.00298 | 0.008926 |
qwen-mt-flash | 0~1,000 | 0.000194 | 0.000593 |
DeepSeek
中国内地
模型 | 输入用量阶梯(千tokens) | 输入(美元/千tokens) | 输出(美元/千tokens) |
deepseek-v4-pro | 0~1,000 | 0.00198 | 0.003961 |
deepseek-v4-flash-0731 | 0~1,000 | 0.000165 | 0.00033 |
非中国内地
模型 | 输入用量阶梯(千tokens) | 输入(美元/千tokens) | 输出(美元/千tokens) |
deepseek-v4-pro | 0~1,000 | 0.002968 | 0.005936 |
deepseek-v4-flash-0731 | 0~1,000 | 0.000247 | 0.000495 |
GLM
中国内地
模型 | 输入用量阶梯(千tokens) | 输入(美元/千tokens) | 输出(美元/千tokens) |
glm-5.2 | 0~1,000 | 0.00132 | 0.004621 |
非中国内地
模型 | 输入用量阶梯(千tokens) | 输入(美元/千tokens) | 输出(美元/千tokens) |
glm-5.2 | 0~1,000 | 0.001731 | 0.005442 |
Embedding
中国内地
模型 | 输入类型 | 美元/千tokens |
qwen3.7-text-embedding | 文本 | 0.000083 |
text-embedding-v4 | 文本 | 0.000083 |
qwen3-vl-embedding | 文本 | 0.000116 |
图片 | 0.000297 |
非中国内地
模型 | 输入类型 | 美元/千tokens |
text-embedding-v4 | 文本 | 0.000085 |
缓存Token计费系数
缓存类Token的费用 = 对应模型的基础输入单价 × 计费系数 × Token用量。详情请参见上下文缓存。
Token类型 | 计费系数 | 说明 |
隐式缓存命中 | ×0.2 | 按基础输入价的20%计费 |
显式缓存创建 | ×1.25 | 按基础输入价的125%计费 |
显式缓存命中 | ×0.1 | 按基础输入价的10%计费 |
计费示例
场景:在华北2(北京)地域使用qwen3.6-plus模型(输入用量阶梯0~256千tokens),累计消耗输入5,000千tokens、输出1,200千tokens。
费用计算:
输入费用:5,000 × 0.00033 = 1.65美元
输出费用:1,200 × 0.00198 = 2.376美元
合计:4.026美元
账单详情
账单按地域、工作空间ID、Flink用途、模型、Token类型、输入用量阶梯分维度出账。
下载账单
在账单详情页面,选择目标账单月份。
将产品名称筛选为实时计算 Flink 版,商品名称筛选为实时计算Flink版_AI_按量付费_国际站,单击搜索。
单击账单列表右上角的导出图标,将账单下载到本地。
打开账单文件,定位实例ID(出账粒度)列。该字段以英文分号(;)分隔,格式如下:
地域;工作空间ID;项目空间名称;Flink用途;模型;Token类型;输入用量阶梯分段
说明
地域
工作空间所在地域
工作空间ID
Flink工作空间的唯一标识
项目空间名称
当前为空,预留字段
Flink用途
Token的使用场景,取值为
ai_function或flink_agents模型
调用的大模型名称
Token类型
输入Token或输出Token
输入用量阶梯
输入Token的区间上限标记,如 128、256、1000 等
欠费说明
欠费后服务暂停,所有使用内置模型的作业将无法调用模型。
充值后服务自动恢复。
欠费期间的模型调用请求不被处理,对应作业可能出现异常。
停止计费
如需停止AI服务计费,在控制台AI服务页面单击关闭服务。关闭后:
所有作业将无法使用内置模型服务。
不再产生AI服务调用费用。
工作空间的CU计算资源费用不受影响。
关闭AI服务前,需确认所有作业均未依赖内置模型,否则可能导致作业运行异常。