日志回流将 SLS(日志服务)推理日志转化为可用于模型微调或评测的结构化数据集。
功能概述
日志回流功能将 SLS(日志服务)中的推理日志数据回流到百炼平台,经过格式化处理后生成结构化数据集(JSONL 格式),可用于模型微调或模型评测。回流产出的是结构化数据,而非原始日志的直接副本。
支持范围
日志回流支持创建以下两类数据集:
- 训练集:训练场景为文本生成,训练方式支持 SFT(监督微调)。
- 评测集:支持文本生成场景。
日志回流目前仅在华北2(北京)和新加坡 Region 可用,其他 Region 不显示日志回流入口。单次回流上限为 10 万条,可多次回流到同一数据集的不同版本以积累更多数据。
日志回流支持平台存储(默认)。存储方式的差异和选择指引,请参见创建日志回流数据集。
回流生成的数据集可直接用于下游任务:训练集可用于模型调优,评测集用于模型评测。
开通并授权相关服务
使用日志回流前,请确认当前 Region 为华北2(北京)或新加坡(其他 Region 不显示日志回流入口),并在模型监控页面完成以下服务开通和权限授权。全部完成后授权配置抽屉自动关闭,进入日志回流表单。
开启审计日志和推理日志
审计日志和推理日志各需完成三个步骤,共六个条件全部满足后才能使用日志回流。审计日志是推理日志的前置依赖,必须先完成审计日志的全部步骤。
审计日志- 授权 SLS 服务关联角色:单击立即授权,授权 AliyunServiceRoleForSFMAccessSLS 角色。未授权时显示红色未授权标签。
- 开通 SLS 日志服务:未开通时显示未开通状态和跳转链接,单击后前往 SLS 控制台完成开通。
- 开启审计日志:单击创建并开启审计日志,系统创建 LogStore(日志库)实例并轮询等待就绪(最多 60 秒)。
- 授权推理日志的 SLS 服务关联角色。
- 确认 SLS 日志服务已开通。
- 开启推理日志:审计日志未开启时该按钮置灰,需先完成审计日志开启。
Important开启必须按序:先审计日志,再推理日志。关闭必须反序:先关闭推理日志,再关闭审计日志。关闭日志后已有数据不可复原,操作前请确认不再需要日志数据。推理日志开启后 SLS 持续产生存储和读写费用,不再需要时应及时关闭。
下表汇总了日志回流涉及的服务关联角色。
角色名称 | 用途 | 授权时机 |
|---|---|---|
AliyunServiceRoleForSFMAccessSLS | 百炼访问 SLS 日志数据 | 审计日志和推理日志各授权一次 |
创建日志回流数据集
日志回流提供三个入口,均可进入配置表单创建数据集:
模型监控列表页
在模型监控列表页顶部,单击日志回流。首次使用时先完成授权配置,授权通过后自动展示日志回流表单。

模型监控详情页
在模型监控详情页的时间选择器区域,单击日志回流。从此入口进入时,表单自动预填当前页面的时间范围、API Key 和模型,且模型不可修改。
数据管理页
在数据管理页面新建数据集时,导入方式选择日志回流。该选项仅在训练集(文本生成 + SFT)或评测集(文本生成)时可见。
配置回流参数
进入日志回流表单后,按从上到下的顺序配置以下参数。部分参数有前置依赖:API Key 过滤需先选时间范围,模型选择需先选时间范围和 API Key。修改时间范围、数据类型、训练场景或训练方式会联动重置其他参数,建议严格按顺序填写。各参数取值说明见下表。
预估日志回流数据:系统根据筛选条件显示预估的回流数据条数。超过 10 万条时红色警告,超出部分不会被回流。查询结果过多时,确定按钮禁用,需缩小筛选范围。
Note表单联动重置规则:修改时间范围会重置 API Key(回到全部)和模型选择(清空);修改数据类型、训练场景或训练方式会重置存储位置和导入方式。
Important存储方式、数据类型和训练方式在创建后均不可更改,选择前请仔细确认。
参数 | 说明 | 是否必填 | 取值说明 |
|---|---|---|---|
回流位置 | 数据集的存储方式 | 是 | 平台存储(默认)。创建后不可更改 |
数据集名称 | 数据集在列表中的显示名称 | 是 | 中文、英文、数字、下划线、斜杠、连字符,最大 50 字符。建议采用 功能场景_模型名_时间 格式命名。创建后不可修改 |
数据集描述 | 数据集用途补充说明 | 否 | 最大 200 字符 |
类型与格式 | 数据集用途类型 | 是 | 训练集或评测集。选择评测集时训练场景和训练方式隐藏。创建后不可更改 |
训练场景 | 训练场景类型(仅训练集显示) | 是 | 当前仅支持文本生成 |
训练方式 | 微调方法(仅训练集显示) | 是 | SFT,选项由系统动态展示。创建后锁定 |
时间范围 | 回流日志的时间段 | 是 | 最近 30 天(含当天),精确到时分秒。修改会重置 API Key 和模型选择 |
API Key 过滤 | 按 API Key 筛选日志数据 | 是 | 全部(不过滤)、其他(排除已列出 Key)、或选择具体 Key(多选) |
模型选择 | 回流目标模型 | 是 | 最多 10 个,按能力类型过滤不匹配模型置灰 |
查看回流结果
提交日志回流任务后,在数据管理列表页查看数据集和导入进度。
列表页展示
日志回流创建的数据集在列表页中的导入方式显示为日志回流,存储位置根据创建时的选择显示为平台存储。
可在列表页查看任务的导入状态。任务失败时,可查看系统返回的具体失败原因。
平台存储模式下,导入完成后系统自动发布数据集版本,无需手动操作。
详情页信息
数据集详情页展示的信息根据存储方式有所不同:
- 平台存储(OSS 导入):展示发布状态、数据量、创建时间、FileID、数据类型、导入状态和 OSS 导入地址。
- 其他情况:展示发布状态、数据量、创建时间、FileID、数据类型和导入状态。
追加日志回流数据
在数据管理页面,向已有数据集追加新一批日志回流数据,有以下两种方式:
导入数据页
进入已有数据集的导入数据页面,选择日志回流作为导入方式。表单参数与创建流程一致,详见创建日志回流数据集。此方式额外支持按工作空间过滤。
此方式适用于所有存储类型的数据集。
新增版本弹窗
在数据集详情页,单击新增版本,在弹窗中选择日志回流导入方式。仅平台存储数据集可用此方式。
增量回流最佳实践
推荐分批次回流,针对不同时段或不同模型分别执行回流任务,逐步积累高质量训练集。每批次可精准选择表现良好的模型和业务高峰时段的数据,确保数据质量优于一次性大量回流。
常见问题
API Key 过滤的「其他」包含哪些请求?
问题:API Key 过滤中其他包含哪些请求?
其他过滤掉已列出 Key 的请求,包含已删除的 Key 或其他工作空间产生的日志。全部则不按 Key 过滤。三种模式(全部/其他/逐个选择)的完整说明见创建日志回流数据集的 API Key 过滤参数。
10 万条上限是数据集总量限制吗?
问题:单次回流上限 10 万条,是否意味着数据集总量也被限制在 10 万条?
不是。10 万条是单次回流的上限,并非数据集的总量上限。可以多次回流到同一数据集的不同版本,累计数据量不受此限制。例如分批次针对不同时段回流,每次 10 万条以内,最终数据集可以积累远超 10 万条的数据。
审计日志和推理日志是同一个操作吗?
问题:开启日志需要分别操作审计日志和推理日志,两者有什么关系?
两者需分别开启,且必须先完成审计日志才能开启推理日志。操作步骤详见开通并授权相关服务。
预估数据量为什么和实际回流结果不一致?
问题:提交前显示的预估数据量与回流完成后的实际条数有差异。
预估数据量是基于筛选条件的近似估算值,实际回流完成后的数据条数可能略有差异,这是正常现象。预估值用于帮助判断是否需要调整筛选条件(如超过 10 万条时提示缩小范围),不代表精确计数。