全部产品
Search
文档中心

大数据开发治理平台 DataWorks:创建知识库

更新时间:Sep 04, 2026

知识库是 DataWorks 中统一管理知识的独立模块,用于自动发现数据语义、融合多源业务知识,构建统一可管控的知识网络。创建知识库后,可以通过工作空间、数据源和上传文件构建知识,并通过管理员和分享授权控制使用范围。构建成功的知识库可供 AI 助理服务和 Data Agent 使用。

功能介绍

知识库是 DataWorks 的统一知识管理模块,为 Data Agent、AI 助理服务等智能应用提供统一的知识底座。它将分散在工作空间元数据、数据源和业务文档中的信息,整理为可浏览、可检索、可授权的知识,使智能应用在问答、取数和分析时具备一致的业务上下文。

知识库以独立实例的形式管理,一个知识库可以被多个智能应用复用,无需在每个应用中重复建设。

核心能力与使用场景

  • 自动构建元数据知识:扫描DataWorks工作空间,自动构建表、字段、任务、指标、血缘等元数据的业务域和语义知识。

  • 生成与管理语义模型:基于数据源生成描述业务实体、维度、指标及其关系的语义模型,统一业务口径。

  • 融合多源业务文档:支持上传文档、表格、网页、图片等文件,将规章制度、产品手册、数据字典等非结构化资料纳入统一检索。

  • 赋能智能应用:作为Data Agent和AI助理的知识底座,使其在自然语言问答、数据探查和代码生成时,能够理解业务术语并提供更精准的回答。

  • 自动化更新与统一授权:通过周期性构建任务保持知识同步,并通过精细化授权控制使用范围。

与 AI 助理服务、Data Agent 的关系

知识库是独立模块,在 DataWorks 控制台左侧导航栏中与 Data AgentAI 助理服务 同级,由该模块统一创建和管理知识库实例。在知识库中创建的知识库,可以在 AI 助理服务和 Data Agent 中使用。

如果此前在 AI 助理服务中创建过知识库,存量知识库将作为本地知识库继续在界面中展示。新建的 AI 助理服务不再支持创建本地知识库,如需创建新的知识库,请在知识库模块中统一创建和管理。详情参见本地知识库(AI 助理服务存量用户)

使用前提

使用知识库前,请完成以下准备:

  1. 已开通 DataWorks,并进入需要创建知识库的租户。

  2. 如需按工作空间构建知识,当前账号具有待采集工作空间及相关数据资产的读取权限。

  3. 已准备可执行知识构建任务的 Serverless 资源组及其所属项目空间,且所选资源组具备与构建所需的数据源或云服务的网络连通和访问权限,并预留至少 4 CU 的可用容量。

核心概念

概念

说明

知识库类型

  • 个人知识库:默认仅所有者可用。所有者或管理员可以通过分享将知识库授权给指定用户使用,并通过管理员配置添加管理员。

  • 企业知识库:同一 DataWorks 租户下的所有成员默认可以查看和检索;只有所有者和管理员可以管理。

本地知识库

AI 助理服务存量用户此前在 AI 助理服务中创建的知识库。继续在界面中展示,并支持再次生成、导出和清空;新建的 AI 助理服务不再生成本地知识库。

来源管理

配置知识构建可选择的工作空间和数据源。

知识构建

将工作空间元数据、数据源或上传文件转换为可浏览、可检索知识的过程。

任务定义

描述构建任务的长期配置,包括任务名称、构建范围、触发方式和运行环境。

运行实例

任务定义的一次真实执行。一个任务定义可以产生多个运行实例,每个实例有独立的运行状态和日志。

语义模型

以结构化方式描述业务实体、维度、指标及其关系的模型,支持版本管理和发布。

业务文档

手动上传到知识库的业务资料,例如业务术语表、设计文档和操作说明,解析后纳入统一检索。

业务域

按业务主题归类的一组数据资产。

语义知识

从元数据和业务资料中整理出的业务名称、定义、关系、提示、同义词和查询示例等内容。

步骤一:创建知识库

  1. 登录 DataWorks 控制台。在顶部菜单栏切换至目标地域。

  2. 在左侧导航栏单击 Context Graph(知识库)。在知识库列表页,单击新建知识库

  3. 新建知识库对话框中,配置知识库信息。

    配置项

    说明

    名称

    必填。输入便于识别的名称,去除首尾空格后最多 128 个字符,建议体现业务范围,例如"零售经营知识库"。

    类型

    必填。选择个人企业个人知识库仅创建者可见和管理;企业知识库同租户用户可见,仅具备权限的用户可管理。详情参见知识库类型与访问范围

    描述

    选填。说明知识库的业务范围、主要用户和更新方式,最多 1,024 个字符。

  4. 单击创建知识库。知识库创建完成后可以为知识库设置管理员,或者将知识库分享给租户下的其他账号。详见配置与权限

重要

删除知识库时会将知识库下的知识同步删除,请谨慎操作。

步骤二:配置来源

来源是知识构建的可选数据边界,决定后续构建任务可以使用哪些工作空间或数据源。您也可以在构建知识库的之后,直接选择知识来源。来源分为两类:

  • 工作空间:用于按工作空间扫描表、任务、血缘和相关元数据。

  • 数据源:用于按引擎和连接选择数据,支持 MaxCompute、Hologres、StarRocks、DLF 等类型,以页面可选列表为准。

您可以通过以下方式进行来源管理:

  1. 进入目标知识库,在详情页右上角单击来源管理。在弹出的抽屉中,单击添加来源

  2. 根据需要选择工作空间或数据源对象,支持多选。

  3. 单击保存。保存后返回构建页面,来源列表会刷新。

移除来源后,新任务不能再选择该来源,但不会删除由历史任务产生的知识结果。

步骤三:知识构建

进入目标知识库后,单击详情页顶部的知识构建,首先选择构建方式。系统提供三种构建方式:

  • 按工作空间构建:选择一个工作空间,直接创建全新的知识构建任务。

  • 按数据源构建:选择一个数据源,精细化圈选表范围构建知识。

  • 手动上传:直接上传本地文件并创建知识构建任务。

触发方式是创建任务时配置的属性:按工作空间构建与按数据源构建可选择手动或周期运行;手动上传任务提交后立即开始构建,不支持周期运行。

按工作空间构建

适合从一个已配置的工作空间进行完整扫描和首次构建。

参数名称

是否必填

说明

任务名称

为本次构建任务指定一个唯一且易于识别的名称,方便后续管理。最多 128 个字符。

扫描范围

选择一个DataWorks工作空间作为知识的来源,系统将分析其中的任务和数据表。选中后,页面会显示预计参与分析的任务数和表数。

数据探查

一个开关选项,强烈建议开启以提升知识质量。

  • 关闭时:仅进行基础元数据分析,包括:解析元数据 Schema、整合数据建模信息、解析任务代码与血缘关系。

  • 开启时(默认):在基础分析之上,额外执行深度分析,包括:

    • 数据采样与画像统计:如 distinct/null 值分布,辅助PII识别。

    • LLM深度语义增强:如自动生成表/列描述、业务域划分、识别派生指标、聚合生成同义词与术语库。

运行工作空间

指定执行本次构建任务的工作空间。它定义了任务的运行位置,可以与扫描工作空间(分析对象)不同。

运行资源组

选择一个用于执行构建任务的Serverless资源组。请确保该资源组:
1. 具备访问“扫描工作空间”所需数据源的网络连通性。
2. 知识构建会占用所选资源组的 4 CU,请确保资源组至少有 4 CU 可用容量。

大模型

选择用于执行“LLM深度语义增强”的大语言模型。不同的模型在能力和Token消耗上可能存在差异,此项选择直接影响知识构建的质量和成本。

更新方式

此部分用于定义任务的触发方式,包含以下配置:

  • 运行策略:定义任务的触发方式。

    • 手动:任务创建后不自动运行,需在“构建管理”中手动触发。

    • 周期:任务将根据您设定的周期和时间自动定时运行。

  • 执行周期:当“运行策略”选择为“周期”时必填,用于设定自动执行的频率。可选:每月、每周、每天、每小时。

  • 执行时间:当“运行策略”选择为“周期”时必填,用于设定任务在执行周期内的具体启动时间点。

说明
  • 知识扫描会调用大语言模型(LLM)进行语义分析,产生 Token 消耗。请根据实际需要发起构建任务。

  • 通过工作空间语义构建时,对与数据表的采集不区分数据源类型,选中空间下的大部分数据源均可被构建为结构化知识。

按数据源构建

适合基于明确的数据源构建知识,通过精细化圈选表范围生成语义模型。

参数

必填

说明

任务名称

自定义任务名称,用于在构建管理中识别和检索。格式:2~64个字符,以字母或数字开头和结尾。

业务目标与关注点

使用业务语言描述业务目标与关注点,系统据此规划扫描范围与模型产出,例如统一分析各区域收入与续费情况,并确保收入指标使用一致口径

数据范围

  1. 选择分析对象:

    1. 数据源类型:选择要分析的数据源引擎(如 MaxCompute, Hologres、StarRocks 、 DLF)。

    2. 数据源:在所选类型下选择已配置的数据源。没有可选项时,可先配置来源,详情参见来源管理。

  2. 配置运行环境与连通性:

    1. 工作空间:任务执行所在的工作空间,选择 MaxCompute 或 DLF 类型时手动选择;选择 Hologres 或 StarRocks 类型时,随所选数据源自动确定,无需手动选择。

    2. 运行资源组:选择执行任务的Serverless资源组(需预留 4 CU 容量)。

    3. 连通性检测:必须通过此检测,以确保资源组能访问数据源。

  3. 圈定分析内容:

    1. 分析范围:按项目或 Schema 圈选参与分析的范围,只有圈选范围内的表会参与语义模型生成。

    2. 起点表:选择圈表的起点表,或导入 Schema 模板作为种子输入,帮助系统确定从哪些表开始分析和扩展。

指标导入

通过固定 Excel 模板导入指标定义文件,补充指标口径和依赖字段,提高生成结果准确度。导入后页面会显示已校验的指标数量,任务运行时按最终圈表范围决定准入结果。

偏好设置

否,默认全选

设置数据过滤规则,命中规则的表不会参与分析,默认全部开启,可按需取消:

  • 排除临时表(表名含 tmp、temp、bak、backup 或 old 等独立字段时排除);

  • 排除版本副本(表名以 _v 加数字、_new 或 _copy 结尾时排除);

  • 排除测试表(表名含 test、demo、sandbox 或 mock 等独立字段时排除);排除测试环境中的表(Catalog、Database 或 Schema 命中测试环境标识时排除其中的表);

  • 排除带测试说明的表(表注释含测试、联调、样例或沙箱等关键词时排除);仅保留最新周期表(识别日期或周期后缀,同一表族仅保留名称排序最新的 3 张表)。

引用文件

上传本地文件或添加 URL,作为业务参考资料辅助语义生成,帮助系统理解业务语境。支持 PDF、Word、Markdown、文本和 YAML 格式的文件。

更新方式

此部分用于定义任务的触发方式,包含以下配置:

  • 运行策略:定义任务的触发方式。

    • 手动:任务创建后不自动运行,需在“构建管理”中手动触发。

    • 周期:任务将根据您设定的周期和时间自动定时运行。

  • 执行周期:当“运行策略”选择为“周期”时必填,用于设定自动执行的频率。可选:每月、每周、每天、每小时。

  • 执行时间:当“运行策略”选择为“周期”时必填,用于设定任务在执行周期内的具体启动时间点。

手动上传

适合以文档为主要知识来源,将本地业务资料纳入知识库。上传任务不支持周期运行,提交后立即开始构建。

参数

必填

说明

上传文件

这是构建知识的核心输入。您可以拖拽文件或文件夹,或选择上传文件上传文件夹的方式上传,上传文件夹时会保留原有的目录结构。上传限制:

  • 数量:单次最多上传 100 个文件。

  • 大小:单个文件不超过 10 MB。

  • 格式:支持文档、结构化数据、技术文本和图片四类文件,详细列表见下表;不支持压缩包(.zip、.rar)和旧版 Office 文件(.doc、.xls),如需批量上传多个文件,请使用上传文件夹。

上传后,系统会自动在文件列表中标记或忽略格式不支持、超限或系统文件。

运行工作空间

本次构建任务执行所在的工作空间。

运行资源组

任务执行所使用的资源组。知识构建会占用所选资源组的 4 CU,请确保资源组至少有 4 CU 可用容量,并具备访问大模型服务的网络连通性。

大模型

解析上传文档所使用的大模型,可选模型以页面显示的列表为准。

手动上传支持的文件格式如下:

文件类别

支持格式

文档

.md.txt.pdf.docx.xlsx.pptx.html.htm

结构化数据

.csv.tsv.json.jsonl.yaml.yml.xml

技术文本

.sql.log.conf.properties

图片

.png.jpg.jpeg.gif.bmp.tif.tiff.webp

说明

如果上传的文件中包含图片,需要选择支持多模态能力的大模型进行构建。[需要确认:当前支持多模态能力的模型列表]

步骤四:构建管理

启动知识构建后,可以在构建管理中查看构建任务,在知识库详情页单击构建管理页签,可以管理任务定义和运行实例。任务的每一次运行,都会产生一个运行实例。

  • 任务定义

    每条任务定义包含任务名称、任务类型、构建范围、触发方式、运行资源组和任务状态,支持按任务名称搜索,按任务类型、触发方式和启用状态筛选,以及刷新任务定义。

    可执行的操作:

    • 立即运行:手动触发一次构建。

    • 编辑:修改任务名称、触发方式等配置。

    • 启用 / 停用:控制周期任务的自动触发。

    • 删除:移除任务定义(任务运行时无法删除)。

  • 运行实例

    运行实例展示每次执行的任务名称、类型、触发方式、运行状态、开始时间和操作,可按运行状态、任务类型和触发方式筛选。可执行的操作:

    重要

    实例运行的时间根据要构建的知识内容大小而定,耗时较长,请耐心等待。

    • 查看:打开运行实例详情。

    • 源文件:查看本次构建使用的输入文件。

    • 取消:取消仍允许终止的实例。

    • 重试:对允许重跑的失败或终止实例重新发起执行。

  • 运行实例详情

    当一个运行实例的状态为“失败”时,按以下步骤操作:

    1. 定位问题:在“运行实例”列表中单击失败任务的 查看,在详情页的执行图中找到红色的失败步骤。

    2. 分析日志:打开该失败步骤的日志,根据错误信息,参考下表进行处理。

    3. 解决与重试:修正问题后,返回“任务定义”页面,单击 立即运行。

错误类别

典型日志线索

处理动作

文件格式

提示 .doc.xls、压缩包(如 .zip、.rar)等格式不支持,或单个文件超出 10 MB 限制

参见「手动上传」章节的文件格式列表,转换为受支持格式或拆分超限文件后重新上传。

资源组

提示 Serverless 资源组不可用、超限或未与项目空间关联

检查资源组状态和所属项目空间,参见使用前提章节确认资源组配置。

工作空间权限

提示元数据、数据资产或工作空间读取被拒绝

联系工作空间管理员补齐目标工作空间及数据资产的读取权限。

网络连通

提示访问数据源或云服务超时、连接失败

检查资源组能否访问所需数据源和云服务的网络路径。

源数据访问

提示源表、源资产不存在或返回空

确认源数据仍然存在、路径与凭证有效,必要时收窄采集范围后重试。

修正问题后,在任务定义中再次单击立即运行

步骤五:使用知识库

知识图谱

知识图谱是通过大语言模型(LLM)从知识对象中提取概念实体并构建它们之间的关系,将非结构化内容转化为结构化网络。其主要作用是为AI Agent提供深度知识推理能力,尤其专注于大数据ETL工程场景。具体而言,它能够支持复杂的数据血缘关系推理,如追溯表的上游加工节点,并在上游节点或指标变更时准确评估对下游的影响范围,从而显著提升在专用业务场景下问题解决的准确率。

页面

内容说明

业务域概览

查看业务域数量、表和任务规模、资产分层、语义覆盖率、敏感数据概况、热门标签和采集范围。

业务域详情

查看指定业务域中的表、任务、指标、逻辑表、负责人、风险和分析提示。

语义知识库

查看业务术语、指标、逻辑表、跨表查询示例、字段语义、查询示例、数据标准和同义词。

资产详情

查看单个资产的业务定义、字段说明、语义来源、置信度、使用建议、敏感数据、质量规则、血缘和相关知识。

页面中的内容可能来自源系统、DataWorks平台元数据或系统推断。系统会尽可能保留语义来源和置信度。重要业务定义和低置信度内容应结合源资产及业务负责人进行确认。

在 AI 助理服务和 Data Agent 中使用

在 Context Graph(知识库)中创建并构建成功的知识库,可以在 AI 助理服务和 Data Agent 中使用,为其提供业务知识。

可使用的知识库范围取决于知识库类型与授权情况:

  • 企业知识库:同一租户下的所有成员均可使用。

  • 个人知识库:默认仅所有者可用。如需供 Data Agent 或 AI 助理服务使用,需由所有者或管理员通过分享为对应实例添加授权。

Data Agent 和 AI 助理服务不能作为知识库的管理员,只能通过分享获得授权后使用知识库。详情参见分享知识库。

配置与权限

配置完知识库后,您可以将设置多位管理员,对知识库进行日常管理,也可以将其分享给用户、AI助理服务或者Data Agent的实例,为Agent的Context提供知识推理能力。

配置管理

进入目标知识库,在详情页顶部单击配置管理,可以修改基础信息、管理员和分享范围。配置管理仅在当前用户至少具备一种配置权限时可用,可见的配置栏目由权限决定,不保证所有用户都能看到全部栏目。

  1. 基础信息

    修改知识库名称、类型和描述,保存规则与新建知识库一致。保存期间关闭操作可能被限制,以避免丢失结果。

  2. 管理员配置

    通过管理员配置可以为知识库添加协同维护的租户用户。管理员可协同维护知识库,但删除和清空知识库仍仅限所有者。操作步骤:

    1. 输入姓名或账号搜索同租户用户。

    2. 选择用户并确认添加,新管理员会出现在管理员列表中,列表同时显示所有者。

    3. 需要撤销权限时,单击移除并二次确认。移除后,该用户会立即失去知识库管理权限。所有者不可被移除。

  3. 分享配置

    分享配置仅在知识库类型和当前用户权限允许时出现,用于将知识库授权给其他对象使用。支持授权的对象类型:用户、Data Agent 实例、AI 助理服务实例。

    1. 切换授权对象类型:用户Data AgentAI 助理服务

    2. 按名称或 ID 搜索目标对象。

    3. 选择对象并确认授权,已授权对象会显示在已授权列表中。

    4. 如需撤销授权,单击移除并确认。

    分享授权允许目标对象使用该知识库进行知识搜索,不等同于授予知识库管理权限。

角色权限

操作

所有者

管理员

企业知识库普通成员

仅获分享授权的对象

查看和检索知识

支持

支持

支持

仅支持检索

修改知识库配置

支持

支持

不支持

不支持

配置和执行构建

支持

支持

不支持

不支持

上传和删除业务文档

支持

支持

不支持

不支持

管理员和分享授权

支持

支持

不支持

不支持

清空知识库语义数据

支持

不支持

不支持

不支持

删除知识库实例

支持

不支持

不支持

不支持

内容语言说明

知识库内容支持简体中文和英文。一个知识库只维护一种内容语言。

  • 首次构建时,系统根据当前 DataWorks 页面右上角的中英语言设置,确定知识库的内容语言。[需要确认:语言在首次构建时锁定且不可修改的规则是否不变]

  • 语言确定后,后续各类构建均沿用该语言。切换页面语言只改变控制台界面,不会改变已有知识的语言。

  • 当前不支持直接修改已有知识库的内容语言。如需使用另一种语言,请新建知识库,并在目标页面语言下发起首次构建。

  • 物理表名、字段名、SQL、代码、ID、原始标签和引用证据不会被翻译,因此英文知识库中仍可能包含源数据自带的中文。

本地知识库(AI 助理服务存量用户)

知识库已从 AI 助理服务中抽离为独立模块。对于 AI 助理服务的存量用户,此前在 AI 助理服务中创建的知识库将作为本地知识库继续在界面中展示,不影响原有使用。在 AI 助理服务中嵌入知识库模块时,本地知识库会显示在知识库列表的个人知识库分区,单击可跳转至 AI 助理服务的知识库管理页面。

  • 本地知识库支持的操作:已有的本地知识库功能保持可用,支持再次生成、导出和清空。

  • 与知识库模块的区别

    对比项

    本地知识库(存量)

    知识库模块

    入口

    AI 助理服务实例详情页的知识库页签

    控制台左侧导航栏的知识库

    能否新建

    新建的 AI 助理服务不再生成

    支持新建

    归属关系

    归属于单个 AI 助理服务实例

    独立实例,可被多个智能应用复用

    知识库类型

    不区分类型

    支持个人知识库和企业知识库

    共享方式

    仅当前实例内使用

    支持通过分享授权给用户、Data Agent 或 AI 助理服务

  • 与新建 AI 助理服务的差异:新建的 AI 助理服务不再生成本地知识库,即不再支持在 AI 助理服务中创建知识库。如需创建新的知识库,请在知识库模块中统一创建和管理,并按需在 AI 助理服务或 Data Agent 中使用。

常见问题

  • Q:为什么来源管理或知识构建不可点击?

    A:当前用户可能只有只读或分享使用权限。请联系知识库所有者或管理员确认权限。

  • Q:为什么配置管理中看不到全部栏目?

    A:系统只展示当前用户有权维护的栏目。例如,能够编辑基础信息不一定代表能够管理分享范围。

  • Q:为什么构建页面没有可选工作空间或数据源?

    A:该来源尚未加入知识库。请在来源管理中添加后返回,页面会刷新可选范围。

  • Q:为什么删除任务失败?

    A:任务可能仍在运行、处于删除中,或被其他任务依赖。先终止活动实例并解除依赖,再重试删除。

  • Q:为什么在 AI 助理服务中无法创建知识库?

    A:知识库已抽离为独立模块统一管理,新建的 AI 助理服务不再生成本地知识库。请在知识库模块中创建知识库,创建后可在 AI 助理服务和 Data Agent 中使用。

  • Q:存量的本地知识库还能继续使用吗?

    A:可以。存量用户此前在 AI 助理服务中创建的知识库将作为本地知识库继续在界面中展示,并支持再次生成、导出和清空,不影响原有使用。

  • Q:管理员和分享授权有什么区别?

    A:管理员可以配置、上传和构建知识库;通过分享获得授权的用户、Data Agent 或 AI 助理服务只能使用知识进行搜索或问答,不能修改知识库。

使用建议

  • 首次构建前先规划来源范围,避免把不相关的工作空间纳入扫描。

  • 为知识库设置明确的负责人,并配置备用管理员。

  • 对语义质量要求高的知识库开启数据探查,并留意 SQL 采样和 Token 消耗。

  • 构建成功后同时检查运行实例、知识图谱覆盖率和知识搜索结果,三者共同验证可用性。

  • 语义模型的未发布版本不会自动替代当前发布版本,审核后再发布。

  • 停用任务用于暂停后续触发;删除任务用于移除定义,两者不要混用。

  • 完善源表和字段注释、数据标准、负责人、血缘和质量规则,提高自动构建质量;对核心指标、敏感字段和关键查询进行人工确认。

  • 定期清理过期资料和测试资产,减少搜索噪声。

  • 遵循最小权限原则,不再需要访问知识库时及时移除授权。