すべてのプロダクト
Search
ドキュメントセンター

DataWorks:ナレッジベースの作成

最終更新日:Sep 21, 2026

Context Graph (ナレッジベース) は、DataWorks におけるナレッジの一元管理を行う独立したモジュールです。データのセマンティクスを自動的に検出し、複数のソースからのビジネスナレッジを統合し、統一的で管理可能なナレッジネットワークを構築します。ナレッジベースを作成した後、ワークスペース、データソース、アップロードされたファイルからナレッジを構築し、管理者や共有権限を通じて使用範囲を制御できます。正常に構築されたナレッジベースは、AI Assistant や Data Agent で使用できます。

概要

Context Graph (ナレッジベース) は、DataWorks の統一ナレッジ管理モジュールです。Data Agent や AI Assistant などのインテリジェントアプリケーションに統一されたナレッジ基盤を提供します。ワークスペースのメタデータ、データソース、ビジネスドキュメントに散在する情報を、閲覧、検索、権限管理が可能なナレッジとして整理し、インテリジェントアプリケーションが Q&A、データ検索、分析の際に一貫したビジネスコンテキストを持つことを可能にします。

ナレッジベースは独立したインスタンスとして管理されます。単一のナレッジベースは、複数のインテリジェントアプリケーションで再利用でき、各アプリケーションで冗長な構築を行う必要はありません。

主な機能とユースケース

  • メタデータのナレッジ自動構築:DataWorks ワークスペースをスキャンし、テーブル、カラム、タスク、メトリック、リネージなどのメタデータに対して、ビジネスドメインとセマンティックナレッジを自動的に構築します。

  • 意味理解モデルの生成と管理:データソースに基づいて、ビジネスエンティティ、ディメンション、メトリック、およびそれらの関係を記述する意味理解モデルを生成し、ビジネス定義を統一します。

  • 複数ソースのビジネスドキュメント統合:ローカルファイルのアップロードや、DingTalk、Feishu、Lark、WeCom、Yuque からのオンラインドキュメントの同期をサポートし、ポリシー、製品マニュアル、データ辞書などの非構造化資料を統一検索に含めます。

  • 構造化されたナレッジの提示:大規模言語モデルを使用して、ナレッジをディレクトリ、トピック、ページを持つ Wiki に整理し、ビジネストピックごとの閲覧とナビゲーションを容易にします。各コンテンツは、そのソースと裏付けとなる証拠まで遡ることができます。

  • ナレッジ関係の探索:ナレッジオブジェクトとその関係を知識グラフで表示し、影響分析やメトリック定義の検証などのユースケースのために、ビジネス上の質問に関する推論パスと裏付けとなる証拠を提供します。

  • インテリジェントアプリケーションの強化:Data Agent と AI Assistant のナレッジ基盤として機能し、自然言語による Q&A、データ探索、コード生成の際に、ビジネス用語を理解し、より正確な応答を提供できるようにします。

  • 自動更新と統一された権限付与:定期的なビルドタスクを通じてナレッジの同期を保ち、詳細な権限付与を通じて使用範囲を制御します。

ナレッジビルドタスクが実行されると、システムはナレッジオブジェクト (意味理解モデルとビジネスドキュメント) を生成し、大規模言語モデルがさらにナレッジコンテンツを Wiki と知識グラフに整理します。ナレッジオブジェクトの表示、レビュー、公開方法については、「ナレッジオブジェクトの管理」をご参照ください。Wiki、知識グラフ、ナレッジ検索の使用方法については、「ナレッジベースの使用」をご参照ください。

AI Assistant および Data Agent との関係

Context Graph (ナレッジベース) は独立したモジュールです。DataWorks コンソールの左側のナビゲーションウィンドウでは、[Data Agent] および [AI Assistant] と同じレベルにあります。このモジュールでナレッジベースインスタンスを作成および管理します。Context Graph (ナレッジベース) で作成されたナレッジベースは、AI Assistant と Data Agent で使用できます。

以前に AI Assistant でナレッジベースを作成した場合、既存のナレッジベースはインターフェイスにローカルナレッジベースとして表示されます。新しく作成された AI Assistant サービスインスタンスでは、ローカルナレッジベースの作成はサポートされなくなりました。ナレッジベースを作成するには、Context Graph (ナレッジベース) に移動して一元的に作成および管理してください。詳細については、「ローカルナレッジベース (既存の AI Assistant ユーザー向け)」をご参照ください。

前提条件

ナレッジベースを使用する前に、以下の準備を完了してください:

  1. DataWorks が有効化されており、ナレッジベースを作成したいテナントに入っていること。

  2. ワークスペースのセマンティクスからナレッジを構築する場合、現在のアカウントが収集対象のワークスペースおよび関連するデータ資産に対する読み取り権限を持っていることを確認してください。

  3. ナレッジビルドタスクを実行するためのサーバーレスリソースグループとそれに関連するプロジェクトが準備されていること。選択したリソースグループは、ビルドに必要なデータソースまたはクラウドサービスへのネットワーク接続とアクセス権限を持ち、タスクのコンピュート CU 要件 (デフォルトで 4 CU) を満たすのに十分な利用可能容量がある必要があります。

基本概念

概念

説明

ナレッジベースのタイプ

  • 個人ナレッジベース: デフォルトでは、所有者のみが使用できます。所有者または管理者は、[共有] を使用して指定したユーザーにアクセス権を付与し、[管理者構成] を使用して管理者を追加できます。

  • エンタープライズナレッジベース: 同じ DataWorks テナント配下のすべてのメンバーがデフォルトでナレッジベースを閲覧および検索できます。管理は所有者と管理者のみが行えます。

ローカルナレッジベース

既存の AI Assistant ユーザーが以前に AI Assistant で作成したナレッジベースです。インターフェイスに引き続き表示され、再生成、エクスポート、クリアをサポートします。新しく作成された AI Assistant サービスインスタンスでは、ローカルナレッジベースは生成されなくなりました。

ソース管理

ナレッジビルドで利用可能なワークスペースとデータソースを構成します。

知識構築

ワークスペースのメタデータ、データソース、またはアップロードされたファイルを、閲覧および検索可能なナレッジに変換するプロセスです。

タスク定義

タスク名、ビルド範囲、トリガー方法、実行環境など、ビルドタスクの長期的な構成を記述します。

インスタンスの実行

タスク定義の実際の実行です。単一のタスク定義から複数の実行インスタンスが生成され、各インスタンスには独自の実行ステータスとログがあります。

セマンティックモデル

ビジネスエンティティ、ディメンション、メトリック、およびそれらの関係を構造化された方法で記述するモデルで、バージョン管理とデプロイメントをサポートします。

ビジネスドキュメント

ビジネス用語集、設計書、操作ガイドなど、ナレッジベースに含まれるビジネス資料です。ローカルファイルをアップロードするか、DingTalk、Feishu、Lark、WeCom、または Yuque からオンラインドキュメントを同期できます。ドキュメントは解析され、統一検索に含まれます。

Wiki

公開されたナレッジオブジェクトに基づいて大規模言語モデルによって生成されます。ナレッジコンテンツをディレクトリ、トピック、ページに整理し、簡単な閲覧とナビゲーションを可能にします。

ビジネスドメイン

ビジネストピックによって分類されたデータ資産のグループです。

セマンティックナレッジ

メタデータとビジネス資料から抽出・整理されたビジネス名、定義、関係、ヒントワード、同義語、クエリ例です。

ステップ 1:ナレッジベースの作成

  1. DataWorks コンソールにログインします。トップナビゲーションバーで、対象のリージョンに切り替えます。

  2. 左側のナビゲーションウィンドウで、[Context Graph] をクリックして、デフォルトでナレッジベースリストページに移動します。ナレッジベースリストページで、[ナレッジベースの作成] をクリックします。

  3. [ナレッジベースの作成] ダイアログで、ナレッジベースの情報を構成します。

    パラメーター

    説明

    名前

    必須。識別しやすい名前を入力します。名前は、前後のスペースを削除した後、最大 128 文字です。「小売業務ナレッジベース」など、ビジネス範囲を反映した名前を推奨します。

    タイプ

    必須。[個人] または [エンタープライズ] を選択します。個人ナレッジベースは作成者のみが閲覧および管理できます。エンタープライズナレッジベースは同じテナント内のすべてのユーザーが閲覧でき、権限を持つユーザーのみが管理できます。詳細については、「ナレッジベースのタイプとアクセス範囲」をご参照ください。

    説明

    任意。ナレッジベースのビジネス範囲、対象ユーザー、更新方法を記述します。説明は最大 1,024 文字です。

  4. [ナレッジベースの作成] をクリックします。ナレッジベースが作成された後、管理者を構成したり、テナント内の他のアカウントと共有したりできます。詳細については、「権限の管理」をご参照ください。

重要

ナレッジベースを削除すると、その中のすべてのナレッジも削除されます。慎重に操作してください。

ステップ 2:ソースの構成 (任意)

オンラインドキュメントへのアクセスには認証情報が必要なため、ドキュメントナレッジビルドタスクで使用する前に、まずソース管理でドキュメントソースとして構成する必要があります。サポートされているドキュメントソースには、DingTalk Docs、Feishu Docs、Lark Docs、WeCom Docs、Yuque Docs があります。

ソースを削除した後、新しいタスクではそのソースを選択できなくなりますが、以前のタスクで生成されたナレッジ結果は削除されません。

DingTalk Docs ソースの追加

前提条件:DingTalk 公式 MCP ポータルで接続を作成し、key パラメーターを含む完全な HTTPS URL を取得します。

  1. DataWorks のソース管理ページに移動し、[ソースの追加] をクリックします。

  2. ソースタイプを DingTalk Docs に設定します。

  3. 以下のパラメーターを設定します。

    • ソース名:最大 256 文字のカスタム名を入力します。

    • MCP 完全 URL:前提条件で取得した完全な HTTPS URL を貼り付けます。

  4. ドキュメント範囲を選択します:

    • マイドキュメント:現在のユーザーの個人ドキュメントを同期します。

    • 指定されたナレッジベース、ディレクトリ、またはドキュメント:同期範囲を指定されたリソースに限定します。

  5. [認証情報と範囲の検証] をクリックします。

    • 検証に失敗した場合は、認証情報、権限範囲、ドキュメントリンク、およびネットワークアクセス構成を確認してください。

  6. 検証が成功したら、[ソースの追加] をクリックします。

説明

  • サポートされているフォーマット:ネイティブの DingTalk ドキュメント (.adoc 拡張子を持つもの) のみが同期可能です。シート、多次元テーブル、マインドマップ、および独立してアップロードされたファイル (PDF や Word ドキュメントなど) は同期範囲に含まれません。

  • コンテンツ変換:同期中、ドキュメントの本文は Markdown 形式に変換されます。画像と添付ファイルはテキスト説明のみが保持されます。

  • 認証情報のセキュリティ:セキュリティ上の理由から、保存された MCP キーは編集ページに表示されません。ソースを編集する際に認証情報を変更する必要がない場合は、対応する入力フィールドを空のままにして既存の構成を保持してください。

Feishu ドキュメントの追加

前提条件:Feishu Open Platform でカスタムエンタープライズアプリケーションを作成または選択し、その App ID と App Secret を取得します。アプリケーションにボット機能を追加し、以下の読み取り専用権限を付与します:

  • wiki:wiki:readonly

  • docx:document:readonly

  • drive:drive:readonly

アプリケーションのバージョンを作成して公開します。同期したい各 Feishu Wiki スペースで、アプリケーションボットをメンバーとして追加し、「読み取り可能」権限を付与します。

操作手順

  1. DataWorks のソース管理ページに移動し、[ソースの追加] をクリックします。

  2. ソースタイプを Feishu ドキュメントに設定します。

  3. 以下のパラメーターを構成します:

    • ソース名:最大 256 文字のカスタム名。

    • App ID:前提条件で取得した App ID。

    • App Secret:前提条件で取得した App Secret。

  4. ドキュメント範囲を選択します:

    • すべての権限範囲:アプリケーションボットがアクセスできるすべての Wiki スペースを同期します。

    • 指定されたナレッジベース、ディレクトリ、またはドキュメント:同期範囲を正確に限定します。独立した Docx ドキュメントを同期するには、そのリンクを提供します。

  5. [認証情報と範囲の検証] をクリックします。

    • 検証に失敗した場合は、認証情報、権限範囲、ドキュメントリンク、およびネットワークアクセス構成を確認してください。

  6. 検証が成功したら、[ソースの追加] をクリックします。

説明

  • サポートされているフォーマット:Feishu Wiki のネイティブドキュメント (obj_type=docx の Wiki ノード) のみが同期可能です。

  • サポートされていないフォーマット:多次元テーブル (Bitable)、マインドマップ (Mindnote)、スプレッドシート (Sheets)、および直接アップロードされたファイル (PDF や Word ドキュメントなど) は同期範囲に含まれません。

  • 認証情報のセキュリティ:セキュリティ上の理由から、保存された App Secret は編集ページに表示されません。

  • 編集ルール:保存されたソースを編集する際、認証情報を変更する必要がない場合は、App Secret 入力フィールドを空のままにして既存の構成を保持します。App ID を変更する場合は、新しい App Secret も提供する必要があります。

Lark ドキュメントの追加

前提条件:Lark Open Platform でカスタムエンタープライズアプリケーションを作成または選択し、その App ID と App Secret を取得します。アプリケーションにボット機能を追加し、以下の読み取り専用権限を付与します:

  • wiki:wiki:readonly

  • docx:document:readonly

  • drive:drive:readonly

アプリケーションのバージョンを作成して公開します。同期したい各 Lark Wiki スペースで、アプリケーションボットをメンバーとして追加し、「読み取り可能」権限を付与します。

操作手順

  1. DataWorks のソース管理ページに移動し、[ソースの追加] をクリックします。

  2. ソースタイプを Lark ドキュメントに設定します。

  3. 以下のパラメーターを構成します:

    • ソース名:最大 256 文字のカスタム名。

    • App ID:前提条件で取得した App ID。

    • App Secret:前提条件で取得した App Secret。

  4. ドキュメント範囲を選択します:

    • すべての権限範囲:アプリケーションボットがアクセスできるすべての Lark Wiki スペースを同期します。

    • 指定された Wiki スペース:同期範囲を正確に限定します。Wiki スペースまたは設定ページのリンクのみがサポートされています。

  5. [認証情報と範囲の検証] をクリックします。検証に失敗した場合は、認証情報、権限範囲、ドキュメントリンク、およびネットワークアクセス構成を確認してください。

  6. 検証が成功したら、[ソースの追加] をクリックします。

説明

  • サポートされているフォーマット:Lark Wiki の Docx ドキュメント。同期中に Markdown 形式に変換されます。

  • サポートされていないフォーマット:Sheet、Base/Bitable、MindNote、および添付ファイルは同期範囲に含まれません。

  • 認証情報のセキュリティ:セキュリティ上の理由から、保存された App Secret は編集ページに表示されません。保存されたソースを編集する際に認証情報を変更しない場合は、App Secret フィールドを空のままにして元の構成を保持できます。App ID を変更する場合は、新しい App Secret も提供する必要があります。

WeCom ドキュメントの追加

前提条件:API モードで WeCom スマートボットを使用し、その Bot ID と Bot Secret を取得します。ボットを作成するには、以下の手順を実行します:

  1. 管理者アカウントまたはアプリケーション管理権限を持つアカウントを使用して、WeCom 管理コンソールにログインします。

  2. [管理ツール] > [スマートボット] に移動し、接続したいボットを作成または選択します。

  3. API モードを選択し、ボット名、アバター、可視範囲を構成して設定を保存します。

  4. ボットの権限構成で、ドキュメントと WeDrive に関連する権限を有効にします。

  5. ボットの詳細または開発構成ページで、Bot ID と Secret をコピーします。

操作手順

  1. DataWorks のソース管理ページに移動し、[ソースの追加] をクリックします。

  2. ソースタイプを WeCom ドキュメントに設定します。

  3. 以下のパラメーターを構成します:

    • ソース名:最大 256 文字のカスタム名。

    • Bot ID:前提条件で取得した Bot ID。

    • Bot Secret:前提条件で取得した Bot Secret。

  4. 同期したい共有スペースを選択します。スペース名を入力して検索するか、フィールドを空のままにしてすべてのスペースをクエリできます。ボットを共有スペースのメンバーとして追加する必要はありません。同期範囲は、ボットが実際に検索および読み取りできる共有スペースとドキュメントによって決まります。

  5. [認証情報と範囲の検証] をクリックします。検証に失敗した場合は、ボットの認証情報と権限を確認してください。

  6. 検証が成功したら、[ソースの追加] をクリックします。

説明

  • サポートされているフォーマット:WeCom Word、通常のスプレッドシート、スマートスプレッドシート。

  • 認証情報のセキュリティ:セキュリティ上の理由から、保存された Bot Secret は編集ページに表示されません。保存されたソースを編集する際に認証情報を変更しない場合は、Bot Secret フィールドを空のままにして元の構成を保持できます。Bot ID を変更する場合は、新しい Bot Secret も提供する必要があります。スペースを再クエリする際には Bot Secret が必要です。空のままにすると、現在選択されているスペースが保持されます。

  • Secret が漏洩、紛失、またはリセットされた場合は、新しい Secret を生成して再検証してください。

Yuque ドキュメントの追加

前提条件:同期したい各 Yuque チームに対して読み取り専用のトークンを作成し、チームに対応するスペースのホストをメモします。トークンを作成するには、以下の手順を実行します:

  1. Yuque チームを作成するか、既存の対象チームに移動します。

  2. チーム管理ページを開き、開発者セクションに移動して、[トークンの作成] を選択します。

  3. ドキュメントの読み取りとナレッジベースの読み取り権限のみを付与します。書き込みやメンバー管理の権限は付与しないでください。

  4. トークンをコピーし、チームの完全なスペースホストをメモします。トークンとホストはペアで構成する必要があります。

説明

チームの読み取り専用トークンを使用してください。本番データソースの認証情報として個人トークンを使用しないでください。

操作手順

  1. DataWorks のソース管理ページに移動し、[ソースの追加] をクリックします。

  2. ソースタイプを Yuque ドキュメントに設定します。

  3. ソース名 (最大 256 文字のカスタム名) を入力し、1〜32 の Yuque チームを構成します。各チームについて、以下の情報を指定します:

    • Yuque ホスト:チームのスペース URL (例:https://example.yuque.com)。

    • チーム読み取り専用トークン:前提条件でチーム用に作成された読み取り専用トークン。

  4. ドキュメント範囲を選択します:

    • すべてのチームナレッジベース:チーム配下のすべてのナレッジベースを同期します。

    • 指定されたナレッジベース:ナレッジベースの URL を指定して同期範囲を限定します (例:https://example.yuque.com/team/repository)。

  5. [認証情報と範囲の検証] をクリックします。検証結果は各チームごとに表示されます。

  6. 検証が成功したら、[ソースの追加] をクリックします。

説明

  • サポートされているフォーマット:Yuque ドキュメントと Yuque データテーブル。シートは同期範囲に含まれません。

  • 認証情報のセキュリティ:セキュリティ上の理由から、保存されたトークンは編集ページに表示されません。保存されたソースを編集する際に認証情報を変更しない場合は、トークンフィールドを空のままにして既存の構成を保持できます。

  • トークンが漏洩、失効、期限切れになった場合、またはホストが変更された場合は、一致する新しいトークンを作成して送信し、再検証してください。

ステップ 3:ナレッジのビルド

対象のナレッジベースに入った後、詳細ページの右上隅にある [ナレッジのビルド] をクリックし、ビルド方法を選択します。システムは 3 つのビルド方法を提供します:

  • ワークスペースセマンティックビルド:ワークスペースを選択して、ゼロからナレッジビルドタスクを作成します。

  • データソースセマンティックビルド:データソースを選択し、テーブルを指定して、詳細な制御でナレッジをビルドします。

  • ドキュメントナレッジビルド:DingTalk、Feishu、Lark、WeCom、Yuque からオンラインドキュメントを同期するか、ローカルファイルをアップロードして、ドキュメントベースのナレッジをビルドします。

3 つのビルド方法すべてで、[更新方法] で実行ポリシーを構成できます。[手動] を選択した場合、タスクは手動でトリガーされた場合にのみ実行されます。[定期的] を選択した場合、月次、週次、日次、または時間単位で実行サイクルと時間を設定でき、システムはタスクを自動的に実行します。

3 つのビルド方法すべてで、以下の実行環境パラメーターが必要です:

パラメーター

必須

説明

ランタイムワークスペース

はい

ビルドタスクが実行されるワークスペース。このパラメーターはタスクが実行される場所を定義し、分析対象のワークスペースとは異なる場合があります。

ランタイムリソースグループ

はい

ビルドタスクを実行するためのサーバーレスリソースグループを選択します。リソースグループが必要なデータソースと大規模言語モデルサービスへのネットワーク接続を持ち、指定されたコンピュート CU に十分な利用可能容量があることを確認してください。

コンピュート CU

いいえ

ビルドタスクに割り当てられる計算リソース。4〜16 CU を構成できます。デフォルト値は 4 です。テーブル数が 30,000 を超える場合は、CU 数を増やすことを推奨します。

リソースグループプロジェクト

はい

選択したリソースグループに関連付けられているプロジェクトを選択します。ナレッジビルドタスクは、リソースグループとその関連プロジェクトで実行されます。プロジェクトがリソースグループに関連付けられていることを確認してください。利用可能なオプションはページに表示されます。

大規模言語モデル

はい

セマンティックエンリッチメントまたはドキュメント解析に使用される大規模言語モデルを選択します。利用可能なモデルはページのリストに表示されます。モデルによって機能とトークン消費量が異なり、ナレッジビルドの品質とコストに直接影響します。

以下のセクションでは、3 つのビルド方法それぞれに固有のパラメーターについて説明します。

ワークスペースセマンティックビルド

構成済みのワークスペースから完全なスキャンと初期ビルドを実行するのに適しています。

パラメーター

必須

説明

タスク名

はい

このビルドタスクに一意で識別しやすい名前を指定して、後の管理を容易にします。最大:128 文字。

スキャン範囲

はい

DataWorks のワークスペースをナレッジソースとして選択します。システムはワークスペース内のタスクとテーブルを分析します。ワークスペースを選択すると、分析対象のタスクとテーブルの推定数がページに表示されます。

データプロファイリング

いいえ

トグルオプションです。ナレッジの品質を向上させるために、このオプションを有効にすることを強く推奨します。

  • 無効:基本的なメタデータ分析のみが実行されます。これには、メタデータスキーマの解析、データモデリング情報の統合、タスクコードとリネージの解析が含まれます。

  • 有効 (デフォルト):基本分析に加えて、詳細な分析が実行されます。これには以下が含まれます:

    • データサンプリングとプロファイリング統計:distinct/null 値の分布など、PII 識別の補助。

    • LLM ベースの詳細なセマンティックエンハンスメント:テーブル/カラムの説明の自動生成、データドメイン分類、派生メトリックの識別、同義語や用語集の集約など。

更新方法

はい

このセクションでは、タスクのトリガー方法を定義し、以下の構成が含まれます:

  • 実行ポリシー:タスクがどのようにトリガーされるかを定義します。

    • 手動:作成後、タスクは自動的に実行されません。ビルド管理で手動でトリガーする必要があります。

    • 定期的:指定した間隔と時刻にタスクが自動的に実行されます。

  • 実行間隔:実行ポリシーが「定期的」に設定されている場合に必須です。自動実行の頻度を指定します。オプション:月次、週次、日次、時間単位。

  • 実行時間:実行ポリシーが「定期的」に設定されている場合に必須です。実行間隔内の正確な開始時刻を指定します。

説明

  • ナレッジスキャンは、セマンティック分析のために大規模言語モデル (LLM) を呼び出し、トークンを消費します。実際のニーズに基づいてビルドタスクを開始してください。

  • ワークスペースセマンティックビルドを使用する場合、テーブルのメタデータ収集はデータソースタイプによって区別されません。選択したワークスペース内のほとんどのデータソースは、構造化されたナレッジに構築できます。

データソースセマンティックビルド

特定のデータソースに基づいてナレッジを構築し、テーブルを詳細に選択して意味理解モデルを生成するのに適しています。

パラメーター

必須

説明

タスク名

はい

ビルド管理でタスクを識別および検索するために使用されるカスタムタスク名。フォーマット:2〜64 文字、英字または数字で開始および終了。

ビジネス目標とフォーカス

はい

ビジネス目標と重点分野をビジネス言語で記述します。システムはこの情報を使用して、スキャン範囲とモデル出力を計画します。例:すべてのリージョンにわたる収益と更新メトリックを統一的に分析し、収益メトリックの定義の一貫性を確保する。

データ範囲

  1. 分析オブジェクトの選択:

    1. データソースタイプ:分析するデータソースエンジン (MaxCompute、Hologres、StarRocks、DLF など) を選択します。

    2. データソース:選択したタイプの下で構成済みのデータソースを選択します。オプションがない場合は、まず DataWorks でデータソースを構成してください。

  2. 実行環境と接続性の構成:

    1. ワークスペース:タスクが実行されるワークスペース。MaxCompute または DLF タイプが選択されている場合は、手動でワークスペースを選択する必要があります。Hologres または StarRocks タイプが選択されている場合は、選択したデータソースに基づいてワークスペースが自動的に決定され、手動選択は不要です。

    2. リソースグループ:タスク実行用のサーバーレスリソースグループを選択します。リソースグループがコンピュート CU 要件を満たすのに十分な利用可能容量があることを確認してください。

    3. 接続性テスト:リソースグループがデータソースにアクセスできることを保証するために、このテストに合格する必要があります。

  3. 分析範囲の定義:

    1. 分析範囲:プロジェクトまたはスキーマごとに分析範囲を選択します。選択した範囲内のテーブルのみが意味理解モデルの生成に参加します。

    2. シードテーブル:テーブル選択の開始テーブルを選択するか、スキーマテンプレートをシード入力としてインポートして、システムがどのテーブルから分析と拡張を開始するかを判断するのに役立てます。

メトリックのインポート

いいえ

固定の Excel テンプレートを使用してメトリック定義ファイルをインポートし、メトリック定義と依存カラムを補足することで、生成結果の精度を向上させます。インポート後、ページには検証済みのメトリック数が表示されます。タスク実行中、最終的なテーブル選択範囲が受け入れ結果を決定します。

設定

いいえ。すべてのオプションはデフォルトで選択されています。

データフィルタリングルールを構成します。これらのルールに一致するテーブルは分析から除外されます。すべてのルールはデフォルトで有効になっています。必要に応じてルールを無効にできます:

  • 一時テーブルを除外 (テーブル名に tmp、temp、bak、backup、old などの独立した用語が含まれるテーブル)。

  • バージョンコピーを除外 (テーブル名が _v の後に数字、_new、または _copy で終わるテーブル)。

  • テストテーブルを除外 (テーブル名に test、demo、sandbox、mock などの独立した用語が含まれるテーブル)。テスト環境のテーブルを除外 (カタログ、データベース、またはスキーマがテスト環境の識別子と一致する場合にテーブルを除外)。

  • テスト説明を持つテーブルを除外 (テーブルのコメントに testing、joint debugging、sample、sandbox などのキーワードが含まれるテーブル)。最新の定期テーブルのみを保持 (日付または期間の接尾辞を識別し、各テーブルファミリー内で名前のソートによって最新の名前を持つ 3 つのテーブルのみを保持)。

参照ファイル

いいえ

ローカルファイルをアップロードするか、URL をビジネス参照資料として追加して、セマンティック生成を支援し、システムがビジネスコンテキストを理解するのに役立てます。サポートされているファイル形式には、PDF、Word、Markdown、テキスト、YAML があります。

更新方法

はい

このセクションでは、タスクのトリガー方法を定義し、以下の設定が含まれます:

  • 実行ポリシー:タスクのトリガー方法を定義します。

    • 手動:作成後、タスクは自動的に実行されません。ビルド管理で手動でトリガーする必要があります。

    • 定期的:指定したスケジュールと時刻にタスクが自動的に実行されます。

  • 実行サイクル:実行ポリシーが「定期的」に設定されている場合に必須です。自動実行の頻度を指定します。オプション:月次、週次、日次、時間単位。

  • 実行時間:実行ポリシーが「定期的」に設定されている場合に必須です。各実行サイクル内の正確な開始時刻を指定します。

ドキュメントナレッジビルド

このオプションは、ドキュメントが主要なナレッジソースである場合に適しています。DingTalk、Feishu、Lark、WeCom、または Yuque からのオンラインドキュメント、およびローカルのビジネス資料をナレッジベースに含めることができます。タスクは、[ドキュメントソース]、[ビルド範囲]、[実行環境]、[更新方法] の 4 つのセクションで構成されます。

3 つのドキュメントソースオプションのいずれかを選択します:

  • ローカルアップロード:ファイルまたはフォルダをアップロードし、それらからナレッジを構築します。

  • DingTalk ドキュメント:ファイルをアップロードせずに、構成済みの DingTalk ソースを同期します。

  • Feishu ドキュメント:ファイルをアップロードせずに、構成済みの Feishu ソースを同期します。

オンラインドキュメントソースは、[ソース管理] で対応するプラットフォームソースが構成されている場合にのみ利用可能です。構成手順については、「ステップ 2:ドキュメントソースの構成」をご参照ください。

オンラインドキュメントソース (DingTalk、Feishu、Lark、WeCom、または Yuque) を選択する場合、[タスク名] を入力し、[ビルド範囲] セクションでドキュメントライブラリを選択します。同期範囲はソース管理のソース構成を継承するため、ここで再度指定する必要はありません。[同期後にナレッジをビルド] はデフォルトで有効になっており、同期完了後に自動的にナレッジを構築します。このオプションを無効にすると、ナレッジ構築なしでドキュメントのみが同期されます。

[ローカルアップロード] を選択した場合、[ビルド範囲] セクションでファイルをアップロードします。以下の表にパラメーターを説明します:

パラメーター

必須

説明

ファイルのアップロード

はい

これはナレッジビルドのコア入力です。ファイルやフォルダをドラッグアンドドロップするか、[ファイルのアップロード] または [フォルダのアップロード] をクリックしてアップロードできます。フォルダをアップロードすると、元のディレクトリ構造が保持されます。アップロード制限:

  • 数量:一度に最大 100 ファイルまでアップロードできます。

  • サイズ:各ファイルは 10 MB を超えることはできません。

  • フォーマット:ドキュメント、構造化データ、技術テキスト、画像の 4 つのカテゴリのファイルがサポートされています。詳細については、以下の表をご参照ください。圧縮ファイル (.zip, .rar) およびレガシー Office ファイル (.doc, .xls) はサポートされていません。複数のファイルを一括でアップロードするには、フォルダアップロード機能を使用してください。

アップロード後、システムはサポートされていないフォーマットのファイル、サイズ制限を超えるファイル、またはシステムファイルをファイルリストで自動的にマークまたは無視します。

ローカルファイルのアップロードでサポートされているファイル形式は次のとおりです:

ファイルカテゴリ

サポートされているフォーマット

ドキュメント

.md, .txt, .pdf, .docx, .xlsx, .pptx, .html, .htm

構造化データ

.csv, .tsv, .json, .jsonl, .yaml, .yml, .xml

技術テキスト

.sql, .log, .conf, .properties

画像

.png, .jpg, .jpeg, .gif, .bmp, .tif, .tiff, .webp

説明

アップロードされたファイルに画像が含まれている場合、ビルドにはマルチモーダル機能をサポートする大規模言語モデルを選択する必要があります。[要確認:現在マルチモーダル機能をサポートしているモデルのリスト]

ステップ 4:ビルド管理

ナレッジビルドを開始した後、ビルド管理でビルドタスクを表示できます。ナレッジベース詳細ページで、[ビルド管理] タブをクリックして、タスク定義と実行インスタンスを管理します。タスクが実行されるたびに、実行インスタンスが生成されます。

  • タスク定義

    各タスク定義には、タスク名、タスクタイプ、ビルド範囲、トリガー方法、実行用リソースグループ、タスクステータスが含まれます。タスク名で検索したり、タスクタイプ、トリガー方法、有効ステータスでフィルタリングしたり、タスク定義を更新したりできます。

    利用可能な操作:

    • 今すぐ実行:手動でビルドをトリガーします。

    • 編集:タスク名やトリガー方法などの構成を変更します。

    • 有効化 / 無効化:定期タスクの自動トリガーを制御します。

    • 削除:タスク定義を削除します。実行中のタスクは削除できません。

  • 実行インスタンス

    実行インスタンスには、各実行のタスク名、タイプ、トリガー方法、実行ステータス、開始時刻、および操作が表示されます。実行ステータス、タスクタイプ、トリガー方法でフィルタリングできます。ナレッジベースのアップグレードタスクも実行インスタンスリストに表示され、タスクタイプはバージョンアップグレードと表示されます。利用可能な操作:

    重要

    インスタンスの実行時間は、ビルドするナレッジコンテンツのサイズによって異なります。プロセスには時間がかかる場合があります。しばらくお待ちください。

    • 表示:実行インスタンスの詳細を開きます。

    • ソースファイル:このビルドで使用された入力ファイルを表示します。

    • キャンセル:まだ終了可能なインスタンスをキャンセルします。

    • リトライ:再実行が許可されている失敗または終了したインスタンスの実行を再開します。

  • 実行中のインスタンスの詳細

    実行中のインスタンスのステータスが「失敗」の場合、以下の手順を実行します:

    1. 問題の特定:実行中のインスタンスリストで、失敗したタスクの [表示] をクリックします。詳細ページで、実行グラフ内の赤色の失敗したステップを見つけます。

    2. ログの分析:失敗したステップのログを開き、以下の表を参照してエラーメッセージに基づいてトラブルシューティングを行います。

    3. 解決とリトライ:問題を修正した後、タスク定義ページに戻り、[今すぐ実行] をクリックします。

エラーカテゴリ

典型的なログの手がかり

アクション

ファイル形式

ログに、.doc、.xls、圧縮ファイル (.zip、.rar など) などの形式がサポートされていない、または単一ファイルが 10 MB の制限を超えていることが示されています。

ドキュメントナレッジビルドセクションのファイル形式リストを参照してください。ファイルをサポートされている形式に変換するか、大きすぎるファイルを分割してから、再度アップロードしてください。

リソースグループ

ログに、サーバーレスリソースグループが利用できない、クォータを超えている、またはプロジェクトに関連付けられていないことが示されています。

リソースグループのステータスと関連プロジェクトを確認してください。前提条件セクションを参照して、リソースグループの構成を検証してください。

ワークスペース権限

ログに、メタデータ、データ資産、またはワークスペースへのアクセスが拒否されたことが示されています。

ワークスペース管理者に連絡して、対象のワークスペースとデータ資産に対する必要な読み取り権限を付与してもらってください。

ネットワーク接続

ログに、データソースまたはクラウドサービスへのアクセス時にタイムアウトまたは接続失敗が示されています。

リソースグループが必要なデータソースとクラウドサービスにネットワーク経由で到達できるかどうかを確認してください。

ソースデータアクセス

ログに、ソーステーブルまたはソースアセットが存在しない、または空の結果を返すことが示されています。

ソースデータがまだ存在し、パスと認証情報が有効であることを確認してください。必要に応じて、収集範囲を狭めて再試行してください。

問題を修正した後、タスク定義で再度 [今すぐ実行] をクリックします。

ステップ 5:ナレッジベースの使用

ビルドタスクが成功すると、ナレッジベースが利用可能になります。以下の操作がサポートされています:

  • Wiki の閲覧、知識グラフと推論パスの表示。

  • 統一ナレッジ検索の使用。

  • Data Agent と AI Assistant でのナレッジベースの使用。

詳細については、「ナレッジベースの使用」をご参照ください。

ビルド中に生成された意味理解モデルとビジネスドキュメントは、ナレッジオブジェクトで表示、レビュー、デプロイできます。詳細については、「ナレッジオブジェクトの管理」をご参照ください。

アクセス制御

ナレッジベースの可用性は、そのタイプと権限付与のステータスに依存します。

  • エンタープライズナレッジベース:同じテナント内のすべてのメンバーが利用可能です。

  • 個人ナレッジベース:デフォルトでは所有者のみが利用可能です。他のユーザーやインテリジェントアプリケーションは、所有者または管理者による共有操作を通じてアクセス権を付与される必要があります。

  • アプリケーション権限の制限:Data Agent と AI Assistant はナレッジベースの管理者として設定できません。共有を通じてコンシューマーとしてのみ権限を付与できます。

ステップ 6:設定と権限の構成

ナレッジベースを構成した後、日常的な管理のために複数の管理者を割り当てることができます。また、ナレッジベースをユーザー、AI Assistant インスタンス、または Data Agent インスタンスと共有して、エージェントコンテキストにナレッジ推論機能を提供することもできます。

構成管理

対象のナレッジベースに移動し、詳細ページの上部にある [構成管理] をクリックして、基本情報、管理者、共有範囲を変更します。[構成管理] は、現在のユーザーが少なくとも 1 つの構成権限を持っている場合にのみ利用可能です。表示される構成セクションは権限によって決定され、すべてのユーザーがすべてのセクションを表示できるわけではありません。

  1. 基本情報

    ナレッジベースの名前、タイプ、説明を変更します。保存ルールはナレッジベース作成時と同じです。保存中にページを閉じると、結果が失われるのを避けるために制限される場合があります。

  2. 管理者設定

    [管理者設定] では、テナントユーザーをナレッジベースの共同メンテナーとして追加できます。管理者は共同でナレッジベースを維持できますが、ナレッジベースの削除またはクリアは所有者のみが行えます。手順:

    1. 名前またはアカウントを入力して、同じテナント内のユーザーを検索します。

    2. ユーザーを選択し、追加を確認します。新しい管理者は管理者リストに表示され、所有者も表示されます。

    3. 権限を取り消すには、[削除] をクリックして確認します。削除後、ユーザーは直ちにナレッジベースの管理権限を失います。所有者は削除できません。

  3. 共有設定

    [共有設定] は、ナレッジベースのタイプと現在のユーザーの権限が許可する場合にのみ表示されます。このセクションは、ナレッジベースへのアクセスを他のオブジェクトに付与するために使用されます。サポートされているオブジェクトタイプ:ユーザー、Data Agent インスタンス、AI Assistant サービスインスタンス。

    1. 権限付与オブジェクトタイプを切り替えます:[ユーザー]、[Data Agent]、または [AI Assistant サービス]。

    2. 名前または ID で対象のオブジェクトを検索します。

    3. オブジェクトを選択し、権限付与を確認します。権限が付与されたオブジェクトは [権限付与済み] リストに表示されます。

    4. アクセスを取り消すには、[削除] をクリックして確認します。

    共有による権限付与は、対象オブジェクトがナレッジベースをナレッジ検索に使用できるようにするものであり、ナレッジベースの管理権限を付与するものではありません。

ロール権限

操作

所有者

管理者

エンタープライズナレッジベースの一般メンバー

共有権限のみを持つオブジェクト

ナレッジの表示と検索

サポート

サポート

サポート

検索のみ

ナレッジベース構成の変更

サポート

サポート

非サポート

非サポート

ビルドの構成と実行

サポート

サポート

非サポート

非サポート

ビジネスドキュメントのアップロードと削除

サポート

サポート

非サポート

非サポート

管理者と共有権限の付与

サポート

サポート

非サポート

非サポート

ナレッジベースのセマンティックデータのクリア

サポート

非サポート

非サポート

非サポート

ナレッジベースインスタンスの削除

サポート

非サポート

非サポート

非サポート

コンテンツ言語

ナレッジベースのコンテンツは、簡体字中国語と英語をサポートしています。各ナレッジベースは 1 つのコンテンツ言語のみを維持します。

  • 最初のビルド時に、システムは DataWorks コンソールの右上隅の言語設定に基づいてナレッジベースのコンテンツ言語を決定します。[要確認:最初のビルドで言語がロックされ、変更できないというルールが変更されていないかどうか]

  • 言語が決定された後、後続のすべてのビルドは同じ言語を使用します。コンソール言語を切り替えても、コンソールインターフェイスが変更されるだけで、既存のナレッジの言語は変更されません。

  • 既存のナレッジベースのコンテンツ言語を直接変更することはサポートされていません。異なる言語を使用するには、ナレッジベースを作成し、対象のページ言語で最初のビルドを開始します。

  • 物理的なテーブル名、カラム名、SQL ステートメント、コード、ID、元のタグ、参照証拠は翻訳されません。したがって、英語のナレッジベースには、ソースデータからの中国語の文字が含まれる場合があります。

レガシーナレッジベースのアップグレード

Wiki と知識グラフを使用する前に、レガシーナレッジベースをアップグレードする必要があります。アップグレードは、ナレッジベースの所有者または管理者が開始できます。一般メンバーはナレッジベースを表示し、利用可能な機能を使用できますが、アップグレードは実行できません。

  1. ナレッジベースリストを開き、[アップグレード可能] とマークされたレガシーナレッジベースを見つけて、そのマークをクリックします。

  2. アップグレードの説明を読み、アップグレードに使用するリソースグループとリソースグループプロジェクトを選択します。

  3. [アップグレードの確認] をクリックします。アップグレードタスクが作成された後、[ビルド管理] の [実行中のインスタンス] で進捗と結果を表示できます。タスクタイプはバージョンアップグレードと表示されます。

説明

アップグレードは、現在のナレッジベースのすべてのベースラインデータに基づいて Wiki と知識グラフを生成し、少量のトークン消費が発生します。アップグレード中は他のナレッジビルドタスクを開始しないでください。ビルドタスクが現在実行中の場合は、それをキャンセルするか、終了するのを待ってからページを更新してアップグレードを開始してください。アップグレードは履歴ナレッジソースを削除しません。アップグレードに失敗しても、既存のナレッジベースデータや通常の使用には影響しません。既存の AI Assistant ユーザー向けのローカルナレッジベースについては、「ローカルナレッジベース (既存の AI Assistant ユーザー向け)」をご参照ください。

ローカルナレッジベース (既存の AI Assistant ユーザー向け)

ナレッジベースは、AI Assistant から独立したモジュールとして分離されました。既存の AI Assistant ユーザーの場合、以前に AI Assistant で作成されたナレッジベースは、インターフェイスにローカルナレッジベースとして表示され、引き続き使用可能です。ナレッジベースモジュールが AI Assistant に埋め込まれている場合、ローカルナレッジベースはナレッジベースリストの個人ナレッジベースセクションに表示されます。ローカルナレッジベースをクリックすると、AI Assistant のナレッジベース管理ページに移動できます。

  • ローカルナレッジベースでサポートされる操作:再生成、エクスポート、クリアなど、既存のローカルナレッジベースの機能は引き続き利用可能です。

  • ナレッジベースモジュールとの違い

    項目

    ローカルナレッジベース (レガシー)

    ナレッジベースモジュール

    エントリ

    AI Assistant インスタンス詳細ページの [ナレッジベース] タブ

    コンソールの左側ナビゲーションウィンドウの [ナレッジベース]

    作成がサポートされているか

    新しく作成された AI Assistant サービスインスタンスでは、ローカルナレッジベースは生成されなくなりました。

    サポート

    所有権

    単一の AI Assistant サービスインスタンスに属する

    複数のインテリジェントアプリケーションで再利用できる独立したインスタンス

    ナレッジベースのタイプ

    タイプの区別なし

    個人ナレッジベースとエンタープライズナレッジベースをサポート

    共有方法

    現在のインスタンス内でのみ使用

    [共有] を通じてユーザー、Data Agent、または AI Assistant サービスへのアクセス権付与をサポート

  • 新しく作成された AI Assistant サービスインスタンスとの違い:新しく作成された AI Assistant サービスインスタンスでは、ローカルナレッジベースは生成されなくなりました。つまり、AI Assistant サービス内でナレッジベースを作成することはできなくなりました。ナレッジベースを作成するには、Context Graph (ナレッジベース) モジュールに移動して一元的に作成および管理し、必要に応じて AI Assistant サービスまたは Data Agent で使用します。既存のナレッジベースで Wiki と知識グラフを使用するには、「既存のナレッジベースのアップグレード」をご参照ください。

よくある質問

  • Q:ソース管理またはナレッジビルドのボタンがクリックできないのはなぜですか?

    A:ご利用のアカウントには読み取り専用または共有使用権限しかない可能性があります。ナレッジベースの所有者または管理者に連絡して、権限を確認してください。

  • Q:構成管理ですべてのセクションが表示されないのはなぜですか?

    A:システムは、管理権限を持つセクションのみを表示します。たとえば、基本情報を編集する権限があっても、必ずしも共有範囲を管理できるとは限りません。

  • Q:ビルドページに利用可能なワークスペースやデータソースがないのはなぜですか?

    A:ソースがナレッジベースに追加されていません。まずソース管理で追加してから、ページに戻ってください。利用可能なオプションが更新されます。

  • Q:DingTalk または Lark のソース検証が失敗した場合はどうすればよいですか?

    A:アプリケーションの認証情報、読み取り専用権限、ドキュメントのメンバー権限、ドキュメント範囲、およびリソースグループのネットワークアクセス構成を確認してください。これらの設定を確認した後、[再検証] をクリックしてください。

  • Q:ナレッジベースがアップグレードできない場合はどうすればよいですか?

    A:[アップグレード可能] タグが表示されない場合、ナレッジベースはすでにアップグレードされているか、ご利用のアカウントが所有者または管理者ではないか、ナレッジベースのバージョン情報が一時的に利用できない可能性があります。リストを更新し、アカウントの権限を確認してください。タグが表示されていてもアップグレードを送信できない場合、通常は同じナレッジベースでビルドタスクが実行中です。タスクをキャンセルするか、終了するのを待ってから、ページを手動で更新して再試行してください。アップグレードに失敗しても、既存のナレッジベースデータや通常の使用には影響しません。

  • Q:タスクの削除が失敗するのはなぜですか?

    A:タスクがまだ実行中であるか、削除処理中であるか、他のタスクに依存している可能性があります。アクティブなインスタンスを終了し、依存関係を削除してから、削除を再試行してください。

  • Q:AI Assistant サービスでナレッジベースを作成できないのはなぜですか?

    A:ナレッジベースは、一元管理のために独立したモジュールに分離されました。新しく作成された AI Assistant サービスインスタンスでは、ローカルナレッジベースは生成されなくなりました。Context Graph (ナレッジベース) モジュールでナレッジベースを作成してください。作成後、AI Assistant サービスと Data Agent で使用できます。

  • Q:既存のローカルナレッジベースはまだ使用できますか?

    A:はい。既存のユーザーが以前に AI Assistant サービスで作成したナレッジベースは、インターフェイスにローカルナレッジベースとして表示されます。元の使用に影響を与えることなく、再生成、エクスポート、クリアが可能です。

  • Q:管理者と共有権限の違いは何ですか?

    A:管理者は、ナレッジベースの構成、アップロード、ビルドができます。[共有] を通じてアクセス権を付与されたユーザー、Data Agent インスタンス、または AI Assistant サービスインスタンスは、ナレッジを検索または Q&A に使用することしかできず、ナレッジベースを変更することはできません。

推奨事項

  • 最初のビルドの前にソース範囲を計画し、無関係なワークスペースのスキャンを避けてください。

  • ナレッジベースに明確な所有者を割り当て、バックアップ管理者を構成してください。

  • 高いセマンティック品質が必要なナレッジベースでは、データプロファイリングを有効にし、SQL サンプリングとトークン消費を監視してください。

  • ビルドが成功した後、実行中のインスタンス、知識グラフのカバレッジ、ナレッジ検索の結果を合わせて確認し、ユーザビリティを検証してください。

  • 未公開バージョンの意味理解モデルは、現在デプロイされているバージョンを自動的に置き換えません。デプロイする前にレビューしてください。

  • タスクを無効にすると後続のトリガーが一時停止され、タスクを削除するとタスク定義が削除されます。2 つの操作を混同しないでください。

  • ソーステーブルとカラムのコメント、データ標準、所有者、リネージ、データ品質ルールを充実させて、自動ビルドの品質を向上させてください。コアメトリック、機密カラム、主要なクエリは手動でレビューしてください。

  • 期限切れの資料やテストアセットを定期的にクリーンアップして、検索ノイズを減らしてください。

  • 最小権限の原則に従い、ユーザーがナレッジベースにアクセスする必要がなくなった場合は、速やかにアクセス権を取り消してください。