エージェントは、自然言語対話と大規模言語モデルを使用して、データ統合、データ開発、データガバナンスのタスクを実行します。要件から結果までのワークフローを自動化し、データワークフローの合理化を支援します。
エージェントの概要
エージェントは DataWorks に組み込まれています。サードパーティクライアントに基づくエージェントとは異なり、追加のソフトウェアをインストールしたり、複雑な設定を行ったりすることなく、DataWorks モジュール内で直接使用できます。
エージェントは、「要件を記述すれば、結果が得られる」 という対話モデルに従います。自然言語で要件を記述すると、エージェントが対応するコードと設定を生成します。エージェントのワークフローは次のとおりです。
アクセス
DataWorks コンソールにログインします。 左側のナビゲーションペインで、データ開発と О&М > データ開発へ を選択します。 ワークスペースを選択して DataStudio に移動します。
クイックスタート
ステップ 1: エージェントチャットを開き、エージェントモードに切り替える
DataStudio ページで、トップナビゲーションバーの右上隅にある
アイコンをクリックして Data Agent Chat を開きます。ダイアログボックスの左下隅で、エージェント モードに切り替えます。
ステップ 2: エージェントの選択
入力ボックスに / と入力してエージェントメニューを開き、タスクに適したエージェントを選択します。使用可能なエージェントタイプは、Data Integration エージェント、データマップ エージェント、データ開発エージェント、データガバナンスエージェント、および データ管理エージェント です。
対応する製品モジュールでは、DataWorks は一致するエージェントを自動的に使用します。手動で選択する必要はありません。
ステップ 3: コンテキストの追加 (オプション)
ダイアログボックスで @ と入力するか、右下隅にある @ アイコンをクリックして、コンテキストを選択して追加します。コンテキストは、エージェントに、より豊富な背景情報を提供します。
サポートされているコンテキストタイプは次のとおりです。
テーブル:1 つ以上のテーブルのメタデータを参照します。
ノード/コードファイル:特定のノード内のコードを参照します。
データコレクション:データマップからデータコレクションを参照します。
ルール:現在の会話に 1 つ以上のルールを一時的に適用します。
ローカルファイル:ローカルドキュメントをアップロードして、背景情報を提供します。
ステップ 4: 大規模言語モデルの切り替え (オプション)
デフォルトでは、エージェントは Auto モードを使用します。このモードでは、エージェントはタスクシナリオに基づいてインテリジェントなモデルスケジューリングを行い、複数のモデル間のシームレスな切り替えをサポートします。詳細については、「サポートされているモデル」をご参照ください。
ダイアログボックスの下部にある
アイコンをクリックして、特定のモデルを選択することもできます。
ステップ 5: 対話の開始
ダイアログボックスにリクエストを入力します。エージェントが目的の結果を生成するまで、フォローアップの質問をしたり、詳細を追加したりするなど、複数回の対話を通じて意図を絞り込むことができます。
ユースケース
エージェントは、データ統合、データ開発、データガバナンス、データマップ、データ運用保守にわたるユースケースをカバーしています。次の表では、適切なエージェントを選択するのに役立つように、各シナリオと代表的なタスクについて説明します。
| エージェントのシナリオ | 説明 | 代表的なタスク |
| データ統合 | データ同期の要件を自然言語で記述します。システムはセマンティクスを解析し、ソースと宛先のデータソース、テーブルスキーママッピング、フィールドフィルター、パーティション分割戦略、スケジューリングパラメーターなど、対応するタスク設定を生成します。 | 異種データソース間のオフラインまたはリアルタイム同期タスクの作成 |
| データ開発 | 要件分析、コード生成、ワークフロー作成、デプロイをカバーする自然言語ベースの ETL 開発。 | 生成されたコードと設定された依存関係を使用してデータ処理ワークフローを構築 |
| データ運用保守 | タスクインスタンスのヘルス評価と問題診断。依存関係チェーン、リソースレベル、過去の実行傾向、変更の影響、ログの異常、Data Quality などの多次元分析を組み合わせて、構造化された診断レポートを生成します。 | 失敗したタスクインスタンスの診断と診断レポートの生成 |
| データマップ | 大規模なデータセットにわたるメタデータを探索するための AI を活用した自然言語対話。 | ビジネスの意図によるテーブルの検索とデータリネージの探索 |
| データガバナンス | DataWorks のデータガバナンスエージェントは、企業がプロアクティブなデータガバナンスから自律的なデータガバナンスへと移行するのを支援します。複雑な分析や広範なフォーム設定を行う代わりに、自然言語でコマンドを発行します。エージェントはこれらのコマンドを正確なガバナンスアクションに変換し、自動的に実行します。 | 品質監視ルールの設定と品質問題の修正 |
ユースケース 1 - データ統合エージェント
説明:中国語や英語などの自然言語でデータ同期要件を記述できます。システムはセマンティクスを自動的に解析し、対応するデータ同期タスク設定を生成します。これには、ソースと宛先のデータソース、テーブルスキーママッピング、フィールドフィルタリング条件、パーティショニング戦略、スケジューリングパラメーターが含まれます。
手順:
ダイアログボックスで、
/を入力し、Data Integration エージェント を選択します。ソース、宛先、テーブル名、同期方法など、データ同期の要件を記述してください。 例:「MySQL テーブル
ods_user_info_dを MaxCompute テーブルods_user_info_dに同期するオフライン同期タスクを作成する。」エージェントは要件を解析し、データソースやテーブルマッピングなどの情報を自動的に入力して、同期ノードを作成します。
ノードが作成された後、必要に応じて確認および変更します。
ユースケース 2 - データ開発エージェント
説明:要件分析、コード生成からワークフローの作成、デプロイまでの全プロセスに対応した、自然言語ベースの ETL 開発エクスペリエンスを提供します。
手順:
自然言語でデータ開発の要件を記述し、必要に応じてコンテキストを追加します。例:「ユーザープロファイル分析ワークフローを構築します。」
エージェントはタスクをノードの作成、コードの生成、依存関係の設定などの複数のステップに分割し、実行します。
生成されたノードコードについては、変更を確認し、保持するか破棄するかを選択します。
ユースケース 3 - データ運用保守エージェント
説明:タスクインスタンスの包括的なヘルス評価と問題診断を提供します。依存関係チェーン、リソースレベル、過去の実行傾向、変更の影響、ログの異常、Data Quality などの多次元分析を統合し、構造化された診断レポートを自動的に生成します。
データ運用保守エージェントの詳細については、「データ運用保守エージェント」をご参照ください。
ユースケース 4 - データマップエージェント
説明:データの検索と理解の効率を向上させます。AI を活用した自然言語対話を通じて、大規模なデータセットのさまざまなシナリオにわたるメタデータを迅速に探索できます。
コア機能:
自然言語検索:自然言語で質問することで、正確なキーワードを必要とせずに、ビジネスの意図に基づいてターゲットデータをすばやく見つけることができます。例:「ユーザーアクティビティに関連する集計テーブルを検索します。」
自動スコープ調整:会話でスコープを指定すると、エージェントが自動的にセマンティクスを理解し、そのスコープ内のデータをすばやく見つけます。例:「adm_bi プロジェクトで、事業運営に関連するテーブルを検索します。」
詳細なデータ理解:ターゲットデータに関するフォローアップの質問をすることで、データリネージ、所有者、フィールド定義などの詳細をすばやく取得できます。例:「@dws_bi_metric_di テーブルの直接的な下流の依存関係は何ですか?その変更によって誰が影響を受けますか?」
ユースケース 5 - データガバナンスエージェント
説明:DataWorks のデータガバナンスエージェントは、企業がプロアクティブなデータガバナンスから自律的なデータガバナンスへと移行するのを支援します。複雑な分析や広範なフォーム設定を行う代わりに、自然言語でコマンドを発行します。エージェントはこれらのコマンドを正確なガバナンスアクションに変換し、専門家レベルの設定を適用して、自動的に実行します。
コア機能:
品質ルールの設定:自然言語を使用して、指定された主要なテーブルの品質監視ルールの設定に役立ちます。データガバナンスエージェントは、指定されたテーブルのフィールドタイプ、ビジネスセマンティクス、重要性を分析して、主キーの一意性、非 NULL 制約、列挙値の範囲チェックなど、適切な監視ルールを自動的に推奨および設定します。このプロセスにより、広範なデータ探索と手動でのルール設定の必要がなくなります。
例:コアユーザーディメンションテーブル
*dim_user_info*のクオリティルールを自動的に生成します。例: 次で始まるテーブル
*ods_*の場合、テーブルの行数に関連する品質ルールを自動的に設定します。
品質問題のガバナンス:「品質ルールがない頻繁にアクセスされるテーブル」や「品質ルールがない高優先度のベースラインタスクによって生成されたテーブル」など、データ資産ガバナンスモジュールでシステムが自動的に特定した品質問題について、自然言語でガバナンス要件を提供できます。その後、システムは問題を自動的に分析して修正します。
例:品質ルールがない頻繁にアクセスされるテーブルを検索し、推奨し、設定します。
例:品質ディメンションの問題解決を支援してください。
主な機能
ストレージ管理
DataStudio エージェントは、プロジェクトディレクトリまたは個人ディレクトリのいずれかにノードとファイルを作成できます。正確なストレージ管理を確実にするには:
ストレージ場所の設定: Data Agent 設定センターで、Agent が生成するコードファイルのデフォルトの保存先を設定します。詳細については、「ストレージ設定」をご参照ください。
競合解決メカニズム:生成されたノードタイプが現在のディレクトリのルールと一致しない場合 (たとえば、個人ディレクトリにデータ統合ノードの作成を要求した場合) 、エージェントは確認プロンプトをトリガーし、ユーザーの確認後に続行します。
複雑なタスクの処理
ロジックが複雑な開発要件に対して、エージェントはライフサイクル全体を通じてステータスフィードバックを提供します。
To-do リスト:エージェントは複雑なタスクを複数の子ステップに分割し、To-do リストとして表示します。実行が進むにつれて、各項目のステータスは自動的に更新されます。
実行サマリー:ワークフローの最後に、エージェントはタスク全体のサマリーレポートを作成して出力します。このレポートには完了した操作と生成されたリソースがまとめられており、レビュープロセスがより効率的になります。
トークンとパフォーマンス統計
タスクが完了すると、エージェントは実行効率とモデルコールの規模を評価するのに役立つ定量的メトリックを提供します。
タスク期間の統計:システムは、現在のタスクの開始から終了までの合計時間を自動的に記録および表示し、自動化されたプロセスの効率を評価できるようにします。
トークン消費量:
をクリックして、対話中に生成された [入力トークン] と [出力トークン] の数を確認します。
インテリジェントなモデルスケジューリング
エージェントのインテリジェントなモデル割り当てメカニズムは、意図に基づいた開発エクスペリエンスを生み出すため、基盤となるモデルを選択する必要はもうありません。
自動モデル割り当て (Auto モード):デフォルトでは、エージェントは Auto モードで動作します。このモードでは、エージェントは開発の意図を特定して分解し、最適なモデルを自動的に割り当てて、さまざまなサブタスクを処理します。
動的なマルチモデル連携 (Auto モード):Auto モードでは、エージェントはさまざまなモデル間を連携させることができます。タスクのリアルタイムのニーズに基づいて、エージェントは 1 回の会話内で複数のモデルを柔軟に切り替え、複雑なタスクの各部分に最適なモデルが割り当てられるようにします。
手動モデル切り替え:Auto モードから切り替えて、特定のシナリオのタスク処理に別のモデルを指定できます。
参考資料
カスタムエージェント機能については、「サードパーティクライアントベースのエージェント」をご参照ください。