DataWorks のバッチ同期タスクのデータ処理機能は、同期パイプライン内で直接データのクリーニング、AI 処理、ベクトル化を行い、ETL アーキテクチャを簡素化します。
制限事項
-
新バージョンの Data Studio が有効になっているワークスペースでのみ使用できます。
-
サーバーレスリソースグループのみをサポートします。
-
現在、一部のシングルテーブルバッチ同期チャネルでのみ有効です。
-
データ処理を有効にすると、追加のコンピューティングリソース (CU) を消費します。リソースクォータを監視してください。
設定へのアクセス
-
バッチ同期タスクの設定ページで、データ処理セクションまでスクロールします。
-
デフォルトでは、この機能は無効になっています。スイッチをオンにして、データ処理モジュールを有効にします。
機能
データ処理を有効にすると、以下の処理ルールを 1 つ以上追加できます。
1. 文字列置換
異なる列に対して置換ルールを定義し、列の値を標準化またはクリーニングします。
ウィザードモードの設定
データ処理一覧 で、[+]ノードの追加 ボタンをクリックし、文字列の置き換え を選択して置換ルールを追加します。以下の表では、パラメーターについて説明します。
|
パラメータ |
説明 |
|
[名前] |
置換ルールのカスタム名。 |
|
[説明] |
(オプション) ルールの目的の説明。 |
|
[列名] |
+ルールの作成 ボタンをクリックして列ルールを追加し、ソーステーブルの列のドロップダウンリストからこのルールを適用する列を選択します。 |
|
[置換する文字列] |
置換元の文字列を入力します。 |
|
[置き換え] |
置換後の文字列を入力します。 |
|
|
置換する文字列のパターンで正規表現を有効にします。 |
|
|
置換時の検索で大文字と小文字を区別するかどうかを制御します。デフォルトでは、検索は大文字と小文字を区別しません。 |
異なる列に対して複数のルールを追加できます。たとえば、gender 列で 'Male' を '1' に置換するルールを 1 つ作成し、status 列で 'active' を 'valid' に置換する別のルールを作成できます。
出力データのプレビュー
-
ルールを設定した後、データ処理セクションの右上にある [出力データのプレビュー] をクリックします。
-
表示されるダイアログで、[入力データ] を設定します。次の 2 つの方法を使用できます。
-
[自動取得]:システムが上流ノードの出力からデータを自動的に取得します。[上流出力を再取得] をクリックしてデータを更新します。
-
[手動構築]:[+データを手動で構築] をクリックして、データ行の各列にカスタム値を入力するか、特定の境界条件 (
NULLや空文字列など) をテストします。
-
-
[プレビュー結果] セクションで [プレビュー] ボタンをクリックします。
-
システムは設定されたすべての処理ルールを実行し、結果を表示します。期待値と比較してルールを検証します。
プレビュー結果はデバッグと参考のためのものです。最終的な結果は実際のタスク実行によって決まります。
スクリプトモードの設定
スクリプトモードでデータ処理を有効にするには、JSON スクリプトの steps モジュールに "category": "map", "stepType": "stringreplace" を含む JSONObject を追加します。一般的なスクリプトモードの設定プロセスについては、「スクリプトモードの設定」をご参照ください。
{
"category": "map",
"stepType": "stringreplace",
"parameter": {
"condition": [
{
"name": "<処理する列名>",
"replaceString": "<置換する文字列>",
"replaceByString": "<新しい置換文字列>",
"useRegex": false,
"caseSensitive": false
}
]
},
"displayName": "<ルール名>",
"description": "<ルールの説明>"
}
2. AI 支援処理
組み込みの大規模言語モデル (LLM) を使用して、列のコンテンツを処理および拡充します。
主なユースケース:
-
コンテンツの要約:製品レビューやニュース記事など、大量のテキストから重要な要約を抽出します。
-
情報抽出:非構造化テキストから名前、住所、連絡先情報などの重要な情報を抽出します。
-
テキスト翻訳:列のコンテンツを指定された言語に翻訳します。
-
感情分析:テキストの感情 (ポジティブ、ネガティブ、ニュートラルなど) を判定します。
設定と使用方法:
ノードの追加 をクリックし、AI 支援による処理を選択します。 詳細な設定手順と典型的な使用例については、「AI 支援による処理」をご参照ください。
3. データベクトル化
埋め込みモデルを使用して、テキストやその他のデータを高次元ベクトルに変換します。これらのベクトルは、検索拡張生成 (RAG)、セマンティック検索、推薦システムなどの AI アプリケーション向けのセマンティック情報を保持します。
主なユースケース:
-
ナレッジベースの構築:ドキュメント、チケット、製品マニュアルなどのテキストデータをベクトル化し、ベクトルデータベースに保存して、LLM の外部ナレッジベースとして機能させます。
-
パーソナライズされた推薦:ユーザーとアイテムのベクトル表現に基づいて類似性を計算し、精度の高い推薦を実現します。
設定と使用方法:
ノードの追加 をクリックし、[データベクトル化] を選択してから、処理対象の列と使用する埋め込みモデルを選択します。詳細な設定手順と実践的な例については、「ベクトル化」をご参照ください。