すべてのプロダクト
Search
ドキュメントセンター

DataWorks:データ処理の設定

最終更新日:Aug 18, 2026

DataWorks のバッチ同期タスクのデータ処理機能は、同期パイプライン内で直接データのクリーニング、AI 処理、ベクトル化を行い、ETL アーキテクチャを簡素化します。

制限事項

  • 新バージョンの Data Studio が有効になっているワークスペースでのみ使用できます。

  • サーバーレスリソースグループのみをサポートします。

  • 現在、一部のシングルテーブルバッチ同期チャネルでのみ有効です。

  • データ処理を有効にすると、追加のコンピューティングリソース (CU) を消費します。リソースクォータを監視してください。

設定へのアクセス

  1. バッチ同期タスクの設定ページで、データ処理セクションまでスクロールします。

  2. デフォルトでは、この機能は無効になっています。スイッチをオンにして、データ処理モジュールを有効にします。

機能

データ処理を有効にすると、以下の処理ルールを 1 つ以上追加できます。

1. 文字列置換

異なる列に対して置換ルールを定義し、列の値を標準化またはクリーニングします。

ウィザードモードの設定

データ処理一覧 で、[+]ノードの追加 ボタンをクリックし、文字列の置き換え を選択して置換ルールを追加します。以下の表では、パラメーターについて説明します。

パラメータ

説明

[名前]

置換ルールのカスタム名。

[説明]

(オプション) ルールの目的の説明。

[列名]

+ルールの作成 ボタンをクリックして列ルールを追加し、ソーステーブルの列のドロップダウンリストからこのルールを適用する列を選択します。

[置換する文字列]

置換元の文字列を入力します。

[置き換え]

置換後の文字列を入力します。

.* (正規表現マッチング)

置換する文字列のパターンで正規表現を有効にします。

Aa (大文字と小文字を区別する)

置換時の検索で大文字と小文字を区別するかどうかを制御します。デフォルトでは、検索は大文字と小文字を区別しません。

異なる列に対して複数のルールを追加できます。たとえば、gender 列で 'Male' を '1' に置換するルールを 1 つ作成し、status 列で 'active' を 'valid' に置換する別のルールを作成できます。

出力データのプレビュー

  1. ルールを設定した後、データ処理セクションの右上にある [出力データのプレビュー] をクリックします。

  2. 表示されるダイアログで、[入力データ] を設定します。次の 2 つの方法を使用できます。

    • [自動取得]:システムが上流ノードの出力からデータを自動的に取得します。[上流出力を再取得] をクリックしてデータを更新します。

    • [手動構築]:[+データを手動で構築] をクリックして、データ行の各列にカスタム値を入力するか、特定の境界条件 (NULL や空文字列など) をテストします。

  3. [プレビュー結果] セクションで [プレビュー] ボタンをクリックします。

  4. システムは設定されたすべての処理ルールを実行し、結果を表示します。期待値と比較してルールを検証します。

プレビュー結果はデバッグと参考のためのものです。最終的な結果は実際のタスク実行によって決まります。

スクリプトモードの設定

スクリプトモードでデータ処理を有効にするには、JSON スクリプトの steps モジュールに "category": "map", "stepType": "stringreplace" を含む JSONObject を追加します。一般的なスクリプトモードの設定プロセスについては、「スクリプトモードの設定」をご参照ください。

{
  "category": "map",
  "stepType": "stringreplace",
  "parameter": {
    "condition": [
      {
        "name": "<処理する列名>",
        "replaceString": "<置換する文字列>",
        "replaceByString": "<新しい置換文字列>",
        "useRegex": false,
        "caseSensitive": false
      }
    ]
  },
  "displayName": "<ルール名>",
  "description": "<ルールの説明>"
}

2. AI 支援処理

組み込みの大規模言語モデル (LLM) を使用して、列のコンテンツを処理および拡充します。

主なユースケース:

  • コンテンツの要約:製品レビューやニュース記事など、大量のテキストから重要な要約を抽出します。

  • 情報抽出:非構造化テキストから名前、住所、連絡先情報などの重要な情報を抽出します。

  • テキスト翻訳:列のコンテンツを指定された言語に翻訳します。

  • 感情分析:テキストの感情 (ポジティブ、ネガティブ、ニュートラルなど) を判定します。

設定と使用方法:
ノードの追加 をクリックし、AI 支援による処理を選択します。 詳細な設定手順と典型的な使用例については、「AI 支援による処理」をご参照ください。















3. データベクトル化

埋め込みモデルを使用して、テキストやその他のデータを高次元ベクトルに変換します。これらのベクトルは、検索拡張生成 (RAG)、セマンティック検索、推薦システムなどの AI アプリケーション向けのセマンティック情報を保持します。

主なユースケース:

  • ナレッジベースの構築:ドキュメント、チケット、製品マニュアルなどのテキストデータをベクトル化し、ベクトルデータベースに保存して、LLM の外部ナレッジベースとして機能させます。

  • パーソナライズされた推薦:ユーザーとアイテムのベクトル表現に基づいて類似性を計算し、精度の高い推薦を実現します。

設定と使用方法:
ノードの追加 をクリックし、[データベクトル化] を選択してから、処理対象の列と使用する埋め込みモデルを選択します。詳細な設定手順と実践的な例については、「ベクトル化」をご参照ください。















関連ドキュメント