すべてのプロダクト
Search
ドキュメントセンター

DataWorks:PAI Flow ノード

最終更新日:Jul 18, 2026

PAI Flow は、エンドツーエンドの機械学習ワークフロー開発を実現します。Platform for AI (PAI) の ビジュアルモデリング Designer と同じ機能を提供し、定期的なスケジューリングもサポートします。

使用制限

  • 製品の制限:

    • PAI Flow は DataWorks ワークスペース (新バージョン) のみをサポートします。

    • PAI Flow は現在、Source/Target ノードおよび RAG データ処理 ノードのみをサポートします。

    • PAI Flow は Serverless リソースグループ のみをサポートします。

  • リージョンの制限: サポートされるリージョンは、中国 (杭州)、中国 (上海)、中国 (北京)、中国 (ウランチャブ)、中国 (深セン)、中国 (香港)、シンガポール、インドネシア (ジャカルタ)、日本 (東京)、ドイツ (フランクフルト)、米国 (シリコンバレー)、および米国 (バージニア) です。

前提条件

[DataWorks Data Studio (new version) ワークスペース] と [Platform for AI (PAI) ワークスペース] を作成済みです。

  • ワークスペースを作成する 際には、PAI アルゴリズムタスクのスケジューリング を選択してください。これにより、DataWorks ワークスペースと同じ名前の Platform for AI (PAI) ワークスペースが自動的に作成され、バインドされます。

  • 既存のワークスペースについては、PAI アルゴリズムタスクのスケジューリング を 管理センター で有効にする必要があります。この操作により、DataWorks ワークスペースと同じ名前の Platform for AI (PAI) ワークスペースも作成されます。

PAI Flow の作成

  1. DataWorks コンソールにログインします。対象のリージョンで、左側のナビゲーションウィンドウの データ開発と О&М > データ開発 をクリックします。ドロップダウンリストからワークスペースを選択し、移動 データ開発 をクリックします。

  2. Data Studio のプロジェクトディレクトリで、image アイコンをクリックし、ノードの作成 > アルゴリズム > PAI Flow を選択します。これにより、PAI Flow ノードが作成され、オーケストレーションページに移動します。

PAI Flow の開発

PAI Flow は、ワークフロー設計用のさまざまなビジュアルモデリングノードをサポートします。

  1. PAI Flow のオーケストレーションページで、左側のペインからノードをキャンバスにドラッグし、接続してワークフローを設計します。

  2. ワークフローの設計が完了したら、ノードをクリックして右側のパネルで設定を行います。

    ノードタイプ

    ノード

    ノードの説明

    Source/Target

    Read table

    MaxCompute テーブルからデータを読み取ります。デフォルトでは、現在のプロジェクトのテーブルデータを読み取ります。

    Read OSS Data

    OSS Bucket パスからファイルまたはフォルダを読み取ります。

    Read CSV file

    CSV ファイルを OSS、HTTP、および HDFS から読み取ります。

    Write table

    入力データを MaxCompute に書き込みます。

    RAG データ処理

    RAG Text Parsing and Chunking

    入力ディレクトリからテキストファイル(HTML、PDF、Markdown、Text など)を読み取り、指定されたブロックサイズを超えない連続したテキストブロックを生成し、指定された出力パスに JSONline 形式で保存します。

    RAG Vector Generation

    指定されたディレクトリから解析・チャンキング済みのすべてのドキュメントファイル(JSONline 形式)を読み込み、Embedding モデルを使用してテキストベクターを生成します。

    RAG Knowledge Base Index Synchronization

    入力データを対象のナレッジベースインデックスに同期します。

    説明

    ファイルパスを設定する際には、パス内に 変数 を含めることができます。例:https://examplebucket.oss-cn-hangzhou.aliyuncs.com/${variable}/example.csv。変数を設定する際には、スケジューリングパラメーター を変数として使用することで、定期的なスケジューリング時に異なるストレージパスから読み取りまたは書き込みを行うことができます。

  3. ノードの開発が完了したら、オーケストレーションページの右側ツールバーで PAI Flow の スケジューリング設定 を行い、本番環境にデプロイ後に PAI Flow が定期的にスケジュールされるようにしてください。

    説明

    スケジューリング設定を行う際、スケジュールリソースグループは Serverless リソースグループ のみをサポートします。

PAI Flow の公開

PAI Flow のデバッグおよびスケジューリング設定が完了したら、PAI Flow ワークフローを公開します。その後、ワークフローは設定されたスケジュールに基づいて定期的に実行されます。

  1. 上部ツールバーの 保存 をクリックして、PAI Flow を保存します。

  2. 変更内容を保存したら、上部ツールバーの image ボタンをクリックしてデプロイメントパネル(タスクのデプロイメント)を開きます。次に、本番リリースの開始 をクリックします。これにより、デプロイメントチェックプロセスに基づいてタスクがデプロイされます。

その他の操作

PAI Flow を公開後、公開パネルの 運用保守へ をクリックして 定期実行タスク ページに移動し、スケジューリングおよび実行ステータスを確認できます。

説明

DAG グラフでは、PAI Flow を開いた後でのみ内部タスクを表示できます。