すべてのプロダクト
Search
ドキュメントセンター

DataWorks:DataWorks と EMR Serverless StarRocks の連携

最終更新日:Aug 25, 2026

DataWorks は StarRocks データソースを介して EMR Serverless StarRocks に接続し、単一のプラットフォームから StarRocks データの統合、開発、分析、サービス提供が可能です。

背景情報

EMR Serverless StarRocks

StarRocks は、高速で統一された分析エクスペリエンスを提供する、次世代の超並列処理 (MPP) データベースです。

EMR Serverless StarRocks は、Alibaba Cloud 上のオープンソース StarRocks 向けのフルマネージドサービスで、StarRocks インスタンスとデータの作成・管理ができます。MySQL プロトコルと互換性があり、StarRocks は多次元分析、データレイク分析、高同時実行クエリ、リアルタイムデータ分析のための高性能な OLAP 機能を提供します。

重要
  • データ開発 (DataStudio) (新版) パブリックプレビューへの参加 を使用するワークスペースでは、E-MapReduce (EMR) Serverless StarRocks コンピューティングリソースをバインドすると、同じ名前のデータソースが自動的に生成されます。このトピックのデータソース作成手順はスキップできます。

  • データ開発 (DataStudio) (新版) パブリックプレビューへの参加 をしないワークスペースでは、DataWorks で StarRocks を使用するには、このトピックで説明されているように StarRocks データソースを作成する必要があります。

EMR Serverless StarRocks 上の DataWorks

DataWorks はデータソースを介して EMR Serverless StarRocks に接続し、StarRocks エンジンを活用してデータ統合、定期的なジョブスケジューリング、インタラクティブ分析、API 生成を行うことができます。

クリックして、DataWorks の主要コンポーネントの基本概念と概要を表示

次の表に、EMR Serverless StarRocks で使用される主な DataWorks のコンポーネントと概念を説明します。

概念/コンポーネント

説明

リファレンス

リソースグループ

タスクを実行するには、DataWorks のリソースグループが必要です。

データソース

StarRocks データソースは、タスクを開発・実行するために、DataWorks を EMR Serverless StarRocks に接続するものです。DataWorks で StarRocks を使用する前に、このデータソースを作成する必要があります。

詳細については、「StarRocks データソース」をご参照ください。

Data Integration

Data Integration は、複数のシナリオにわたり、さまざまなデータソース間のデータ同期を実現します。

詳細については、「Data Integration」をご参照ください。

データ開発とオペレーションセンター

データ開発 と オペレーションセンター は連携して動作します。データ開発でタスクを開発・デバッグし、オペレーションセンターに送信・デプロイして定期的に実行します。

データ分析

データ分析では、オンラインでデータのクエリ、分析、編集、共有ができます。

データ分析

DataService Studio

DataService Studio は、データ API を構築するためのプラットフォームです。個人、チーム、企業にデータサービスと共有機能を提供し、内部および外部の API サービスを⼀元的に管理できます。

DataService Studio

データマップ

データマップは、メタデータに基づいて構築されたエンタープライズデータカタログです。グローバルなデータ検索、メタデータの詳細、データプレビュー、データリネージ、データカテゴリ管理を提供し、データの発見、理解、活用を支援します。

データマップの概要

前提条件

  • リソースグループを購入し、ワークスペースのバインドとネットワーク設定を完了していること。詳細については、「リソースグループ管理」をご参照ください。

  • EMR Serverless StarRocks インスタンスを作成済みであること。詳細については、「オールインワンインスタンスのクイックスタート」をご参照ください。

    説明

    インスタンスを作成した後、EMR コンソールでその詳細を表示し、EMR StarRocks Manager を介して接続してデータベースとテーブルを表示できます。

  • DataWorks リソースグループの IP アドレスを EMR Serverless StarRocks インスタンスのホワイトリストに追加済みであること。

    EMR Serverless StarRocks インスタンスのホワイトリストは、以下の方法で設定できます。

    EMR Serverless StarRocks インスタンスの [インスタンス詳細] ページで、[セキュリティグループ ID] の右側にある [内部ホワイトリスト] をクリックして、内部ネットワークのホワイトリストを設定します。[FE 詳細] セクションで、[パブリックエンドポイント] の右側にある [パブリックホワイトリスト] をクリックして、パブリックホワイトリストを設定します。

データソースの作成

DataWorks で EMR Serverless StarRocks を使用するには、まず EMR Serverless StarRocks データベースに接続する StarRocks データソースを作成します。これにより、すべての DataWorks コンポーネントで StarRocks が有効になります。

重要
  • データ開発 (DataStudio) (新版) パブリックプレビューへの参加 のワークスペースでは、EMR Serverless StarRocks コンピューティングリソースをバインドすると、同じ名前のデータソースが自動的に生成されます。このトピックのデータソース作成手順はスキップできます。

  • データ開発 (DataStudio) (新版) パブリックプレビューへの参加 を使用しないワークスペースでは、DataWorks で StarRocks を使用するには、このトピックで説明されているように StarRocks データソースを作成する必要があります。

詳細については、「StarRocks データソース」をご参照ください。アクセス方法と主要な設定パラメーターについては、以下の手順で説明します。

  1. [データソース] ページに移動します。

    1. DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、[Management Center] をクリックします。 表示されるページで、ドロップダウンリストから目的のワークスペースを選択し、[管理センターに移動] をクリックします。

    2. 表示されるページの左側のナビゲーションウィンドウで、[データソース] をクリックします。 [データソース] ページが表示されます。

    1. Log on to the DataWorks console. In the target region, click その他 > 管理センター in the left-side navigation pane. Select a workspace from the drop-down list and click [移動] [管理センター].

    2. On the Workspace Management page, click [Data Sources] in the left-side navigation pane to open the data source page.

  2. データソースの作成 をクリックします。次のセクションで説明するように、主要なパラメーターを設定します。他のパラメーターはデフォルト値のままにしておくことができます。

    StarRocks インスタンスと DataWorks リソースグループ間のネットワーク接続に基づいて、適切な方法を選択してデータソースを作成します。ネットワーク接続ソリューションの詳細については、「ネットワーク接続ソリューションの概要」をご参照ください。

    内部ネットワーク

    パラメーター

    説明

    [設定モード]

    ApsaraDB RDS を選択します。

    [所属 Alibaba Cloud アカウント]

    • EMR Serverless StarRocks インスタンスと DataWorks が同じアカウントに属する場合は、現在の Alibaba Cloud アカウント を選択します。

    • EMR Serverless StarRocks インスタンスが別の Alibaba Cloud アカウントに属する場合は、その他の Alibaba Cloud アカウント を選択します。その他の Alibaba Cloud アカウント を選択した後、相手側 Alibaba Cloud アカウントの UID と 相手方 RAM ロール も設定する必要があります。他のアカウントの RAM ロールの設定に関する詳細については、「クロスアカウント認証 (RDS、Hive、または Kafka)」をご参照ください。

    [リージョン]

    EMR Serverless StarRocks インスタンスが存在するリージョンを選択します。

    [インスタンス]

    対象の [Serverless] StarRocks インスタンスを選択します。

    [データベース名]

    接続するデータベースの名前です。この名前は、EMR StarRocks Manager を使用してインスタンスに接続した後、[メタデータ管理] で確認できます。

    [ユーザー名]/[パスワード]

    インスタンスのユーザー名とパスワードです。

    StarRocks インスタンスを作成すると、デフォルトの admin ユーザーが作成されます。パスワードは、インスタンス作成時に指定したものです。

    [接続設定]

    データソースと選択したリソースグループ間の接続性をテストします。ステータスが 接続可能 であれば、接続は成功です。

    パブリックネットワーク

    パラメーター

    説明

    [設定モード]

    パブリック IP あり を選択します。

    [ホストアドレス/IP]

    EMR Serverless StarRocks インスタンス内の FE の パブリックアドレス です。

    パブリックエンドポイントは fe-c-<instance-id>.starrocks.aliyuncs.com 形式で、HTTP ポートは 8030 です。[パブリックホワイトリスト] をクリックしてアクセスホワイトリストを設定するか、[パブリックアクセスを無効にする] をクリックしてパブリックアクセスを無効にすることができます。

    [ポート]

    EMR Serverless StarRocks インスタンス内の FE の [クエリポート] です。デフォルト値は 9030 です。

    [URL の読み込み]

    StreamLoad で使用する StarRocks FE ノードのアドレスです。複数のアドレスはカンマで区切り、FE public endpoint:FE HTTP port の形式で指定します。

    [データベース名]

    接続するデータベースの名前です。この名前は、EMR StarRocks Manager を使用してインスタンスに接続した後、[メタデータ管理] で確認できます。

    [ユーザー名]/[パスワード]

    インスタンスのユーザー名とパスワードです。

    StarRocks インスタンスを作成すると、デフォルトの admin ユーザーが作成されます。パスワードは、インスタンス作成時に指定したものです。

    [接続設定]

    データソースと選択したリソースグループ間の接続性をテストします。ステータスが 接続可能 であれば、接続は成功です。

Data Integration

DataWorks は、MySQL、Hive、Kafka、OSS、HDFS などのさまざまなソースから EMR Serverless StarRocks テーブルへのデータ同期をサポートしています。次の例では、MySQL から StarRocks テーブルにデータをバッチ同期する方法を説明します。

説明

StarRocks データソースの同期タスクの設定方法の詳細については、「StarRocks データソース」をご参照ください。

  1. DataStudioページに移動します。

    DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、[データモデリングと開発] > [DataStudio] を選択します。 表示されるページで、ドロップダウンリストから目的のワークスペースを選択し、[DataStudioに移動] をクリックします。

  2. バッチ同期ノードを作成します。データソースを MySQL に設定し、宛先を StarRocks データソースに設定します。

    左側のナビゲーションツリーで、[Data Integration] を展開し、[新しいノード] > [バッチ同期] を選択します。[ネットワークとリソース設定] の手順で、リソースグループを選択し、ソースと宛先の両方で [接続性をテスト] をクリックして、両方が [接続済み] であることを確認します。

  3. リソースグループを選択した後、ソースと宛先のデータソースへの接続性をテストします。

  4. スケジューリング周期を設定し、ノードを送信してデプロイし、定期的に実行します。

    ノードをデバッグした後、右側のペインで スケジューリング設定 をクリックして、スケジューリング周期や再実行ポリシーなどのスケジューリングパラメーターを設定し、タスクのリソースグループを設定します。設定が完了したら、コミット と 発行 をクリックします。

データ開発とスケジューリング

EMR Serverless StarRocks タスクを定期的にスケジューリングするには、Data Studio で StarRocks ノードを作成し、そこで SQL を記述し、StarRocks データソースに接続し、スケジューリングを設定します。主要な手順は次のとおりです。

  1. DataStudioページに移動します。

    DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、[データモデリングと開発] > [DataStudio] を選択します。 表示されるページで、ドロップダウンリストから目的のワークスペースを選択し、[DataStudioに移動] をクリックします。

  2. Data Studio で StarRocks ノードを作成し、接続済みの StarRocks データソースを選択して、SQL タスクを記述します。

    ビジネスフロー内のデータベースノードを右クリックし、[新規ノード] > [StarRocks] を選択します。表示された SQL エディターで、対応するデータソースを選択して SQL 文を記述します。例: SELECT * FROM testdb.testtb;。

  3. Data Studio で EMR Serverless StarRocks SQL タスクをデバッグするには、デバッグする SQL ステートメントを選択し、実行ボタンをクリックして、テスト実行用のリソースグループを選択します。

  4. スケジューリング周期を設定し、ノードを送信してデプロイし、定期的に実行します。

    ノードをデバッグした後、右側のペインで スケジューリング設定 をクリックして、スケジューリング周期や再実行ポリシーなどのスケジューリングパラメーターを設定し、タスクのリソースグループを設定します。設定が完了したら、コミット と 発行 をクリックします。

データ分析

データ分析を使用して、EMR Serverless StarRocks テーブルのデータを迅速にクエリおよび分析します。主要な手順は次のとおりです。

  1. [SQLクエリ] ページに移動します。

    DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、[DataAnalysis] > [SQLクエリ] を選択します。 表示されるページで、ドロップダウンリストから目的のワークスペースを選択し、[SQLクエリに移動] をクリックします。

  2. 左側のペインで image アイコンをクリックし、その他 > システム管理 をクリックして システム管理 ページに移動し、StarRocks のクエリリソースグループを、タスクで使用するリソースグループに設定します。

    [SQL クエリ] > [リソースグループ] セクションでは、[StarRocks] エンジンはデフォルトで [パブリックスケジューリングリソースグループ] を使用します。これを対象のリソースグループに変更し、[保存] をクリックします。

  3. SQL クエリページに戻ります。右上隅で、エンジンタイプを StarRocks に切り替え、データソースを選択します。これで、クエリを記述して実行し、EMR Serverless StarRocks でデータ分析を実行できます。

    右側の設定パネルで、[ワークスペース] も選択し、[OK] をクリックする必要があります。

DataService Studio

DataService Studio は、StarRocks データソースからの API 生成をサポートしています。主要な手順は次のとおりです。

  1. DataService Studioページに移動します。

    DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、[DataService Studio] をクリックします。 表示されるページで、ドロップダウンリストから目的のワークスペースを選択し、[DataService Studioに移動] をクリックします。

  2. API を生成し、そのパラメーターを設定します。

    DataService Studio は、ウィザードモードとスクリプトモードの両方をサポートしています。スクリプトモードでは、SQL クエリに基づいて API リクエストとレスポンスのパラメーターを自動生成できます。以下の手順では、ウィザードモードの使用方法を説明します。

    左側のナビゲーションツリーで、目的のビジネスフロー配下の [API] ノードを展開し、右クリックして [新しい API] > [API を生成] を選択し、ウィザードモードの設定ページに移動します。

    データソースタイプを StarRocks に設定し、作成した StarRocks データソースを選択し、対応するテーブルを選択してから、ページ上のプロンプトに従って API リクエストパラメーター、レスポンスパラメーター、およびその他の設定を行います。

  3. 右側のペインで [サービスリソースグループ] をクリックし、リソースグループをデータサービス専用のリソースグループに設定します。

    [専用サービスリソースグループ] ドロップダウンリストで、test などの対象のリソースグループを選択し、[API Gateway インスタンスタイプ] を [共有インスタンス] に、[タイムアウト] を 30000 ms に、[リクエストあたりの最大データ行数] を 10000 に設定します。

  4. API のテストに成功したら、送信して公開します。

データマップ

データマップは、StarRocks データのメタデータ収集、検索、およびテーブル詳細の表示をサポートしています。

メタデータ収集

  1. [データマップ] ページに移動します。

    DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、[データガバナンス] > [データマップ] を選択します。 表示されるページで、[データマップに移動] をクリックします。

  2. 左側メニューで image アイコンをクリックし、StarRocks モジュールの右上隅にある 管理 をクリックします。

  3. 未収集リスト タブに切り替え、操作 列の メタデータ取得 をクリックします。

  4. リソースグループ名 を設定し、接続性のテスト をパスし、[収集スケジュール] を設定したら、[確認] をクリックしてメタデータ収集設定を完了します。

    説明
    • メタデータ収集の詳細については、「メタデータ収集」をご参照ください。

    • このタスクは Serverless リソースグループでのみ実行できます。

検索

  1. [データマップ] ページに移動します。

    DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、[データガバナンス] > [データマップ] を選択します。 表示されるページで、[データマップに移動] をクリックします。

  2. 左側メニューで image アイコンをクリックし、データソースとして StarRocks を選択し、上部の検索バーを使用してテーブルを検索します。

    説明

    検索機能の詳細については、「メタデータ検索」をご参照ください。

テーブル詳細

  1. [データマップ] ページに移動します。

    DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、[データガバナンス] > [データマップ] を選択します。 表示されるページで、[データマップに移動] をクリックします。

  2. データマップのホームページまたは検索結果で対象のテーブルを見つけ、テーブル名をクリックしてテーブル詳細ページに移動します。

  3. テーブル詳細ページでは、テーブルの基本情報、[技術情報]、ビジネス情報、明細情報、出力情報、データリネージ情報 などの情報を表示できます。

    説明
    • テーブル詳細の詳細については、「メタデータ検索」をご参照ください。

    • バージョン 3.1.13、および 3.2.9 以降の EMR Serverless StarRocks クラスターは、メタデータとデータリネージ分析をサポートしています。この機能の設定方法の詳細については、「データリネージの表示」をご参照ください。

    テーブル詳細ページには、[使用ガイド] タブも含まれています。[詳細] タブには、[フィールド情報] と [変更履歴] の 2 つのサブタブがあります。[フィールド情報] テーブルには、各フィールドの名前、データ型、および説明が表示されます。