DataWorks は StarRocks データソースを介して EMR Serverless StarRocks に接続し、単一のプラットフォームから StarRocks データの統合、開発、分析、サービス提供が可能です。
背景情報
EMR Serverless StarRocks
StarRocks は、高速で統一された分析エクスペリエンスを提供する、次世代の超並列処理 (MPP) データベースです。
EMR Serverless StarRocks は、Alibaba Cloud 上のオープンソース StarRocks 向けのフルマネージドサービスで、StarRocks インスタンスとデータの作成・管理ができます。MySQL プロトコルと互換性があり、StarRocks は多次元分析、データレイク分析、高同時実行クエリ、リアルタイムデータ分析のための高性能な OLAP 機能を提供します。
データ開発 (DataStudio) (新版) パブリックプレビューへの参加 を使用するワークスペースでは、E-MapReduce (EMR) Serverless StarRocks コンピューティングリソースをバインドすると、同じ名前のデータソースが自動的に生成されます。このトピックのデータソース作成手順はスキップできます。
データ開発 (DataStudio) (新版) パブリックプレビューへの参加 をしないワークスペースでは、DataWorks で StarRocks を使用するには、このトピックで説明されているように StarRocks データソースを作成する必要があります。
EMR Serverless StarRocks 上の DataWorks
DataWorks はデータソースを介して EMR Serverless StarRocks に接続し、StarRocks エンジンを活用してデータ統合、定期的なジョブスケジューリング、インタラクティブ分析、API 生成を行うことができます。
前提条件
リソースグループを購入し、ワークスペースのバインドとネットワーク設定を完了していること。詳細については、「リソースグループ管理」をご参照ください。
EMR Serverless StarRocks インスタンスを作成済みであること。詳細については、「オールインワンインスタンスのクイックスタート」をご参照ください。
説明インスタンスを作成した後、EMR コンソールでその詳細を表示し、EMR StarRocks Manager を介して接続してデータベースとテーブルを表示できます。
DataWorks リソースグループの IP アドレスを EMR Serverless StarRocks インスタンスのホワイトリストに追加済みであること。
EMR Serverless StarRocks インスタンスのホワイトリストは、以下の方法で設定できます。
EMR Serverless StarRocks インスタンスの [インスタンス詳細] ページで、[セキュリティグループ ID] の右側にある [内部ホワイトリスト] をクリックして、内部ネットワークのホワイトリストを設定します。[FE 詳細] セクションで、[パブリックエンドポイント] の右側にある [パブリックホワイトリスト] をクリックして、パブリックホワイトリストを設定します。
データソースの作成
DataWorks で EMR Serverless StarRocks を使用するには、まず EMR Serverless StarRocks データベースに接続する StarRocks データソースを作成します。これにより、すべての DataWorks コンポーネントで StarRocks が有効になります。
データ開発 (DataStudio) (新版) パブリックプレビューへの参加 のワークスペースでは、EMR Serverless StarRocks コンピューティングリソースをバインドすると、同じ名前のデータソースが自動的に生成されます。このトピックのデータソース作成手順はスキップできます。
データ開発 (DataStudio) (新版) パブリックプレビューへの参加 を使用しないワークスペースでは、DataWorks で StarRocks を使用するには、このトピックで説明されているように StarRocks データソースを作成する必要があります。
詳細については、「StarRocks データソース」をご参照ください。アクセス方法と主要な設定パラメーターについては、以下の手順で説明します。
[データソース] ページに移動します。
DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、[Management Center] をクリックします。 表示されるページで、ドロップダウンリストから目的のワークスペースを選択し、[管理センターに移動] をクリックします。
表示されるページの左側のナビゲーションウィンドウで、[データソース] をクリックします。 [データソース] ページが表示されます。
Log on to the DataWorks console. In the target region, click in the left-side navigation pane. Select a workspace from the drop-down list and click [移動] [管理センター].
On the Workspace Management page, click [Data Sources] in the left-side navigation pane to open the data source page.
データソースの作成 をクリックします。次のセクションで説明するように、主要なパラメーターを設定します。他のパラメーターはデフォルト値のままにしておくことができます。
StarRocks インスタンスと DataWorks リソースグループ間のネットワーク接続に基づいて、適切な方法を選択してデータソースを作成します。ネットワーク接続ソリューションの詳細については、「ネットワーク接続ソリューションの概要」をご参照ください。
内部ネットワーク
パラメーター
説明
[設定モード]
ApsaraDB RDS を選択します。
[所属 Alibaba Cloud アカウント]
EMR Serverless StarRocks インスタンスと DataWorks が同じアカウントに属する場合は、現在の Alibaba Cloud アカウント を選択します。
EMR Serverless StarRocks インスタンスが別の Alibaba Cloud アカウントに属する場合は、その他の Alibaba Cloud アカウント を選択します。その他の Alibaba Cloud アカウント を選択した後、相手側 Alibaba Cloud アカウントの UID と 相手方 RAM ロール も設定する必要があります。他のアカウントの RAM ロールの設定に関する詳細については、「クロスアカウント認証 (RDS、Hive、または Kafka)」をご参照ください。
[リージョン]
EMR Serverless StarRocks インスタンスが存在するリージョンを選択します。
[インスタンス]
対象の [Serverless] StarRocks インスタンスを選択します。
[データベース名]
接続するデータベースの名前です。この名前は、EMR StarRocks Manager を使用してインスタンスに接続した後、[メタデータ管理] で確認できます。
[ユーザー名]/[パスワード]
インスタンスのユーザー名とパスワードです。
StarRocks インスタンスを作成すると、デフォルトの admin ユーザーが作成されます。パスワードは、インスタンス作成時に指定したものです。
[接続設定]
データソースと選択したリソースグループ間の接続性をテストします。ステータスが 接続可能 であれば、接続は成功です。
パブリックネットワーク
パラメーター
説明
[設定モード]
パブリック IP あり を選択します。
[ホストアドレス/IP]
EMR Serverless StarRocks インスタンス内の FE の パブリックアドレス です。
パブリックエンドポイントは
fe-c-<instance-id>.starrocks.aliyuncs.com形式で、HTTP ポートは8030です。[パブリックホワイトリスト] をクリックしてアクセスホワイトリストを設定するか、[パブリックアクセスを無効にする] をクリックしてパブリックアクセスを無効にすることができます。[ポート]
EMR Serverless StarRocks インスタンス内の FE の [クエリポート] です。デフォルト値は 9030 です。
[URL の読み込み]
StreamLoad で使用する StarRocks FE ノードのアドレスです。複数のアドレスはカンマで区切り、
FE public endpoint:FE HTTP portの形式で指定します。[データベース名]
接続するデータベースの名前です。この名前は、EMR StarRocks Manager を使用してインスタンスに接続した後、[メタデータ管理] で確認できます。
[ユーザー名]/[パスワード]
インスタンスのユーザー名とパスワードです。
StarRocks インスタンスを作成すると、デフォルトの admin ユーザーが作成されます。パスワードは、インスタンス作成時に指定したものです。
[接続設定]
データソースと選択したリソースグループ間の接続性をテストします。ステータスが 接続可能 であれば、接続は成功です。
Data Integration
DataWorks は、MySQL、Hive、Kafka、OSS、HDFS などのさまざまなソースから EMR Serverless StarRocks テーブルへのデータ同期をサポートしています。次の例では、MySQL から StarRocks テーブルにデータをバッチ同期する方法を説明します。
StarRocks データソースの同期タスクの設定方法の詳細については、「StarRocks データソース」をご参照ください。
DataStudioページに移動します。
DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、 を選択します。 表示されるページで、ドロップダウンリストから目的のワークスペースを選択し、[DataStudioに移動] をクリックします。
バッチ同期ノードを作成します。データソースを MySQL に設定し、宛先を StarRocks データソースに設定します。
左側のナビゲーションツリーで、[Data Integration] を展開し、[新しいノード] > [バッチ同期] を選択します。[ネットワークとリソース設定] の手順で、リソースグループを選択し、ソースと宛先の両方で [接続性をテスト] をクリックして、両方が [接続済み] であることを確認します。
リソースグループを選択した後、ソースと宛先のデータソースへの接続性をテストします。
スケジューリング周期を設定し、ノードを送信してデプロイし、定期的に実行します。
ノードをデバッグした後、右側のペインで スケジューリング設定 をクリックして、スケジューリング周期や再実行ポリシーなどのスケジューリングパラメーターを設定し、タスクのリソースグループを設定します。設定が完了したら、コミット と 発行 をクリックします。
データ開発とスケジューリング
EMR Serverless StarRocks タスクを定期的にスケジューリングするには、Data Studio で StarRocks ノードを作成し、そこで SQL を記述し、StarRocks データソースに接続し、スケジューリングを設定します。主要な手順は次のとおりです。
DataStudioページに移動します。
DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、 を選択します。 表示されるページで、ドロップダウンリストから目的のワークスペースを選択し、[DataStudioに移動] をクリックします。
Data Studio で StarRocks ノードを作成し、接続済みの StarRocks データソースを選択して、SQL タスクを記述します。
ビジネスフロー内のデータベースノードを右クリックし、[新規ノード] > [StarRocks] を選択します。表示された SQL エディターで、対応するデータソースを選択して SQL 文を記述します。例:
SELECT * FROM testdb.testtb;。Data Studio で EMR Serverless StarRocks SQL タスクをデバッグするには、デバッグする SQL ステートメントを選択し、実行ボタンをクリックして、テスト実行用のリソースグループを選択します。
スケジューリング周期を設定し、ノードを送信してデプロイし、定期的に実行します。
ノードをデバッグした後、右側のペインで スケジューリング設定 をクリックして、スケジューリング周期や再実行ポリシーなどのスケジューリングパラメーターを設定し、タスクのリソースグループを設定します。設定が完了したら、コミット と 発行 をクリックします。
データ分析
データ分析を使用して、EMR Serverless StarRocks テーブルのデータを迅速にクエリおよび分析します。主要な手順は次のとおりです。
[SQLクエリ] ページに移動します。
DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、 を選択します。 表示されるページで、ドロップダウンリストから目的のワークスペースを選択し、[SQLクエリに移動] をクリックします。
左側のペインで
アイコンをクリックし、 をクリックして システム管理 ページに移動し、StarRocks のクエリリソースグループを、タスクで使用するリソースグループに設定します。[SQL クエリ] > [リソースグループ] セクションでは、[StarRocks] エンジンはデフォルトで [パブリックスケジューリングリソースグループ] を使用します。これを対象のリソースグループに変更し、[保存] をクリックします。
SQL クエリページに戻ります。右上隅で、エンジンタイプを StarRocks に切り替え、データソースを選択します。これで、クエリを記述して実行し、EMR Serverless StarRocks でデータ分析を実行できます。
右側の設定パネルで、[ワークスペース] も選択し、[OK] をクリックする必要があります。
DataService Studio
DataService Studio は、StarRocks データソースからの API 生成をサポートしています。主要な手順は次のとおりです。
DataService Studioページに移動します。
DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、[DataService Studio] をクリックします。 表示されるページで、ドロップダウンリストから目的のワークスペースを選択し、[DataService Studioに移動] をクリックします。
API を生成し、そのパラメーターを設定します。
DataService Studio は、ウィザードモードとスクリプトモードの両方をサポートしています。スクリプトモードでは、SQL クエリに基づいて API リクエストとレスポンスのパラメーターを自動生成できます。以下の手順では、ウィザードモードの使用方法を説明します。
左側のナビゲーションツリーで、目的のビジネスフロー配下の [API] ノードを展開し、右クリックして [新しい API] > [API を生成] を選択し、ウィザードモードの設定ページに移動します。
データソースタイプを StarRocks に設定し、作成した StarRocks データソースを選択し、対応するテーブルを選択してから、ページ上のプロンプトに従って API リクエストパラメーター、レスポンスパラメーター、およびその他の設定を行います。
右側のペインで [サービスリソースグループ] をクリックし、リソースグループをデータサービス専用のリソースグループに設定します。
[専用サービスリソースグループ] ドロップダウンリストで、test などの対象のリソースグループを選択し、[API Gateway インスタンスタイプ] を [共有インスタンス] に、[タイムアウト] を
30000ms に、[リクエストあたりの最大データ行数] を10000に設定します。API のテストに成功したら、送信して公開します。
データマップ
データマップは、StarRocks データのメタデータ収集、検索、およびテーブル詳細の表示をサポートしています。
メタデータ収集
[データマップ] ページに移動します。
DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、 を選択します。 表示されるページで、[データマップに移動] をクリックします。
左側メニューで
アイコンをクリックし、StarRocks モジュールの右上隅にある 管理 をクリックします。未収集リスト タブに切り替え、操作 列の メタデータ取得 をクリックします。
リソースグループ名 を設定し、接続性のテスト をパスし、[収集スケジュール] を設定したら、[確認] をクリックしてメタデータ収集設定を完了します。
説明メタデータ収集の詳細については、「メタデータ収集」をご参照ください。
このタスクは Serverless リソースグループでのみ実行できます。
検索
[データマップ] ページに移動します。
DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、 を選択します。 表示されるページで、[データマップに移動] をクリックします。
左側メニューで
アイコンをクリックし、データソースとして StarRocks を選択し、上部の検索バーを使用してテーブルを検索します。説明検索機能の詳細については、「メタデータ検索」をご参照ください。
テーブル詳細
[データマップ] ページに移動します。
DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、 を選択します。 表示されるページで、[データマップに移動] をクリックします。
データマップのホームページまたは検索結果で対象のテーブルを見つけ、テーブル名をクリックしてテーブル詳細ページに移動します。
テーブル詳細ページでは、テーブルの基本情報、[技術情報]、ビジネス情報、明細情報、出力情報、データリネージ情報 などの情報を表示できます。
説明テーブル詳細の詳細については、「メタデータ検索」をご参照ください。
バージョン 3.1.13、および 3.2.9 以降の EMR Serverless StarRocks クラスターは、メタデータとデータリネージ分析をサポートしています。この機能の設定方法の詳細については、「データリネージの表示」をご参照ください。
テーブル詳細ページには、[使用ガイド] タブも含まれています。[詳細] タブには、[フィールド情報] と [変更履歴] の 2 つのサブタブがあります。[フィールド情報] テーブルには、各フィールドの名前、データ型、および説明が表示されます。