Lindorm インスタンスを DataWorks コンピューティングリソースとして関連付けることで、データ同期や開発などの Lindorm タスクを開発および管理できます。
背景
Lindorm は、コミュニティ版のコンピューティングモデルをサポートし、Spark インターフェイスと互換性があり、Lindorm ストレージエンジンと緊密に統合されている、クラウドネイティブな分散コンピューティングサービスです。ストレージレベルのインデックスを活用して、大規模なデータ処理、インタラクティブ分析、機械学習、グラフコンピューティングのための分散ジョブを効率的に実行します。
前提条件
-
ワークスペースを作成済みであること。
重要この機能は、 データ開発 (DataStudio) (新版) パブリックプレビューへの参加 が有効になっているワークスペースでのみ利用できます。
-
以下の要件を満たすLindorm インスタンスを作成済みであること。
-
Lindorm インスタンスで [コンピュートエンジン] が有効になっていること。
-
Lindorm インスタンスと DataWorks ワークスペースが同じリージョンにあること。
-
-
サーバーレスリソースグループを使用し、ターゲットの DataWorks ワークスペースに関連付け済みであること。
Lindorm コンピューティングリソースの関連付け
制限事項
-
リージョン:中国 (杭州)、中国 (上海)、中国 (北京)、中国 (深圳)、中国 (成都)、中国 (香港)、日本 (東京)、シンガポール、マレーシア (クアラルンプール)、インドネシア (ジャカルタ)。
-
権限:
-
DataWorks で Lindorm タスクを実行するには、DataWorks のサーバーレスリソースグループを使用する必要があります。
-
O&M または ワークスペース管理者 のロールを持つワークスペースメンバー、あるいは
AliyunDataWorksFullAccess権限を持つメンバーのみが、コンピューティングリソースを作成できます。メンバーのロールの表示または権限の付与については、「ワークスペースメンバーの追加とメンバーのロールおよび権限の管理」をご参照ください。
-
[コンピューティングリソース] ページへの移動
-
[DataWorks ワークスペース] ページに移動します。上部ナビゲーションバーでターゲットリージョンを選択し、コンピューティングリソースを作成するワークスペースを見つけます。ワークスペース名または 操作 列の 詳細 をクリックして、ワークスペースの詳細ページに移動します。
-
左側のナビゲーションペインで、計算リソース をクリックします。
Lindorm コンピューティングリソースの関連付け
[コンピューティングリソース] ページで、パラメーターを設定して Lindorm コンピューティングリソースを関連付けます。
-
関連付けるコンピューティングリソースのタイプを選択します。
-
計算リソースのアタッチ をクリックして、計算リソースのアタッチ ページを開きます。
-
計算リソースのアタッチ ページで、コンピューティングリソースタイプとして Lindorm を選択し、[Lindorm コンピューティングリソースのバインド] 設定ページに移動します。
-
-
Lindorm コンピューティングリソースを設定します。
[Lindorm コンピューティングリソースの関連付け] ページで、以下のパラメーターを設定します。
セクション
パラメーター
説明
[基本情報]
[設定パターン]
ApsaraDB RDS のみがサポートされています。
[インスタンス]
DataWorks に関連付ける Lindorm インスタンスを選択します。ドロップダウンリストには、現在のリージョンにある Lindorm インスタンスが表示されます。
[データベース名]
このコンピューティングリソースのデフォルトデータベースを選択します。DataWorks はタスクの実行時にこのデータベースに接続します。デフォルト値は
defaultです。[ユーザー名] / [パスワード]
DataWorks がこの Lindorm コンピューティングリソースで認証するためのユーザー名とパスワードを入力します。認証情報を取得するには、[Lindorm コンソール] に移動し、インスタンス名 をクリックして、左側のナビゲーションペインの [データベース接続] セクションで認証情報を見つけます。
[計算リソースインスタンス名]
タスクを設定する際にリソースを識別して選択するために、この名前を使用します。
[接続設定]
[接続状態]
接続設定セクションで、DataWorks が Lindorm タスクの実行に使用するサーバーレスリソースグループを選択し、接続テスト をクリックして、リソースグループが Lindorm インスタンスにアクセスできることを確認します。詳細については、「ネットワーク接続ソリューション」をご参照ください。
-
OK をクリックして、Lindorm コンピューティングリソースの設定を完了します。
(オプション) グローバル Spark パラメーターの設定
Data Studio やオペレーションセンターなどのモジュールに対して、ワークスペースレベルでグローバル Spark パラメーターを指定できます。これらの設定は、モジュール固有のパラメーターを上書きできます。詳細については、「グローバル Spark パラメーターの設定」をご参照ください。
背景
DataWorks では、スケジューリングノードが実行時に使用する Spark パラメーターを以下の方法で設定できます:
方法1:ワークスペースレベルでグローバル Spark パラメーターを設定し、各 DataWorks モジュールが Lindorm タスクに使用する Spark 設定を制御します。また、グローバルパラメーターがモジュール固有のパラメーターより優先されるかどうかを定義することもできます。詳細については、「グローバル Spark パラメーターの設定」をご参照ください。
方法2:Data Studio では、ノード編集ページで個々のノードタスクに対して Spark プロパティを設定します。他のモジュールでは、タスクごとの Spark プロパティ設定をサポートしていません。
アクセス制御
以下のロールのみがグローバル Spark パラメーターを設定できます:
-
Alibaba Cloud アカウント。
-
AliyunDataWorksFullAccess権限を持つ RAM ユーザーまたは RAM ロール。 -
ワークスペース管理者ロールを持つ RAM ユーザー。
グローバル Spark パラメーターの表示
-
[コンピューティングリソース] ページに移動し、関連付けられている Lindorm コンピューティングリソースを見つけます。
-
Spark パラメーター をクリックして、Spark パラメーター設定ペインを開きます。
グローバル Spark パラメーターの設定
以下の手順に従って、グローバル Spark パラメーターを設定します。特定のパラメーターの詳細については、「ジョブ設定」をご参照ください。
-
[コンピューティングリソース] ページに移動し、関連付けられている Lindorm コンピューティングリソースを見つけます。
-
Spark パラメーター をクリックして、Spark パラメーター設定ペインを開きます。
-
グローバル Spark パラメーターを設定します。
Spark パラメーター ペインの右上隅にある Spark のパラメーターの編集 をクリックして、各モジュールのグローバル Spark パラメーターと優先度を設定します。
説明これはワークスペースレベルの設定です。続行する前に、正しいワークスペースが選択されていることを確認してください。
パラメーター
手順
[Spark プロパティ]
各モジュールが Lindorm タスクを実行するときに使用する Spark プロパティを設定します。詳細については、「ジョブ設定」をご参照ください。
追加 をクリックし、Spark プロパティ名 と対応する Spark プロパティ値 を入力します。
説明データリネージと出力収集を有効にするには、次のプロパティを設定します:
-
Spark プロパティ名 に
spark.sql.queryExecutionListenersを設定します。 -
Spark プロパティ値 を
com.aliyun.dataworks.meta.lineage.LineageListenerに設定します。
Spark プロパティ設定の詳細については、「ジョブ設定」をご参照ください。
[グローバル設定を優先]
このオプションを選択すると、グローバル設定が製品モジュール内の設定よりも優先されます。この場合、タスクはグローバルに設定された Spark プロパティに基づいて実行されます。
-
グローバル設定: Spark パラメーター ページで設定される Spark プロパティで、 にある Lindorm コンピューティングリソースに適用されます。
現在、グローバル Spark パラメーターは Data Studio およびオペレーションセンターモジュールに対してのみ設定できます。
-
製品モジュール内の設定:
-
Data Studio:Lindorm Spark および Lindorm Spark SQL ノードの場合、ノード編集ページの 設定項目 タブで、単一ノードタスクの Spark プロパティを設定できます。
-
その他の製品モジュール:モジュール内で個別に Spark プロパティを設定することはサポートしていません。
-
-
-
OK をクリックして、グローバル Spark パラメーターを保存します。
次のステップ
-
関連付けられた Lindorm コンピューティングリソースを使用して、Data Studio でノードタスクを開発できます。詳細については、「Lindorm Spark ノード」および「Lindorm Spark SQL ノード」をご参照ください。
-
グローバル Spark パラメーターを設定する際に、Lindorm のデータリネージと出力収集を有効にできます。メタデータコレクターを作成して実行した後、データマップで Lindorm のメタデータを表示および管理できます。詳細については、「データマップでの Lindorm の表示と管理」をご参照ください。