Cloudera Distribution for Hadoop (CDH) クラスターを、データ同期と開発のためのコンピューティングリソースとして DataWorks のワークスペースに関連付けます。
前提条件
-
RAM ユーザーはワークスペースのメンバーで、ワークスペース管理者ロールを持っている必要があります。
-
CDH クラスターがデプロイされていること。
説明DataWorks は、デプロイ環境が Alibaba Cloud VPC に接続されている場合、Alibaba Cloud ECS の外部にデプロイされた CDH クラスターもサポートしています。通常、オンプレミスデータソースのネットワーク接続方法を使用して安定した接続を確立できます。
-
リソースグループがワークスペースに関連付けられ、ネットワーク接続が検証済みであること。
-
サーバーレスリソースグループを使用する場合は、CDH コンピューティングリソースと サーバーレスリソースグループ間の接続性を確保するだけで済みます。
-
レガシー専用リソースグループを使用する場合は、CDH コンピューティングリソースと スケジューリング用専用リソースグループ間の接続性を確保する必要があります。
-
制限事項
-
リージョン:この機能は、中国 (北京)、中国 (上海)、中国 (深圳)、中国 (杭州)、中国 (張家口)、中国 (成都)、ドイツ (フランクフルト) で使用できます。
-
権限:
オペレーター
必要な権限
Alibaba Cloud アカウント
追加の権限は不要です。
RAM ユーザー / RAM ロール
-
運用保守ロール、ワークスペース管理者ロール、または
AliyunDataWorksFullAccess権限を持つワークスペースメンバーのみがコンピューティングリソースを作成できます。権限の付与方法については、「ユーザーにワークスペース管理者権限を付与する」をご参照ください。
-
コンピューティングリソースリストページへの移動
-
DataWorks コンソールにログインします。左側メニューで、対象のリージョンに切り替え、 をクリックします。ドロップダウンリストからワークスペースを選択し、管理センターへ をクリックします。
-
左側メニューで、計算リソース をクリックしてコンピューティングリソースリストページを開きます。
CDH コンピューティングリソースの関連付け
コンピューティングリソースページで、CDH コンピューティングリソースを設定して関連付けます。
-
コンピューティングリソースのタイプを選択します。
-
計算リソースのアタッチ をクリックして 計算リソースのアタッチ ページに移動します。
-
計算リソースのアタッチ ページで、コンピューティングリソースのタイプとして [CDH] を選択します。[CDH コンピューティングリソースの関連付け] の設定ページが表示されます。
-
-
CDH コンピューティングリソースを設定します。
[CDH コンピューティングリソースの関連付け] ページで、次のパラメータを設定します。
パラメータ
説明
[クラスターバージョン]
登録対象のクラスターのバージョンを選択します。
DataWorks は CDH 5.16.2、CDH 6.1.1、CDH 6.2.1、CDH 6.3.2、CDP 7.1.7 を標準でサポートしており、これらのバージョンでは、クラスター接続情報内のすべてのコンポーネントバージョンが固定されています。要件に合うバージョンがない場合は、カスタムバージョン を選択し、必要に応じてコンポーネントバージョンを設定します。
説明-
必要なコンポーネントはクラスターのバージョンによって異なり、設定ページに表示されます。
-
カスタムバージョン でクラスターを登録する場合、サポートされるのはスケジューリング用レガシー専用リソースグループのみです。登録後、テクニカルサポートに環境の初期化を依頼するには、チケットを送信 する必要があります。
[クラスター名]
別のワークスペースに登録されているクラスター名を選択して設定を読み込むか、カスタム名を指定して新しい設定を作成します。
[クラスター接続情報]
Hive 接続情報
クラスターに Hive ジョブを送信するために使用します。
-
HiveServer2 の設定形式:
jdbc:hive2://<host>:<port>/<database> -
メタストアの設定形式:
thrift://<host>:<port>
パラメータの取得方法:詳細については、「CDH または CDP クラスター情報を取得し、ネットワーク接続を設定する」をご参照ください。
コンポーネントバージョンの選択:システムが現在のクラスターのコンポーネントバージョンを自動検出します。
Impala 接続情報
Impala ジョブを送信するために使用します。
設定形式:
jdbc:impala://<host>:<port>/<schema>。Spark 接続情報
デフォルトの Spark バージョンを選択し、接続を設定します。
Yarn 接続情報
タスクの送信およびタスク詳細の表示に関する設定です。
-
Yarn.Resourcemanager.Address の設定形式:
http://<host>:<port>説明Spark または MapReduce タスクの送信アドレスです。
-
Jobhistory.Webapp.Address の設定形式:
http://<host>:<port2>説明完了したタスクの詳細を確認するための JobHistory Server の Web UI アドレスです。
MapReduce 接続情報
デフォルトの MapReduce バージョンを選択し、接続を設定します。
Presto 接続情報
Presto ジョブを送信するために使用します。
JDBC アドレス情報の設定形式:
jdbc:presto://<host>:<port>/<catalog>/<schema>説明これはデフォルトの CDH コンポーネントではありません。必要に応じてこのコンポーネントを設定します。
[クラスター設定ファイル]
core-site ファイルの設定
HDFS および MapReduce の共通 I/O 設定など、Hadoop Core ライブラリのグローバル設定を含みます。
Spark または MapReduce タスクを実行する場合、このファイルをアップロードします。
hdfs-site ファイルの設定
データブロックサイズ、レプリカ数、パス名などの HDFS 関連設定を含みます。
mapred-site ファイルの設定
実行モードやスケジューリング動作などの MapReduce パラメータを設定します。
MapReduce タスクを実行する場合、このファイルをアップロードします。
yarn-site ファイルの設定
ResourceManager、NodeManager、アプリケーション実行時環境の環境設定など、YARN デーモンに関連するすべての設定を含みます。
Spark または MapReduce タスクを実行する場合、またはアカウントマッピングに Kerberos を使用する場合は、このファイルをアップロードします。
hive-site ファイルの設定
データベース接続情報、Hive メタストア設定、実行エンジンなどの Hive パラメータを設定します。
アカウントマッピングタイプとして Kerberos を選択する場合は、このファイルをアップロードします。
spark-defaults ファイルの設定
メモリサイズや CPU コア数など、デフォルトの Spark ジョブ設定を指定します。Spark アプリケーションは実行時にこれらの設定を適用します。
Spark タスクを実行する場合、このファイルをアップロードします。
config.properties ファイルの設定
Presto クラスター内のコーディネーターおよびワーカーノードのグローバルプロパティなど、Presto サーバーに関連する設定を含みます。
Presto コンポーネントを使用し、アカウントマッピングタイプとして OPEN LDAP または Kerberos を選択する場合は、このファイルをアップロードします。
presto.jks ファイルの設定
Presto プロセス間の SSL/TLS 暗号化通信で使用するセキュリティ証明書 (秘密鍵および公開鍵証明書) を格納します。
[デフォルトアクセス主体]
マッピングされたクラスターアカウントに関連付けられたアイデンティティを使用するには、計算リソース ページに移動し、アカウントマッピング タブで クラスターアイデンティティマッピングを設定してください。
-
開発環境:クラスターアカウント、またはタスク実行者のマッピング済みクラスターアカウントを使用できます。
-
本番環境:クラスターアカウント、タスク所有者のマッピング済みクラスターアカウント、Alibaba Cloud アカウントのマッピング済みクラスターアカウント、または RAM ユーザーのマッピング済みクラスターアカウントを使用できます。
[計算リソースインスタンス名]
コンピューティングリソースインスタンスのカスタム名を指定します。実行時に、この名前に基づいてタスクのコンピューティングリソースを選択できます。
-
-
OK をクリックして設定を完了します。
リソースグループの初期化
クラスターを初めて登録する場合、またはクラスターサービス設定 (core-site.xml など) を変更した場合は、ネットワーク接続を設定した後にリソースグループを初期化し、CDH クラスターにアクセスできることを確認してください。
-
計算リソース ページで、作成した CDH コンピューティングリソースを見つけます。右上隅で リソースグループの初期化をクリックします。
-
使用するリソースグループの横にある [初期化] をクリックします。リソースグループの初期化が完了したら、OK をクリックします。
(オプション) YARN リソースキューの設定
計算リソース ページで、関連付けた CDH クラスターを見つけます。YARN リソースキュー タブで [YARN リソースキューの編集] をクリックし、異なるモジュールのタスクに専用の YARN リソースキューを設定できます。
(オプション) Spark パラメータの設定
異なるモジュールのタスクに専用の Spark パラメータを設定できます。
-
計算リソース ページで、関連付けた CDH クラスターを見つけます。
-
SPARK パラメーター タブで [Spark パラメータの編集] をクリックし、CDH クラスターの Spark パラメータを編集できるページに移動します。
-
モジュールの下にある 追加 ボタンをクリックし、Spark プロパティ名 と Spark プロパティ値 を入力して、Spark プロパティ情報を設定できます。
(オプション) ホスト設定の構成
DataWorks の サーバーレスリソースグループが Kerberos 対応の CDH クラスターに接続する場合、タスクの送信に失敗することがあります。
これは、Kerberos が認証に ホスト名を使用するためです。DNS がクラスター IP アドレスを Kerberos に登録されたホスト名に解決できない場合、認証に失敗します。
ホスト設定機能を使用すると、CDH コンピューティングリソースに対して静的な IP とホスト名のマッピングを定義できます。DataWorks はクラスターへのアクセス時にこのマッピングを優先するため、Kerberos 認証を成功させることができます。
-
設定する CDH コンピューティングリソースを見つけ、ホストの設定 をクリックします。
-
表示されるダイアログボックスで、
IP address hostname形式でマッピング関係を入力してください。1 行につき 1 つのマッピングのみを入力してください。 -
[OK] をクリックして設定を保存します。
-
保存後、設定したホスト名情報がコンピューティングリソースカードに表示され、設定が有効であることを確認できます。
-
形式要件:
IP addressとhostnameは、1 つ以上のスペースで区切る必要があります。 -
設定の完全性:Kerberos 認証およびタスク実行に関わる重要ノード (NameNode、ResourceManager、NodeManager など) の正しいマッピングをすべて設定してください。
-
スコープ:このホスト設定は、現在のコンピューティングリソースにのみ適用されますが、ワークスペース内の他のリソースには適用されません。
次のステップ
CDH コンピューティングリソースを設定した後、Data Studio で CDH 関連ノードを使用してデータ開発を行います。