すべてのプロダクト
Search
ドキュメントセンター

DataWorks:CDH コンピューティングリソースの関連付け

最終更新日:Aug 26, 2026

Cloudera Distribution for Hadoop (CDH) クラスターを、データ同期と開発のためのコンピューティングリソースとして DataWorks のワークスペースに関連付けます。

前提条件

  • RAM ユーザーはワークスペースのメンバーで、ワークスペース管理者ロールを持っている必要があります。

  • CDH クラスターがデプロイされていること。

    説明

    DataWorks は、デプロイ環境が Alibaba Cloud VPC に接続されている場合、Alibaba Cloud ECS の外部にデプロイされた CDH クラスターもサポートしています。通常、オンプレミスデータソースのネットワーク接続方法を使用して安定した接続を確立できます。

  • リソースグループがワークスペースに関連付けられ、ネットワーク接続が検証済みであること。

制限事項

  • リージョン:この機能は、中国 (北京)、中国 (上海)、中国 (深圳)、中国 (杭州)、中国 (張家口)、中国 (成都)、ドイツ (フランクフルト) で使用できます。

  • 権限:

    オペレーター

    必要な権限

    Alibaba Cloud アカウント

    追加の権限は不要です。

    RAM ユーザー / RAM ロール

    • 運用保守ロール、ワークスペース管理者ロール、または AliyunDataWorksFullAccess 権限を持つワークスペースメンバーのみがコンピューティングリソースを作成できます。権限の付与方法については、「ユーザーにワークスペース管理者権限を付与する」をご参照ください。

コンピューティングリソースリストページへの移動

  1. DataWorks コンソールにログインします。左側メニューで、対象のリージョンに切り替え、もっと見る > 管理センター をクリックします。ドロップダウンリストからワークスペースを選択し、管理センターへ をクリックします。

  2. 左側メニューで、計算リソース をクリックしてコンピューティングリソースリストページを開きます。

CDH コンピューティングリソースの関連付け

コンピューティングリソースページで、CDH コンピューティングリソースを設定して関連付けます。

  1. コンピューティングリソースのタイプを選択します。

    1. 計算リソースのアタッチ をクリックして 計算リソースのアタッチ ページに移動します。

    2. 計算リソースのアタッチ ページで、コンピューティングリソースのタイプとして [CDH] を選択します。[CDH コンピューティングリソースの関連付け] の設定ページが表示されます。

  2. CDH コンピューティングリソースを設定します。

    [CDH コンピューティングリソースの関連付け] ページで、次のパラメータを設定します。

    パラメータ

    説明

    [クラスターバージョン]

    登録対象のクラスターのバージョンを選択します。

    DataWorks は CDH 5.16.2、CDH 6.1.1、CDH 6.2.1、CDH 6.3.2、CDP 7.1.7 を標準でサポートしており、これらのバージョンでは、クラスター接続情報内のすべてのコンポーネントバージョンが固定されています。要件に合うバージョンがない場合は、カスタムバージョン を選択し、必要に応じてコンポーネントバージョンを設定します。

    説明
    • 必要なコンポーネントはクラスターのバージョンによって異なり、設定ページに表示されます。

    • カスタムバージョン でクラスターを登録する場合、サポートされるのはスケジューリング用レガシー専用リソースグループのみです。登録後、テクニカルサポートに環境の初期化を依頼するには、チケットを送信 する必要があります。

    [クラスター名]

    別のワークスペースに登録されているクラスター名を選択して設定を読み込むか、カスタム名を指定して新しい設定を作成します。

    [クラスター接続情報]

    Hive 接続情報

    クラスターに Hive ジョブを送信するために使用します。

    • HiveServer2 の設定形式:jdbc:hive2://<host>:<port>/<database>

    • メタストアの設定形式:thrift://<host>:<port>

    パラメータの取得方法:詳細については、「CDH または CDP クラスター情報を取得し、ネットワーク接続を設定する」をご参照ください。

    コンポーネントバージョンの選択:システムが現在のクラスターのコンポーネントバージョンを自動検出します。

    説明

    サーバーレスリソースグループを使用してドメイン名で CDH コンポーネントにアクセスする場合、Alibaba Cloud DNS の [PrivateZone] で、ドメイン名の権威解決を設定し、その有効範囲を設定する必要があります。

    Impala 接続情報

    Impala ジョブを送信するために使用します。

    設定形式:jdbc:impala://<host>:<port>/<schema>。

    Spark 接続情報

    デフォルトの Spark バージョンを選択し、接続を設定します。

    Yarn 接続情報

    タスクの送信およびタスク詳細の表示に関する設定です。

    • Yarn.Resourcemanager.Address の設定形式:http://<host>:<port>

      説明

      Spark または MapReduce タスクの送信アドレスです。

    • Jobhistory.Webapp.Address の設定形式:http://<host>:<port2>

      説明

      完了したタスクの詳細を確認するための JobHistory Server の Web UI アドレスです。

    MapReduce 接続情報

    デフォルトの MapReduce バージョンを選択し、接続を設定します。

    Presto 接続情報

    Presto ジョブを送信するために使用します。

    JDBC アドレス情報の設定形式:jdbc:presto://<host>:<port>/<catalog>/<schema>

    説明

    これはデフォルトの CDH コンポーネントではありません。必要に応じてこのコンポーネントを設定します。

    [クラスター設定ファイル]

    core-site ファイルの設定

    HDFS および MapReduce の共通 I/O 設定など、Hadoop Core ライブラリのグローバル設定を含みます。

    Spark または MapReduce タスクを実行する場合、このファイルをアップロードします。

    hdfs-site ファイルの設定

    データブロックサイズ、レプリカ数、パス名などの HDFS 関連設定を含みます。

    mapred-site ファイルの設定

    実行モードやスケジューリング動作などの MapReduce パラメータを設定します。

    MapReduce タスクを実行する場合、このファイルをアップロードします。

    yarn-site ファイルの設定

    ResourceManager、NodeManager、アプリケーション実行時環境の環境設定など、YARN デーモンに関連するすべての設定を含みます。

    Spark または MapReduce タスクを実行する場合、またはアカウントマッピングに Kerberos を使用する場合は、このファイルをアップロードします。

    hive-site ファイルの設定

    データベース接続情報、Hive メタストア設定、実行エンジンなどの Hive パラメータを設定します。

    アカウントマッピングタイプとして Kerberos を選択する場合は、このファイルをアップロードします。

    spark-defaults ファイルの設定

    メモリサイズや CPU コア数など、デフォルトの Spark ジョブ設定を指定します。Spark アプリケーションは実行時にこれらの設定を適用します。

    Spark タスクを実行する場合、このファイルをアップロードします。

    config.properties ファイルの設定

    Presto クラスター内のコーディネーターおよびワーカーノードのグローバルプロパティなど、Presto サーバーに関連する設定を含みます。

    Presto コンポーネントを使用し、アカウントマッピングタイプとして OPEN LDAP または Kerberos を選択する場合は、このファイルをアップロードします。

    presto.jks ファイルの設定

    Presto プロセス間の SSL/TLS 暗号化通信で使用するセキュリティ証明書 (秘密鍵および公開鍵証明書) を格納します。

    [デフォルトアクセス主体]

    マッピングされたクラスターアカウントに関連付けられたアイデンティティを使用するには、計算リソース ページに移動し、アカウントマッピング タブで クラスターアイデンティティマッピングを設定してください。

    • 開発環境:クラスターアカウント、またはタスク実行者のマッピング済みクラスターアカウントを使用できます。

    • 本番環境:クラスターアカウント、タスク所有者のマッピング済みクラスターアカウント、Alibaba Cloud アカウントのマッピング済みクラスターアカウント、または RAM ユーザーのマッピング済みクラスターアカウントを使用できます。

    [計算リソースインスタンス名]

    コンピューティングリソースインスタンスのカスタム名を指定します。実行時に、この名前に基づいてタスクのコンピューティングリソースを選択できます。

  3. OK をクリックして設定を完了します。

リソースグループの初期化

クラスターを初めて登録する場合、またはクラスターサービス設定 (core-site.xml など) を変更した場合は、ネットワーク接続を設定した後にリソースグループを初期化し、CDH クラスターにアクセスできることを確認してください。

  1. 計算リソース ページで、作成した CDH コンピューティングリソースを見つけます。右上隅で リソースグループの初期化をクリックします。

  2. 使用するリソースグループの横にある [初期化] をクリックします。リソースグループの初期化が完了したら、OK をクリックします。

(オプション) YARN リソースキューの設定

計算リソース ページで、関連付けた CDH クラスターを見つけます。YARN リソースキュー タブで [YARN リソースキューの編集] をクリックし、異なるモジュールのタスクに専用の YARN リソースキューを設定できます。

(オプション) Spark パラメータの設定

異なるモジュールのタスクに専用の Spark パラメータを設定できます。

  1. 計算リソース ページで、関連付けた CDH クラスターを見つけます。

  2. SPARK パラメーター タブで [Spark パラメータの編集] をクリックし、CDH クラスターの Spark パラメータを編集できるページに移動します。

  3. モジュールの下にある 追加 ボタンをクリックし、Spark プロパティ名 と Spark プロパティ値 を入力して、Spark プロパティ情報を設定できます。

(オプション) ホスト設定の構成

DataWorks の サーバーレスリソースグループが Kerberos 対応の CDH クラスターに接続する場合、タスクの送信に失敗することがあります。

これは、Kerberos が認証に ホスト名を使用するためです。DNS がクラスター IP アドレスを Kerberos に登録されたホスト名に解決できない場合、認証に失敗します。

ホスト設定機能を使用すると、CDH コンピューティングリソースに対して静的な IP とホスト名のマッピングを定義できます。DataWorks はクラスターへのアクセス時にこのマッピングを優先するため、Kerberos 認証を成功させることができます。

  1. 設定する CDH コンピューティングリソースを見つけ、ホストの設定 をクリックします。

  2. 表示されるダイアログボックスで、IP address hostname 形式でマッピング関係を入力してください。1 行につき 1 つのマッピングのみを入力してください。

  3. [OK] をクリックして設定を保存します。

  4. 保存後、設定したホスト名情報がコンピューティングリソースカードに表示され、設定が有効であることを確認できます。

重要
  • 形式要件:IP address と hostname は、1 つ以上のスペースで区切る必要があります。

  • 設定の完全性:Kerberos 認証およびタスク実行に関わる重要ノード (NameNode、ResourceManager、NodeManager など) の正しいマッピングをすべて設定してください。

  • スコープ:このホスト設定は、現在のコンピューティングリソースにのみ適用されますが、ワークスペース内の他のリソースには適用されません。

次のステップ

CDH コンピューティングリソースを設定した後、Data Studio で CDH 関連ノードを使用してデータ開発を行います。