権限
スーパー管理者 または システム管理者 ロールを持つユーザー、および クラスター管理 - 管理 権限を持つカスタムグローバルロールは、クラスターを作成および管理できます。これらのユーザーは、コンピュートソースを作成する際にクラスターを使用できるユーザーを指定したり、クラスター管理者を割り当てたりすることもできます。
クラスター管理者 は、割り当てられたクラスターを管理できます。
コンピュートソース管理 - 作成 のグローバル権限を持つユーザーは、コンピュートソースを作成する際に承認済みのクラスターを選択できます。
クラスターの作成
Dataphin ホームページの上部のナビゲーションバーで、[プラン] > [クラスター管理] を選択します。
[クラスター管理] ページで、[クラスターの作成] をクリックします。
[クラスターの作成] ページで、次のパラメーターを設定します。
基本情報
パラメーター
説明
クラスター名
クラスターの名前を入力します。名前に使用できるのは、漢字、英字、数字、スペース、および次の特殊文字です:
-_.@~()。名前の長さは 128 文字までです。エンジンタイプ
次のエンジンタイプがサポートされています:
MaxCompute
AnalyticDB for PostgreSQL
Alibaba Cloud E-MapReduce 3.x
Alibaba Cloud E-MapReduce 5.x
CDH 5.x
CDH 6.x
Cloudera Data Platform 7.x
Huawei FusionInsight 8.x
AsiaInfo DP 5.3
StarRocks
Databricks
Amazon EMR
SelectDB
Doris
GaussDB(DWS)
Transwarp TDH 6.x
Transwarp TDH 9.3.x
Transwarp ArgoDB
Lindorm
Hologres
OushuDB
Alibaba Cloud EMR Serverless Spark
[クラスター管理者]
現在のテナントから 1 人以上のメンバーを選択して、クラスター管理者に指定します。クラスター管理者 は、設定の編集、履歴バージョンの表示、削除など、クラスターの管理ができます。
[説明] (任意)
クラスターの簡単な説明を入力します。説明の長さは 128 文字までです。
クラスターのセキュリティコントロール
利用可能なメンバー: コンピュートソースを作成する際にこのクラスターを使用できるユーザーを指定します。[「コンピュートソースの作成」権限を持つロール] または [指定されたユーザー] を選択できます。
[「コンピュートソースの作成」権限を持つロール]: このオプションはデフォルトで選択されています。
[指定されたユーザー]: 1 つ以上の個人アカウントおよびユーザーグループを選択できます。
クラスター設定
MaxCompute
パラメーター
説明
エンドポイント
コンピュートエンジンのエンドポイントを入力します。例:
http://service.odps.aliyun.com/api。[AccessKey ID]
MaxCompute プロジェクトのデータにアクセスする権限を持つアカウントの AccessKey ID と AccessKey Secret を入力します。
AccessKey ID と AccessKey Secret は、ユーザー情報管理 ページから取得できます。
重要Dataphin と MaxCompute プロジェクト間の接続を正常に行うために、MaxCompute プロジェクト管理者の AccessKey を使用することを推奨します。
メタデータ収集が正しく行われるように、MaxCompute プロジェクトの AccessKey を変更しないでください。
[AccessKey Secret]
Hadoop
Hadoop には、CDH 5.x、CDH 6.x、Cloudera Data Platform 7.x、Alibaba Cloud E-MapReduce 3.x、Alibaba Cloud E-MapReduce 5.x、AsiaInfo DP 5.3、および Huawei FusionInsight 8.x エンジンが含まれます。
マルチエンジンモードでは、Hadoop クラスター、HDFS コンピュートエンジン、Hive メタデータ、Spark JAR サービス、Spark SQL サービス、および Impala タスクの設定は、シングルエンジンモードと同じです。詳細については、「Hadoop クラスター設定」をご参照ください。
AnalyticDB for PostgreSQL
マルチエンジンモードでは、AnalyticDB for PostgreSQL のクラスター設定はシングルエンジンモードと同じです。詳細については、「ADB PG クラスター設定」をご参照ください。
Transwarp TDH 6.x/9.3.x
マルチエンジンモードでは、Transwarp TDH 6.x および 9.3.x クラスター、HDFS、Inceptor、および Inceptor メタデータ接続の設定は、シングルエンジンモードと同じです。詳細については、「Transwarp TDH クラスター設定」をご参照ください。
Transwarp ArgoDB
マルチエンジンモードでは、Transwarp ArgoDB クラスター、HDFS、ArgoDB、および ArgoDB メタデータ接続の設定は、シングルエンジンモードと同じです。詳細については、「Transwarp ArgoDB クラスター設定」をご参照ください。
SelectDB、Doris、および StarRocks
マルチエンジンモードでは、SelectDB、Doris、および StarRocks のクラスター設定はシングルエンジンモードと同じです。詳細については、「SelectDB、Doris クラスター設定」および「StarRocks クラスター設定」をご参照ください。
Databricks
マルチエンジンモードでは、Databricks のクラスター設定はシングルエンジンモードと同じです。詳細については、「Databricks クラスター設定」をご参照ください。
Amazon EMR
マルチエンジンモードでは、Amazon EMR のクラスター設定はシングルエンジンモードと同じです。詳細については、「Amazon EMR クラスター設定」をご参照ください。
Lindorm
パラメーター
説明
core-site.xml
Lindorm の設定ファイルである core-site.xml、hdfs-site.xml、hive-site.xml をアップロードします。設定ファイルについては、「インスタンスへの接続と使用」をご参照ください。
hdfs-site.xml
hive-site.xml (任意)
JDBC URL
Lindorm の JDBC URL を設定します。URL を取得するには、「接続文字列の表示」をご参照ください。
ユーザー名、パスワード
Lindorm インスタンスにアクセスするためのユーザー名とパスワードを入力します。
GaussDB (DWS)
パラメーター
説明
バージョン
現在、バージョン 9.1.0 のみがサポートされています。
[JDBC URL]
JDBC 接続 URL を入力します。例:
jdbc:postgresql://{host};{port}/{database name}。[接続アカウント]
[メタデータ取得と実行に同じアカウントを使用]: メタデータ取得と SQL 実行の両方に単一のユーザー名とパスワードを使用します。
[個別のアカウント]: メタデータ取得と SQL 実行に個別のユーザー名とパスワードを使用します。
[ユーザー名]、[パスワード]
GaussDB (DWS) データベースにログインするためのユーザー名とパスワードを入力します。
説明このパラメーターは、[接続アカウント] に [メタデータ取得と実行に同じアカウントを使用] を選択した場合にのみ使用できます。
[メタデータアカウントのユーザー名]、[メタデータアカウントのパスワード]
メタデータアカウントと実行アカウントのユーザー名とパスワードをそれぞれ入力します。
説明これらのパラメーターは、[接続アカウント] に [個別のアカウント] を選択した場合にのみ使用できます。
[実行アカウントのユーザー名]、[実行アカウントのパスワード]
Hologres
パラメーター
説明
JDBC URL
Hologres コンピュートソースへの接続 URL。フォーマットは
jdbc:postgresql://host:port/dbnameです。ユーザー名、パスワード
コンピュートソースへの接続に使用する認証情報です。
Alibaba Cloud RAM ユーザーの場合は AccessKey ID と AccessKey Secret を、データベースネイティブアカウントの場合はアカウントのユーザー名とパスワードを入力します。
OushuDB
パラメーター
説明
バージョン
現在、バージョン [6.4.0] のみがサポートされています。
[JDBC URL]
JDBC URL を
jdbc:oushudb://{host}:{port}/のフォーマットで入力します。デフォルト実行ユーザー、パスワード
ユーザー名とパスワードを入力します。タスクが正常に実行されるように、ユーザーが必要なデータ権限を持っていることを確認してください。
Alibaba Cloud EMR Serverless Spark
パラメーター
説明
[Endpoint]
Alibaba Cloud EMR Serverless Spark の OpenAPI (SDK) エンドポイントを入力します。
AccessKey ID、AccessKey Secret
AccessKey ID と AccessKey Secret を入力します。
ワークスペース
AccessKey に関連付けられている RAM ユーザーが参加しているワークスペースを選択します (ListWorkspaces)。
その他の設定
MaxCompute
パラメーター
説明
外部テーブルのデフォルトストレージフォーマット
新規外部テーブルのデフォルトストレージフォーマットです。次のフォーマットがサポートされています:
parquet
avro
rcfile
orc
textfile
sequencefile
アドホッククエリの MCQA アクセラレーション
有効にすると、MCQA を使用して MaxCompute プロジェクトのアドホッククエリを高速化できます。
ログ内の Logview URL
ログに Logview URL を表示する方法を指定します。プレーンテキストで表示 または 実行ステートメントにアカウントとパスワードのグローバル変数が含まれている場合に非表示 を選択できます。
デフォルトのライフサイクル
物理テーブルと論理テーブルのデフォルトのライフサイクルです。1~36500 日の値を入力するか、7、14、30、または 360 日をクイック選択できます。
グローバルコンピュートエンジンパラメーター
メモリ割り当て、タスクの優先度、MapJoin の有効化など、ランタイムの動作を制御するためのカスタムパラメーターを設定します。有効にすると、モデリングタスク と SQL コンピュートタスク に個別のパラメーターを設定できます。SQL コンピュートタスクのパラメーターは、開発環境でタスクを実行する場合にも適用されます。
説明パラメーターは、現在のエンジンタイプの構文ルールに従う必要があります。
タスクレベルまたはタスクコードで設定されたパラメーターは、グローバルパラメーターをオーバーライドします。
Hadoop
Hadoop には、CDH 5.x、CDH 6.x、Cloudera Data Platform 7.x、Alibaba Cloud E-MapReduce 3.x、Alibaba Cloud E-MapReduce 5.x、AsiaInfo DP 5.3、および Huawei FusionInsight 8.x エンジンが含まれます。
パラメーター
説明
デフォルトストレージフォーマット
テーブル管理で作成される新しいテーブルのデフォルトストレージフォーマット。次のいずれかのフォーマットを選択できます:
[エンジンのデフォルト (テーブル作成ステートメントで指定可能)]
[hudi]
delta (Delta Lake)
[paimon]
[iceberg]
[kudu]
parquet
[avro]
rcfile
[orc]
テキストファイル
シーケンスファイル
説明hudi、delta (Delta Lake)、paimon、または iceberg フォーマットは、Spark SQL サービス設定 を有効にした場合にのみ使用できます。kudu フォーマットは、Impala タスク設定 を有効にした場合にのみ使用できます。
[標準モデリングのデフォルトコンピュートエンジン]
[Hive]、[Spark]、または [Impala] を選択できます。
説明Spark は、Spark SQL サービス設定 を有効にした場合にのみ使用できます。Impala は、Impala タスク設定 を有効にした場合にのみ使用できます。
グローバル コンピュートエンジン パラメーター
メモリ割り当て、タスク優先度、MapJoin の有効化など、ランタイム動作を制御するためのカスタムパラメーターを設定します。有効にすると、[モデリングタスク] と [SQL コンピュートタスク] に個別のパラメーターを設定できます。SQL コンピュートタスクのパラメーターは、開発環境でタスクを実行する場合にも適用されます。
説明パラメーターは、現在のエンジンタイプの構文ルールに従う必要があります。
タスクレベルまたはタスクコードで設定されたパラメーターは、グローバルパラメーターをオーバーライドします。
AnalyticDB for PostgreSQL および OushuDB
[グローバルコンピュートエンジンパラメーター]: メモリ割り当て、タスク優先度、MapJoin の有効化など、ランタイム動作を制御するためのカスタムパラメーターを設定します。有効にすると、[モデリングタスク] と [SQL コンピュートタスク] に個別のパラメーターを設定できます。SQL コンピュートタスクのパラメーターは、開発環境でタスクを実行する場合にも適用されます。
説明パラメーターは、現在のエンジンタイプの構文ルールに従う必要があります。
タスクレベルまたはタスクコードで設定されたパラメーターは、グローバルパラメーターをオーバーライドします。
Transwarp TDH 6.x/9.3.x、Lindorm、および Alibaba Cloud EMR Serverless Spark
パラメーター
説明
[デフォルトのストレージフォーマット]
テーブル管理で作成される新規テーブルのデフォルトのストレージフォーマットです。次のいずれかのフォーマットを選択できます:
[エンジンのデフォルト (テーブル作成文で指定可能)]
parquet
avro
rcfile
orc
textfile
sequencefile
[グローバルコンピュートエンジンパラメーター]
メモリ割り当て、タスクの優先度、MapJoin の有効化など、ランタイム動作をコントロールするためのカスタムパラメーターを設定します。有効にすると、[モデリングタスク] と [SQL コンピュートタスク] に個別のパラメーターを設定できます。SQL コンピュートタスクのパラメーターは、開発環境でタスクを実行する際にも適用されます。
説明パラメーターは、現在のエンジンタイプの構文ルールに従う必要があります。
タスクレベルまたはタスクコードで設定されたパラメーターは、グローバルパラメーターをオーバーライドします。
Transwarp ArgoDB、SelectDB、StarRocks、および Doris
[グローバルコンピュートエンジンパラメーター]: メモリ割り当て、タスク優先度、MapJoin の有効化など、ランタイム動作を制御するためのカスタムパラメーターを設定します。有効にすると、[モデリングタスク] と [SQL コンピュートタスク] に個別のパラメーターを設定できます。SQL コンピュートタスクのパラメーターは、開発環境でタスクを実行する場合にも適用されます。
Databricks
パラメーター
説明
[デフォルトのストレージフォーマット]
テーブル管理で作成される新しいテーブルのデフォルトストレージフォーマット。次のいずれかのフォーマットを選択できます:
[エンジンのデフォルト (テーブル作成ステートメントで指定可能)]
parquet
avro
[orc]
[binaryfile]
CSV
json
テキスト
グローバル コンピュートエンジン パラメーター
メモリ割り当て、タスク優先度、MapJoin の有効化など、ランタイム動作を制御するためのカスタムパラメーターを設定します。有効にすると、[モデリングタスク] と [SQL コンピュートタスク] に個別のパラメーターを設定できます。SQL コンピュートタスクのパラメーターは、開発環境でタスクを実行する場合にも適用されます。
説明パラメーターは、現在のエンジンタイプの構文ルールに従う必要があります。
タスクレベルまたはタスクコードで設定されたパラメーターは、グローバルパラメーターをオーバーライドします。
Amazon EMR
パラメーター
説明
デフォルトのストレージフォーマット
テーブル管理で作成される新しいテーブルのデフォルトストレージフォーマット。次のいずれかのフォーマットを選択できます:
[エンジンのデフォルト (テーブル作成ステートメントで指定可能)]
hudi
delta (Delta Lake)
[paimon]
iceberg
parquet
avro
rcfile
[orc]
[textfile]
シーケンスファイル
説明hudi、delta (Delta Lake)、paimon、または iceberg フォーマットは、Spark SQL サービス設定 を有効にした後にのみ選択できます。
[標準モデリングのデフォルトコンピュートエンジン]
[Hive] または [Spark] を選択できます。
説明Spark は、Spark SQL サービス設定 を有効にした後にのみ選択できます。
グローバル コンピュートエンジン パラメーター
メモリ割り当て、タスク優先度、MapJoin の有効化など、ランタイム動作を制御するためのカスタムパラメーターを設定します。有効にすると、[モデリングタスク] と [SQL コンピュートタスク] に個別のパラメーターを設定できます。SQL コンピュートタスクのパラメーターは、開発環境でタスクを実行する場合にも適用されます。
説明パラメーターは、現在のエンジンタイプの構文ルールに従う必要があります。
タスクレベルまたはタスクコードで設定されたパラメーターは、グローバルパラメーターをオーバーライドします。
[接続テスト] をクリックします。システムは各サービスへの接続を自動的にテストします。
接続テストが成功した場合、設定を保存できます。テストが失敗した場合、[接続テストに失敗しました] ダイアログボックスが表示され、失敗したサービスとそのエラー詳細が一覧表示されます。
接続テストが成功した後、[保存] をクリックしてクラスターを作成します。