許可權說明
超級管理員、系統管理員和擁有叢集管理-管理許可權的自訂全域角色,均可建立和管理叢集。同時,這些使用者可設定在建立計算源時可引用該叢集的使用者,以及為該叢集指定叢集管理員。
叢集管理員可管理自己負責的叢集。
擁有計算源管理-建立全域角色的使用者,可以在建立計算源時,選擇引用自己有使用許可權的叢集。
建立叢集
在Dataphin首頁的頂部功能表列中,選擇規劃 > 叢集管理。
在叢集管理頁面,單擊建立叢集。
在建立叢集頁面,配置以下參數。
基本資料
參數
描述
叢集名稱
輸入當前叢集的名稱,僅支援中文、英文、數字、以及部分特殊字元
-_.@~()以及空格,長度不超過128個字元。引擎類型
當前支援選擇以下引擎:
MaxCompute
AnalyticDB for PostgreSQL
Aliyun EMR 3.x
Aliyun EMR 5.x
CDH 5.x
CDH 6.x
Cloudera Data Platform 7.x
華為FusionInsight 8.x
亞信DP 5.3
StarRocks
Databricks
Amazon EMR
SelectDB
Doris
GaussDB(DWS)
星環TDH 6.x
星環TDH 9.3.x
星環ArgoDB
Lindorm(計算引擎)
Hologres
OushuDB
Aliyun EMR Serverless Spark
叢集管理員
選擇一個或多個當前租戶下的成員,成為當前叢集的叢集管理員。叢集管理員可管理當前叢集,支援編輯、查看歷史版本和刪除操作。
描述(非必選)
輸入當前叢集的簡單描述,長度不超過128個字元。
叢集安全管控
可使用成員:建立計算源時哪些使用者可以引用當前叢集的配置資訊,可選擇擁有“建立計算源”許可權的角色或指定使用者。
擁有“建立計算源”許可權的角色:預設選中。
指定使用者:支援選擇一個或多個個人帳號和使用者組。
叢集配置
MaxCompute
參數
描述
Endpoint
輸入計算引擎的Endpoint,例如
http://service.odps.aliyun.com/api。AccessKey ID
填寫可以訪問MaxCompute專案資料的帳號的AccessKey ID和AccessKey Secret。
您可在使用者資訊管理頁面,擷取帳號的AccessKey ID和AccessKey Secret。
重要為了保證Dataphin專案空間與MaxCompute專案正常串連,建議填寫MaxCompute專案系統管理員的AccessKey。
為了保證中繼資料正常採集,請盡量不修改MaxCompute專案的AccessKey。
AccessKey Secret
Hadoop
Hadoop包含CDH5.x、CDH6.x、Cloudera Data Platform 7.x、Aliyun EMR 3.x、Aliyun EMR 5.x、亞信DP 5.3、華為FusionInsight 8.x引擎。
多引擎模式下Hadoop的叢集配置、HDFS計算引擎配置、Hive中繼資料配置、Spark Jar服務配置、Spark SQL服務配置、Impala任務配置同單引擎模式,詳情請參見Hadoop叢集配置。
AnalyticDB for PostgreSQL
多引擎模式下AnalyticDB for PostgreSQL的叢集配置同單引擎模式,詳情請參見ADB PG叢集配置。
星環TDH 6.x、星環TDH 9.3.x
多引擎模式下星環TDH 6.x、星環TDH 9.3.x的叢集配置、HDFS資訊配置、Inceptor配置、Inceptor中繼資料串連資訊同單引擎模式,詳情請參見星環TDH叢集配置。
星環ArgoDB
多引擎模式下星環ArgoDB的叢集配置、HDFS資訊配置、ArgoDB配置、ArgoDB中繼資料串連資訊同單引擎模式,詳情請參見星環ArgoDB叢集配置。
SelectDB、Doris、StarRocks
多引擎模式下SelectDB、Doris、StarRocks的叢集配置同單引擎模式,詳情請參見SelectDB、Doris叢集配置、StarRocks叢集配置。
Databricks
多引擎模式下Databricks的叢集配置同單引擎模式,詳情請參見Databricks叢集配置。
Amazon EMR
多引擎模式下Amazon EMR的叢集配置同單引擎模式,詳情請參見Amazon EMR叢集配置。
Lindorm(計算引擎)
參數
描述
core-site.xml
上傳Lindorm(計算引擎)的core-site.xml、hdfs-site.xml和hive-site.xml設定檔。設定檔,請參見串連並使用執行個體。
hdfs-site.xml
hive-site.xml(非必選)
JDBC URL
配置Lindorm(計算引擎)的JDBC URL地址。擷取地址,請參見查看串連地址。
使用者名稱、密碼
訪問Lindorm執行個體的使用者名稱和密碼。
GaussDB(DWS)
參數
描述
版本
當前僅支援9.1.0版本。
JDBC URL
輸入JDBC串連地址,例如
jdbc:postgresql://{host};{port}/{database name}。使用者名稱、密碼
填寫GaussDB(DWS)計算引擎資料庫的登入使用者名稱和密碼。
Hologres
參數
描述
JDBC URL
Hologres計算源的串連地址。串連格式為:
jdbc:postgresql://host:port/dbname。使用者名稱、密碼
填寫串連計算源的使用者名稱和密碼。
若使用阿里雲RAM帳號,可填寫該帳號的AccessKey和AccessKey Secret;若使用資料庫自建帳號,需填寫自建帳號的ID和密碼。
OushuDB
參數
描述
版本
當前僅支援6.4.0。
JDBC URL
輸入JDBC URL,格式為
jdbc:oushudb://{host}:{port}/。預設執行使用者、密碼
輸入鑒權使用者名稱和密碼,為保證任務正常運行,請確保使用者有所需資料許可權。
Aliyun EMR Serverless Spark
參數
描述
Endpoint
輸入Aliyun EMR Serverless Spark OpenAPI(SDK)的Endpoint。
AccessKeyId、AccessKeySecret
輸入AccessKeyID和AccessKey Secret。
工作空間
可選擇AccessKey對應RAM帳號所加入的工作空間(ListWorkspaces)。
其他配置
MaxCompute
參數
描述
外部表格預設儲存格式
建立外部表格預設儲存格式,支援選擇以下格式:
parquet
avro
rcfile
orc
textfile
sequencefile
即席查詢MCQA查詢加速
開啟後,MaxCompute引擎下的專案使用即席查詢時,可選擇MCQA進行查詢加速。
日誌中logview URL
日誌中logview URL的展示形式,可選擇全部明文展示或執行語句包含帳號密碼全域變數時隱藏。
預設生命週期
物理表和邏輯表的預設生命週期,支援輸入1~36500天,或快速選擇7、14、30、360天。
自訂參數生效
開啟後將全域應用到智能計算引擎的代碼建置規則中,起到控制任務運行時的資源分派與運行機制。例如設定任務預設記憶體配置、預設優先順序、MapJoin開啟等。自訂參數配置需遵循當前引擎類型設定。
Hadoop
Hadoop包含CDH5.x、CDH6.x、Cloudera Data Platform 7.x、Aliyun EMR 3.x、Aliyun EMR 5.x、亞信DP 5.3、華為FusionInsight 8.x引擎。
參數
描述
預設儲存格式
在表管理中建立表時預設的儲存格式,可選擇以下格式:
引擎預設(建表語句中可另外指定)
hudi
delta(Delta Lake)
paimon
iceberg
kudu
parquet
avro
rcfile
orc
textfile
sequencefile
說明開啟Spark SQL服務配置後才可選擇hudi、delta(Delta Lake)、paimon、iceberg格式。開啟Impala任務配置後才可選擇kudu格式。
規範建模預設計算引擎
支援選擇Hive、Spark或Impala。
說明開啟Spark SQL服務配置後才可選擇Spark;開啟Impala任務配置後才可選擇Impala。
自訂參數生效
開啟後將全域應用到智能計算引擎的代碼建置規則中,起到控制任務運行時的資源分派與運行機制。例如設定任務預設記憶體配置、預設優先順序、MapJoin開啟等。自訂參數配置需遵循當前引擎類型設定。
AnalyticDB for PostgreSQL、OushuDB
自訂參數生效:開啟後將全域應用到智能計算引擎的代碼建置規則中,起到控制任務運行時的資源分派與運行機制。例如設定任務預設記憶體配置、預設優先順序、MapJoin開啟等。自訂參數配置需遵循當前引擎類型設定。
星環TDH 6.x/9.3.x、Lindorm(計算引擎)、Aliyun EMR Serverless Spark
參數
描述
預設儲存格式
在表管理中建立表時預設的儲存格式,可選擇以下格式:
引擎預設(建表語句中可另外指定)
parquet
avro
rcfile
orc
textfile
sequencefile
自訂參數生效
開啟後將全域應用到智能計算引擎的代碼建置規則中,起到控制任務運行時的資源分派與運行機制。例如設定任務預設記憶體配置、預設優先順序、MapJoin開啟等。自訂參數配置需遵循當前引擎類型設定。
星環ArgoDB、SelectDB、StarRocks、Doris
自訂參數生效:開啟後將全域應用到智能計算引擎的代碼建置規則中,起到控制任務運行時的資源分派與運行機制。例如設定任務預設記憶體配置、預設優先順序、MapJoin開啟等。自訂參數配置需遵循當前引擎類型設定。
Databricks
參數
描述
預設儲存格式
在表管理中建立表時預設的儲存格式,可選擇以下格式:
引擎預設(建表語句中可另外指定)
parquet
avro
orc
binaryfile
csv
json
text
自訂參數生效
開啟後將全域應用到智能計算引擎的代碼建置規則中,起到控制任務運行時的資源分派與運行機制。例如設定任務預設記憶體配置、預設優先順序、MapJoin開啟等。自訂參數配置需遵循當前引擎類型設定。
Amazon EMR
參數
描述
預設儲存格式
在表管理中建立表時預設的儲存格式,可選擇以下格式:
引擎預設(建表語句中可另外指定)
hudi
delta(Delta Lake)
paimon
iceberg
parquet
avro
rcfile
orc
textfile
sequencefile
說明開啟Spark SQL服務配置後才可選擇hudi、delta(Delta Lake)、paimon、iceberg格式。
規範建模預設計算引擎
支援選擇Hive或Spark。
說明開啟Spark SQL服務配置後才可選擇Spark。
自訂參數生效
開啟後將全域應用到智能計算引擎的代碼建置規則中,起到控制任務運行時的資源分派與運行機制。例如設定任務預設記憶體配置、預設優先順序、MapJoin開啟等。自訂參數配置需遵循當前引擎類型設定。
單擊測試連接,系統將自動開始測試與各服務間的串連。
測試連接通過後即可進行儲存,若測試連接未通過,系統將彈出測試連接未通過對話方塊,可在對話方塊中查看未通過測試的服務以及其錯誤詳情。
測試連接通過後,單擊儲存,完成叢集建立。