使用限制
僅當計算引擎為CDH5.x、CDH6.x、Cloudera Data Platform 7.x、E-MapReduce3.x、E-MapReduce5.x、亞信DP5.3或華為FusionInsight 8.x時,支援管理Hadoop叢集。
許可權說明
超級管理員、系統管理員和擁有Hadoop叢集-管理許可權的自訂全域角色,均可建立和管理Hadoop叢集。同時,這些使用者可設定在建立Hadoop計算源時可引用該叢集的使用者,以及為該叢集指定叢集管理員。
支援叢集管理員對自己負責的叢集進行管理。
擁有計算源管理-建立全域角色的使用者,可以在建立Hadoop計算源時,選擇引用自己有使用許可權的Hadoop叢集。
建立Hadoop叢集
在Dataphin首頁的頂部功能表列中,選擇規劃 > 計算源。
在計算源頁面,單擊管理Hadoop叢集。
在管理Hadoop叢集對話方塊中,單擊+建立Hadoop叢集。
在建立Hadoop叢集頁面,配置以下參數。
基本資料
參數
描述
叢集名稱
輸入當前叢集的名稱,僅支援中文、英文、數字、底線(_)和短劃線(-),長度不超過128個字元。
叢集管理員
選擇一個或多個當前租戶下的成員,成為當前叢集的叢集管理員。叢集管理員可管理當前叢集,支援編輯、查看歷史版本和刪除操作。
描述(非必選)
輸入當前叢集的簡單描述,長度不超過128個字元。
叢集安全管控
可使用成員:建立計算源時哪些使用者可以引用當前叢集的配置資訊,可選擇擁有“建立計算源”許可權的角色或指定使用者。
擁有“建立計算源”許可權的角色:預設選中。
指定使用者:支援選擇一個或多個個人帳號和使用者組。
叢集配置
參數
描述
叢集儲存
選擇HDFS或OSS-HDFS。
當選擇為HDFS時,支援在NameNode配置項中新增NameNode。
當選擇為OSS-HDFS時,還需配置叢集儲存跟目錄、AccessKey ID和AccessKey Secret。
說明僅當計算引擎為E-MapReduce5.x時,支援配置此項。其他計算引擎均預設為HDFS。
NameNode
單擊+新增,在新增NameNode對話方塊中配置相關參數,支援新增多個NameNode。
NameNode為HDFS叢集中NameNode節點的HostName或者IP和連接埠。配置範例:
NameNode:193.168.xx.xx
Web UI Port:50070
IPC Port:8020
Web UI Port和IPC Port兩個連接埠中,至少選中一個。配置完成後NameNode為
host=192.168.xx.xx,webUiPort=50070,ipcPort=8020。說明當叢集儲存為HDFS時,支援配置此項。
叢集儲存根目錄
可查看EMR叢集基礎資訊擷取,格式為
oss://<Bucket>.<Endpoint>/。說明僅當計算引擎為E-MapReduce5.x,且叢集儲存選擇為OSS-HDFS時,支援配置此項。
AccessKey ID、AccessKey Secret
輸入OSS的訪問AccessKey ID和AccessKey Secret。
說明此處填寫的配置優先順序高於core-site.xml中配置的AccessKey。
僅當計算引擎為E-MapReduce5.x,且叢集儲存選擇為OSS-HDFS時,支援配置此項。
core-site.xml
上傳當前計算引擎的core-site.xml、hdfs-site.xml、hive-site.xml、hivemetastore-site.xml、yarn-site.xml和其他設定檔。
說明僅當計算引擎為E-MapReduce5.x,且叢集儲存選擇為OSS-HDFS時,無需上傳hdfs-site.xml檔案。
當Hive中繼資料擷取方式選擇為HMS時,必須上傳hive-site.xml檔案。
當計算引擎為E-MapReduce5.x或華為FusionInsight 8.x,且Hive中繼資料擷取方式選擇為HMS時,必須上傳hivemetastore-site.xml檔案。
hdfs-site.xml
hive-site.xml(非必選)
hivemetastore-site.xml(非必選)
yarn-site.xml(非必選)
其他設定檔(非必選)
任務執行機器
配置MapReduce或Spark Jar的執行機器的串連地址。格式為
hostname:port或ip:port,port預設為22且非必填。執行使用者名稱、密碼
MR任務執行、HDFS讀存等登入任務執行機器的使用者名稱和密碼,需確保有任務提交許可權。
認證方式
支援無認證和Kerberos認證方式。
Kerberos是一種基於對稱金鑰技術的身份認證協議,可以為其他服務提供身份認證功能,且支援SSO(即用戶端身份認證後,可以訪問多個服務,例如HBase和HDFS)。
當認證方式選擇Kerberos時,還需選擇Kerberos配置方式。
Krb5認證檔案:上傳Krb5檔案進行Kerberos認證。
KDC Server地址:KDC伺服器位址,輔助完成Kerberos認證。支援配置多個KDC Server服務地址,使用英文分號(;)分隔。
說明當計算引擎類型為E-MapReduce 5.x時,僅支援krb5檔案配置配置方式。
HDFS資訊配置
參數
描述
認證方式
支援無認證和Kerberos。
如果Hadoop叢集有Kerberos認證,則需要開啟HDFS Kerberos並上傳Keytab File認證檔案與配置Principal。
Keytab File:上傳keytab檔案,您可以在HDFS Server上擷取keytab檔案。
Principal:填寫HDFS Keytab File檔案對應的Kerberos認證使用者名稱。
說明僅當計算引擎為E-MapReduce 5.x,且叢集儲存選擇為OSS-HDFS時,無需配置此項。
HDFS User(非必選)
指定檔案上傳的使用者名稱,如果不填則預設為執行使用者名稱。
說明僅當認證方式選擇為無認證時,支援配置此項。
Hive計算引擎配置
參數
描述
JDBC URL
支援配置以下三種串連地址:
Hive Server的串連地址,格式為
jdbc:hive://{串連地址}:{連接埠}/{資料庫名稱}。ZooKeeper的串連地址。例如
jdbc:hive2://zk01:2181,zk02:2181,zk03:2181/;serviceDiscoveryMode=zooKeeper;zooKeeperNamespace=hiveserver2。開啟Kerberos的串連地址,格式為
jdbc:hive2://{串連地址}:{連接埠}/{資料庫名稱};principal=hive/_HOST@xx.com。
認證方式
支援無認證、LDAP和Kerberos認證方式。
無認證:無認證方式需填寫Hive服務的使用者名稱。
LDAP:LDAP認證方式需填寫Hive服務的使用者名稱和密碼。
Kerberos:如果Hadoop叢集有Kerberos認證,則需要開啟Hive Kerberos並上傳Keytab File認證檔案與配置Principal。
Keytab File:上傳keytab檔案,您可以在Hive Server上擷取keytab檔案。
Principal:填寫Hive Keytab File檔案對應的Kerberos認證使用者名稱。
使用者名稱
填寫Hive服務的使用者名稱。
說明認證方式選擇為無認證或LDAP時,支援配置此項。所填寫的使用者須確保具備任務的執行許可權,以保證任務的正常執行。
密碼
填寫Hive服務的使用者的密碼。
說明僅當認證方式選擇為LADP時,支援配置此項。
執行引擎
預設:Default:綁定該計算源的專案下的任務(包括邏輯表任務)預設使用該執行引擎。
自訂:選擇其他計算引擎類型。
Hive中繼資料配置
中繼資料擷取方式:支援中繼資料庫、HMS、DLF三種來源資料擷取方式。擷取方式不同,所需配置資訊不同。
重要僅當計算引擎為E-MapReduce5.x時,支援選擇DLF擷取方式。
若使用DLF方式擷取中繼資料,請先在設定檔中上傳hive-site.xml設定檔。
中繼資料擷取方式
參數
描述
中繼資料庫
資料庫類型
根據叢集中使用的中繼資料庫類型,選擇資料庫。Dataphin支援選擇MySQL。
支援MySQL的版本包括MySQL 5.1.43、MySQL 5.6/5.7和MySQL 8版本。
JDBC URL
填寫目標資料庫的JDBC串連地址。例如:
MySQL:格式為
jdbc:mysql://{串連地址}[,failoverhost...]{連接埠}/{資料庫名稱} [?propertyName1][=propertyValue1][&propertyName2][=propertyValue2]...。使用者名稱、密碼
填寫登入中繼資料庫的使用者名稱和密碼。
HMS
認證方式
HMS擷取方式支援無認證、LDAP、Kerberos三種認證方式。Kerberos認證方式需上傳Keytab File檔案及配置Principal。
DLF
Endpoint
填寫叢集在DLF資料中心所在地區的Endpoint。如何擷取,請參見DLF Region和Endpoint對照表。
AccessKey ID、AccessKey Secret
填寫叢集所在帳號的AccessKey ID和AccessKey Secret。
您可在使用者資訊管理頁面,擷取帳號的AccessKey ID和AccessKey Secret。
Spark Jar服務配置
重要由於效能原因,修改Spark執行機器或本地用戶端配置,不會做連通性和有效性測試。請修改的第一時間,到研發模組運行測試程式檢測Spark服務是否可用。
參數
描述
Spark執行機器
如果Hadoop叢集有部署Spark,則支援開啟Spark SQL任務。
說明使用叢集配置中的任務執行機器上的Spark用戶端時,需提前在執行機器部署並完成相關設定(例如設定環境變數、建立執行使用者、對執行使用者授權等)。但僅支援一台執行機器,無法實現高可用和負載平衡。Spark Job提交後,Dataphin側無法查看日誌和終止。
執行使用者名稱、密碼
填寫登入計算執行機器使用者名稱和密碼。
說明需確認使用者已開通Spark-submit許可權。
Spark本地用戶端
支援開啟或關閉Spark本地用戶端。開啟後,若存在引用Spark本地用戶端的任務,則不支援關閉。使用Spark本地用戶端運行Spark程式,須上傳yarn-site.xml設定檔,且確保Dataphin與yarn之間的連接埠串連正常。
單擊+新增用戶端,在新增用戶端對話方塊中輸入用戶端名稱並上傳用戶端檔案。
用戶端名稱:僅支援字母、數字、底線(_)、短劃線(-)和半形句號(.),長度不超過32個字元。
同一個Hadoop叢集內,用戶端名稱唯一(區分大小寫)。
用戶端檔案:上傳用戶端檔案,檔案格式僅支援.tgz和.zip。
說明可前往https://spark.apache.org/downloads.html下載相應版本的Spark用戶端;自有用戶端須與社區版目錄結構一致,附帶Hadoop用戶端,並上傳完整的壓縮包(格式為.tgz或.zip)。Dataphin使用上傳的用戶端通過調度叢集提交Job,可以實現Job的全生命週期管理。
用戶端上傳完成後,您可在用戶端列表中,單擊
表徵圖編輯對應用戶端,若上傳新的用戶端檔案,則新的用戶端檔案將覆蓋已有檔案。單擊
表徵圖,可刪除對應用戶端。說明若已上傳的用戶端被任務(包括草稿狀態任務)引用,則不支援編輯用戶端名稱和刪除用戶端操作。
認證方式
支援無認證或Kerberos認證方式。
如果Hadoop叢集有Kerberos認證,則需要開啟Spark Kerberos並上傳Keytab File認證檔案與配置Principal。
Keytab File:上傳keytab檔案,您可以在Spark Server上擷取keytab檔案。
Principal:填寫Spark Keytab File檔案對應的Kerberos認證使用者名稱。
Spark SQL服務配置
參數
描述
Spark SQL任務
如果Hadoop叢集有部署Spark,則支援開啟Spark SQL任務。
Spark版本
目前僅支援3.x。
服務類型
選擇Spark JDBC訪問的目標伺服器類型。
JDBC URL
輸入JDBC串連方式,例如:
jdbc:hive2://host1:port1/或jdbc:kyuubi://host1:port1/,無需填寫database name。認證方式
支援無認證、LDAP和Kerberos認證方式。
無認證:無認證方式需填寫Spark服務的使用者名稱。
LDAP:LDAP認證方式需填寫Spark服務的使用者名稱和密碼。
Kerberos:如果Hadoop叢集有Kerberos認證,則需要開啟Spark Kerberos並上傳Keytab File認證檔案與配置Principal。
Keytab File:上傳keytab檔案,您可以在Spark Server上擷取keytab檔案。
Principal:填寫Spark Keytab File檔案對應的Kerberos認證使用者名稱。
說明無認證和LDAP方式所填寫的使用者須確保具備任務的執行許可權,以保證任務的正常執行。
使用者名稱
填寫Spark服務的使用者名稱。
說明認證方式選擇為無認證或LDAP時,支援配置此項。所填寫的使用者須確保具備任務的執行許可權,以保證任務的正常執行。
密碼
填寫Spark服務使用者的密碼。
說明僅當認證方式選擇為LADP時,支援配置此項。
SQL任務隊列設定
不同服務類型使用不同的任務SQL任務隊列。詳情如下:
Spark Thrift Server:不支援設定任務隊列。
Kyuubi:使用HDFS串連資訊的優先順序隊列設定,僅當Kyuubi使用Yarn作為資源調度時生效,生產任務使用Connection共用層級。
Livy:使用HDFS串連資訊的優先順序隊列設定,僅當Livy使用Yarn作為資源調度時生效,即席查詢及生產任務均使用新的Connection執行。
MapReduce(MRS):使用HDFS串連資訊的優先順序隊列設定。
Impala任務配置
參數
描述
Impala任務
如果Hadoop叢集有部署Impala,則支援開啟Impala任務。
JDBC URL
輸入Impala的JDBC串連方式,例如:
jdbc:impala://host:port/,無需填寫schema。認證方式
支援無認證、LDAP、Kerberos認證方式。
無認證:無認證方式需填寫Impala使用者名稱。
LDAP:LDAP認證方式需填寫Impala的使用者名稱和密碼。
Kerberos:Kerberos認證方式需上傳Keytab File認證檔案與配置Principal。
使用者名稱
填寫Impala使用者名稱。
說明認證方式選擇為無認證或LDAP時,支援配置此項。所填寫的使用者須確保具備任務的執行許可權,以保證任務的正常執行。
密碼
填寫Impala使用者的密碼。
說明僅當認證方式選擇為LADP時,支援配置此項。
開發工作單位請求池
輸入用於開發工作單位的Impala請求池(request pool)名稱。
周期工作要求池
輸入用於周期任務的Impala請求池(request pool)名稱。
單擊測試連接,系統將自動開始測試與各服務間的串連。
測試連接通過後即可進行儲存,若測試連接未通過,系統將彈出測試連接未通過對話方塊,可在對話方塊中查看未通過測試的服務以及其錯誤詳情。
測試連接通過後,單擊儲存,完成Hadoop叢集的建立。
管理Hadoop叢集
在Dataphin首頁的頂部功能表列中,選擇規劃 > 計算源。
在計算源頁面,單擊管理Hadoop叢集。
在管理Hadoop叢集對話方塊中,查看Hadoop叢集列表,列表中展示叢集名稱、叢集管理員、關聯計算源、建立資訊和修改資訊等資訊。
關聯計算源:展示關聯計算源的總數,單擊
表徵圖查看關聯計算源的列表,單擊計算原名稱將跳轉至計算源頁面。建立資訊:記錄建立使用者和建立時間。
修改資訊:記錄最近一次編輯當前叢集的使用者名稱和修改時間。
說明計算任務只能在一個叢集中運行,不同Hadoop叢集之間的資料無法進行聯結操作。
(可選)可在搜尋方塊中輸入集群名稱,進行模糊搜尋。
在Hadoop叢集列表操作列中,對目的地組群進行相關管理操作。支援的操作如下。
操作項
說明
查看
單擊目的地組群操作列的
表徵圖,查看叢集目前的版本的詳細資料。擁有Hadoop叢集-管理許可權的使用者,可下載叢集設定檔。編輯
單擊目的地組群操作列的
表徵圖,開啟編輯Hadoop叢集頁面。您可在編輯Hadoop叢集頁面中修改已有的配置,其中Spark Jar任務、Spark SQL任務、Impala任務的服務配置若為開啟狀態,且叢集所關聯的計算源下已經開啟了相應服務,則不可關閉相關服務。編輯完成後,若僅修改了叢集基本資料和叢集安全管控資訊,則無需測試連接,直接儲存即可;若有其他修改,則仍需進行測試連接,測試連接成功後單擊儲存,在彈出的對話方塊中填寫變更說明並單擊確定。
複製
單擊目的地組群操作列的
表徵圖,系統將自動複製當前叢集的所有資料並開啟建立Hadoop叢集頁面,您可在已有配置基礎上進行修改。歷史版本
單擊目的地組群操作列的
表徵圖,選擇歷史版本,對話方塊中展示當前叢集各版本資訊,包含版本名稱、修改人、變更說明等資訊。您可在歷史版本進行查看、對比和復原操作。查看:單擊目標版本操作列中的
表徵圖,跳轉至查看Hadoop叢集頁面,查看叢集目前的版本的詳細資料。擁有Hadoop叢集-管理許可權的使用者,可下載叢集設定檔。對比:單擊目標版本操作列中的
表徵圖,跳轉至版本對比頁面。可在對比頁面中篩選的下拉式清單中選擇不同版本,預設將目前的版本的Hadoop叢集和目標版本進行對比。復原:單擊目標版本操作列中的
表徵圖,在彈出的對話方塊中單擊確定。單擊確定後,系統將對該版本的叢集資訊自動進行測試連接,若測試通過則正常進行復原,若復原失敗,系統將彈出復原失敗的提示資訊,您可在提示資訊中查看具體失敗原因。若測試連接失敗則結束本次復原,您可在彈出的對話方塊中查看測試連接失敗的服務。
刪除
說明僅在當前Hadoop叢集下沒有關聯的計算源時,支援刪除當前叢集。
叢集刪除後無法恢複。
單擊目的地組群操作列的
表徵圖,選擇刪除,在彈出的對話方塊中,單擊確定。