全部產品
Search
文件中心

Dataphin:建立及管理Hadoop叢集

更新時間:Jan 25, 2025

使用限制

僅當計算引擎為CDH5.xCDH6.xCloudera Data Platform 7.xE-MapReduce3.xE-MapReduce5.x亞信DP5.3華為FusionInsight 8.x時,支援管理Hadoop叢集。

許可權說明

  • 超級管理員系統管理員和擁有Hadoop叢集-管理許可權的自訂全域角色,均可建立和管理Hadoop叢集。同時,這些使用者可設定在建立Hadoop計算源時可引用該叢集的使用者,以及為該叢集指定叢集管理員。

  • 支援叢集管理員對自己負責的叢集進行管理。

  • 擁有計算源管理-建立全域角色的使用者,可以在建立Hadoop計算源時,選擇引用自己有使用許可權的Hadoop叢集。

建立Hadoop叢集

  1. 在Dataphin首頁的頂部功能表列中,選擇規劃 > 計算源

  2. 計算源頁面,單擊管理Hadoop叢集

  3. 管理Hadoop叢集對話方塊中,單擊+建立Hadoop叢集

  4. 建立Hadoop叢集頁面,配置以下參數。

    • 基本資料

      參數

      描述

      叢集名稱

      輸入當前叢集的名稱,僅支援中文、英文、數字、底線(_)和短劃線(-),長度不超過128個字元。

      叢集管理員

      選擇一個或多個當前租戶下的成員,成為當前叢集的叢集管理員。叢集管理員可管理當前叢集,支援編輯、查看歷史版本和刪除操作。

      描述(非必選)

      輸入當前叢集的簡單描述,長度不超過128個字元。

    • 叢集安全管控

      可使用成員:建立計算源時哪些使用者可以引用當前叢集的配置資訊,可選擇擁有“建立計算源”許可權的角色指定使用者

      • 擁有“建立計算源”許可權的角色:預設選中。

      • 指定使用者:支援選擇一個或多個個人帳號和使用者組。

    • 叢集配置

      參數

      描述

      叢集儲存

      選擇HDFSOSS-HDFS

      • 當選擇為HDFS時,支援在NameNode配置項中新增NameNode。

      • 當選擇為OSS-HDFS時,還需配置叢集儲存跟目錄、AccessKey IDAccessKey Secret

      說明

      僅當計算引擎為E-MapReduce5.x時,支援配置此項。其他計算引擎均預設為HDFS

      NameNode

      單擊+新增,在新增NameNode對話方塊中配置相關參數,支援新增多個NameNode。

      NameNode為HDFS叢集中NameNode節點的HostName或者IP和連接埠。配置範例:

      • NameNode:193.168.xx.xx

      • Web UI Port:50070

      • IPC Port:8020

      Web UI Port和IPC Port兩個連接埠中,至少選中一個。配置完成後NameNode為host=192.168.xx.xx,webUiPort=50070,ipcPort=8020

      說明

      當叢集儲存為HDFS時,支援配置此項。

      叢集儲存根目錄

      可查看EMR叢集基礎資訊擷取,格式為oss://<Bucket>.<Endpoint>/

      說明

      僅當計算引擎為E-MapReduce5.x,且叢集儲存選擇為OSS-HDFS時,支援配置此項

      AccessKey IDAccessKey Secret

      輸入OSS的訪問AccessKey ID和AccessKey Secret。

      說明
      • 此處填寫的配置優先順序高於core-site.xml中配置的AccessKey。

      • 僅當計算引擎為E-MapReduce5.x,且叢集儲存選擇為OSS-HDFS時,支援配置此項

      core-site.xml

      上傳當前計算引擎的core-site.xml、hdfs-site.xml、hive-site.xml、hivemetastore-site.xml、yarn-site.xml和其他設定檔。

      說明
      • 僅當計算引擎為E-MapReduce5.x,且叢集儲存選擇為OSS-HDFS時,無需上傳hdfs-site.xml檔案。

      • Hive中繼資料擷取方式選擇為HMS時,必須上傳hive-site.xml檔案。

      • 計算引擎為E-MapReduce5.x華為FusionInsight 8.x,且Hive中繼資料擷取方式選擇為HMS時,必須上傳hivemetastore-site.xml檔案。

      hdfs-site.xml

      hive-site.xml(非必選)

      hivemetastore-site.xml(非必選)

      yarn-site.xml(非必選)

      其他設定檔(非必選)

      任務執行機器

      配置MapReduce或Spark Jar的執行機器的串連地址。格式為hostname:portip:port,port預設為22且非必填。

      執行使用者名稱密碼

      MR任務執行、HDFS讀存等登入任務執行機器的使用者名稱和密碼,需確保有任務提交許可權

      認證方式

      支援無認證Kerberos認證方式。

      Kerberos是一種基於對稱金鑰技術的身份認證協議,可以為其他服務提供身份認證功能,且支援SSO(即用戶端身份認證後,可以訪問多個服務,例如HBase和HDFS)。

      當認證方式選擇Kerberos時,還需選擇Kerberos配置方式

      • Krb5認證檔案:上傳Krb5檔案進行Kerberos認證。

      • KDC Server地址:KDC伺服器位址,輔助完成Kerberos認證。支援配置多個KDC Server服務地址,使用英文分號(;)分隔。

      說明

      當計算引擎類型為E-MapReduce 5.x時,僅支援krb5檔案配置配置方式。

    • HDFS資訊配置

      參數

      描述

      認證方式

      支援無認證Kerberos

      如果Hadoop叢集有Kerberos認證,則需要開啟HDFS Kerberos並上傳Keytab File認證檔案與配置Principal。

      • Keytab File:上傳keytab檔案,您可以在HDFS Server上擷取keytab檔案。

      • Principal:填寫HDFS Keytab File檔案對應的Kerberos認證使用者名稱。

      說明

      僅當計算引擎為E-MapReduce 5.x,且叢集儲存選擇為OSS-HDFS時,無需配置此項。

      HDFS User(非必選)

      指定檔案上傳的使用者名稱,如果不填則預設為執行使用者名稱。

      說明

      僅當認證方式選擇為無認證時,支援配置此項。

    • Hive計算引擎配置

      參數

      描述

      JDBC URL

      支援配置以下三種串連地址:

      • Hive Server的串連地址,格式為jdbc:hive://{串連地址}:{連接埠}/{資料庫名稱}

      • ZooKeeper的串連地址。例如jdbc:hive2://zk01:2181,zk02:2181,zk03:2181/;serviceDiscoveryMode=zooKeeper;zooKeeperNamespace=hiveserver2

      • 開啟Kerberos的串連地址,格式為jdbc:hive2://{串連地址}:{連接埠}/{資料庫名稱};principal=hive/_HOST@xx.com

      認證方式

      支援無認證LDAPKerberos認證方式。

      • 無認證:無認證方式需填寫Hive服務的使用者名稱。

      • LDAP:LDAP認證方式需填寫Hive服務的使用者名稱和密碼。

      • Kerberos:如果Hadoop叢集有Kerberos認證,則需要開啟Hive Kerberos並上傳Keytab File認證檔案與配置Principal。

        • Keytab File:上傳keytab檔案,您可以在Hive Server上擷取keytab檔案。

        • Principal:填寫Hive Keytab File檔案對應的Kerberos認證使用者名稱。

      使用者名稱

      填寫Hive服務的使用者名稱。

      說明

      認證方式選擇為無認證LDAP時,支援配置此項。所填寫的使用者須確保具備任務的執行許可權,以保證任務的正常執行。

      密碼

      填寫Hive服務的使用者的密碼。

      說明

      僅當認證方式選擇為LADP時,支援配置此項。

      執行引擎

      預設:Default:綁定該計算源的專案下的任務(包括邏輯表任務)預設使用該執行引擎。

      自訂:選擇其他計算引擎類型。

    • Hive中繼資料配置

      中繼資料擷取方式:支援中繼資料庫HMSDLF三種來源資料擷取方式。擷取方式不同,所需配置資訊不同。

      重要
      • 僅當計算引擎為E-MapReduce5.x時,支援選擇DLF擷取方式。

      • 若使用DLF方式擷取中繼資料,請先在設定檔中上傳hive-site.xml設定檔。

      中繼資料擷取方式

      參數

      描述

      中繼資料庫

      資料庫類型

      根據叢集中使用的中繼資料庫類型,選擇資料庫。Dataphin支援選擇MySQL

      支援MySQL的版本包括MySQL 5.1.43MySQL 5.6/5.7MySQL 8版本。

      JDBC URL

      填寫目標資料庫的JDBC串連地址。例如:

      MySQL:格式為jdbc:mysql://{串連地址}[,failoverhost...]{連接埠}/{資料庫名稱} [?propertyName1][=propertyValue1][&propertyName2][=propertyValue2]...

      使用者名稱密碼

      填寫登入中繼資料庫的使用者名稱和密碼。

      HMS

      認證方式

      HMS擷取方式支援無認證、LDAP、Kerberos三種認證方式。Kerberos認證方式需上傳Keytab File檔案及配置Principal。

      DLF

      Endpoint

      填寫叢集在DLF資料中心所在地區的Endpoint。如何擷取,請參見DLF Region和Endpoint對照表

      AccessKey IDAccessKey Secret

      填寫叢集所在帳號的AccessKey ID和AccessKey Secret。

      您可在使用者資訊管理頁面,擷取帳號的AccessKey ID和AccessKey Secret。

    • Spark Jar服務配置

      重要

      由於效能原因,修改Spark執行機器或本地用戶端配置,不會做連通性和有效性測試。請修改的第一時間,到研發模組運行測試程式檢測Spark服務是否可用。

      參數

      描述

      Spark執行機器

      如果Hadoop叢集有部署Spark,則支援開啟Spark SQL任務

      說明

      使用叢集配置中的任務執行機器上的Spark用戶端時,需提前在執行機器部署並完成相關設定(例如設定環境變數、建立執行使用者、對執行使用者授權等)。但僅支援一台執行機器,無法實現高可用和負載平衡。Spark Job提交後,Dataphin側無法查看日誌和終止。

      執行使用者名稱密碼

      填寫登入計算執行機器使用者名稱和密碼。

      說明

      需確認使用者已開通Spark-submit許可權。

      Spark本地用戶端

      支援開啟或關閉Spark本地用戶端。開啟後,若存在引用Spark本地用戶端的任務,則不支援關閉。使用Spark本地用戶端運行Spark程式,須上傳yarn-site.xml設定檔,且確保Dataphin與yarn之間的連接埠串連正常

      單擊+新增用戶端,在新增用戶端對話方塊中輸入用戶端名稱並上傳用戶端檔案

      • 用戶端名稱:僅支援字母、數字、底線(_)、短劃線(-)和半形句號(.),長度不超過32個字元。

        同一個Hadoop叢集內,用戶端名稱唯一(區分大小寫)。

      • 用戶端檔案:上傳用戶端檔案,檔案格式僅支援.tgz和.zip。

        說明

        可前往https://spark.apache.org/downloads.html下載相應版本的Spark用戶端;自有用戶端須與社區版目錄結構一致,附帶Hadoop用戶端,並上傳完整的壓縮包(格式為.tgz或.zip)。Dataphin使用上傳的用戶端通過調度叢集提交Job,可以實現Job的全生命週期管理。

      用戶端上傳完成後,您可在用戶端列表中,單擊image表徵圖編輯對應用戶端,若上傳新的用戶端檔案,則新的用戶端檔案將覆蓋已有檔案。單擊image表徵圖,可刪除對應用戶端。

      說明

      若已上傳的用戶端被任務(包括草稿狀態任務)引用,則不支援編輯用戶端名稱和刪除用戶端操作。

      認證方式

      支援無認證Kerberos認證方式。

      如果Hadoop叢集有Kerberos認證,則需要開啟Spark Kerberos並上傳Keytab File認證檔案與配置Principal。

      • Keytab File:上傳keytab檔案,您可以在Spark Server上擷取keytab檔案。

      • Principal:填寫Spark Keytab File檔案對應的Kerberos認證使用者名稱。

    • Spark SQL服務配置

      參數

      描述

      Spark SQL任務

      如果Hadoop叢集有部署Spark,則支援開啟Spark SQL任務

      Spark版本

      目前僅支援3.x。

      服務類型

      選擇Spark JDBC訪問的目標伺服器類型。

      JDBC URL

      輸入JDBC串連方式,例如:jdbc:hive2://host1:port1/jdbc:kyuubi://host1:port1/無需填寫database name

      認證方式

      支援無認證LDAPKerberos認證方式。

      • 無認證:無認證方式需填寫Spark服務的使用者名稱。

      • LDAP:LDAP認證方式需填寫Spark服務的使用者名稱和密碼。

      • Kerberos:如果Hadoop叢集有Kerberos認證,則需要開啟Spark Kerberos並上傳Keytab File認證檔案與配置Principal。

        • Keytab File:上傳keytab檔案,您可以在Spark Server上擷取keytab檔案。

        • Principal:填寫Spark Keytab File檔案對應的Kerberos認證使用者名稱。

      說明

      無認證和LDAP方式所填寫的使用者須確保具備任務的執行許可權,以保證任務的正常執行。

      使用者名稱

      填寫Spark服務的使用者名稱。

      說明

      認證方式選擇為無認證LDAP時,支援配置此項。所填寫的使用者須確保具備任務的執行許可權,以保證任務的正常執行。

      密碼

      填寫Spark服務使用者的密碼。

      說明

      僅當認證方式選擇為LADP時,支援配置此項。

      SQL任務隊列設定

      不同服務類型使用不同的任務SQL任務隊列。詳情如下:

      • Spark Thrift Server:不支援設定任務隊列。

      • Kyuubi:使用HDFS串連資訊的優先順序隊列設定,僅當Kyuubi使用Yarn作為資源調度時生效,生產任務使用Connection共用層級。

      • Livy:使用HDFS串連資訊的優先順序隊列設定,僅當Livy使用Yarn作為資源調度時生效,即席查詢及生產任務均使用新的Connection執行。

      • MapReduce(MRS):使用HDFS串連資訊的優先順序隊列設定。

    • Impala任務配置

      參數

      描述

      Impala任務

      如果Hadoop叢集有部署Impala,則支援開啟Impala任務。

      JDBC URL

      輸入Impala的JDBC串連方式,例如:jdbc:impala://host:port/無需填寫schema

      認證方式

      支援無認證LDAPKerberos認證方式。

      • 無認證:無認證方式需填寫Impala使用者名稱。

      • LDAP:LDAP認證方式需填寫Impala的使用者名稱和密碼。

      • Kerberos:Kerberos認證方式需上傳Keytab File認證檔案與配置Principal。

      使用者名稱

      填寫Impala使用者名稱。

      說明

      認證方式選擇為無認證LDAP時,支援配置此項。所填寫的使用者須確保具備任務的執行許可權,以保證任務的正常執行。

      密碼

      填寫Impala使用者的密碼。

      說明

      僅當認證方式選擇為LADP時,支援配置此項。

      開發工作單位請求池

      輸入用於開發工作單位的Impala請求池(request pool)名稱。

      周期工作要求池

      輸入用於周期任務的Impala請求池(request pool)名稱。

  5. 單擊測試連接,系統將自動開始測試與各服務間的串連。

    測試連接通過後即可進行儲存,若測試連接未通過,系統將彈出測試連接未通過對話方塊,可在對話方塊中查看未通過測試的服務以及其錯誤詳情。

  6. 測試連接通過後,單擊儲存,完成Hadoop叢集的建立。

管理Hadoop叢集

  1. 在Dataphin首頁的頂部功能表列中,選擇規劃 > 計算源

  2. 計算源頁面,單擊管理Hadoop叢集

  3. 管理Hadoop叢集對話方塊中,查看Hadoop叢集列表,列表中展示叢集名稱、叢集管理員、關聯計算源、建立資訊和修改資訊等資訊。

    • 關聯計算源:展示關聯計算源的總數,單擊image表徵圖查看關聯計算源的列表,單擊計算原名稱將跳轉至計算源頁面。

    • 建立資訊:記錄建立使用者和建立時間。

    • 修改資訊:記錄最近一次編輯當前叢集的使用者名稱和修改時間。

    說明

    計算任務只能在一個叢集中運行,不同Hadoop叢集之間的資料無法進行聯結操作。

  4. (可選)可在搜尋方塊中輸入集群名稱,進行模糊搜尋。

  5. 在Hadoop叢集列表操作列中,對目的地組群進行相關管理操作。支援的操作如下。

    操作項

    說明

    查看

    單擊目的地組群操作列的image表徵圖,查看叢集目前的版本的詳細資料。擁有Hadoop叢集-管理許可權的使用者,可下載叢集設定檔。

    編輯

    單擊目的地組群操作列的image表徵圖,開啟編輯Hadoop叢集頁面。您可在編輯Hadoop叢集頁面中修改已有的配置,其中Spark Jar任務、Spark SQL任務、Impala任務的服務配置若為開啟狀態,且叢集所關聯的計算源下已經開啟了相應服務,則不可關閉相關服務。

    編輯完成後,若僅修改了叢集基本資料叢集安全管控資訊,則無需測試連接,直接儲存即可;若有其他修改,則仍需進行測試連接,測試連接成功後單擊儲存,在彈出的對話方塊中填寫變更說明並單擊確定

    複製

    單擊目的地組群操作列的image表徵圖,系統將自動複製當前叢集的所有資料並開啟建立Hadoop叢集頁面,您可在已有配置基礎上進行修改。

    歷史版本

    單擊目的地組群操作列的image表徵圖,選擇歷史版本,對話方塊中展示當前叢集各版本資訊,包含版本名稱、修改人、變更說明等資訊。您可在歷史版本進行查看對比復原操作。

    • 查看:單擊目標版本操作列中的image表徵圖,跳轉至查看Hadoop叢集頁面,查看叢集目前的版本的詳細資料。擁有Hadoop叢集-管理許可權的使用者,可下載叢集設定檔。

    • 對比:單擊目標版本操作列中的image表徵圖,跳轉至版本對比頁面。可在對比頁面中篩選的下拉式清單中選擇不同版本,預設將目前的版本的Hadoop叢集和目標版本進行對比。

    • 復原:單擊目標版本操作列中的image表徵圖,在彈出的對話方塊中單擊確定

      單擊確定後,系統將對該版本的叢集資訊自動進行測試連接,若測試通過則正常進行復原,若復原失敗,系統將彈出復原失敗的提示資訊,您可在提示資訊中查看具體失敗原因。若測試連接失敗則結束本次復原,您可在彈出的對話方塊中查看測試連接失敗的服務。

    刪除

    說明
    • 僅在當前Hadoop叢集下沒有關聯的計算源時,支援刪除當前叢集。

    • 叢集刪除後無法恢複

    單擊目的地組群操作列的image表徵圖,選擇刪除,在彈出的對話方塊中,單擊確定