Flink計算源用於承載Dataphin專案下基於Flink的計算資源,只有綁定了Flink計算源的專案,才支援基於Flink引擎研發計算任務。本文將為您介紹如何建立Flink計算源。
前提條件
當前租戶已經啟用Apache Flink作為Realtime Compute引擎。更多資訊,請參見設定Realtime Compute引擎。
僅支援具備建立計算源許可權點的自訂使用者角色,以及超級管理員和專案系統管理員角色的帳號建立計算源。更多資訊,請參見數倉規劃許可權列表。
操作步驟
在Dataphin首頁的頂部功能表列中,選擇規劃 > 計算源。
在計算源頁面單擊新增計算源,選擇Flink計算源。
在建立計算源頁面,配置參數。
計算源基本資料
參數
描述
計算類型
選擇為Flink。
計算源名稱
填寫計算源的名稱。命名規則如下:
包含中文、數字、字母及底線(_)或短劃線(-)。
不能超過64個字元。
計算源描述
填寫計算源的描述,128個字元以內。
選擇部署模式並配置相應資訊
Dataphin支援叢集的不同部署模式,包括Yarn和Kubernetes部署模式。不同部署模式需要配置的參數不同。
Yarn部署模式
叢集基本資料
參數
描述
設定檔
上傳叢集的設定檔。yarn-site.xml、core-site.xml和hdfs-site.xml設定檔必須上傳。
叢集Kerberos
Kerberos是一種基於對稱金鑰技術的身份認證協議,可以為其他服務提供身份認證功能,且支援SSO(即用戶端身份認證後,可以訪問多個服務,例如HBase和HDFS)。
如果叢集有Kerberos認證,則需要開啟叢集Kerberos並上傳Krb5認證檔案或配置KDC Server地址。
Krb5認證檔案:需要上傳Krb5檔案進行Kerberos認證。
KDC Server地址:KDC伺服器位址,輔助完成Kerberos認證。支援配置多個KDC Server服務地址,使用半形逗號(,)分隔。
叢集類型(非必選)
選擇叢集的類型,用於測試連接。包括Aliyun E-MapReduce5.x、CDH5.x Hadoop、CDH6.x Hadoop、Cloudera Data Platform 7.x、亞信DP5.3 Hadoop、星環TDH 6.x Hadoop。
重要通常情況下,未選擇叢集類型也能夠測試連接通過;個別情況未選擇可能導致測試連接失敗,建議進行選擇。
Flink計算資源
參數
描述
計算資源類型
可選擇資源隊列和Session叢集。
資源隊列
當計算資源類型選擇資源隊列時,可填寫資源隊列名稱,即Flink任務提交到YARN的隊列名稱。命名規範及限制說明如下:
長度限制:隊列名稱長度不能超過256個字元。
字元限制:隊列名稱只能包含英文、數字、部分特殊字元
-_.@'()以及空格。大小寫敏感:隊列名稱區分英文字母大小寫,即名稱中的大小寫字母為不同的字元。
唯一性:隊列名稱必須是計算源唯一,不能與其他隊列名稱重複。
若需配置多個任務隊列,您可單擊+添加進行新增。
說明至多支援10個資源隊列。
若需刪除多餘的資源隊列,您可單擊
進行刪除,但至少需保留1個資源隊列。刪除後,已有作業將無法正常提交。
Session叢集
當計算資源類型選擇Session叢集時,可選擇一個或多個Session叢集。下拉式清單中包含所有在Session叢集中建立的叢集,不分區叢集狀態。
Flink Kerberos認證
說明僅當計算資源類型選中了資源隊列時,支援配置Flink Kerberos認證。
Flink Kerberos:如果Flink叢集有Kerberos認證,您可開啟Flink Kerberos並上傳Keytab File認證檔案與配置Principal。
Keytab File:上傳keytab檔案,您可以在Flink Server上擷取keytab檔案。
Principal:填寫Flink Keytab File檔案對應的Kerberos認證使用者名稱。
使用者名稱:Flink Kerberos關閉時,需填寫提交Flink任務的叢集使用者名稱。
CheckPoint儲存
檔案系統:支援HDFS、OSS-HDFS和Aliyun OSS(僅Flink 1.14及1.15支援)。不同檔案系統需配置不同參數。
說明OSS-HDFS檔案系統僅支援Aliyun E-MapReduce5.x Hadoop計算引擎。
當檔案系統為HDFS時需配置如下參數:
目錄路徑:輸入CheckPoint叢集儲存的目錄路徑,並確保Flink有訪問該路徑的許可權。例如
hdfs://cdh-cluster-00001:8020/openflink/savepoint/。若您的HDFS為HA高可用叢集,支援填寫高可用路徑,即hdfs://服務名(nameservice)/路徑。當檔案系統為OSS-HDFS時需配置如下參數:
目錄路徑:輸入CheckPoint叢集儲存的目錄路徑,並確保Flink有訪問該路徑的許可權。例如
hdfs://cdh-cluster-00001:8020/openflink/savepoint/。若您的HDFS為HA高可用叢集,支援填寫高可用路徑,即hdfs://服務名(nameservice)/路徑。AccessKey ID、AccessKey Secret:需填寫訪問叢集OSS的AccessKey ID和AccessKey Secret。請使用已有AccessKey或者參考建立AccessKey重新建立。
說明為降低AccessKey泄露的風險,AccessKey Secret只在建立時顯示一次,後續無法查看。請務必妥善保管。
當檔案系統為Aliyun OSS時需配置如下參數:
Endpoint:填寫OSS服務的串連地址。
目錄路徑:填寫格式為
oss://{Bucket}/{Object}。AccessKey ID、AccessKey Secret:需填寫訪問叢集OSS的AccessKey ID和AccessKey Secret。請使用已有AccessKey或者參考建立AccessKey重新建立。
說明為降低AccessKey泄露的風險,AccessKey Secret只在建立時顯示一次,後續無法查看。請務必妥善保管。
重要此處填寫的配置優先順序高於core-site.xml中配置的AccessKey。
Kubernetes部署模式
叢集基本資料
Kubernetes部署模式無需配置叢集基本資料。
Flink計算引擎配置資訊
Kubernetes部署模式下,Flink計算引擎的檔案系統可選擇NFS、S3、Azure Blob Storage三種類型,選擇不同類型的檔案系統後所需配置的參數不同。
NFS
參數
描述
Server
填寫NFS伺服器的網域名稱。
版本
選擇NFS的版本。支援NFSv3和NFSv4版本。
目錄
填寫NFS上CheckPoint的儲存路徑目錄。例如,
/data/checkpoint。最大容量
輸入NFS支援儲存的最大容量,超出後將影響Checkpoint儲存。單位(Gi)。
S3
參數
描述
Endpoint(非必填)
輸入正確地址,例如
http://s3.us-east-2.amazonaws.com。說明若為AmazonS3則無需填寫Endpoint,其他情況下,此項為必填。
目錄路徑
輸入儲存路徑,預設為
s3://{YOUR-BUCKET}/{path}。建議為Checkpoint儲存提供專屬目錄,且定期清理。Access Key、Secret Key
輸入訪問Amazon S3的AccessKey和AccessKey Secret,單擊
表徵圖可查看明文。Azure Blob Storage
參數
描述
協議
當前僅支援選擇ABDS。
認證方式
當前僅支援選擇Shared Key。
目錄路徑
輸入儲存路徑,預設為
abfs://{YOUR-CONTAINER}@${YOUR-AZURE-ACCOUNT}.dfs.core.windows.net/{object-path}。存取金鑰
輸入訪問Azure Blob Storage賬戶的存取金鑰,單擊
表徵圖可查看明文。
單擊測試連接,測試Dataphin與叢集的連通性。
Kubernetes部署模式不支援測試連接,您可以直接單擊提交。
測試成功後,單擊提交。
後續步驟
完成建立Flink計算源後,即可為專案綁定Flink計算源。更多資訊,請參見建立通用專案。