Kaitkan kluster Cloudera Distribution for Hadoop (CDH) dengan ruang kerja DataWorks Anda sebagai sumber daya komputasi untuk sinkronisasi data dan pengembangan.
Prasyarat
-
Pengguna RAM harus merupakan anggota ruang kerja dan memiliki peran administrator ruang kerja.
-
Kluster CDH telah diterapkan.
CatatanDataWorks mendukung kluster CDH yang diterapkan di luar ECS Alibaba Cloud, asalkan lingkungan penerapan terhubung ke VPC Alibaba Cloud. Biasanya, Anda dapat menggunakan metode konektivitas jaringan untuk sumber data on-premises guna membangun koneksi yang stabil.
-
Kelompok sumber daya telah dikaitkan dengan ruang kerja, dan konektivitas jaringan telah diverifikasi.
-
Jika Anda menggunakan kelompok sumber daya serverless, Anda hanya perlu memastikan konektivitas antara sumber daya komputasi CDH dan kelompok sumber daya serverless.
-
Jika Anda menggunakan kelompok sumber daya eksklusif lama, Anda harus memastikan konektivitas antara sumber daya komputasi CDH dan Grup sumber daya eksklusif untuk penjadwalan.
-
Batasan
-
Wilayah: Fitur ini tersedia di Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Shenzhen), Tiongkok (Hangzhou), Tiongkok (Zhangjiakou), Tiongkok (Chengdu), dan Jerman (Frankfurt).
-
Izin:
Operator
Izin yang diperlukan
Akun Alibaba Cloud
Tidak diperlukan izin tambahan.
Pengguna RAM/Peran RAM
-
Hanya anggota ruang kerja dengan peran O&M, peran administrator ruang kerja, atau izin
AliyunDataWorksFullAccessyang dapat membuat sumber daya komputasi. Untuk informasi lebih lanjut tentang cara memberikan izin, lihat Berikan izin administrator ruang kerja kepada pengguna.
-
Buka halaman daftar sumber daya komputasi
-
Masuk ke Konsol DataWorks. Di panel navigasi sebelah kiri, alihkan ke wilayah target dan klik . Pilih ruang kerja Anda dari daftar drop-down dan klik Go to Management Center.
-
Di panel navigasi sebelah kiri, klik Computing Resources untuk membuka halaman daftar sumber daya komputasi.
Kaitkan sumber daya komputasi CDH
Di halaman sumber daya komputasi, konfigurasikan dan kaitkan sumber daya komputasi CDH.
-
Pilih jenis sumber daya komputasi.
-
Klik Associate Computing Resources untuk membuka halaman Associate Computing Resources.
-
Di halaman Associate Computing Resources, pilih CDH sebagai jenis sumber daya komputasi. Halaman konfigurasi Associate CDH Computing Resource akan muncul.
-
-
Konfigurasikan sumber daya komputasi CDH.
Di halaman Associate CDH Computing Resource, konfigurasikan parameter berikut.
Parameter
Deskripsi
Cluster Version
Pilih versi kluster yang ingin Anda daftarkan.
DataWorks telah mendukung CDH 5.16.2, CDH 6.1.1, CDH 6.2.1, CDH 6.3.2, dan CDP 7.1.7 secara bawaan, dengan semua versi komponen dalam informasi koneksi kluster bersifat tetap. Jika tidak ada versi tersebut yang sesuai dengan kebutuhan Anda, pilih Custom Version dan konfigurasikan versi komponen sesuai kebutuhan.
Catatan-
Komponen yang diperlukan bervariasi tergantung versi kluster dan akan ditampilkan di halaman konfigurasi.
-
Jika Anda mendaftarkan kluster dengan Custom Version, hanya kelompok sumber daya eksklusif lama untuk penjadwalan yang didukung. Setelah pendaftaran, Anda harus submit a ticket untuk meminta dukungan teknis menginisialisasi lingkungan.
Cluster Name
Pilih nama kluster yang telah didaftarkan di ruang kerja lain untuk memuat konfigurasinya, atau tentukan nama kustom untuk membuat konfigurasi baru.
Cluster Connection Information
Hive connection information
Digunakan untuk mengirimkan pekerjaan Hive ke kluster.
-
HiveServer2 configuration format:
jdbc:hive2://<host>:<port>/<database> -
Metastore configuration format:
thrift://<host>:<port>
Cara memperoleh parameter: Untuk informasi lebih lanjut, lihat Peroleh informasi kluster CDH atau CDP dan konfigurasikan konektivitas jaringan.
Pemilihan versi komponen: Sistem secara otomatis mendeteksi versi komponen untuk kluster saat ini.
CatatanJika Anda menggunakan kelompok sumber daya serverless untuk mengakses komponen CDH melalui nama domain, Anda harus mengonfigurasi resolusi otoritatif untuk nama domain tersebut dan menetapkan cakupan efektifnya di PrivateZone DNS Alibaba Cloud.
Impala connection information
Digunakan untuk mengirimkan pekerjaan Impala.
Configuration format:
jdbc:impala://<host>:<port>/<schema>.Spark connection information
Pilih versi Spark default dan konfigurasikan koneksi.
Yarn connection information
Konfigurasi untuk mengirimkan tugas dan melihat detail tugas.
-
Yarn.Resourcemanager.Address configuration format:
http://<host>:<port>CatatanAlamat pengiriman untuk tugas Spark atau MapReduce.
-
Jobhistory.Webapp.Address configuration format:
http://<host>:<port2>CatatanAlamat UI web JobHistory Server untuk melihat detail tugas yang telah selesai.
MapReduce connection information
Pilih versi MapReduce default dan konfigurasikan koneksi.
Presto connection information
Digunakan untuk mengirimkan pekerjaan Presto.
JDBC address information configuration format:
jdbc:presto://<host>:<port>/<catalog>/<schema>CatatanIni bukan komponen CDH default. Konfigurasikan komponen ini sesuai kebutuhan.
Cluster Configuration File
Configure core-site file
Berisi konfigurasi global untuk pustaka Hadoop Core, seperti pengaturan I/O umum untuk HDFS dan MapReduce.
Unggah file ini untuk menjalankan tugas Spark atau MapReduce.
Configure hdfs-site file
Berisi konfigurasi terkait HDFS, seperti ukuran blok data, jumlah replika, dan nama path.
Configure mapred-site file
Mengonfigurasi parameter MapReduce seperti mode eksekusi dan perilaku penjadwalan.
Unggah file ini untuk menjalankan tugas MapReduce.
Configure yarn-site file
Berisi semua konfigurasi terkait daemon YARN, seperti pengaturan lingkungan untuk resource manager, node manager, dan waktu proses aplikasi.
Unggah file ini jika Anda berencana menjalankan tugas Spark atau MapReduce atau menggunakan Kerberos untuk pemetaan akun.
Configure hive-site file
Mengonfigurasi parameter Hive seperti informasi koneksi database, pengaturan Hive Metastore, dan mesin eksekusi.
Unggah file ini jika Anda memilih Kerberos sebagai jenis pemetaan akun.
Configure spark-defaults file
Menentukan konfigurasi tugas Spark default seperti ukuran memori dan inti CPU. Aplikasi Spark menerapkan pengaturan ini pada waktu proses.
Unggah file ini untuk menjalankan tugas Spark.
Configure config.properties file
Berisi konfigurasi terkait server Presto, seperti properti global untuk coordinator dan node pekerja di kluster Presto.
Unggah file ini jika Anda menggunakan komponen Presto dan memilih OPEN LDAP atau Kerberos sebagai jenis pemetaan akun.
Configure presto.jks file
Menyimpan sertifikat keamanan (kunci privat dan sertifikat kunci publik) untuk komunikasi terenkripsi SSL/TLS antar proses Presto.
Default Access Identity
Untuk menggunakan identitas yang dikaitkan dengan akun kluster yang dipetakan, buka halaman Computing Resources, lalu di tab Account Mappings, tetapkan pemetaan identitas kluster.
-
Lingkungan pengembangan: Anda dapat menggunakan akun kluster atau akun kluster yang dipetakan dari pelaksana tugas.
-
Lingkungan produksi: Anda dapat menggunakan akun kluster, akun kluster yang dipetakan dari pemilik tugas, akun kluster yang dipetakan dari Akun Alibaba Cloud, atau akun kluster yang dipetakan dari Pengguna RAM.
Computing Resource Instance Name
Tentukan nama kustom untuk instans sumber daya komputasi. Pada waktu proses, Anda dapat memilih sumber daya komputasi untuk suatu tugas berdasarkan nama ini.
-
-
Klik Confirm untuk menyelesaikan konfigurasi.
Inisialisasi kelompok sumber daya
Saat Anda mendaftarkan kluster untuk pertama kalinya atau mengubah konfigurasi layanan kluster (seperti core-site.xml), inisialisasi kelompok sumber daya untuk memastikan kluster tersebut dapat diakses oleh CDH setelah Anda mengonfigurasi konektivitas jaringan.
-
Di halaman Computing Resources, temukan sumber daya komputasi CDH yang telah Anda buat. Di pojok kanan atas, klik Initialize Resource Group.
-
Klik Initialize di samping kelompok sumber daya yang ingin Anda gunakan. Setelah kelompok sumber daya diinisialisasi, klik Determine.
(Opsional) Konfigurasikan antrian sumber daya YARN
Di halaman Computing Resources, temukan kluster CDH yang telah Anda kaitkan. Di tab YARN Resource Queue, klik Edit YARN Resource Queue untuk menetapkan antrian sumber daya YARN khusus bagi tugas di modul yang berbeda.
(Opsional) Konfigurasikan parameter Spark
Anda dapat menetapkan parameter Spark khusus untuk tugas di modul yang berbeda.
-
Di halaman Computing Resources, temukan kluster CDH yang telah Anda kaitkan.
-
Di tab Spark-related Parameter, klik Edit Spark Parameters untuk membuka halaman tempat Anda dapat mengedit parameter Spark untuk kluster CDH.
-
Anda dapat mengonfigurasi informasi properti Spark dengan mengklik tombol Add di bawah modul dan memasukkan Spark Property Name dan Spark Property Value.
(Opsional) Konfigurasikan pengaturan host
Pengiriman tugas dapat gagal ketika kelompok sumber daya serverless DataWorks terhubung ke kluster CDH yang diaktifkan Kerberos.
Hal ini terjadi karena Kerberos bergantung pada hostname untuk otentikasi. Jika DNS tidak dapat menguraikan alamat IP kluster ke hostname yang terdaftar di Kerberos, otentikasi akan gagal.
Fitur konfigurasi host memungkinkan Anda menentukan pemetaan statis IP ke hostname untuk sumber daya komputasi CDH. DataWorks memprioritaskan pemetaan ini saat mengakses kluster, sehingga memastikan otentikasi Kerberos berhasil.
-
Temukan sumber daya komputasi CDH yang ingin Anda konfigurasi dan klik Host Configuration.
-
Di kotak dialog yang muncul, masukkan hubungan pemetaan dalam format
alamat IP hostname. Masukkan hanya satu pemetaan per baris. -
Klik OK untuk menyimpan konfigurasi.
-
Setelah disimpan, informasi hostname yang dikonfigurasi akan muncul di kartu sumber daya komputasi, yang menegaskan bahwa konfigurasi telah aktif.
-
Persyaratan format:
alamat IPdanhostnameharus dipisahkan oleh satu atau beberapa spasi. -
Kelengkapan konfigurasi: Konfigurasikan pemetaan yang benar untuk semua node penting yang terlibat dalam otentikasi Kerberos dan eksekusi tugas, seperti NameNode, ResourceManager, dan NodeManager.
-
Cakupan: Konfigurasi host ini hanya berlaku untuk sumber daya komputasi saat ini, bukan untuk sumber daya lain di ruang kerja.
Langkah selanjutnya
Setelah Anda mengonfigurasi sumber daya komputasi CDH, gunakan node terkait CDH di Data Studio untuk pengembangan data.