Anda dapat menggunakan OSS-HDFS (JindoFS) sebagai penyimpanan data untuk kluster E-MapReduce (EMR) versi 3.42 ke atas atau versi 5.8.0 ke atas. OSS-HDFS menyediakan fitur seperti cache acceleration dan otorisasi Ranger untuk meningkatkan kinerja serta menyederhanakan migrasi dari HDFS dalam skenario ETL data besar yang menggunakan Hive atau Spark. Topik ini menjelaskan cara mengakses data di OSS-HDFS menggunakan Hive atau Spark pada EMR.
Prasyarat
OSS-HDFS telah diaktifkan untuk sebuah bucket dan izin telah diberikan kepada role RAM untuk mengakses OSS-HDFS. Untuk informasi selengkapnya, lihat Aktifkan OSS-HDFS dan berikan izin akses.
Secara default, Akun Alibaba Cloud memiliki izin untuk menghubungkan kluster EMR ke OSS-HDFS dan melakukan operasi umum terkait OSS-HDFS. Sebuah pengguna RAM dengan izin yang diperlukan telah dibuat. Jika Anda ingin menggunakan pengguna RAM untuk menghubungkan kluster EMR ke OSS-HDFS, pengguna tersebut harus memiliki izin yang sesuai. Untuk informasi selengkapnya, lihat Berikan izin kepada pengguna RAM untuk menghubungkan kluster EMR ke OSS-HDFS.
Latar Belakang
OSS-HDFS adalah layanan penyimpanan data lake cloud-native. Dengan kemampuan manajemen metadata terpadu, OSS-HDFS sepenuhnya kompatibel dengan antarmuka sistem file HDFS dan menyediakan dukungan POSIX yang komprehensif, menjadikannya solusi ideal untuk berbagai skenario komputasi data lake di bidang data besar dan AI. Untuk informasi selengkapnya, lihat Apa itu OSS-HDFS?.
Prosedur
- Login ke kluster. Untuk informasi selengkapnya, lihat Login ke kluster.
-
Buat tabel Hive yang mengarah ke OSS-HDFS.
- Jalankan perintah berikut untuk masuk ke Hive CLI.
hive -
Jalankan perintah berikut untuk membuat database yang mengarah ke OSS-HDFS.
CREATE DATABASE if not exists dw LOCATION 'oss://{yourHdfsBucketDomain}/{path}';Penjelasan parameter:
-
dw: Nama database. Anda dapat menyesuaikan nama ini. -
{path}: Path di OSS-HDFS untuk menyimpan database. Anda dapat menyesuaikan path ini. -
{yourHdfsBucketDomain}: Nama domain bucket untuk layanan OSS-HDFS.-
Untuk mendapatkan titik akhir, login ke OSS console. Buka bucket yang dituju. Pada tab Overview, di bagian Access Ports, salin titik akhir bucket lengkap untuk OSS-HDFS.
-
CatatanContoh ini menggunakan nama domain OSS-HDFS sebagai awalan path. Jika Anda ingin hanya menggunakan nama bucket untuk mengarah ke OSS-HDFS, Anda dapat mengonfigurasi endpoint tingkat bucket atau endpoint global. Untuk informasi selengkapnya, lihat Lampiran 1: Cara lain mengonfigurasi endpoint.
-
- Jalankan perintah berikut untuk menggunakan database yang baru dibuat.
use dw; - Jalankan perintah berikut untuk membuat tabel di database baru.
CREATE TABLE IF NOT EXISTS employee(eid int, name String,salary String,destination String) COMMENT 'Employee details';
- Jalankan perintah berikut untuk masuk ke Hive CLI.
- Verifikasi data tabel.
SELECT * FROM employee WHERE eid = 1; - Verifikasi data tabel.
SELECT * FROM employee WHERE eid = 1;Respons mencakup data yang dimasukkan.OK 1 liu hua 100.0 Time taken: 12.379 seconds, Fetched: 1 row(s)