All Products
Search
Document Center

Object Storage Service:Mengakses OSS-HDFS dari EMR Hive atau Spark

Last Updated:May 15, 2026

Anda dapat menggunakan OSS-HDFS (JindoFS) sebagai penyimpanan data untuk kluster E-MapReduce (EMR) versi 3.42 ke atas atau versi 5.8.0 ke atas. OSS-HDFS menyediakan fitur seperti cache acceleration dan otorisasi Ranger untuk meningkatkan kinerja serta menyederhanakan migrasi dari HDFS dalam skenario ETL data besar yang menggunakan Hive atau Spark. Topik ini menjelaskan cara mengakses data di OSS-HDFS menggunakan Hive atau Spark pada EMR.

Prasyarat

  • OSS-HDFS telah diaktifkan untuk sebuah bucket dan izin telah diberikan kepada role RAM untuk mengakses OSS-HDFS. Untuk informasi selengkapnya, lihat Aktifkan OSS-HDFS dan berikan izin akses.

  • Secara default, Akun Alibaba Cloud memiliki izin untuk menghubungkan kluster EMR ke OSS-HDFS dan melakukan operasi umum terkait OSS-HDFS. Sebuah pengguna RAM dengan izin yang diperlukan telah dibuat. Jika Anda ingin menggunakan pengguna RAM untuk menghubungkan kluster EMR ke OSS-HDFS, pengguna tersebut harus memiliki izin yang sesuai. Untuk informasi selengkapnya, lihat Berikan izin kepada pengguna RAM untuk menghubungkan kluster EMR ke OSS-HDFS.

Latar Belakang

OSS-HDFS adalah layanan penyimpanan data lake cloud-native. Dengan kemampuan manajemen metadata terpadu, OSS-HDFS sepenuhnya kompatibel dengan antarmuka sistem file HDFS dan menyediakan dukungan POSIX yang komprehensif, menjadikannya solusi ideal untuk berbagai skenario komputasi data lake di bidang data besar dan AI. Untuk informasi selengkapnya, lihat Apa itu OSS-HDFS?.

Prosedur

Catatan Topik ini menggunakan Hive untuk menunjukkan cara bekerja dengan data di OSS-HDFS. Metode yang sama berlaku untuk Spark.
  1. Login ke kluster. Untuk informasi selengkapnya, lihat Login ke kluster.
  2. Buat tabel Hive yang mengarah ke OSS-HDFS.

    1. Jalankan perintah berikut untuk masuk ke Hive CLI.
      hive
    2. Jalankan perintah berikut untuk membuat database yang mengarah ke OSS-HDFS.

      CREATE DATABASE if not exists dw LOCATION 'oss://{yourHdfsBucketDomain}/{path}';

      Penjelasan parameter:

      • dw: Nama database. Anda dapat menyesuaikan nama ini.

      • {path}: Path di OSS-HDFS untuk menyimpan database. Anda dapat menyesuaikan path ini.

      • {yourHdfsBucketDomain}: Nama domain bucket untuk layanan OSS-HDFS.

        • Untuk mendapatkan titik akhir, login ke OSS console. Buka bucket yang dituju. Pada tab Overview, di bagian Access Ports, salin titik akhir bucket lengkap untuk OSS-HDFS.

      Catatan

      Contoh ini menggunakan nama domain OSS-HDFS sebagai awalan path. Jika Anda ingin hanya menggunakan nama bucket untuk mengarah ke OSS-HDFS, Anda dapat mengonfigurasi endpoint tingkat bucket atau endpoint global. Untuk informasi selengkapnya, lihat Lampiran 1: Cara lain mengonfigurasi endpoint.

    3. Jalankan perintah berikut untuk menggunakan database yang baru dibuat.
      use dw;
    4. Jalankan perintah berikut untuk membuat tabel di database baru.
      CREATE TABLE IF NOT EXISTS employee(eid int, name String,salary String,destination String)
      COMMENT 'Employee details';
  3. Verifikasi data tabel.
    SELECT * FROM employee WHERE eid = 1;
  4. Verifikasi data tabel.
    SELECT * FROM employee WHERE eid = 1;
    Respons mencakup data yang dimasukkan.
    OK
    1       liu hua 100.0
    Time taken: 12.379 seconds, Fetched: 1 row(s)