All Products
Search
Document Center

AnalyticDB:Impor data Hive

Last Updated:Aug 22, 2026

AnalyticDB for MySQL mendukung migrasi data dari Hive ke OSS menggunakan fitur migrasi data. Topik ini menjelaskan cara menambahkan sumber data Hive, membuat dan memulai pekerjaan migrasi data, menganalisis data setelah migrasi, serta mengelola pekerjaan migrasi tersebut.

Fitur

AnalyticDB for MySQL memungkinkan Anda melakukan migrasi metadata dan data Hive ke OSS hanya dengan satu klik. Anda juga dapat melakukan migrasi beberapa database dan tabel secara paralel.

Prasyarat

  • Kluster E-MapReduce: Skenario bisnis kluster adalah New Data Lake, tipe metadata adalah Self-managed RDS atau Built-in MySQL, dan layanan Hive telah diaktifkan. Hive Storage Mode harus HDFS, artinya kotak centang Data Lake Storage tidak dipilih. Untuk informasi lebih lanjut, lihat Buat kluster.

    Penting
    • Kluster E-MapReduce dengan tipe metadata DLF Unified Metadata tidak mendukung migrasi data Hive ke OSS.

    • Jika Data Lake Storage kluster E-MapReduce Anda adalah Data Lake Storage, datanya sudah berada di OSS. Anda dapat menggunakan fitur penemuan metadata untuk mengimpor data tersebut ke AnalyticDB for MySQL. Untuk informasi lebih lanjut, lihat Impor data menggunakan penemuan metadata.

  • Kluster CDH yang dikelola sendiri pada instance ECS.

  • Buat database Hive dan tabel partisi. Untuk informasi lebih lanjut, lihat Operasi dasar Hive.

Penagihan

Migrasi data ke OSS menggunakan fitur migrasi data AnalyticDB for MySQL akan dikenakan biaya sebagai berikut.

  • Biaya sumber daya elastis untuk ACU kluster AnalyticDB for MySQL Anda. Untuk informasi lebih lanjut tentang item yang dapat ditagih, lihat Item yang dapat ditagih Edisi Data Lakehouse.

  • Biaya penyimpanan, biaya permintaan GET, serta biaya permintaan PUT dan lainnya untuk OSS. Untuk informasi lebih lanjut tentang item yang dapat ditagih, lihat Ikhtisar penagihan.

Alur kerja

Buat sumber data Hive

Catatan

Jika Anda telah menambahkan sumber data Hive, Anda dapat melewati langkah ini dan langsung membuat pekerjaan migrasi data. Untuk informasi lebih lanjut, lihat Buat pekerjaan migrasi data.

  1. Masuk ke Konsol AnalyticDB for MySQL. Di pojok kiri atas konsol, pilih wilayah. Di panel navigasi sebelah kiri, klik Clusters. Temukan kluster yang ingin Anda kelola, lalu klik ID kluster tersebut.

  2. Di panel navigasi sebelah kiri, pilih Data Ingestion>Data Sources.

  3. Di pojok kiri atas, klik Create Data Source.

  4. Pada halaman Create Data Source, konfigurasikan parameter. Tabel berikut menjelaskan parameter tersebut.

    Alibaba Cloud Instance

    Parameter

    Deskripsi

    Data Source Type

    Pilih Hive.

    Data Source Name

    Sistem secara otomatis menghasilkan nama berdasarkan tipe sumber data dan waktu saat ini. Anda dapat mengedit nama ini sesuai kebutuhan.

    Data Source Description

    Deskripsi sumber data, seperti kasus penggunaan dan batasan bisnisnya.

    Deployment Mode

    Jika Anda menggunakan layanan Hive dari E-MapReduce, pilih Alibaba Cloud Instance.

    Instance

    Pilih instance E-MapReduce yang menjadi tujuan sumber data.

    Hive Metastore URI

    Alamat koneksi Hive Metastore. Formatnya adalah thrift://<Alamat IP node master>:<Nomor port>. Nomor port default adalah 9083.

    Untuk melihat alamat IP node master:

    Masuk ke Konsol EMR on ECS. Pada tab Nodes, klik ikon 加号..png di sebelah node emr-master untuk melihat alamat IP pribadi node master.

    Self-managed CDH on ECS

    Parameter

    Deskripsi

    Data Source Type

    Pilih Hive.

    Data Source Name

    Sistem secara otomatis menghasilkan nama berdasarkan tipe sumber data dan waktu saat ini. Anda dapat mengedit nama ini sesuai kebutuhan.

    Data Source Description

    Deskripsi sumber data, seperti kasus penggunaan dan batasan bisnisnya.

    Deployment Mode

    Jika Anda memiliki kluster CDH yang dikelola sendiri pada instance ECS, pilih Self-managed CDH on ECS.

    Instance

    Pilih instance ECS yang menjadi tujuan sumber data.

    Hive Metastore URI

    Alamat koneksi Hive Metastore. Ini adalah alamat IP publik instance ECS yang sesuai dengan node master CDH. Formatnya adalah thrift://<Alamat IP node master>:<Nomor port>. Nomor port default adalah 9083.

    Host Configuration Information

    Masukkan setiap pemetaan host-ke-IP pada baris baru.

    Contoh:

    192.168.2.153 master.cdh

    192.168.2.154 node1.cdh

    192.168.2.155 node2.cdh

  5. Setelah mengonfigurasi parameter, klik Create.

Buat pekerjaan migrasi data

  1. Di panel navigasi sebelah kiri, klik Data Migration.

  2. Di pojok kanan atas, klik Create Migration Job.

  3. Pada halaman Create Migration Job, konfigurasikan parameter pada bagian Source and Destination Settings, Database/Table Migration Settings, dan Migration Settings.

    Source and destination settings

    Parameter

    Deskripsi

    Job Name

    Nama pekerjaan migrasi data. Sistem secara otomatis menghasilkan nama berdasarkan tipe sumber data dan waktu saat ini. Anda dapat mengedit nama ini sesuai kebutuhan.

    Data Source

    Pilih sumber data Hive yang sudah ada atau buat yang baru.

    Destination Type

    Hanya Data Lake - OSS Storage yang didukung.

    OSS Path

    Jalur penyimpanan di OSS untuk data kluster AnalyticDB for MySQL Edisi Data Lakehouse.

    Penting
    • Semua bucket di wilayah yang sama dengan kluster AnalyticDB for MySQL ditampilkan. Anda dapat memilih salah satunya. Rencanakan jalur penyimpanan dengan hati-hati. Anda tidak dapat mengubah jalur penyimpanan setelah dibuat.

    • Kami menyarankan Anda memilih direktori kosong dan memastikan bahwa jalur OSS-nya tidak memiliki hubungan awalan (prefix) dengan jalur OSS pekerjaan lain. Hal ini mencegah data tertimpa. Misalnya, jika jalur OSS dua pekerjaan migrasi data adalah oss://adb_demo/test/sls1/ dan oss://adb_demo/test/, kedua jalur tersebut memiliki hubungan awalan, yang dapat menyebabkan data tertimpa selama migrasi.

    Database/table migration settings

    Penting

    Jika nama database atau tabel terdapat dalam daftar putih dan blacklist sekaligus, blacklist yang berlaku, sehingga layanan tidak akan melakukan migrasi database atau tabel tersebut.

    Parameter

    Deskripsi

    Database/Table Migration Whitelist

    Pekerjaan akan melakukan migrasi database dan tabel yang sesuai dengan ekspresi. Masukkan ekspresi reguler untuk nama database dan tabel. Pisahkan beberapa ekspresi dengan koma (,).

    Database/Table Migration Blacklist

    Pekerjaan tidak akan melakukan migrasi database dan tabel yang sesuai dengan ekspresi. Masukkan ekspresi reguler untuk nama database dan tabel. Pisahkan beberapa ekspresi dengan koma (,).

    Migration settings

    Parameter

    Deskripsi

    Handling Same Named Destination Table

    Menentukan cara menangani tabel tujuan yang sudah ada:

    • Skip this table (do not migrate): Melewatkan hanya tabel saat ini. Migrasi tabel lain tetap berlanjut.

    • Report error and pause migration: Menghentikan sementara pekerjaan migrasi. Migrasi untuk tabel dengan nama yang sama dan semua tabel lainnya berhenti.

    Job Resource Group

    Tentukan kelompok sumber daya pekerjaan tempat pekerjaan dijalankan.

    Required ACUs

    Tentukan jumlah ACU untuk kelompok sumber daya pekerjaan. Nilai minimum adalah 4. Nilai maksimum adalah jumlah sumber daya komputasi yang tersedia di kelompok sumber daya pekerjaan. Alokasikan lebih banyak ACU untuk meningkatkan kinerja migrasi dan stabilitas pekerjaan.

    Parallel Tasks

    Nilai default adalah 1. Nilai maksimum adalah 8.

    Jika Anda menaikkan nilai ini, beberapa tugas migrasi akan dimulai secara bersamaan, dan setiap tugas melakukan migrasi satu tabel. Namun, setiap tugas memerlukan minimal 4 ACU. Jika jumlah ACU tidak mencukupi, tugas migrasi akan dijalankan secara berurutan.

    Advanced Settings

    Memungkinkan Anda menentukan konfigurasi khusus untuk pekerjaan. Untuk melakukannya, hubungi dukungan teknis.

  4. Setelah mengonfigurasi parameter, klik Submit.

Mulai pekerjaan migrasi data

  1. Pada halaman Data Migration, temukan pekerjaan migrasi data yang telah Anda buat, lalu klik Resume di kolom Actions.

  2. Klik Search di pojok kanan atas. Ketika status berubah menjadi Starting, pekerjaan migrasi data telah dimulai.

Analisis data

Setelah tugas migrasi berhasil, Anda juga dapat menggunakan fitur penemuan metadata untuk mengimpor data dari OSS ke Edisi Data Lakehouse, lalu menganalisis data yang diimpor ke Edisi Data Lakehouse di Spark Jar. Untuk informasi lebih lanjut tentang pengembangan Spark, lihat Editor pengembangan Spark dan Pengembangan aplikasi offline Spark.

    1. Di panel navigasi sebelah kiri, klik Job Development > Spark JAR Development.

    2. Pada templat default, masukkan contoh pernyataan dan klik Run Now.

      -- Berikut ini hanya contoh SparkSQL. Ubah kontennya dan jalankan program spark Anda.
      
      conf spark.driver.resourceSpec=medium;
      conf spark.executor.instances=2;
      conf spark.executor.resourceSpec=medium;
      conf spark.app.name=Spark SQL Test;
      conf spark.adb.connectors=oss;
      
      -- Berikut adalah pernyataan sql Anda
      show tables from lakehouse20220413156_adbTest;
    3. Opsi: Pada tab Applications, klik Logs di kolom Actions untuk melihat log eksekusi pekerjaan Spark SQL.

Manajemen pekerjaan

Pada halaman Data Migration, Anda dapat melakukan operasi berikut di kolom Actions.

Actions

Deskripsi

Start

Memulai pekerjaan migrasi data.

View Details

Menampilkan konfigurasi pekerjaan secara detail, jumlah tabel yang dimigrasikan, dan detail migrasi.

Edit

Memodifikasi properti konfigurasi pekerjaan.

Pause

Menghentikan sementara pekerjaan migrasi saat ini.

Delete

Menghapus pekerjaan migrasi saat ini.