All Products
Search
Document Center

Elasticsearch:Sinkronisasi data HBase ke Alibaba Cloud Elasticsearch menggunakan DataWorks

Last Updated:Jul 18, 2026

Alibaba Cloud Elasticsearch memungkinkan Anda mencari dan menganalisis data yang disimpan di HBase. Gunakan Data Integration di DataWorks untuk melakukan sinkronisasi offline dari HBase ke instans Alibaba Cloud Elasticsearch.

Latar Belakang

DataWorks adalah platform pengembangan dan tata kelola data besar (big data) end-to-end yang dibangun di atas mesin data besar. Platform ini mengintegrasikan fitur-fitur seperti pengembangan data, penjadwalan tugas, dan manajemen data. Anda dapat menggunakan tugas sinkronisasi di DataWorks untuk dengan cepat menyinkronkan data dari berbagai sumber data ke Alibaba Cloud Elasticsearch.

  • Sumber data yang didukung meliputi:

    • Database Alibaba Cloud (MySQL, PostgreSQL, SQL Server, MongoDB, dan HBase)

    • Alibaba Cloud PolarDB-X (hasil peningkatan dari DRDS)

    • Alibaba Cloud MaxCompute

    • Alibaba Cloud OSS

    • Alibaba Cloud Tablestore

    • Versi self-managed HDFS, Oracle, FTP, DB2, dan jenis database lain yang didukung

  • Skenario:

Prasyarat

Catatan
  • Anda hanya dapat menyinkronkan data ke Alibaba Cloud Elasticsearch. Elasticsearch versi self-managed tidak didukung.

  • Instans HBase, instans Alibaba Cloud Elasticsearch, dan ruang kerja DataWorks harus berada di wilayah yang sama.

  • Instans HBase, instans Alibaba Cloud Elasticsearch, dan ruang kerja DataWorks harus berada di zona waktu yang sama. Jika tidak, perbedaan zona waktu dapat terjadi antara data sumber dan tujuan saat Anda menyinkronkan data yang berkaitan dengan waktu.

Penagihan

Prosedur

Langkah 1: Siapkan data sumber

Pernyataan pembuatan tabel dan data uji berikut digunakan dalam contoh ini. Untuk informasi lebih lanjut tentang cara mengimpor data ke instans HBase, lihat Gunakan HBase Shell untuk mengakses.

  • Pernyataan pembuatan tabel

    create 'student', {NAME => 'name'}, {NAME => 'ID'}, {NAME => 'gender'}
  • Data uji

    Jalankan perintah put untuk memasukkan data ke dalam tabel. Contoh: put 'student', 'row1', 'name:a', 'xiaoming'.

    Jalankan perintah scan untuk melihat data dalam tabel. Contoh: scan 'student'.HBase测试数据

Langkah 2: Beli dan konfigurasi grup sumber daya eksklusif

Beli grup sumber daya eksklusif untuk Data Integration dan sambungkan VPC serta ruang kerja ke grup tersebut. Grup sumber daya eksklusif menjamin transmisi data yang cepat dan stabil.

  1. Masuk ke Konsol DataWorks.

  2. Di bilah navigasi atas, pilih wilayah. Di panel navigasi kiri, klik Resource Groups.

  3. Di tab Exclusive Resource Group, klik Create Legacy Resource Group > Resource Group for Data Integration.

  4. Di halaman DataWorks Exclusive Resources (Subscription), atur Resource Type menjadi Exclusive Resource Group for Data Integration, masukkan nama untuk grup sumber daya, lalu klik Buy Now untuk membeli grup sumber daya eksklusif tersebut.

    Untuk informasi lebih lanjut, lihat Langkah 1: Beli grup sumber daya.

  5. Di kolom Actions untuk grup sumber daya eksklusif yang telah Anda buat, klik Network Settings untuk menyambungkan VPC.

    Catatan

    Prosedur ini menyinkronkan data melalui VPC menggunakan grup sumber daya eksklusif untuk Data Integration. Untuk informasi lebih lanjut, lihat Konfigurasi daftar putih alamat IP.

    Untuk menyinkronkan data, grup sumber daya eksklusif harus terhubung ke VPC dari kedua instans HBase dan Alibaba Cloud Elasticsearch. Sambungkan grup sumber daya ke Virtual Private Cloud (VPC), Zone, dan VSwitch dari kedua instans tersebut. Untuk melihat informasi VPC instans Alibaba Cloud Elasticsearch, lihat Lihat informasi dasar instans Elasticsearch.

    Penting

    Setelah menyambungkan VPC, Anda harus menambahkan vSwitch CIDR Block dari VPC ke daftar putih alamat IP privat untuk instans HBase dan Alibaba Cloud Elasticsearch. Untuk informasi lebih lanjut, lihat Konfigurasi daftar putih alamat IP publik atau privat untuk instans Elasticsearch.

  6. Di pojok kiri atas, klik ikon kembali untuk kembali ke halaman Resource List.

  7. Di kolom Actions untuk grup sumber daya eksklusif, klik Attach Workspace untuk menyambungkan ruang kerja tujuan.

    Untuk informasi lebih lanjut, lihat Langkah 2: Asosiasikan ruang kerja.

Langkah 3: Tambahkan sumber data

Tambahkan sumber data HBase dan Elasticsearch ke Data Integration di DataWorks.

  1. Buka halaman Data Integration.

    1. Masuk ke Konsol DataWorks.

    2. Di panel navigasi kiri, klik Workspace.

    3. Di kolom Actions untuk ruang kerja target, pilih Shortcuts > Data Integration.

  2. Di panel navigasi kiri, klik Data Source.

  3. Tambahkan sumber data HBase.

    1. Di halaman Data Sources, klik Add Data Source.

    2. Di kotak dialog Add Data Source, cari dan pilih HBase.

    3. Di kotak dialog Add HBase Data Source, konfigurasikan parameter pada bagian Basic Information.

      Untuk informasi lebih lanjut, lihat Konfigurasi sumber data HBase.

    4. Di bagian Connection Configuration, klik Test Connectivity. Status Connected menunjukkan koneksi berhasil.

    5. Klik OK.

  4. Tambahkan sumber data Elasticsearch dengan cara yang sama. Untuk informasi lebih lanjut, lihat Konfigurasi sumber data Elasticsearch.

Langkah 4: Konfigurasi dan jalankan tugas sinkronisasi offline

Konfigurasi dan jalankan tugas sinkronisasi offline pada grup sumber daya eksklusif.

Catatan
  1. Buka halaman Data Development.

    1. Masuk ke Konsol DataWorks.

    2. Di panel navigasi kiri, klik Workspace.

    3. Di kolom Actions untuk ruang kerja tujuan, pilih Shortcuts > Data development.

  2. Buat node sinkronisasi offline.

    1. Di tab Data Development (image), pilih Create > New business process.

    2. Klik kanan alur kerja yang telah Anda buat dan pilih Create Node > Data Integration > Batch Synchronization.

    3. Di kotak dialog Create Node, masukkan nama untuk node tersebut dan klik OK.

  3. Konfigurasi jaringan dan sumber daya.

    1. Di bagian Source, pilih HBase dari daftar drop-down Source dan pilih nama sumber data sumber dari daftar drop-down Data Source Name.

    2. Di bagian Resource Group, pilih grup sumber daya eksklusif.

    3. Di bagian Destination, pilih Elasticsearch dari daftar drop-down Destination dan pilih nama sumber data tujuan dari daftar drop-down Data Source Name.

  4. Klik Next.

  5. Konfigurasikan Tugas.

    1. Di bagian Source, pilih tabel yang ingin Anda sinkronkan.

    2. Di bagian Destination, konfigurasikan parameter-parameter tersebut.

    3. Di bagian Field Mapping, petakan Source Column ke Target Column. Untuk informasi lebih lanjut, lihat Konfigurasi tugas sinkronisasi offline menggunakan Antarmuka tanpa kode.

    4. Di bagian Channel Control, konfigurasikan parameter saluran.

    Untuk informasi lebih lanjut, lihat Konfigurasi tugas sinkronisasi offline menggunakan Antarmuka tanpa kode.

  6. Jalankan tugas.

    1. (Opsional) Di sisi kanan halaman, klik Properties untuk mengonfigurasi parameter penjadwalan. Untuk informasi lebih lanjut, lihat Konfigurasi penjadwalan.

    2. Di bilah alat atas, klik ikon Simpan untuk menyimpan tugas.

    3. Di bilah alat atas, klik ikon Submit untuk mengirimkan tugas.

      Jika Anda mengonfigurasi properti penjadwalan, tugas akan berjalan secara berkala. Anda juga dapat mengklik ikon Run di pojok kanan atas editor node untuk menjalankan tugas segera.

      Pesan Shell run successfully! di log eksekusi menunjukkan bahwa tugas berhasil dijalankan.

Langkah 5: Verifikasi data yang telah disinkronkan

  1. Masuk ke konsol Kibana kluster Elasticsearch Anda dan buka halaman utama Kibana.

  2. Di menu navigasi kiri, klik Dev tools.

  3. Di tab Console, jalankan perintah berikut untuk melihat data yang telah disinkronkan.

    POST /student_info/_search?pretty
    {
       "query": { "match_all": {}}
    }
    Catatan

    student_info adalah nama indeks tujuan yang dikonfigurasi dalam tugas sinkronisasi offline.