Alibaba Cloud Elasticsearch memungkinkan Anda mencari dan menganalisis data yang disimpan di HBase. Gunakan Data Integration di DataWorks untuk melakukan sinkronisasi offline dari HBase ke instans Alibaba Cloud Elasticsearch.
Latar Belakang
DataWorks adalah platform pengembangan dan tata kelola data besar (big data) end-to-end yang dibangun di atas mesin data besar. Platform ini mengintegrasikan fitur-fitur seperti pengembangan data, penjadwalan tugas, dan manajemen data. Anda dapat menggunakan tugas sinkronisasi di DataWorks untuk dengan cepat menyinkronkan data dari berbagai sumber data ke Alibaba Cloud Elasticsearch.
-
Sumber data yang didukung meliputi:
-
Database Alibaba Cloud (MySQL, PostgreSQL, SQL Server, MongoDB, dan HBase)
-
Alibaba Cloud PolarDB-X (hasil peningkatan dari DRDS)
-
Alibaba Cloud MaxCompute
-
Alibaba Cloud OSS
-
Alibaba Cloud Tablestore
-
Versi self-managed HDFS, Oracle, FTP, DB2, dan jenis database lain yang didukung
-
-
Skenario:
-
Sinkronisasi offline data besar ke Alibaba Cloud Elasticsearch. Anda dapat menyinkronkan seluruh database atau semua data dalam tabel tertentu. Untuk informasi lebih lanjut, lihat Sinkronisasi offline seluruh database MySQL ke Elasticsearch.
-
Sinkronisasi real-time data besar ke Alibaba Cloud Elasticsearch. Metode ini mendukung sinkronisasi penuh maupun inkremental. Untuk informasi lebih lanjut, lihat Sinkronisasi real-time seluruh database MySQL ke Elasticsearch.
-
Prasyarat
-
Instans HBase telah dibuat. Untuk informasi lebih lanjut, lihat Buat instans.
-
Instans Alibaba Cloud Elasticsearch telah dibuat, dan fitur Auto Indexing telah diaktifkan untuk instans tersebut. Untuk informasi lebih lanjut, lihat Buat instans Alibaba Cloud Elasticsearch dan Konfigurasi parameter YML.
-
Ruang kerja DataWorks telah dibuat. Untuk informasi lebih lanjut, lihat Buat ruang kerja.
-
Anda hanya dapat menyinkronkan data ke Alibaba Cloud Elasticsearch. Elasticsearch versi self-managed tidak didukung.
-
Instans HBase, instans Alibaba Cloud Elasticsearch, dan ruang kerja DataWorks harus berada di wilayah yang sama.
-
Instans HBase, instans Alibaba Cloud Elasticsearch, dan ruang kerja DataWorks harus berada di zona waktu yang sama. Jika tidak, perbedaan zona waktu dapat terjadi antara data sumber dan tujuan saat Anda menyinkronkan data yang berkaitan dengan waktu.
Penagihan
-
Untuk informasi tentang biaya instans Alibaba Cloud Elasticsearch, lihat Item yang dapat ditagih Elasticsearch.
-
Untuk informasi tentang biaya kelompok sumber daya Data Integration, lihat Biaya kelompok sumber daya.
Prosedur
Langkah 1: Siapkan data sumber
Pernyataan pembuatan tabel dan data uji berikut digunakan dalam contoh ini. Untuk informasi lebih lanjut tentang cara mengimpor data ke instans HBase, lihat Gunakan HBase Shell untuk mengakses.
-
Pernyataan pembuatan tabel
create 'student', {NAME => 'name'}, {NAME => 'ID'}, {NAME => 'gender'} -
Data uji
Jalankan perintah
putuntuk memasukkan data ke dalam tabel. Contoh:put 'student', 'row1', 'name:a', 'xiaoming'.Jalankan perintah
scanuntuk melihat data dalam tabel. Contoh:scan 'student'.
Langkah 2: Beli dan konfigurasi grup sumber daya eksklusif
Beli grup sumber daya eksklusif untuk Data Integration dan sambungkan VPC serta ruang kerja ke grup tersebut. Grup sumber daya eksklusif menjamin transmisi data yang cepat dan stabil.
-
Masuk ke Konsol DataWorks.
-
Di bilah navigasi atas, pilih wilayah. Di panel navigasi kiri, klik Resource Groups.
-
Di tab Exclusive Resource Group, klik .
-
Di halaman DataWorks Exclusive Resources (Subscription), atur Resource Type menjadi Exclusive Resource Group for Data Integration, masukkan nama untuk grup sumber daya, lalu klik Buy Now untuk membeli grup sumber daya eksklusif tersebut.
Untuk informasi lebih lanjut, lihat Langkah 1: Beli grup sumber daya.
-
Di kolom Actions untuk grup sumber daya eksklusif yang telah Anda buat, klik Network Settings untuk menyambungkan VPC.
CatatanProsedur ini menyinkronkan data melalui VPC menggunakan grup sumber daya eksklusif untuk Data Integration. Untuk informasi lebih lanjut, lihat Konfigurasi daftar putih alamat IP.
Untuk menyinkronkan data, grup sumber daya eksklusif harus terhubung ke VPC dari kedua instans HBase dan Alibaba Cloud Elasticsearch. Sambungkan grup sumber daya ke Virtual Private Cloud (VPC), Zone, dan VSwitch dari kedua instans tersebut. Untuk melihat informasi VPC instans Alibaba Cloud Elasticsearch, lihat Lihat informasi dasar instans Elasticsearch.
PentingSetelah menyambungkan VPC, Anda harus menambahkan vSwitch CIDR Block dari VPC ke daftar putih alamat IP privat untuk instans HBase dan Alibaba Cloud Elasticsearch. Untuk informasi lebih lanjut, lihat Konfigurasi daftar putih alamat IP publik atau privat untuk instans Elasticsearch.
-
Di pojok kiri atas, klik ikon kembali untuk kembali ke halaman Resource List.
-
Di kolom Actions untuk grup sumber daya eksklusif, klik Attach Workspace untuk menyambungkan ruang kerja tujuan.
Untuk informasi lebih lanjut, lihat Langkah 2: Asosiasikan ruang kerja.
Langkah 3: Tambahkan sumber data
Tambahkan sumber data HBase dan Elasticsearch ke Data Integration di DataWorks.
-
Buka halaman Data Integration.
-
Masuk ke Konsol DataWorks.
-
Di panel navigasi kiri, klik Workspace.
-
Di kolom Actions untuk ruang kerja target, pilih .
-
-
Di panel navigasi kiri, klik Data Source.
-
Tambahkan sumber data HBase.
-
Di halaman Data Sources, klik Add Data Source.
-
Di kotak dialog Add Data Source, cari dan pilih HBase.
-
Di kotak dialog Add HBase Data Source, konfigurasikan parameter pada bagian Basic Information.
Untuk informasi lebih lanjut, lihat Konfigurasi sumber data HBase.
-
Di bagian Connection Configuration, klik Test Connectivity. Status Connected menunjukkan koneksi berhasil.
-
Klik OK.
-
-
Tambahkan sumber data Elasticsearch dengan cara yang sama. Untuk informasi lebih lanjut, lihat Konfigurasi sumber data Elasticsearch.
Langkah 4: Konfigurasi dan jalankan tugas sinkronisasi offline
Konfigurasi dan jalankan tugas sinkronisasi offline pada grup sumber daya eksklusif.
-
Langkah-langkah berikut menggunakan Antarmuka tanpa kode (codeless UI). Untuk informasi tentang cara menggunakan editor kode, lihat Konfigurasi tugas sinkronisasi batch menggunakan editor kode dan Elasticsearch Writer.
-
Langkah-langkah berikut dilakukan di halaman Data Development (DataStudio) versi lama.
-
Buka halaman Data Development.
-
Masuk ke Konsol DataWorks.
-
Di panel navigasi kiri, klik Workspace.
-
Di kolom Actions untuk ruang kerja tujuan, pilih .
-
-
Buat node sinkronisasi offline.
-
Di tab Data Development (
), pilih . -
Klik kanan alur kerja yang telah Anda buat dan pilih .
-
Di kotak dialog Create Node, masukkan nama untuk node tersebut dan klik OK.
-
-
Konfigurasi jaringan dan sumber daya.
-
Di bagian Source, pilih HBase dari daftar drop-down Source dan pilih nama sumber data sumber dari daftar drop-down Data Source Name.
-
Di bagian Resource Group, pilih grup sumber daya eksklusif.
-
Di bagian Destination, pilih Elasticsearch dari daftar drop-down Destination dan pilih nama sumber data tujuan dari daftar drop-down Data Source Name.
-
-
Klik Next.
-
Konfigurasikan Tugas.
-
Di bagian Source, pilih tabel yang ingin Anda sinkronkan.
-
Di bagian Destination, konfigurasikan parameter-parameter tersebut.
-
Di bagian Field Mapping, petakan Source Column ke Target Column. Untuk informasi lebih lanjut, lihat Konfigurasi tugas sinkronisasi offline menggunakan Antarmuka tanpa kode.
-
Di bagian Channel Control, konfigurasikan parameter saluran.
Untuk informasi lebih lanjut, lihat Konfigurasi tugas sinkronisasi offline menggunakan Antarmuka tanpa kode.
-
-
Jalankan tugas.
-
(Opsional) Di sisi kanan halaman, klik Properties untuk mengonfigurasi parameter penjadwalan. Untuk informasi lebih lanjut, lihat Konfigurasi penjadwalan.
-
Di bilah alat atas, klik ikon Simpan untuk menyimpan tugas.
-
Di bilah alat atas, klik ikon Submit untuk mengirimkan tugas.
Jika Anda mengonfigurasi properti penjadwalan, tugas akan berjalan secara berkala. Anda juga dapat mengklik ikon Run di pojok kanan atas editor node untuk menjalankan tugas segera.
Pesan
Shell run successfully!di log eksekusi menunjukkan bahwa tugas berhasil dijalankan.
-
Langkah 5: Verifikasi data yang telah disinkronkan
Masuk ke konsol Kibana kluster Elasticsearch Anda dan buka halaman utama Kibana.
Di menu navigasi kiri, klik Dev tools.
-
Di tab Console, jalankan perintah berikut untuk melihat data yang telah disinkronkan.
POST /student_info/_search?pretty { "query": { "match_all": {}} }Catatanstudent_infoadalah nama indeks tujuan yang dikonfigurasi dalam tugas sinkronisasi offline.