AnalyticDB for MySQL mendukung migrasi data dari Hive ke OSS menggunakan fitur migrasi data. Topik ini menjelaskan cara menambahkan sumber data Hive, membuat dan memulai pekerjaan migrasi data, menganalisis data setelah migrasi, serta mengelola pekerjaan migrasi tersebut.
Fitur
AnalyticDB for MySQL memungkinkan Anda melakukan migrasi metadata dan data Hive ke OSS hanya dengan satu klik. Anda juga dapat melakukan migrasi beberapa database dan tabel secara paralel.
Prasyarat
Kluster AnalyticDB for MySQL Edisi Perusahaan, Edisi Dasar, atau Edisi Data Lakehouse telah dibuat.
Kelompok sumber daya pekerjaan telah dibuat untuk kluster AnalyticDB for MySQL.
Akun database telah dibuat untuk kluster AnalyticDB for MySQL.
Jika Anda menggunakan akun Alibaba Cloud, Anda hanya perlu membuat akun istimewa.
Jika Anda menggunakan pengguna Resource Access Management (RAM), Anda harus membuat akun istimewa dan akun standar, lalu mengaitkan akun standar tersebut dengan pengguna RAM.
-
Buat kluster E-MapReduce atau kluster CDH yang dikelola sendiri pada instance ECS di wilayah yang sama dengan kluster AnalyticDB for MySQL. Kluster tersebut harus memenuhi persyaratan berikut:
-
Kluster E-MapReduce: Skenario bisnis kluster adalah New Data Lake, tipe metadata adalah Self-managed RDS atau Built-in MySQL, dan layanan Hive telah diaktifkan. Hive Storage Mode harus HDFS, artinya kotak centang Data Lake Storage tidak dipilih. Untuk informasi lebih lanjut, lihat Buat kluster.
Penting-
Kluster E-MapReduce dengan tipe metadata DLF Unified Metadata tidak mendukung migrasi data Hive ke OSS.
-
Jika Data Lake Storage kluster E-MapReduce Anda adalah Data Lake Storage, datanya sudah berada di OSS. Anda dapat menggunakan fitur penemuan metadata untuk mengimpor data tersebut ke AnalyticDB for MySQL. Untuk informasi lebih lanjut, lihat Impor data menggunakan penemuan metadata.
-
-
Kluster CDH yang dikelola sendiri pada instance ECS.
-
Buat database Hive dan tabel partisi. Untuk informasi lebih lanjut, lihat Operasi dasar Hive.
Penagihan
Migrasi data ke OSS menggunakan fitur migrasi data AnalyticDB for MySQL akan dikenakan biaya sebagai berikut.
-
Biaya sumber daya elastis untuk ACU kluster AnalyticDB for MySQL Anda. Untuk informasi lebih lanjut tentang item yang dapat ditagih, lihat Item yang dapat ditagih Edisi Data Lakehouse.
-
Biaya penyimpanan, biaya permintaan GET, serta biaya permintaan PUT dan lainnya untuk OSS. Untuk informasi lebih lanjut tentang item yang dapat ditagih, lihat Ikhtisar penagihan.
Alur kerja
-
Langkah 1: Buat sumber data Hive.
-
Langkah 2: Buat pekerjaan migrasi data.
-
Langkah 3: Mulai pekerjaan migrasi data.
-
Langkah 4: Analisis data.
-
Langkah 5 (Opsional): Kelola pekerjaan migrasi data.
Buat sumber data Hive
Jika Anda telah menambahkan sumber data Hive, Anda dapat melewati langkah ini dan langsung membuat pekerjaan migrasi data. Untuk informasi lebih lanjut, lihat Buat pekerjaan migrasi data.
Masuk ke Konsol AnalyticDB for MySQL. Di pojok kiri atas konsol, pilih wilayah. Di panel navigasi sebelah kiri, klik Clusters. Temukan kluster yang ingin Anda kelola, lalu klik ID kluster tersebut.
-
Di panel navigasi sebelah kiri, pilih Data Ingestion>Data Sources.
-
Di pojok kiri atas, klik Create Data Source.
-
Pada halaman Create Data Source, konfigurasikan parameter. Tabel berikut menjelaskan parameter tersebut.
Alibaba Cloud Instance
Parameter
Deskripsi
Data Source Type
Pilih Hive.
Data Source Name
Sistem secara otomatis menghasilkan nama berdasarkan tipe sumber data dan waktu saat ini. Anda dapat mengedit nama ini sesuai kebutuhan.
Data Source Description
Deskripsi sumber data, seperti kasus penggunaan dan batasan bisnisnya.
Deployment Mode
Jika Anda menggunakan layanan Hive dari E-MapReduce, pilih Alibaba Cloud Instance.
Instance
Pilih instance E-MapReduce yang menjadi tujuan sumber data.
Hive Metastore URI
Alamat koneksi Hive Metastore. Formatnya adalah
thrift://<Alamat IP node master>:<Nomor port>. Nomor port default adalah 9083.Untuk melihat alamat IP node master:
Masuk ke Konsol EMR on ECS. Pada tab Nodes, klik ikon
di sebelah node emr-master untuk melihat alamat IP pribadi node master.Self-managed CDH on ECS
Parameter
Deskripsi
Data Source Type
Pilih Hive.
Data Source Name
Sistem secara otomatis menghasilkan nama berdasarkan tipe sumber data dan waktu saat ini. Anda dapat mengedit nama ini sesuai kebutuhan.
Data Source Description
Deskripsi sumber data, seperti kasus penggunaan dan batasan bisnisnya.
Deployment Mode
Jika Anda memiliki kluster CDH yang dikelola sendiri pada instance ECS, pilih Self-managed CDH on ECS.
Instance
Pilih instance ECS yang menjadi tujuan sumber data.
Hive Metastore URI
Alamat koneksi Hive Metastore. Ini adalah alamat IP publik instance ECS yang sesuai dengan node master CDH. Formatnya adalah
thrift://<Alamat IP node master>:<Nomor port>. Nomor port default adalah 9083.Host Configuration Information
Masukkan setiap pemetaan host-ke-IP pada baris baru.
Contoh:
192.168.2.153 master.cdh
192.168.2.154 node1.cdh
192.168.2.155 node2.cdh
-
Setelah mengonfigurasi parameter, klik Create.
Buat pekerjaan migrasi data
-
Di panel navigasi sebelah kiri, klik Data Migration.
-
Di pojok kanan atas, klik Create Migration Job.
-
Pada halaman Create Migration Job, konfigurasikan parameter pada bagian Source and Destination Settings, Database/Table Migration Settings, dan Migration Settings.
Source and destination settings
Parameter
Deskripsi
Job Name
Nama pekerjaan migrasi data. Sistem secara otomatis menghasilkan nama berdasarkan tipe sumber data dan waktu saat ini. Anda dapat mengedit nama ini sesuai kebutuhan.
Data Source
Pilih sumber data Hive yang sudah ada atau buat yang baru.
Destination Type
Hanya Data Lake - OSS Storage yang didukung.
OSS Path
Jalur penyimpanan di OSS untuk data kluster AnalyticDB for MySQL Edisi Data Lakehouse.
Penting-
Semua bucket di wilayah yang sama dengan kluster AnalyticDB for MySQL ditampilkan. Anda dapat memilih salah satunya. Rencanakan jalur penyimpanan dengan hati-hati. Anda tidak dapat mengubah jalur penyimpanan setelah dibuat.
-
Kami menyarankan Anda memilih direktori kosong dan memastikan bahwa jalur OSS-nya tidak memiliki hubungan awalan (prefix) dengan jalur OSS pekerjaan lain. Hal ini mencegah data tertimpa. Misalnya, jika jalur OSS dua pekerjaan migrasi data adalah
oss://adb_demo/test/sls1/danoss://adb_demo/test/, kedua jalur tersebut memiliki hubungan awalan, yang dapat menyebabkan data tertimpa selama migrasi.
Database/table migration settings
PentingJika nama database atau tabel terdapat dalam daftar putih dan blacklist sekaligus, blacklist yang berlaku, sehingga layanan tidak akan melakukan migrasi database atau tabel tersebut.
Parameter
Deskripsi
Database/Table Migration Whitelist
Pekerjaan akan melakukan migrasi database dan tabel yang sesuai dengan ekspresi. Masukkan ekspresi reguler untuk nama database dan tabel. Pisahkan beberapa ekspresi dengan koma (,).
Database/Table Migration Blacklist
Pekerjaan tidak akan melakukan migrasi database dan tabel yang sesuai dengan ekspresi. Masukkan ekspresi reguler untuk nama database dan tabel. Pisahkan beberapa ekspresi dengan koma (,).
Migration settings
Parameter
Deskripsi
Handling Same Named Destination Table
Menentukan cara menangani tabel tujuan yang sudah ada:
-
Skip this table (do not migrate): Melewatkan hanya tabel saat ini. Migrasi tabel lain tetap berlanjut.
-
Report error and pause migration: Menghentikan sementara pekerjaan migrasi. Migrasi untuk tabel dengan nama yang sama dan semua tabel lainnya berhenti.
Job Resource Group
Tentukan kelompok sumber daya pekerjaan tempat pekerjaan dijalankan.
Required ACUs
Tentukan jumlah ACU untuk kelompok sumber daya pekerjaan. Nilai minimum adalah 4. Nilai maksimum adalah jumlah sumber daya komputasi yang tersedia di kelompok sumber daya pekerjaan. Alokasikan lebih banyak ACU untuk meningkatkan kinerja migrasi dan stabilitas pekerjaan.
Parallel Tasks
Nilai default adalah 1. Nilai maksimum adalah 8.
Jika Anda menaikkan nilai ini, beberapa tugas migrasi akan dimulai secara bersamaan, dan setiap tugas melakukan migrasi satu tabel. Namun, setiap tugas memerlukan minimal 4 ACU. Jika jumlah ACU tidak mencukupi, tugas migrasi akan dijalankan secara berurutan.
Advanced Settings
Memungkinkan Anda menentukan konfigurasi khusus untuk pekerjaan. Untuk melakukannya, hubungi dukungan teknis.
-
-
Setelah mengonfigurasi parameter, klik Submit.
Mulai pekerjaan migrasi data
-
Pada halaman Data Migration, temukan pekerjaan migrasi data yang telah Anda buat, lalu klik Resume di kolom Actions.
-
Klik Search di pojok kanan atas. Ketika status berubah menjadi Starting, pekerjaan migrasi data telah dimulai.
Analisis data
Setelah tugas migrasi berhasil, Anda juga dapat menggunakan fitur penemuan metadata untuk mengimpor data dari OSS ke Edisi Data Lakehouse, lalu menganalisis data yang diimpor ke Edisi Data Lakehouse di Spark Jar. Untuk informasi lebih lanjut tentang pengembangan Spark, lihat Editor pengembangan Spark dan Pengembangan aplikasi offline Spark.
-
-
Di panel navigasi sebelah kiri, klik .
-
Pada templat default, masukkan contoh pernyataan dan klik Run Now.
-- Berikut ini hanya contoh SparkSQL. Ubah kontennya dan jalankan program spark Anda. conf spark.driver.resourceSpec=medium; conf spark.executor.instances=2; conf spark.executor.resourceSpec=medium; conf spark.app.name=Spark SQL Test; conf spark.adb.connectors=oss; -- Berikut adalah pernyataan sql Anda show tables from lakehouse20220413156_adbTest; -
Opsi: Pada tab Applications, klik Logs di kolom Actions untuk melihat log eksekusi pekerjaan Spark SQL.
-
Manajemen pekerjaan
Pada halaman Data Migration, Anda dapat melakukan operasi berikut di kolom Actions.
|
Actions |
Deskripsi |
|
Start |
Memulai pekerjaan migrasi data. |
|
View Details |
Menampilkan konfigurasi pekerjaan secara detail, jumlah tabel yang dimigrasikan, dan detail migrasi. |
|
Edit |
Memodifikasi properti konfigurasi pekerjaan. |
|
Pause |
Menghentikan sementara pekerjaan migrasi saat ini. |
|
Delete |
Menghapus pekerjaan migrasi saat ini. |