Fitur AnalyticDB for MySQL lake storage menyederhanakan pembangunan dan manajemen penyimpanan data lake. Fitur ini mendukung penyimpanan data tabel terstruktur dalam format seperti Iceberg dan Paimon, serta objek file tidak terstruktur, sehingga ideal untuk skenario yang memerlukan pemrosesan batch offline dan analitik real-time secara bersamaan. Topik ini menjelaskan mode penyimpanan, jenis penyimpanan, serta operasi manajemen sumber daya untuk lake storage.
Prasyarat
Kluster AnalyticDB for MySQL Edisi Perusahaan, Edisi Dasar, atau Edisi Data Lakehouse telah dibuat.
Aktifkan lake storage
Fitur lake storage sedang dalam pratinjau undangan. Untuk mengaktifkannya, submit a ticket untuk menghubungi dukungan teknis.
Mode penyimpanan
Sebelum membuat tabel data lake, Anda harus menentukan lokasi penyimpanan datanya. AnalyticDB for MySQL menyediakan dua mode penyimpanan. Mode ditentukan saat pembuatan tabel dan tidak dapat diubah setelahnya.
Dimensi | Lake storage terkelola (internal lake) | OSS milik pengguna (external lake) |
Manajemen penyimpanan | AnalyticDB for MySQL sepenuhnya mengelola dan secara otomatis menangani bucket penyimpanan dasar | Pengguna mengelola bucket OSS mereka sendiri |
Parameter utama pembuatan tabel |
|
|
Pengaktifan | Memerlukan lake storage diaktifkan terlebih dahulu | Tidak diperlukan pengaturan tambahan untuk akses akun yang sama |
Kasus penggunaan | Proyek baru yang memerlukan operasi yang disederhanakan | Data OSS yang sudah ada atau kebutuhan penyimpanan yang dikelola sendiri |
Lake storage terkelola: Data disimpan dalam bucket dasar yang dikelola secara otomatis oleh AnalyticDB for MySQL. Anda dapat membaca dari dan menulis ke tabel lake menggunakan SQL standar tanpa perlu mengelola sistem file, konfigurasi izin, atau kebijakan siklus hidup. Untuk informasi selengkapnya, lihat Buat lake storage.
OSS milik pengguna: Data disimpan sepenuhnya dalam bucket OSS yang Anda tentukan di wilayah yang sama. Anda menentukan path OSS dengan menggunakan parameter
LOCATIONsaat membuat tabel.
Sintaks pembuatan tabel bervariasi tergantung pada engine. Untuk informasi selengkapnya, lihat dokumentasi baca dan tulis untuk engine yang sesuai di Langkah berikutnya.
Jenis penyimpanan
Lake storage terkelola AnalyticDB for MySQL menawarkan dua jenis penyimpanan. Anda dapat memilih solusi penyimpanan yang sesuai berdasarkan kebutuhan bisnis Anda.
Dimensi | Basic | Standard |
Penyimpanan dasar | Penyimpanan objek OSS | Penyimpanan objek berkinerja-tinggi AFS (AnalyticDB Filesystem) |
Protokol akses | API OSS | Protokol kompatibel S3, dengan dukungan tambahan antarmuka POSIX (dalam pratinjau undangan) |
Kasus penggunaan | Analis data tujuan umum dan pemrosesan batch offline | Pelatihan dan inferensi AI/ML, komputasi berkinerja tinggi, serta pemrosesan data multi-modal |
Karakteristik kinerja | Throughput dan latensi standar | Throughput tinggi, latensi rendah, dengan cache multi-level bawaan |
Tiering hot-cold | Tidak didukung | Didukung — data panas disimpan di AFS, dan data dingin secara otomatis dipindahkan ke OSS |
Pengaktifan | Submit a ticket | Submit a ticket |
Basic (lake storage standar OSS)
Lake storage Basic dibangun di atas penyimpanan objek OSS Alibaba Cloud, sehingga cocok untuk sebagian besar skenario analitik data tujuan umum dan pemrosesan batch offline. Setelah dibuat, sistem secara otomatis membuat bucket di OSS di bawah akun layanan. Bucket ini berada di wilayah yang sama dengan kluster Anda dan memiliki nama yang sama dengan lake storage.
Standard (lake storage berkinerja-tinggi AFS)
AFS (AnalyticDB Filesystem) adalah penyimpanan objek berkinerja tinggi yang kompatibel dengan S3 dan menyediakan kemampuan ingesti data serta persistensi berkinerja tinggi untuk lake storage AnalyticDB for MySQL. AFS dirancang untuk skenario yang membutuhkan kinerja penyimpanan lebih tinggi, seperti pelatihan dan inferensi AI/ML, serta pemrosesan data multi-modal skala besar.
Kemampuan inti:
Kompatibilitas protokol S3: Anda dapat langsung menggunakan rantai alat standar seperti AWS SDK dan Spark/Flink S3A untuk mengakses AFS tanpa memodifikasi alat yang sudah ada.
Antarmuka POSIX (dalam pratinjau undangan): Data yang sama dapat diakses melalui API S3 maupun mount POSIX, mencakup skenario seperti pelatihan dan inferensi yang bergantung pada path file.
Tiering hot-cold: Data panas disimpan di AFS untuk memastikan akses berkinerja tinggi, sementara data dingin secara otomatis dipindahkan ke OSS. Namespace terpadu bersifat transparan bagi aplikasi lapisan atas, mencapai keseimbangan antara biaya dan kinerja.
Keamanan dan izin: AFS mendukung model izin detail halus berbasis kebijakan S3, memungkinkan otorisasi hak istimewa minimum berdasarkan bucket, path, dan jenis operasi. AFS juga mendukung sistem pengguna dan AccessKey untuk isolasi multi-tim.
Antarmuka POSIX
Pipeline pelatihan dan inferensi AI/ML biasanya bergantung pada path file POSIX daripada kunci S3. AFS menyediakan antarmuka POSIX di atas API S3, memberikan manfaat utama berikut:
Pelatihan dan inferensi tanpa modifikasi: Operator Ray dan checkpoint model dapat langsung membaca dari dan menulis ke titik mount tanpa beralih ke SDK S3.
Akses mode ganda ke data yang sama: Pipeline produksi hulu menulis melalui S3, sementara pelatihan atau pengambilan hilir membaca melalui antarmuka POSIX — tanpa copy, tanpa perpindahan data.
Antarmuka POSIX saat ini dalam pratinjau undangan. Untuk menggunakan fitur ini, submit a ticket.
Penagihan
Setelah Anda membuat lake storage, AnalyticDB for MySQL menagih Anda secara bayar sesuai penggunaan berdasarkan volume data dan durasi penggunaan. Untuk detail harga, lihat Harga Edisi Perusahaan dan Edisi Dasar dan Harga Edisi Data Lakehouse.
Membaca data dari atau menulis data ke lake storage akan dikenai biaya permintaan. Biaya ini mencakup tagihan untuk permintaan PUT dan GET. Untuk detail harga, lihat Harga Edisi Perusahaan dan Edisi Dasar dan Harga Edisi Data Lakehouse.
Catatan penggunaan
Akun Alibaba Cloud dapat membuat hingga lima lake storage di wilayah yang sama.
Terdapat penundaan dalam pembaruan penggunaan penyimpanan yang ditampilkan untuk lake storage, sehingga Anda mungkin tidak melihat volume data terbaru segera setelah menulis data.
Sebelum menghapus lake storage, Anda harus terlebih dahulu menghapus semua data di dalamnya. Jika tidak, penghapusan akan gagal.
Setelah Anda membuat lake storage, AnalyticDB for MySQL secara otomatis membuat bucket di OSS di bawah akun layanannya. Bucket ini berada di wilayah yang sama dengan kluster AnalyticDB for MySQL Anda dan memiliki nama yang sama dengan lake storage. Anda dapat melihat bucket ini di Konsol OSS di bawah akun Alibaba Cloud Anda dengan menambahkan path favorit.
Fitur backup dan pemulihan AnalyticDB for MySQL tidak mendukung data di lake storage.
Buat lake storage
Standard
Lake storage Standard dibangun di atas penyimpanan objek berkinerja tinggi AFS. Untuk membuat lake storage Standard, Anda harus terlebih dahulu membuat kluster penyimpanan lalu membuat bucket.
Login ke Konsol AnalyticDB for MySQL. Di pojok kiri atas konsol, pilih wilayah. Di panel navigasi kiri, klik Clusters. Temukan kluster yang ingin Anda kelola dan klik ID kluster tersebut.
Klik tab Storage Cluster Management.
Klik Create Cluster.
Pada kotak dialog Create Cluster, Storage Class tetap diatur ke Standard. Atur Reserved Resource Size, masukkan (opsional) Cluster Description, lalu klik OK.
CatatanPembuatan kluster penyimpanan memerlukan waktu. Tunggu hingga kluster selesai dibuat sebelum melanjutkan.
Klik tab Bucket Management.
Klik Create Bucket.
Pada kotak dialog Create Bucket, konfigurasi parameter berikut lalu klik OK.
Type: Pilih Standard.
Cluster: Pilih kluster penyimpanan yang dibuat pada langkah sebelumnya.
Bucket Name: Masukkan nama bucket. Nama harus unik secara global dan tidak dapat diubah setelah dibuat.
Data Redundancy Type: Pilih Zone-Redundant Storage atau Locally Redundant Storage.
Bucket Description: (Opsional) Masukkan deskripsi untuk membedakan skenario bisnis yang berbeda.
Basic
Login ke Konsol AnalyticDB for MySQL. Di pojok kiri atas konsol, pilih wilayah. Di panel navigasi kiri, klik Clusters. Temukan kluster yang ingin Anda kelola dan klik ID kluster tersebut.
Di panel navigasi kiri, pilih .
Di tab Bucket Management, klik Create Bucket.
Pada kotak dialog Create Bucket, konfigurasi parameter berikut lalu klik OK.
Type: Pilih Basic.
Bucket Name: Dihasilkan secara otomatis oleh sistem. Anda tidak perlu memasukkan nama.
Bucket Description: (Opsional) Masukkan deskripsi untuk membedakan skenario bisnis yang berbeda.
Data Redundancy Type: Pilih Zone-Redundant Storage atau Locally Redundant Storage.
PentingNama bucket dihasilkan secara otomatis dalam format
adb-lake-<Region ID>-<Random String>. Nama ini unik secara global dan tidak dapat diubah setelah dibuat.(Opsional) Ubah deskripsi bucket.
Nama bucket dihasilkan secara otomatis dan tidak dapat dimodifikasi. Kami menyarankan Anda mengubah deskripsi bucket untuk membedakannya dari bucket lain yang digunakan untuk skenario bisnis berbeda.
Di kolom Bucket Description bucket yang dituju, klik ikon
.Pada kotak dialog Edit Bucket Description, masukkan deskripsi lalu klik OK.
(Opsional) Tambahkan otorisasi.
Di kolom Actions, klik Add Authorization dan pilih untuk memberikan otorisasi kepada RAM user atau RAM role.
CatatanRead-only: Mengizinkan pengguna melihat data lake storage, tetapi tidak mengubah atau menghapusnya.
Read/write: Mengizinkan pengguna membaca, menulis, dan mengubah data.
Hanya akun Alibaba Cloud atau RAM user dengan izin yang sesuai yang dapat memberikan izin.
Perubahan izin berlaku segera. Pastikan cakupan otorisasi sebelum melanjutkan.
Lihat titik akhir koneksi
Setelah membuat lake storage Standard, Anda dapat melihat titik akhir koneksi S3-nya di konsol. Gunakan titik akhir ini untuk mengonfigurasi alat kompatibel S3 seperti AWS SDK dan Spark/Flink S3A agar dapat mengakses lake storage AFS.
Di tab Bucket Management, temukan bucket Standard yang dituju dan lihat titik akhir koneksi S3-nya di kolom Endpoint.
Titik akhir ini hanya dapat diakses dalam VPC yang sama. Pastikan alat atau aplikasi Anda dideploy dalam VPC yang sama.
Lake storage Basic tidak mendukung protokol S3. Kolom Endpoint menampilkan tanda hubung (-) untuk bucket Basic.
Lihat volume data lake storage
Di panel navigasi kiri, pilih .
Lihat volume data di kolom Storage Usage pada lake storage yang dituju.
PentingTerdapat penundaan dalam pembaruan penggunaan penyimpanan yang ditampilkan untuk lake storage, sehingga Anda mungkin tidak melihat volume data terbaru segera setelah menulis data.
Hapus lake storage
Di panel navigasi kiri, pilih .
Di kolom Actions lake storage yang dituju, klik Delete.
Pada kotak dialog Delete yang muncul, klik OK.
PentingSebelum menghapus lake storage, Anda harus terlebih dahulu menghapus semua data di dalamnya. Jika tidak, penghapusan akan gagal.
Langkah berikutnya
Tetapkan format tabel default (hanya Spark SQL)
Fitur ini hanya berlaku untuk engine Spark SQL.
Anda dapat menetapkan format tabel default di tingkat database sehingga tabel baru yang dibuat dalam database tersebut secara otomatis menggunakan format yang ditentukan tanpa perlu deklarasi per tabel.
Di kelompok resource job Spark, kelompok resource interaktif, atau job yang dikirimkan, atur parameter berikut:
spark.sql.adb.sources.extractProviderFromDBProperties.enabled trueSaat membuat database, tentukan
DBPROPERTIESdengan'storage.format'diatur ke salah satu format berikut:delta,iceberg,parquet, atauorc. Contoh:CREATE DATABASE IF NOT EXISTS db_storage_format LOCATION 'oss://path/to/db/' WITH DBPROPERTIES ('storage.format'='delta');Setelah menjalankan pernyataan ini, tabel yang dibuat dalam database
db_storage_formatsecara default menggunakan formatdelta. Jika Anda secara eksplisit menentukan format tabel dengan menggunakanusing ${tableFormat}saat membuat tabel, format yang ditentukan secara eksplisit akan diutamakan.
Operasi tabel data lake
Berdasarkan engine dan format lake yang Anda pilih, rujuk dokumentasi yang sesuai untuk membuat tabel dan melakukan operasi baca/tulis:
Tabel data lake: Untuk dokumentasi baca dan tulis berdasarkan format lake dan engine, lihat Tabel data lake.
Manajemen siklus hidup: Untuk mengelola versi tabel, snapshot, dan data kedaluwarsa, lihat Manajemen siklus hidup data lake.
Optimasi kinerja: Untuk meningkatkan kinerja kueri tabel lake, lihat Optimasi lake storage dan Cache lake.
Data Ingestion: