Sumber data mendaftarkan detail koneksi sistem data eksternal (database, penyimpanan, atau antrian pesan) di DataWorks untuk operasi baca/tulis data lintas modul. Ruang kerja mode standar mendukung isolasi lingkungan—sumber data terpisah untuk pengembangan dan produksi mencegah operasi pengujian memengaruhi data produksi.
Fitur
Penggunaan sumber data
Sumber data di DataWorks dikelola secara terpusat di bagian ruang kerja. Setelah Anda membuat dan menguji koneksi, sumber data tersebut dapat digunakan di seluruh modul DataWorks.
|
Modul |
Kasus penggunaan |
Jenis yang didukung |
|
Data Integration |
Jalankan tugas sinkronisasi data untuk memigrasikan data antar sumber data, seperti dari MySQL ke MaxCompute. Mendukung berbagai jenis sinkronisasi, termasuk tabel tunggal, database penuh, batch, dan real-time. |
|
|
Data Studio |
Kembangkan, debug, dan jadwalkan node secara berkala. Di mode standar, tugas secara otomatis menggunakan sumber data yang ditentukan untuk lingkungan pengembangan atau produksi. |
|
|
Data Map |
Kumpulkan metadata dari sumber data. Anda dapat melihat struktur tabel dan informasi lineage. |
|
|
Data Analysis |
Hubungkan ke database untuk pemrosesan, analisis, transformasi, dan visualisasi data. |
|
|
Data Service |
Buat layanan API berdasarkan struktur tabel sumber data untuk menyediakan antarmuka kueri data. |
Isolasi lingkungan sumber data
Ruang kerja mode standar mendukung isolasi lingkungan sumber data—sumber data terpisah untuk pengembangan dan produksi mencegah operasi pengujian memengaruhi data produksi. Untuk informasi lebih lanjut, lihat Deskripsi lingkungan sumber data.
Jenis sumber data
DataWorks mendukung dua jenis sumber data:
|
Perbandingan |
Jenis standar |
Jenis metadata |
|
Tujuan utama |
Menyimpan detail koneksi untuk akses data fisik, digunakan untuk membaca, menulis, dan komputasi. |
Menyimpan detail koneksi untuk pusat metadata data lake. Hanya digunakan untuk pengumpulan dan tata kelola metadata. |
|
Objek target |
Data fisik itu sendiri. |
Informasi deskriptif tentang data (metadata), seperti struktur database, tabel, dan kolom. |
|
Tersedia untuk eksekusi tugas |
Ya. Reader dan writer tugas sinkronisasi harus mereferensikan jenis sumber data ini. |
Tidak. Tidak dapat digunakan sebagai input atau output tugas. |
|
Contoh khas |
MySQL, MaxCompute, Hologres, DLF, OSS, dan lainnya. |
Paimon Catalog. |
Ringkasan: Gunakan sumber data standar untuk membaca, menulis, atau komputasi data. Gunakan sumber data metadata untuk membawa struktur tabel Paimon dan data lake lainnya ke DataWorks guna tata kelola dan peninjauan.
Prasyarat
Sebelum mengonfigurasi sumber data, pastikan hal-hal berikut:
-
Persyaratan izin: Anda harus memiliki peran Workspace Administrator atau Operator di ruang kerja target, atau merupakan RAM user dengan kebijakan
AliyunDataWorksFullAccessatauAdministratorAccess. Otorisasi: Berikan izin kepada RAM user dan Kelola peran dan anggota ruang kerja. -
Detail koneksi: Siapkan informasi koneksi: instans atau titik akhir (Endpoint/JDBC URL), port, nama database, username, dan password.
-
Konektivitas jaringan: Pastikan resource group DataWorks dapat mengakses sumber data Anda. Jika sumber data Anda dapat diakses melalui Internet dan Anda menggunakan resource group serverless, Anda harus mengonfigurasi Internet NAT Gateway dan EIP untuk VPC yang terkait dengan resource group tersebut.
Catatan
-
Batasan penggunaan: Sumber data yang dibuat dengan metode cross-region, cross-account, atau AccessKey hanya dapat digunakan untuk sinkronisasi data, bukan untuk pengembangan data atau penjadwalan tugas.
-
Perbedaan pembuatan modul: Di mode standar, sumber data yang dibuat di Administration mencakup informasi lingkungan pengembangan dan produksi. Sumber data yang dibuat di Data Integration hanya mencakup informasi lingkungan produksi. Buat dan kelola semua sumber data di Administration.
Metode pembuatan: Otomatis dan manual
|
Metode pembuatan |
Deskripsi |
Skenario yang berlaku |
|
Pembuatan otomatis |
Saat Anda mengaitkan resource komputasi (seperti MaxCompute atau Hologres) dengan ruang kerja, sistem secara otomatis membuat dan mengelola sumber data yang sesuai. Siklus hidup dan izinnya diwariskan dari resource komputasi tersebut. |
Disarankan: Saat sumber data digunakan untuk pengembangan data, Anda harus menggunakan metode ini. Jika tidak, tugas tidak dapat dijalankan. |
|
Pembuatan manual |
Tentukan secara manual detail koneksi, kredensial autentikasi, dan parameter lainnya untuk sumber data. Anda dapat mengontrol siklus hidup dan penugasan izin sumber data tersebut. |
Berlaku untuk semua jenis sumber data, terutama untuk Data Integration, Data Service, atau skenario yang memerlukan kontrol izin detail halus. |
Titik masuk
Masuk ke Konsol DataWorks. Di wilayah target, klik di panel navigasi sebelah kiri. Pilih ruang kerja dari daftar drop-down dan klik Go to Management Center.
-
Di panel navigasi sebelah kiri, klik Data Sources untuk membuka halaman Data Sources.
-
Klik Add Connection di pojok kiri atas halaman.
Buat sumber data
Langkah 1: Pilih mode koneksi
DataWorks mendukung mode Instance Mode dan User-created Data Store with Public IP Addresses untuk mengonfigurasi koneksi sumber data.
Skenario 1: Mode instans (akun Alibaba Cloud saat ini)
Jika sumber data Anda adalah layanan Alibaba Cloud (seperti ApsaraDB RDS atau PolarDB) di bawah akun saat ini, pilih Instance Mode. Tentukan Region dan Instance. Sistem secara otomatis memperoleh detail koneksi.
-
Jika membeli instans baru, gunakan VPC yang sama dengan resource group DataWorks untuk meminimalkan konfigurasi jaringan.
-
Jika Anda sudah memiliki instans sumber data dan VPC-nya berbeda dari VPC yang digunakan oleh resource group DataWorks, pastikan untuk mengonfigurasi konektivitas jaringan guna memastikan akses sumber data yang tepat.
Skenario 2: Mode instans (akun Alibaba Cloud lain)
Saat menambahkan sumber data dalam mode instans, jika Anda perlu mengakses instans di bawah Another Alibaba Cloud Account, Anda dapat mengonfigurasi ID of Another Alibaba Cloud Account dan Name of Role Assigned to RAM User untuk membuat sumber data lintas akun.
Saat membuat sumber data lintas akun, pastikan bahwa:
-
Peran RAM yang Anda gunakan memiliki akses ke sumber data target. Untuk otorisasi lintas akun, lihat Otorisasi lintas akun untuk sumber data dan Otorisasi lintas akun untuk instans.
-
Konektivitas jaringan telah dibangun antara resource group akun konsumen (akun saat ini) dan sumber data akun pemilik resource (akun lain).
Skenario 3: Mode string koneksi
Untuk sumber data yang dikelola sendiri di instans ECS, di pusat data lokal, atau di jaringan publik, gunakan mode string koneksi. Konfigurasikan secara manual alamat jaringan (Endpoint/JDBC URL), port, nama database, dan kredensial (username/password/AccessKey).
-
Saat menggunakan mode string koneksi, pastikan alamat IP dan port dapat diakses dari jaringan resource group DataWorks. Tentukan apakah perlu mengaktifkan akses jaringan publik dan konfigurasikan grup keamanan serta daftar izin sesuai kebutuhan. Konfigurasikan konektivitas jaringan.
-
Jika alamat IP sumber data Anda sering berubah atau menggunakan akses berbasis domain, atasi hal ini dengan mengikat host ke grup sumber daya eksklusif untuk Integrasi Data atau mengonfigurasi resolusi DNS PrivateZone untuk resource group serverless.
Saat Anda menggunakan mode string koneksi, DataWorks secara otomatis mengurai URL JDBC. Jika URL berisi parameter yang tidak didukung, sistem secara otomatis menghapus parameter tersebut. Untuk mempertahankan parameter khusus, untuk menghubungi dukungan teknis.
Langkah 2: Masukkan detail koneksi
Di mode standar, Anda harus mengonfigurasi detail koneksi secara terpisah untuk lingkungan pengembangan dan lingkungan produksi. Anda dapat memilih untuk menggunakan konfigurasi yang sama atau berbeda untuk kedua lingkungan tersebut.
-
Nama sumber data: Harus unik dalam ruang kerja. Kami menyarankan Anda menggunakan nama yang secara jelas mengidentifikasi bisnis dan lingkungan, seperti
rds_mysql_order_dev. -
Deskripsi sumber data: Jelaskan secara singkat tujuan sumber data tersebut.
-
Detail koneksi: Berdasarkan mode koneksi yang dijelaskan di atas, masukkan instans atau alamat URL, port, dan informasi lainnya untuk sumber data.
Langkah 3: Atur kredensial autentikasi
DataWorks mendukung beberapa metode autentikasi. Atur kredensial berdasarkan jenis sumber data dan halaman konfigurasi. Pastikan kredensial memiliki izin database yang diperlukan.
|
Metode autentikasi |
Kasus penggunaan |
|
Username dan password |
Berlaku untuk sebagian besar jenis database (seperti ApsaraDB RDS dan StarRocks). DataWorks mengakses sumber data melalui otentikasi username dan password. |
|
RAM account |
Beberapa metode didukung seperti dijelaskan di bawah. Berlaku untuk layanan Alibaba Cloud yang mendukung autentikasi akun RAM, seperti MaxCompute dan Hologres. Anda dapat menetapkan akun berdasarkan izin yang diperlukan.
|
|
Otentikasi Kerberos |
Mekanisme autentikasi pihak ketiga. Berlaku untuk komponen data besar seperti Hive, HDFS, dan HBase. Otentikasi Kerberos memerlukan pengunggahan file autentikasi seperti Keytab dan krb5.conf. Panduan konfigurasi: Konfigurasikan otentikasi Kerberos. |
|
AccessKey |
Pasangan AccessKey adalah kredensial akses permanen yang terdiri dari AccessKey ID dan AccessKey Secret. Berlaku untuk sumber data seperti OSS dan Tablestore. Pasangan AccessKey memiliki tingkat keamanan lebih rendah — gunakan autentikasi berbasis peran RAM bila tersedia. |
|
Rahasia generik KMS |
Simpan kredensial akses sumber data di Alibaba Cloud Key Management Service (KMS). Saat membuat sumber data, atur Access identity ke Key Management Service, pilih Kms Region tempat rahasia generik KMS berada, dan pilih rahasia generik target dari KMS List. Setelah rahasia diputar, DataWorks secara otomatis menggunakan kredensial terbaru, dan tidak perlu dikonfigurasi ulang di DataWorks. Anda harus terlebih dahulu membuat rahasia generik di KMS. Untuk informasi lebih lanjut, lihat Kelola dan gunakan rahasia generik. Konten rahasia generik KMS mendukung dua format JSON berikut:
Jenis sumber data yang saat ini mendukung rahasia generik KMS: DB2, FTP, MongoDB, MySQL, Oracle, PolarDB, PolarDB-O, PostgreSQL, PolarDB-X 2.0, SQL Server. Catatan
Setelah konten rahasia generik KMS diubah, DataWorks menyimpan cache rahasia tersebut hingga 5 menit. Rahasia baru akan berlaku paling lama dalam waktu 5 menit. |
Jika database Anda telah mengaktifkan autentikasi SSL, aktifkan juga SSL saat membuat sumber data. Aktifkan autentikasi SSL untuk sumber data PostgreSQL.
Langkah 4: Uji konektivitas
Di bagian bawah halaman, klik Test Connectivity untuk setiap resource group yang terkait dengan ruang kerja.
-
Jika Connectable ditampilkan, konfigurasi sudah benar.
-
Jika Cannot Connect ditampilkan, sistem menyediakan alat diagnostik untuk membantu pemecahan masalah. Penyebab umum meliputi kredensial salah, masalah jaringan (daftar izin IP belum dikonfigurasi), atau gateway NAT yang tidak ada.
-
Di mode standar, pastikan bahwa baik lingkungan pengembangan maupun lingkungan produksi menampilkan Connectable. Jika tidak, kesalahan akan terjadi selama penggunaan selanjutnya.
Anda dapat mengonfigurasi jaringan berdasarkan mode konfigurasi sumber data, wilayah, kepemilikan instans, dan lokasi penerapan:
|
Skenario |
Instruksi |
|
Sumber data adalah layanan Alibaba Cloud dan dimiliki oleh akun Alibaba Cloud yang sama serta berada di wilayah yang sama dengan ruang kerja DataWorks. |
|
|
Sumber data adalah layanan Alibaba Cloud dan dimiliki oleh akun Alibaba Cloud yang sama dengan ruang kerja DataWorks, tetapi berada di wilayah yang berbeda. |
Hubungkan sumber data di bawah akun Alibaba Cloud yang sama lintas wilayah berbeda |
|
Sumber data adalah layanan Alibaba Cloud, tetapi dimiliki oleh akun Alibaba Cloud yang berbeda dari ruang kerja DataWorks. |
|
|
Sumber data diterapkan di instans ECS Alibaba Cloud. |
|
|
Sumber data diterapkan di pusat data lokal. |
|
|
Sumber data memiliki titik akhir publik. |
Kelola sumber data
Di halaman manajemen sumber data, filter sumber data berdasarkan Data Source Type dan Data Source Name. Anda juga dapat melakukan operasi berikut pada sumber data:
Edit, kloning, dan kelola izin
-
Edit: Ubah konfigurasi sumber data sesuai kebutuhan. Nama sumber data dan lingkungan yang berlaku tidak dapat diubah.
Sumber data yang dibuat secara otomatis saat Anda mengaitkan resource komputasi di Administration tidak dapat diedit langsung. Untuk mengubahnya, edit di halaman manajemen resource komputasi.
-
Cloning: Kloning sumber data untuk membuat yang baru dengan konfigurasi yang sama secara cepat.
-
Manage Permissions: Anda dapat mengklik ikon
untuk mengelola izin penggunaan lintas ruang kerja untuk sumber data. Manajemen izin sumber data memungkinkan Anda memberikan akses ke sumber data saat ini untuk ruang kerja lain atau pengguna tertentu di ruang kerja lain. Setelah Anda memberikan izin Allowed, pengguna dapat melihat dan menggunakan sumber data tetapi tidak dapat mengeditnya.Masalah izin sumber data lainnya: FAQ izin sumber data.
Hapus sumber data dan dampaknya
Di daftar sumber data, klik tombol hapus untuk menghapus sumber data. Namun, sumber data yang dibuat secara otomatis saat Anda mengaitkan resource komputasi di Administration tidak dapat dihapus langsung. Di Administration, klik Computing Resources di panel navigasi kiri Administration, temukan resource komputasi, dan klik Disassociate. Setelah diputuskan kaitannya, sumber data yang sesuai juga akan dihapus.
Dampak penghapusan sumber data pada modul Data Integration adalah sebagai berikut:
Pemeriksaan awal: Sebelum menghapus sumber data, verifikasi apakah sumber data tersebut terkait dengan tugas sinkronisasi apa pun di lingkungan produksi.
Solusi: Jika tugas terkait ada, gunakan pengeditan batch untuk mengubah sumber data tugas tersebut, lalu kirim ulang dan terapkan.
|
Skenario penghapusan |
Dampak |
|
Hapus kedua lingkungan pengembangan dan produksi |
• Tugas produksi akan gagal total dan tidak dapat dijalankan. • Sumber data tidak akan terlihat saat Anda mengonfigurasi tugas baru di lingkungan pengembangan. |
|
Hapus hanya lingkungan pengembangan |
• Tugas produksi dapat berjalan normal. • Namun, saat Anda mengedit tugas, metadata (seperti struktur tabel) tidak dapat diambil. • Sumber data tidak akan terlihat saat Anda mengonfigurasi tugas baru di lingkungan pengembangan. |
|
Hapus hanya lingkungan produksi. |
• Tugas produksi akan gagal total dan tidak dapat dijalankan. • Tugas yang menggunakan sumber data ini di lingkungan pengembangan tidak dapat dikirim dan diterapkan ke lingkungan produksi. |
Dampak pada modul lain adalah sebagai berikut:
|
Modul |
Tingkat risiko |
Dampak utama dan solusi |
|
Operation Center |
Tinggi |
Dampak: Semua tugas komputasi periodik dan Data Integration yang bergantung pada sumber data ini akan gagal. Solusi: Gunakan pengeditan batch untuk mengubah sumber data tugas tersebut, lalu terapkan ulang. |
|
Data Service API |
Tinggi |
Dampak: Semua API yang dihasilkan dan orkestrasi API berdasarkan sumber data ini akan gagal dipanggil. Solusi: Ganti sumber data untuk API yang terpengaruh. |
|
Data Analysis |
Sedang |
Dampak: Di modul DataAnalysis, tugas kueri yang menargetkan sumber data ini akan gagal. Solusi: Beralih ke sumber data lain yang tersedia saat menjalankan kueri SQL. |
|
Data Quality |
Sedang |
Dampak: Tugas dengan aturan pemantauan kualitas data yang dikonfigurasi akan melaporkan pengecualian pemeriksaan. Solusi: Buka Operation Center dan putuskan kaitan tugas dari aturan DQC, atau ubah aturan tersebut. |
Jika sumber data telah diberikan untuk penggunaan lintas ruang kerja, menghapus sumber data tersebut juga akan menyebabkan tugas yang menggunakan sumber data ini di ruang kerja lain gagal.
Topik lanjutan
Deskripsi lingkungan sumber data
Mode ruang kerja: Dasar vs. standar
DataWorks menyediakan ruang kerja mode dasar dan mode standar. Mode dasar dan mode standar.
-
Mode dasar: Satu lingkungan. Semua operasi pengembangan langsung memengaruhi produksi. Cocok untuk verifikasi cepat atau pengujian pribadi.
-
Mode standar: Direkomendasikan untuk penggunaan perusahaan. Memiliki lingkungan pengembangan dan produksi bawaan. Anda dapat mengonfigurasi sumber data berbeda (seperti database pengujian dan produksi) atau izin akses berbeda untuk setiap lingkungan guna mencapai isolasi data.
Isolasi lingkungan sumber data
Ruang kerja dalam mode standar mendukung isolasi lingkungan sumber data. Sumber data dengan nama yang sama dapat memiliki dua konfigurasi — satu untuk pengembangan dan satu untuk produksi — yang terhubung ke database atau instans berbeda. Hal ini mengisolasi data yang diakses selama pengujian dan penjadwalan produksi, mencegah data produksi terkontaminasi oleh operasi debugging.
-
Di modul Data Integration, hanya tugas sinkronisasi batch tabel tunggal di ruang kerja mode standar yang mendukung isolasi sumber data antara lingkungan pengembangan dan produksi. Jenis tugas sinkronisasi lainnya menggunakan sumber data lingkungan produksi.
-
Sumber data yang hanya dikonfigurasi untuk lingkungan produksi dan tidak memiliki informasi lingkungan pengembangan tidak dapat dipilih saat Anda mengonfigurasi node di Data Studio.
-
Jika Anda meningkatkan ruang kerja dari mode dasar ke mode standar, sumber data asli akan dibagi menjadi dua sumber data untuk lingkungan produksi dan pengembangan. Tingkatkan ruang kerja dari mode dasar ke mode standar.
Hubungan dengan sumber data Integrasi Data
Mode dasar:
Saat ruang kerja dalam mode dasar, hanya ada satu lingkungan. Sumber data yang dibuat di Integrasi Data dan yang dibuat di Administration identik.
Mode standar:
-
Saat Anda membuat sumber data di Administration, sumber data dengan nama yang sama secara otomatis dibuat di Integrasi Data. Keduanya berbagi konfigurasi lingkungan produksi sumber data tersebut.
-
Saat Anda membuat sumber data di Integrasi Data, sumber data dengan nama yang sama juga secara otomatis dibuat di Administration. Namun, sumber data ini hanya memiliki informasi lingkungan produksi, dan lingkungan pengembangan akan menunjukkan informasi yang hilang. Anda harus melengkapi informasi lingkungan pengembangan sebelum sumber data dapat digunakan di Data Studio.
-
Untuk memastikan integritas informasi sumber data, kami menyarankan agar Anda selalu membuat dan mengelola semua sumber data di Administration.
FAQ
-
T: Tugas yang dikonfigurasi dengan sumber data di ruang kerja mode standar berhasil di lingkungan pengembangan tetapi gagal selama penjadwalan produksi. Mengapa?
J:
-
Periksa apakah uji konektivitas berhasil untuk kedua lingkungan pengembangan dan produksi sumber data tersebut.
-
Periksa apakah data di database lingkungan pengembangan dan produksi konsisten dan memenuhi persyaratan bisnis.
-
Apa fungsi sumber data lingkungan pengembangan dan produksi?
Anda dapat mengonfigurasi sumber data terpisah untuk lingkungan pengembangan dan produksi. Sumber data lingkungan pengembangan hanya digunakan untuk pengembangan dan debugging node, sedangkan sumber data lingkungan produksi menangani penjadwalan periodik untuk node yang diterapkan. Pemisahan ketat ini mencegah operasi pengujian memengaruhi data produksi.
-
-
T: Mengapa uji konektivitas sumber data gagal?
J: Hal ini biasanya disebabkan oleh alasan berikut. Periksa satu per satu. Untuk konfigurasi konektivitas jaringan, lihat Konfigurasikan konektivitas jaringan.
-
Kredensial salah: Periksa apakah username dan password yang Anda masukkan benar.
-
Target akses salah: Periksa apakah nama database, bucket, atau target koneksi lain yang Anda masukkan benar, dan apakah akun serta password memiliki izin akses yang diperlukan.
-
Alamat atau port salah: Periksa apakah alamat koneksi sumber data dan nomor port benar. Jika nama domain host ditentukan sebagai alamat, pastikan nama domain tersebut dapat di-resolve dengan benar. Lihat Resolusi DNS PrivateZone.
-
Masalah jaringan: Periksa apakah sumber data dan resource group terhubung. Jika sumber data memiliki kontrol daftar izin, periksa apakah Blok CIDR vSwitch yang terkait dengan resource group telah ditambahkan ke daftar izin. Jika Anda menggunakan resource group serverless untuk menghubungkan ke sumber data jaringan publik, periksa apakah gateway NAT telah dikonfigurasi.
-
-
T: Apa perbedaan antara resource komputasi dan sumber data?
J:
-
Resource komputasi adalah instans resource di DataWorks yang dapat menjalankan tugas pemrosesan dan analisis data serta memiliki kemampuan komputasi. Biasanya merujuk pada mesin komputasi dasar, seperti MaxCompute, Hologres, atau AnalyticDB, dan terutama digunakan untuk tugas pengembangan dan penjadwalan data.
-
Sumber data di DataWorks digunakan untuk menghubungkan ke berbagai layanan penyimpanan data dan menyediakan kemampuan penyimpanan dan manajemen data. Sumber data menyediakan antarmuka untuk membaca dan menulis data, dan terutama digunakan untuk tugas sinkronisasi dan integrasi. Selain itu, sumber data juga mendukung fitur seperti node database, API Layanan Data, dan analisis kueri.
-
-
T: Apa perbedaan antara sumber data DLF dan sumber data Paimon Catalog?
J: Sumber data DLF adalah jenis sumber data standar yang dapat digunakan untuk Integrasi Data dan Analisis Data. Sumber data ini juga mendukung manajemen metadata untuk tipe tabel Paimon, Iceberg, dan lainnya yang menggunakan metadata terdaftar DLF. Sumber data Paimon Catalog hanya digunakan untuk pengumpulan metadata format lake Paimon dari sumber non-DLF, mendukung fitur tata kelola seperti pengambilan metadata, peninjauan, dan pemantauan kualitas. Saat ini tidak mendukung sinkronisasi data.