Alur data untuk penyebaran Flink memungkinkan Anda melacak asal-usul data, mengelola dan mengoptimalkan aliran data, mengidentifikasi masalah dengan cepat, serta menilai dampaknya. Topik ini menjelaskan cara melihat alur data dari perspektif penyebaran dan perspektif metadata.
Latar Belakang
Ketika asal-usul dan riwayat perubahan data tidak dapat dilacak, kualitas dan keamanan data sulit dipastikan, serta analisis data dan troubleshooting menjadi tidak efisien. Alur data mengatasi tantangan ini dengan menggambarkan hubungan yang terbentuk saat data diambil, diproses, ditransmisikan, dan dikonsumsi. Hubungan tersebut mencakup aliran data antar metadata, dependensi, serta hubungan produksi dan konsumsi antara metadata dengan penyebaran aliran (stream) atau batch. Di Flink, Anda dapat melihat dan menganalisis alur data di berbagai lapisan penyebaran, baik pada tingkat tabel maupun kolom. Tabel berikut menjelaskan manfaat utamanya.
|
Manfaat |
Deskripsi |
|
Tingkatkan efisiensi validasi data |
Dengan melacak alur data, Anda dapat memahami setiap aspek data Anda, termasuk Produk, database, dan tabel yang terlibat dalam suatu penyebaran, atribut dan asosiasi kolom tabel, serta asal-usul data, langkah-langkah pemrosesan, jalur transmisi, dan konsumen akhirnya. Pengetahuan ini membantu Anda memvalidasi kredibilitas dan akurasi data, mengelola dan menganalisis data secara lebih efektif, serta bekerja lebih efisien. |
|
Tingkatkan efisiensi troubleshooting |
Ketika terjadi masalah dalam pemrosesan data, alur data memungkinkan Anda melacak akar penyebabnya untuk penyelesaian yang cepat, sehingga mencegah kerugian bisnis dan biaya tenaga kerja yang tinggi. |
|
Tingkatkan efisiensi analisis data |
Ketika aset data berubah atau mengandung kesalahan, Anda dapat dengan cepat mengidentifikasi penyebaran online yang terdampak dan mengambil tindakan korektif untuk mencegah keputusan yang salah. |
|
Optimalkan biaya aset data |
Dengan menganalisis alur data, Anda dapat memahami jalur aliran data dan dependensinya. Hal ini memungkinkan Anda mengoptimalkan pipeline pemrosesan data, menghentikan layanan yang telah lama tidak aktif, meningkatkan efisiensi dan kualitas pemrosesan data, serta mengurangi biaya data. |
Model alur data
Gambar tersebut terdiri dari node (entitas) dan edge (hubungan). Entitas dan hubungan bersama-sama membentuk alur data.
|
Elemen |
Deskripsi |
|
Node |
Setiap katalog, tabel data, dan kolom merupakan entitas data. Dalam graf alur data, entitas direpresentasikan sebagai node. Node alur data mencakup dua jenis berikut:
|
|
Edge |
Hubungan antar entitas didefinisikan berdasarkan sumber hulu (produsen) dan konsumen hilirnya. Anda dapat melihat hubungan alur data berikut:
|
Batasan
-
Alur data hanya didukung dalam satu namespace. Alur data lintas namespace tidak didukung.
-
Untuk melihat alur data dari perspektif metadata, Anda harus menggunakan katalog. Melihat dari perspektif penyebaran tidak bergantung pada katalog.
-
Hanya penyebaran SQL yang mendukung pelacakan dan pencarian alur data.
-
Alur data hanya tersedia untuk penyebaran SQL yang telah dijalankan minimal satu kali. Saat Anda menghentikan penyebaran, sistem menyimpan alur data terakhir yang diketahui.
-
Hanya QueryOperation, SinkModifyOperation, dan CreateTableAsTableOperation yang didukung. Sistem tidak dapat melacak atau menampilkan alur data tidak langsung dari sumber seperti sintaks CDAS, kondisi filter, atau kondisi join.
Lihat alur data dari perspektif penyebaran
Pada halaman Deployments, Anda dapat melihat informasi spesifik tentang deployment node dan data node, serta dependensi antar tabel dan hubungan hierarkis antara tabel dan kolom dalam penyebaran target.
Secara default, graf berpusat pada penyebaran dan menampilkan tiga level alur data: tabel hulu, penyebaran pusat, dan tabel hilir. Jika Anda perlu melacak alur data lebih jauh ke hulu atau hilir, klik tanda plus di sebelah kiri tabel hulu atau di sebelah kanan tabel hilir.
-
Masuk ke Konsol Realtime Compute for Apache Flink.
-
Klik Console di kolom Actions ruang kerja target.
-
Di panel navigasi sebelah kiri, pilih , lalu klik nama penyebaran target.
-
Pada tab Data Lineage, klik Table Level atau Column Level untuk melihat alur data yang sesuai.
-
Table Level
Anda dapat melihat informasi seperti jenis node, konektor, nama katalog, nama database, nama tabel tujuan dan sumber, serta ID penyebaran, waktu pembuatan, pembuat, waktu modifikasi terakhir, dan pengubah terakhir.
Dalam Directed Acyclic Graph (DAG) penyebaran, data mengalir dari node sumber datagen melalui node pemrosesan resource_setting_plan menuju node tujuan blackhole. Anda dapat mengklik suatu node untuk membuka panel detail dan melihat nilai setiap kolom.
-
Column Level
Anda dapat melihat kolom tabel, tipe kolom, nama database tabel, nama katalog, dan konektor, serta informasi tentang penyebaran.
Dalam DAG penyebaran, data mengalir dari node sumber datagen melalui node pemrosesan resource_setting_plan menuju node sink blackhole. Setiap node menampilkan tipe konektor dan detail kolom, seperti id dan name, keduanya bertipe VARCHAR(2147483647).
-
Lihat alur data dari perspektif metadata
Jika suatu tabel dalam katalog dikaitkan dengan banyak penyebaran, graf alur datanya menjadi padat. Anda dapat menggunakan fitur seperti zoom untuk menavigasi graf tersebut. Anda juga dapat mengaktifkan sakelar Auto focus clicked node. Saat fitur ini diaktifkan, mengklik penyebaran atau tabel target akan secara otomatis memusatkan graf pada node tersebut.
-
Masuk ke Konsol Realtime Compute for Apache Flink.
-
Klik Console di kolom Actions ruang kerja target.
-
Di panel navigasi sebelah kiri, klik Catalogs. Kemudian, klik ganda nama tabel di bawah database tertentu dalam suatu katalog.
-
Pada tab Data Lineage, klik Table Level atau Column Level untuk melihat alur data yang sesuai.
-
Table Level
Anda dapat melihat penyebaran mana saja yang mereferensi tabel tertentu dalam katalog target. Ketika skema tabel atau data berubah, Anda dapat dengan cepat menangani dampaknya terhadap penyebaran yang direferensi dengan memodifikasi kode atau menghentikannya.
Klik ganda node penyebaran target untuk melihat ID-nya serta informasi pembuatan dan modifikasinya. Untuk langsung menuju halaman O&M penyebaran tersebut, klik nama penyebarannya.
-
Column Level
Anda dapat mengklik kolom target dan mengikuti garis padat berwarna biru muda untuk menentukan penyebaran dan tabel mana yang mereferensinya, serta kolom yang sesuai. Ketika kolom target dihapus atau nama/atributnya berubah, Anda dapat dengan cepat menemukan penyebaran, tabel, dan kolom yang direferensi untuk menangani kolom tabel terkait secara tepat.
Kanvas menampilkan node kueri perantara terkait (seperti query-91) di tengah. Panel properti di sebelah kanan menampilkan detail kolom yang dipilih, seperti jenis node, tipe kolom (misalnya, VARCHAR(2147483647)), dan apakah nilainya boleh null.
-
Cari node atau kolom
Ketika graf alur data kompleks, Anda dapat menggunakan pencarian fuzzy berdasarkan nama node atau kolom untuk dengan cepat menemukan target dan melihat informasinya.
-
Pada tab Data Lineage untuk penyebaran target di halaman , masukkan nama node target atau nama kolom (hanya didukung pada level kolom) di kotak pencarian dan tekan Enter.
Node pusat berpindah dari penyebaran saat ini ke target pencarian dan disorot.
-
Klik ganda nama node atau kolom target untuk melihat informasi alur datanya.