Konfigurasikan aturan kustom untuk memantau status task dan penggunaan resource, gunakan garis dasar cerdas guna memastikan data dihasilkan tepat waktu dalam skenario dependensi yang kompleks, serta buat aturan O&M untuk mengotomatiskan operasi kelompok sumber daya.
Fitur
Tabel berikut menjelaskan fitur pemantauan.
|
Feature |
Description |
|
Garis dasar cerdas mendeteksi anomali yang dapat menunda penyelesaian task, memberikan peringatan dini, dan memastikan data dihasilkan tepat waktu dalam skenario dependensi yang kompleks.
|
|
|
Anda dapat mengelola aturan global pada halaman . Anda juga dapat membuat aturan pemantauan kustom sesuai kebutuhan bisnis Anda.
|
|
|
Lihat peringatan dari aturan kustom, aturan global, dan garis dasar cerdas pada halaman . |
|
|
Tentukan jadwal shift pada halaman . Pilih jadwal saat mengonfigurasi aturan pemantauan agar peringatan diarahkan ke engineer yang sedang bertugas. Catatan
Jadwal shift menentukan engineer utama dan cadangan yang bertugas. Peringatan dikirim ke engineer utama secara default. Setelah dua peringatan untuk masalah yang sama, peringatan ketiga dan seterusnya dikirim ke kedua engineer tersebut. |
|
|
Buat aturan O&M untuk kelompok sumber daya eksklusif dan kaitkan dengan aturan pemantauan. Saat suatu aturan dipicu, sistem secara otomatis melakukan O&M terhadap task yang berjalan pada kelompok sumber daya target dan sesuai dengan Filter Conditions. Catatan
Saat ini, aturan O&M hanya dapat dikaitkan dengan aturan pemantauan untuk sumber daya penjadwalan. |
Pemantauan status tugas
Objek yang dipantau
Aturan pemantauan (aturan kustom dan garis dasar cerdas) mencakup status node auto triggered, status instans node auto triggered, status instans workflow yang dipicu, status task komputasi real-time, serta penggunaan resource.
-
Monitor the status of auto triggered nodes
Setiap malam, DataWorks menghasilkan Scheduled Instance untuk hari berikutnya berdasarkan Auto Triggered Node. Untuk memastikan instans tersebut dihasilkan dan berjalan sesuai harapan, DataWorks menyediakan aturan peringatan global bawaan (bukan tingkat workspace) untuk memantau status Auto Triggered Node. Jika terjadi anomali, sistem secara otomatis mengirim peringatan. Peringatan dipicu untuk Isolated Nodes dan Node Dependency Loop.
Rule type
Monitored object
Trigger condition
Description
Global rule
isolated node: Node yang tidak memiliki dependensi induk.
Peringatan dipicu secara otomatis saat node terisolasi terdeteksi. Segera selesaikan masalah tersebut.
CatatanSetiap node auto triggered, kecuali node root workspace, harus memiliki dependensi induk agar dapat dijadwalkan dan dijalankan. Node terisolasi tidak akan berjalan secara otomatis dan dapat menyebabkan masalah serius jika memiliki banyak dependensi downstream.
-
DataWorks memindai status node auto triggered setiap hari pukul 09.00, 12.00, dan 16.00. Jika ditemukan anomali seperti node terisolasi atau loop dependensi, sistem mengirim peringatan. Anomali yang terjadi dalam 10 menit sebelum pemindaian akan diproses pada siklus berikutnya.
-
Aturan global merupakan aturan bawaan. Secara default, peringatan dikirim ke pemilik node melalui pesan teks dan email. Ubah penerima peringatan pada halaman Rule Management.
-
Anda dapat menonaktifkan aturan peringatan global pada halaman Rule Management.
node dependency loop: Node yang merupakan task upstream tetapi juga bergantung pada salah satu task downstream-nya sendiri, sehingga membentuk dependensi melingkar.
Peringatan dipicu secara otomatis saat loop dependensi terdeteksi. Segera selesaikan masalah tersebut.
CatatanPenjadwal otomatis tidak akan menjalankan node yang berada dalam loop dependensi.
-
-
Monitor the running status of auto triggered node instances
Node auto triggered menghasilkan instans saat dijadwalkan secara berkala. Konfigurasikan aturan pemantauan kustom untuk Auto Triggered Node guna memantau status running Scheduled Instance-nya. Ini mencakup peringatan berbasis aturan kustom untuk objek tertentu dan peringatan garis dasar cerdas untuk peringatan proaktif pada task penting.
Rule type
Monitored object
Trigger condition
Task dalam Node, Baseline, Workspace, atau Workflow tertentu.
-
Peringatan dipicu saat task berstatus Complete, Incomplete, mengalami Error, Incomplete in Cycle, mengalami Timeout, atau mengalami Error Persisting After Automatic Rerun of Node.
-
Saat tipe objek adalah Workspace, kondisi pemicu tambahan mencakup Instance Generated dan Fluctuation of Instance Count.
Ruang lingkup pemantauan mencakup task dalam garis dasar dan semua dependensi upstream-nya.
Catatan-
Anda dapat mengatur prioritas garis dasar untuk memastikan task di dalamnya berjalan tepat waktu dan menghasilkan data sesuai harapan.
-
Jika suatu task bersifat kritis dan memiliki dependensi upstream yang kompleks, Anda dapat menambahkannya ke garis dasar untuk memastikan stabilitasnya.
-
Baseline alerts: Saat sistem memprediksi bahwa task garis dasar tidak akan selesai dalam waktu yang dijanjikan, sistem mengirim peringatan garis dasar berdasarkan metode notifikasi yang dikonfigurasi. Core logic: baseline alerts.
-
Event alerts: Sistem menghasilkan event dan mengirim peringatan jika task garis dasar atau task upstream gagal, atau jika task pada jalur kritis mengalami perlambatan. Manage events.
-
-
Monitor the running status of real-time compute tasks
-
Rule type: Custom rule.
-
Monitored object: Real-time compute tasks.
-
Trigger condition: Peringatan dipicu saat task mengalami Error.
-
-
Monitor resource usage
-
Rule type: Custom rule.
-
Monitored object: exclusive resource group for scheduling, exclusive resource group for Data Integration.
-
Trigger conditions:
-
Peringatan dipicu jika Usage kelompok sumber daya melebihi nilai tertentu selama durasi tertentu.
-
Peringatan dipicu jika Number of Instances Waiting for Resources in Resource Group dalam kelompok sumber daya melebihi nilai tertentu selama durasi tertentu.
-
-
Metode notifikasi
Saat aturan pemantauan dipicu, platform mengirim notifikasi melalui email, pesan teks, panggilan telepon, atau pesan grup DingTalk.
|
Rule type |
Notification method |
Alerting frequency control |
|
Custom rules, global rules, and intelligent baselines |
|
Anda dapat mengontrol frekuensi peringatan dengan mengatur Maximum Alerts, Minimum Alert Interval, dan Alerting Do-Not-Disturb Period. Catatan
|
O&M Resource Otomatis
O&M otomatis menggunakan aturan pemantauan dan O&M yang telah dikonfigurasi sebelumnya untuk mengelola task secara otomatis.
-
Trigger condition: Aturan pemantauan terkait dipicu.
Catatan-
Pemantauan saat ini didukung untuk Resource Group Usage dan number of instances waiting for resources in a resource group.
-
O&M otomatis saat ini hanya didukung untuk kelompok sumber daya eksklusif untuk penjadwalan.
-
-
Target instances: O&M otomatis dilakukan pada instans yang sesuai dengan Filter Conditions seperti Type, siklus penjadwalan, Priority, Status, dan Workspace.
-
O&M action: Menghentikan instans yang sedang berjalan.
CatatanAnda dapat menghentikan maksimal 2.000 instans sekaligus.
Diagnosis Peringatan Task
Lihat informasi peringatan task di DAG atau pada halaman Run Diagnosis.
-
Lihat di DAG task
Jika sebuah instans memicu peringatan pemantauan dalam 24 jam terakhir, buka halaman . Buka DAG untuk instans tersebut dan klik ikon peringatan merah di pojok kanan atas instans. Panel Monitoring Details akan muncul, menampilkan daftar aturan atau garis dasar yang memantau task tersebut beserta status pemicunya. Anda dapat mengklik View Alert Content di pojok kanan atas untuk melihat detail peringatan di halaman Alerts, atau mengklik Rule/Baseline Name untuk melihat detail konfigurasinya.
CatatanAnda dapat memilih kotak centang Nodes that generated alarms in the past 24 hours untuk memfilter instans.
-
Lihat di halaman Run Diagnosis
Untuk task yang telah dikonfigurasi dengan peringatan pemantauan, Anda juga dapat mengklik View Details di area notifikasi pada halaman Intelligent Diagnostics. Di jendela Monitoring Details yang muncul, ditampilkan daftar aturan atau garis dasar yang memantau task saat ini beserta status pemicu masing-masing. Anda dapat mengklik View Alert Content di pojok kanan atas untuk menuju halaman Informasi Peringatan dan melihat detail peringatan, atau mengklik Rule/Baseline Name untuk menuju halaman konfigurasi aturan tersebut dan melihat detail konfigurasinya.
-
Lihat di halaman Alerts
Lihat semua peringatan dari modul pemantauan cerdas di halaman Alerts. Detail peringatan menunjukkan proses pemicu, termasuk aturan, kondisi, dan alasan peringatan tersebut.
