Konfigurasikan aturan O&M otomatis berdasarkan pengalaman respons darurat Anda. Ketika kondisi pemicu terpenuhi, sistem secara otomatis melakukan operasi seperti menghentikan instans yang sedang berjalan atau menjalankan ulang node yang gagal, sehingga meningkatkan stabilitas layanan dan mengurangi beban pemeliharaan malam hari.
Latar Belakang
Di DataWorks, fitur O&M otomatis mencakup penghentian otomatis instans node yang sedang berjalan dan jalankan ulang otomatis.
-
Penghentian otomatis instans node yang sedang berjalan
Jika sebuah node yang berjalan pada grup sumber daya eksklusif untuk penjadwalan memicu aturan alert kustom tentang grup sumber daya, sistem menggunakan aturan O&M otomatis yang ditentukan untuk menghentikan instans tertentu yang dihasilkan oleh node tersebut. Misalnya, jika laju penggunaan sumber daya grup sumber daya eksklusif untuk penjadwalan mencapai 80% dan bertahan selama 10 menit, sistem secara otomatis menghentikan eksekusi instans node non-auto triggered dengan prioritas 1 dan 3 pada grup sumber daya eksklusif tersebut.
-
Jalankan ulang otomatis
Sebuah node dijalankan ulang secara otomatis berdasarkan aturan jalankan ulang otomatis dalam skenario berikut: (1) Status node adalah Failed dan properti automatic rerun tidak dikonfigurasi untuk node tersebut; (2) Node gagal karena eksekusi node melebihi batas waktu (timeout).
Batasan
-
Batasan izin: Hanya Akun Alibaba Cloud, Pengguna RAM yang memiliki kebijakan AliyunDataWorksFullAccess, dan administrator ruang kerja yang dapat mengelola aturan O&M otomatis.
-
Batasan grup sumber daya:
-
Aturan O&M otomatis tentang penghentian otomatis instans node yang sedang berjalan hanya berlaku untuk node yang dijalankan pada grup sumber daya eksklusif untuk penjadwalan dan hanya berlaku untuk node yang telah dikonfigurasi aturan alert mengenai laju penggunaan sumber daya grup sumber daya eksklusif untuk penjadwalan.
-
Aturan O&M otomatis tentang membuat aturan jalankan ulang otomatis hanya berlaku untuk node yang dijalankan pada serverless resource group.
-
-
Batasan fitur:
-
Anda dapat mengaitkan beberapa aturan O&M otomatis tentang penghentian otomatis instans node yang sedang berjalan dengan aturan alert yang sama.
-
Anda hanya dapat membuat satu aturan O&M otomatis untuk membuat aturan jalankan ulang otomatis di setiap ruang kerja.
-
Anda dapat melihat catatan eksekusi yang dihasilkan oleh aturan O&M otomatis dalam 30 hari terakhir.
-
Buka halaman Automatic
-
Login ke Konsol DataWorks. Di wilayah target, klik di panel navigasi sebelah kiri. Pilih ruang kerja dari daftar drop-down lalu klik Go to Operation Center.
-
Di bilah navigasi kiri, pilih untuk membuka halaman O&M Otomatis.
Buat aturan
Di halaman , Anda dapat membuat aturan O&M otomatis Create Terminate Running Instance dan Auto Rerun. Setiap aturan memerlukan kondisi pemicu, kondisi filter untuk menargetkan node tertentu, blacklist opsional untuk mengecualikan node, serta aturan kendala untuk membatasi kapan aturan tersebut berlaku.
Buat aturan untuk menghentikan instans yang sedang berjalan
Di Automatic O&M, konfigurasikan aturan untuk secara otomatis menghentikan instans yang memenuhi aturan kustom. Tipe instans yang didukung: recurring instances, data backfill instances, test instances, one-time task instances, dan manually triggered workflow instances. Parameter konfigurasi utama adalah sebagai berikut:
|
Bagian |
Parameter |
Deskripsi |
|
Trigger Condition |
Associated Monitoring Rule |
Aturan alert yang ingin Anda kaitkan dengan aturan O&M otomatis. Jika aturan alert dipicu, instans node akan dihentikan secara otomatis. Catatan
|
|
Filter Conditions |
Workspace |
Nama ruang kerja tempat aturan O&M otomatis diterapkan. |
|
Instance Type |
Tipe instans node tempat aturan O&M otomatis diterapkan. |
|
|
Scheduling Cycle |
Pilih siklus penjadwalan tempat aturan O&M berlaku. Jika Anda mengatur Instance Type menjadi Scheduled Instance atau Data Backfill Instance, Anda harus mengonfigurasi parameter ini. |
|
|
Priority |
Prioritas instans node tempat aturan O&M otomatis diterapkan. Nilai yang lebih besar menunjukkan prioritas yang lebih tinggi. |
|
|
Status |
Status instans node tempat aturan O&M otomatis diterapkan. |
|
|
Blocklist |
Node yang memenuhi kondisi yang ditentukan dalam aturan O&M otomatis tetapi tidak ingin Anda lakukan operasi O&M. Untuk menambahkan node ke daftar hitam, masukkan nama atau ID node di kotak pencarian. |
|
|
Constraints on Rule |
Effective Period |
Rentang waktu di mana aturan berlaku. Operasi O&M hanya dilakukan jika kondisi aturan terpenuhi dan dipicu dalam periode ini. Di luar periode ini, operasi tidak dilakukan meskipun kondisi terpenuhi. |
|
Maximum Effective Times |
Jumlah maksimum kali aturan dapat dipicu dan dieksekusi. Catatan
Setiap kali sebelum aturan O&M otomatis dieksekusi, sistem memeriksa apakah kondisi pemicu terpenuhi. Jika kondisi pemicu tidak terpenuhi, aturan O&M otomatis tidak dieksekusi. |
|
|
Minimum Effective Interval |
Interval minimum di mana aturan O&M otomatis dapat dipicu. |
|
Buat aturan jalankan ulang otomatis
Di Automatic O&M, konfigurasikan fitur Auto Rerun untuk node yang memenuhi Trigger Condition yang ditentukan. Tipe instans yang didukung: periodically scheduled instances, data backfill instances, smoke testing instances, one-time task instances, dan manually triggered workflow instances.
-
Untuk recurring instance, jalankan ulang otomatis hanya memeriksa instans dengan waktu data kemarin.
Misalnya, jika tanggal saat ini adalah 5 Juni 2025, hanya recurring instances dengan waktu data 4 Juni 2025 yang akan dijalankan ulang secara otomatis setelah memenuhi kondisi pemicu jalankan ulang otomatis.
-
Untuk data backfill instance, test instance, one-time task instance, atau manually triggered workflow instance, jalankan ulang otomatis memeriksa instans yang dibuat hari ini, kemarin, dan dua hari lalu.
Misalnya, jika tanggal saat ini adalah 5 Juni 2025, maka data backfill instances, test instances, one-time task instances, dan manually triggered workflow instances yang dibuat pada tanggal 5, 4, dan 3 Juni akan dijalankan ulang secara otomatis setelah memenuhi kondisi pemicu jalankan ulang otomatis.
Parameter konfigurasi utama untuk aturan jalankan ulang otomatis adalah sebagai berikut:
|
Bagian |
Parameter |
Deskripsi |
|
Trigger Condition |
Running status |
Instans yang ditentukan akan dijalankan ulang secara otomatis ketika memenuhi kondisi berikut dan gagal dijalankan:
|
|
Filter Conditions |
Workspace |
Nama ruang kerja tempat aturan O&M otomatis diterapkan. |
|
Instance Type |
Tipe instans node tempat aturan O&M otomatis diterapkan. |
|
|
Scheduling Cycle |
Pilih siklus penjadwalan tempat aturan O&M berlaku. Jika Anda mengatur Instance type menjadi Scheduled Instance atau Data Backfill Instance, Anda dapat mengonfigurasi parameter ini. |
|
|
Priority |
Prioritas instans node tempat aturan O&M otomatis diterapkan. Nilai yang lebih besar menunjukkan prioritas yang lebih tinggi. |
|
|
Logs Contain Keywords |
Kata kunci yang ingin Anda identifikasi dalam log operasi instans node. Jika log operasi instans node mengandung kata kunci tersebut, aturan jalankan ulang otomatis akan dipicu secara otomatis. Nilai yang valid adalah Catatan
Aturan jalankan ulang otomatis hanya dapat dipicu untuk node yang log operasinya mengandung kata kunci |
|
|
Blacklist |
Blocklist |
Node yang memenuhi kondisi yang ditentukan dalam aturan O&M otomatis tetapi tidak ingin Anda lakukan operasi O&M. Untuk menambahkan node ke daftar hitam, masukkan nama atau ID node di kotak pencarian. |
|
Rerun |
Preparation |
Untuk node komputasi yang berjalan pada serverless resource group, Anda dapat memilih Add CUs for Computing Tasks sebelum node dijalankan ulang. Catatan
Tentukan jumlah CU yang ditambahkan untuk setiap jalankan ulang guna mencegah eksekusi node lain terblokir akibat persaingan sumber daya. |
|
CUs to Add |
Selain CU yang dikonsumsi oleh instans node asli, tambahkan CU yang ditentukan untuk instans jalankan ulang. CU tambahan hanya digunakan untuk jalankan ulang instans tersebut. |
|
|
Rerun Times |
Jumlah maksimum kali jalankan ulang otomatis dapat dipicu. Nilai valid: 1 hingga 10. Satuan: kali. |
|
|
Rerun Interval |
Interval antar jalankan ulang. Nilai valid: 3 hingga 30. Satuan: menit. |
|
|
Constraints on Rule |
Effective Period |
Rentang waktu di mana aturan berlaku. Operasi O&M hanya dilakukan jika kondisi aturan terpenuhi dan dipicu dalam periode ini. Di luar periode ini, operasi tidak dilakukan meskipun kondisi terpenuhi. |
Aktifkan atau nonaktifkan aturan
Secara default, aturan O&M otomatis langsung berlaku setelah dibuat. Untuk menonaktifkan aturan, klik ikon
di kolom Actions pada aturan tersebut.
Operasi lainnya
Kelola aturan
-
Untuk melihat informasi aturan, buka halaman Rule Management lalu klik View pada baris aturan tersebut.
-
Untuk mengubah aturan, klik Edit di bagian bawah kotak dialog View Rule.
-
Untuk menghapus aturan, klik Delete pada baris aturan tersebut lalu klik Confirm pada kotak dialog yang muncul.
-
Untuk mencari aturan, masukkan namanya di kotak pencarian pada halaman Rule Management.
Lihat catatan eksekusi aturan
Di halaman Execution Records, Anda dapat melihat catatan eksekusi aturan O&M, termasuk waktu eksekusi, pemilik aturan, dan jumlah node yang terlibat. Untuk melihat informasi detail, klik View Details pada baris catatan eksekusi.
Ketika aturan O&M otomatis dipicu, operasi dilakukan atas identitas pemilik aturan. Anda dapat melihat operasi tersebut di log operasi instans node yang memicu.
-
Catatan eksekusi aturan O&M otomatis tentang penghentian otomatis instans node yang sedang berjalan mencakup informasi berikut:
-
Instances Waiting for Resources/Resource Usage: Grafik garis yang menampilkan jumlah instans yang menunggu sumber daya dan penggunaan sumber daya dari waktu ke waktu. Arahkan kursor ke grafik untuk melihat metrik tersebut pada titik waktu tertentu.
-
Terminated Node Instances: Bagian ini menampilkan semua instans node yang eksekusinya dihentikan.
-
-
Catatan eksekusi aturan O&M otomatis tentang jalankan ulang otomatis instans node mencakup informasi berikut:
-
Automatically rerun instances: Daftar instans yang dijalankan ulang secara otomatis, termasuk Node Name, Data Timestamp, Instance Type, Task type, dan Owner.
-
Monitor grup sumber daya
Setelah Anda membuat aturan O&M otomatis, sistem secara otomatis memantau penggunaan sumber daya grup sumber daya yang ditentukan dalam aturan tersebut. Untuk informasi lebih lanjut tentang pemantauan grup sumber daya, lihat Resource O&M.