Event sistem ECS memberi tahu Anda mengenai status tugas O&M, pengecualian resource, dan perubahan status, sehingga memungkinkan respons cepat serta alur kerja O&M otomatis.
Topik ini hanya mencakup event sistem ECS. Untuk event sistem produk Alibaba Cloud lainnya, lihat dokumentasi masing-masing produk.
Kasus penggunaan
-
Notifikasi risiko dan pengecualian
Alibaba Cloud mendorong event sistem ke Konsol ECS untuk memberi tahu Anda mengenai situasi yang memengaruhi ketersediaan dan kinerja resource, seperti restart pemeliharaan sistem dan masa berlaku instans yang akan habis. Untuk event kritis, Alibaba Cloud juga mengirim notifikasi melalui email, dan pesan internal. Segera tanggapi di Konsol ECS atau dengan OpenAPI untuk menghindari gangguan bisnis. Lihat Kueri dan tanggapi event sistem ECS.
Misalnya, ketika instans subscription akan kedaluwarsa, Konsol ECS akan meminta Anda untuk memperpanjang sebelum instans berhenti.
-
O&M otomatis
Event sistem di Konsol ECS memiliki status yang telah ditentukan untuk melacak eksekusi tugas O&M. Perubahan status disinkronkan dengan CloudMonitor, memungkinkan alur kerja O&M otomatis. Lihat Status dan jendela event sistem.
Catatan-
Tiap status event dipetakan ke nama event CloudMonitor. Misalnya,
InstanceFailure.Rebootmendukung statusExecutingdanExecuted, yang masing-masing berkorespondensi denganInstance:InstanceFailure.Reboot:ExecutingdanInstance:InstanceFailure.Reboot:Executed.
Beberapa event perubahan status, seperti perubahan status running instans dan interupsi spot instans, tidak ditampilkan di Konsol ECS dan tidak memiliki status event yang ditentukan. Namun, event tersebut tetap dilaporkan ke CloudMonitor, memungkinkan O&M otomatis berbasis event.
Sebagai contoh, menjalankan atau menghentikan instans secara manual menghasilkan event perubahan status. Ini bukan merupakan risiko atau pengecualian, tetapi Anda dapat mengatur notifikasi event untuk mencatat operasi tersebut di sistem log Anda melalui callback.
-
Jenis event sistem
Event sistem diklasifikasikan berdasarkan pemicunya:
Untuk jenis event yang didukung dan tindakan yang direkomendasikan, lihat Ringkasan event sistem ECS.
|
Kategori |
Deskripsi |
Ditampilkan di Konsol ECS |
|
Event O&M terjadwal |
Alibaba Cloud melakukan upgrade perangkat lunak host dan secara proaktif mengurangi risiko kegagalan perangkat keras maupun perangkat lunak. Jika tugas O&M berpotensi memengaruhi ketersediaan atau kinerja resource ECS Anda, Alibaba Cloud akan memberi tahu Anda terlebih dahulu mengenai waktu eksekusi, resource yang terdampak, dan dampaknya. Tanggapi selama jam sepi dalam jendela yang dijadwalkan untuk meminimalkan gangguan bisnis. Catatan
Event O&M terjadwal (juga disebut event O&M proaktif) memanfaatkan pengalaman manajemen server skala besar Alibaba Cloud dan algoritma pembelajaran mesin Akademi DAMO Alibaba untuk memprediksi serta menghindari risiko kegagalan host. Ketika risiko tidak dapat dihindari, Alibaba Cloud akan memberi tahu Anda terlebih dahulu agar Anda dapat melakukan alih bencana. Jika Anda tidak merespons, instans Anda mungkin mati atau restart saat kegagalan terjadi. |
Ya Catatan
Untuk keluarga instans big data atau keluarga instans dengan SSD lokal (kecuali i4p), event O&M terjadwal muncul di bawah Local Disk Instance Events. Lihat Skenario O&M dan event sistem untuk instans dengan disk lokal. |
|
Event O&M tak terduga |
Ketika host dasar mengalami kegagalan perangkat keras atau perangkat lunak secara tiba-tiba, atau instans mengalami masalah seperti error OOM atau kernel panic, instans mungkin restart atau mati secara tak terduga. Alibaba Cloud mengirim event O&M tak terduga, memulihkan ketersediaan resource, dan memberi tahu Anda mengenai status tugas O&M tersebut. Catatan
Event O&M tak terduga biasanya melibatkan downtime atau restart instans secara tiba-tiba akibat kegagalan host yang tidak dapat diprediksi atau error kernel OS.
|
Ya Catatan
Untuk keluarga instans big data atau keluarga instans dengan SSD lokal (kecuali i4p), event O&M tak terduga muncul di bawah Local Disk Instance Events. Lihat Skenario O&M dan event sistem untuk instans dengan disk lokal. |
|
Event instans disk lokal |
Event untuk disk lokal (seperti kerusakan disk) dan untuk instans dengan disk lokal (seperti instans yang terdampak kerusakan disk lokal atau kegagalan host dasar). Catatan
Local Disk Instance Events bukan jenis event spesifik. Ini mengelompokkan event O&M terjadwal dan tak terduga untuk keluarga instans big data atau keluarga instans dengan SSD lokal (kecuali i4p). Lihat Skenario O&M dan event sistem untuk instans dengan disk lokal. |
Ya |
|
Event keterbatasan kinerja untuk instans burstable |
Event pengingat yang menunjukkan bahwa instans burstable telah menghabiskan Kredit CPU-nya. CPU berjalan pada kinerja dasar, yang dapat menyebabkan akses lambat dan penurunan kinerja aplikasi. |
Ya |
|
Event Keamanan Instance |
Event yang memengaruhi keamanan instans, seperti Serangan DDoS atau blackhole yang mengancam instans. |
Ya |
|
Event migrasi instans akibat upgrade lapisan dasar |
Ketika Alibaba Cloud melakukan upgrade infrastruktur fisik, instans di wilayah dan zona yang terdampak mungkin perlu dimigrasikan. Ikuti panduan event sistem untuk memigrasikan instans Anda. |
Ya |
|
Event perubahan status |
Event yang dipicu oleh operasi siklus hidup instans (seperti start/stop manual) atau perubahan properti yang dideteksi oleh Alibaba Cloud:
|
|
Tingkat keparahan event sistem
Event sistem memiliki tingkat keparahan sebagai berikut:
-
Critical: Dampak besar yang memerlukan tindakan segera. Tanpa tindakan, instans mungkin menjadi tidak dapat digunakan. Contoh: rilis resource akibat pembayaran tertunda, redeployment instans akibat error.
-
Warning: Dampak sedang yang memerlukan perhatian atau tindakan pada waktu yang tepat. Contoh: instans burstable dengan kinerja terbatas masih dapat berjalan tetapi tidak dapat melebihi garis dasar.
-
Information: Event yang dapat Anda pantau secara opsional. Contoh: event pembuatan Snapshot disk.
Status dan jendela event sistem
Tabel berikut mencantumkan status event sistem yang ditampilkan di Konsol ECS.
Untuk status event yang didukung tiap event sistem, lihat kolom nama event CloudMonitor di Ringkasan event sistem ECS.
|
State |
Properti |
Deskripsi |
|
Inquiring |
Status antara |
Sedang dalam proses inquiry, menunggu otorisasi. Setelah otorisasi, status berubah menjadi Executing. |
|
Scheduled |
Status antara |
Tugas O&M telah dijadwalkan tetapi belum dimulai. Berubah menjadi Executing saat tugas dimulai. |
|
Executing |
Status antara |
Tugas O&M sedang berlangsung. |
|
Executed |
Status stabil |
Tugas O&M telah selesai. |
|
Avoided |
Status stabil |
Instans telah dimigrasikan dalam jendela operasi pengguna, sehingga dampak event sistem berhasil dihindari. |
|
Failed |
Status stabil |
Tugas O&M gagal. |
|
Canceled |
Status stabil |
Sistem membatalkan tugas O&M. |
Gambar berikut menunjukkan transisi status event khas.
Event sistem mencakup jendela berikut:
-
Jendela operasi pengguna
Periode dari saat event sistem dikirim hingga waktu eksekusi yang dijadwalkan. Anda dapat merespons selama jendela ini atau menunggu eksekusi otomatis. Durasi jendela bervariasi tergantung event:
-
Event O&M terjadwal: biasanya 24 hingga 48 jam.
CatatanEvent dalam status Inquiring tidak memiliki batas waktu. Tugas O&M baru dimulai setelah otorisasi.
-
Event O&M tak terduga akibat kegagalan mendadak atau operasi yang tidak sesuai biasanya tidak memiliki jendela operasi pengguna.
-
Penghentian instans subscription akibat kedaluwarsa: 3 hari.
-
Penghentian instans bayar sesuai penggunaan akibat pembayaran tertunda: kurang dari 1 jam.
-
-
Jendela eksekusi event
Periode dari awal hingga penyelesaian tugas. Durasi bervariasi tergantung event:
-
Notifikasi perbaikan kegagalan: biasanya selesai dalam 10 menit.
-
Event O&M tak terduga akibat kegagalan mendadak hanya memiliki jendela eksekusi yang singkat.
-
Operasi
|
Operasi |
Deskripsi dan referensi |
|
Pahami event sistem |
Baca topik ini untuk memahami nama event sistem, tingkat keparahan, kasus penggunaan, status, dan format penamaannya. |
|
Lihat event sistem |
Lihat event sistem di konsol atau dengan Cloud Assistant CLI:
|
|
Tanggapi event sistem |
Untuk event sistem kritis yang memengaruhi ketersediaan dan kinerja resource ECS, segera tanggapi di konsol atau dengan OpenAPI.
|
|
Monitor event sistem |
Atur notifikasi event untuk memantau perubahan lingkungan dasar dan mengaktifkan O&M otomatis untuk instans ECS Anda.
|
|
Ubah pengaturan event sistem |
Ubah pengaturan event sistem:
|