Peristiwa sistem RDS Custom didefinisikan oleh Alibaba Cloud untuk mencatat dan memberi tahu informasi terkait sumber daya cloud, seperti status eksekusi tugas O&M, pengecualian sumber daya, dan perubahan status sumber daya. Anda dapat memperoleh informasi risiko dan pengecualian terkait sumber daya RDS Custom melalui peristiwa sistem, seperti migrasi instans akibat peningkatan lapisan bawah, atau restart instans karena pemeliharaan sistem. Anda kemudian dapat menanggapi dan menangani peristiwa sistem secara tepat waktu untuk mencegah dampak bisnis yang disebabkan oleh berkurangnya ketersediaan atau kinerja sumber daya RDS Custom.
Casus Penggunaan
Notifikasi untuk Risiko dan Pengecualian
Alibaba Cloud menampilkan peristiwa sistem (seperti restart pemeliharaan sistem, kedaluwarsa instans, dan peristiwa lain yang dapat memengaruhi ketersediaan dan kinerja sumber daya) di Konsol RDS Custom. Beberapa peristiwa sistem penting juga dikirim melalui email, dan pesan internal. Anda dapat menanggapi peristiwa ini di Konsol RDS Custom atau melalui OpenAPI. Kami merekomendasikan agar Anda menanggapi peristiwa sistem secara tepat waktu untuk menghindari dampak bisnis.
Sebagai contoh, ketika instans langganan akan berhenti karena kedaluwarsa, Konsol RDS Custom dengan jelas mengingatkan Anda untuk memperpanjang instans guna menghindari dampak bisnis yang disebabkan oleh penghentian instans akibat kedaluwarsa.
Otomatisasi O&M
Peristiwa sistem yang ditampilkan di Konsol RDS Custom memiliki status peristiwa yang telah ditentukan, sehingga memudahkan untuk membedakan status eksekusi tugas O&M sistem terkait. Perubahan status peristiwa sistem disinkronkan ke Cloud Monitor untuk membantu Anda membangun mekanisme O&M otomatis. Untuk informasi lebih lanjut tentang status peristiwa, lihat Status Peristiwa Sistem dari RDS Custom.
CatatanSetiap status peristiwa sesuai dengan nama peristiwa Cloud Monitor. Sebagai contoh, kode peristiwa RDS Custom InstanceFailure.Reboot mendukung status peristiwa Executing dan Executed, yang sesuai dengan nama peristiwa Cloud Monitor Instance:InstanceFailure.Reboot:Executing dan Instance:InstanceFailure.Reboot:Executed.
Peristiwa perubahan status mencakup beberapa peristiwa sistem yang tidak ditampilkan di Konsol RDS Custom, seperti perubahan status instans yang sedang berjalan dan interupsi instans preemptible. Peristiwa sistem ini tidak dapat langsung ditanggapi di Konsol RDS Custom atau melalui OpenAPI. RDS Custom tidak mendefinisikan status peristiwa untuk peristiwa sistem ini, tetapi ketika peristiwa sistem ini terjadi, mereka tetap dilaporkan ke Cloud Monitor, memungkinkan Anda membangun sistem O&M otomatis berbasis peristiwa sesuai kebutuhan Anda.
Sebagai contoh, peristiwa perubahan status dipicu ketika Anda memulai atau menghentikan instans ECS. Peristiwa ini tidak menunjukkan risiko atau pengecualian. Jika Anda ingin mencatat operasi Anda ke sistem Anda, Anda dapat mengonfigurasi notifikasi peristiwa untuk peristiwa perubahan status dan menggunakan fitur panggilan balik peringatan untuk menulis informasi startup dan stop instans ke log operasi.
Jenis-jenis peristiwa sistem
Peristiwa sistem dapat diklasifikasikan menjadi kategori berikut berdasarkan penyebabnya.
Kategori | Deskripsi | Ditampilkan di Pusat Insiden RDS Custom |
Peristiwa O&M terjadwal | Alibaba Cloud mungkin perlu meningkatkan perangkat lunak host karena alasan keamanan atau untuk memprediksi dan menangani risiko kegagalan yang terletak pada perangkat keras dan perangkat lunak host lapisan bawah. Jika pelaksanaan tugas O&M terkait dapat memengaruhi ketersediaan sumber daya RDS Custom atau menyebabkan penurunan kinerja, Alibaba Cloud akan memberi tahu Anda sebelumnya tentang waktu eksekusi, objek, dampak, dan informasi lainnya. Anda dapat menanggapi peristiwa sistem ini selama waktu eksekusi terjadwal, memilih untuk menanganinya selama periode aktivitas bisnis rendah untuk menghindari dampak selama periode puncak. Catatan Peristiwa O&M terjadwal, juga dikenal sebagai peristiwa O&M proaktif, didasarkan pada pengalaman O&M Alibaba Cloud pada jutaan server, kemampuan untuk melayani puluhan ribu pelanggan perusahaan besar, dan algoritma pembelajaran mesin mutakhir dari Akademi DAMO Alibaba untuk memprediksi dan menangani risiko kegagalan yang terletak pada perangkat keras atau perangkat lunak host lapisan bawah. Ketika risiko kegagalan host tidak dapat dihindari, Alibaba Cloud memberi tahu pengguna RDS Custom yang terpengaruh sebelumnya melalui peristiwa O&M terjadwal, memberikan pengguna waktu buffer untuk pergantian bisnis. Jika pengguna tidak menanggapi peristiwa O&M terjadwal sebelumnya, ketika risiko kegagalan terjadi, instans RDS Custom mungkin menjadi tidak tersedia atau restart. | Ya |
Peristiwa O&M tak terduga | Kategori peristiwa sistem ini dipicu ketika instans ECS restart atau menjadi tidak tersedia karena masalah tak terduga seperti kernel panic, kesalahan out-of-memory, atau kegagalan perangkat keras atau perangkat lunak di host lapisan bawah. Alibaba Cloud mengirimkan peristiwa O&M tak terduga dengan cepat, memulihkan ketersediaan sumber daya RDS Custom secepat mungkin, dan memberi tahu Anda tentang status eksekusi tugas O&M sistem terkait. Catatan Peristiwa O&M tak terduga umumnya merujuk pada peristiwa di mana instans RDS Custom tiba-tiba menjadi tidak tersedia atau restart karena kegagalan yang tidak dapat diprediksi di host lapisan bawah atau masalah seperti kesalahan kernel dalam sistem operasi instans RDS Custom.
| Ya |
Tingkat keparahan peristiwa sistem
Peristiwa sistem diberi tingkat keparahan berikut berdasarkan dampaknya pada operasi normal instans:
Kritis: Peristiwa sistem kritis dapat mengakibatkan instans tidak tersedia dan harus ditangani secepat mungkin. Sebagai contoh, peristiwa sistem kritis dipicu ketika sumber daya dilepaskan karena pembayaran tertunda atau ketika instans diredistribusi karena kesalahan instans.
Peringatan: Peristiwa sistem peringatan memiliki dampak pada bisnis Anda. Sebagai contoh, peristiwa sistem peringatan dipicu ketika instans burstable tidak dapat melebihi garis dasar kinerjanya. Anda harus memperhatikan peristiwa ini dengan cermat atau menanganinya saat sesuai.
Informasi: Anda dapat memilih apakah akan memperhatikan peristiwa ini. Sebagai contoh, snapshot disk telah dibuat.
Status dan jendela peristiwa sistem
Peristiwa sistem yang ditampilkan di konsol mendefinisikan status peristiwa seperti yang dijelaskan dalam tabel berikut.
Status | Properti | Deskripsi |
Mengajukan Pertanyaan | Sementara | Sistem sedang mengajukan pertanyaan dan menunggu otorisasi Anda. Setelah otorisasi, peristiwa memasuki status Executing. |
Terjadwal | Sementara | Tugas O&M dijadwalkan untuk dieksekusi tetapi belum dimulai. Ketika eksekusi dimulai, peristiwa memasuki status Executing. |
Menjalankan | Sementara | Tugas O&M terkait dengan peristiwa sistem sedang dijalankan. |
Telah Dieksekusi | Stabil | Tugas O&M terkait dengan peristiwa sistem telah selesai. |
Dihindari | Stabil | Dampak peristiwa sistem dicegah karena Anda telah memigrasi instans yang terpengaruh dalam jendela operasi pengguna. |
Gagal | Stabil | Tugas O&M terkait dengan peristiwa sistem gagal. |
Dibatalkan | Stabil | Tugas O&M terkait dengan peristiwa sistem dibatalkan secara otomatis. |
Gambar berikut menunjukkan transisi tipikal antara status peristiwa.
Peristiwa sistem mencakup jendela berikut.
Jendela Operasi Pengguna
Jendela operasi pengguna peristiwa sistem dimulai ketika peristiwa dikirim dan berakhir pada saat tugas O&M terkait dijalankan sesuai jadwal. Anda dapat menangani peristiwa secara manual dalam jendela operasi pengguna atau menunggu sistem untuk menangani peristiwa secara otomatis. Perhatikan item berikut tentang panjang jendela operasi pengguna:
Dalam kebanyakan kasus, jendela operasi pengguna peristiwa O&M terjadwal berkisar antara 24 hingga 48 jam.
CatatanPanjang jendela operasi pengguna tidak terbatas untuk peristiwa sistem dalam status Mengajukan Pertanyaan. Tugas O&M terkait dengan peristiwa hanya dapat dimulai setelah Anda mengotorisasi tugas untuk dieksekusi.
Dalam kebanyakan kasus, peristiwa O&M sistem tak terduga yang disebabkan oleh kegagalan atau operasi tidak sah tidak memiliki jendela operasi pengguna.
Untuk peristiwa sistem yang menunjukkan bahwa instans langganan akan kedaluwarsa, jendela tersebut adalah 3 hari.
Untuk peristiwa sistem yang menunjukkan bahwa instans berbayar sesuai penggunaan akan segera dihentikan karena pembayaran tertunda, jendela tersebut kurang dari 1 jam.
Jendela Eksekusi Peristiwa
Jendela eksekusi peristiwa sistem dimulai ketika tugas O&M terkait dijalankan dan berakhir ketika tugas selesai. Perhatikan item berikut tentang panjang jendela eksekusi peristiwa:
Untuk peristiwa sistem seperti peristiwa pemulihan kegagalan, jendela tersebut dalam waktu 10 menit.
Peristiwa O&M tak terduga yang disebabkan oleh kegagalan atau operasi tidak sah memiliki jendela eksekusi peristiwa yang singkat.
Operasi
Operasi | Deskripsi dan referensi |
Pahami peristiwa sistem | Untuk mempelajari tentang peristiwa sistem dan memahami nama peristiwa, tingkat keparahan, skenario penggunaan, batasan, status, dan format nama, lihat topik ini. |
Lihat peristiwa sistem |
|
Tangani peristiwa sistem | Untuk beberapa peristiwa sistem penting (seperti peristiwa yang memengaruhi ketersediaan sumber daya RDS Custom atau menyebabkan penurunan kinerja), kami merekomendasikan agar Anda segera menanggapi melalui konsol atau OpenAPI dan menanganinya sesuai rekomendasi untuk menghindari memengaruhi operasi bisnis. |
Monitor peristiwa sistem | Untuk memastikan stabilitas operasi bisnis pada instans RDS Custom dan menerapkan O&M otomatis, kami merekomendasikan agar Anda mengonfigurasi notifikasi peristiwa untuk memantau perubahan di lingkungan lapisan bawah. Setelah Anda mengonfigurasi notifikasi peristiwa, sistem menggunakan metode notifikasi yang Anda tentukan untuk mengirimkan notifikasi kepada Anda. Untuk mengonfigurasi aturan peringatan melalui CloudMonitor dan mendorong notifikasi peristiwa, lihat Gunakan CloudMonitor untuk berlangganan notifikasi peristiwa RDS Custom. |