Topik ini merangkum peristiwa sistem yang didukung oleh RDS Custom, termasuk peristiwa pemeliharaan terjadwal dan tak terduga, serta memberikan saran penanganan untuk setiap peristiwa sistem.
Format kode peristiwa RDS Custom dan nama peristiwa CloudMonitor
Untuk membantu Anda membangun mekanisme pemeliharaan otomatis melalui peristiwa sistem, peristiwa sistem RDS Custom disinkronkan ke CloudMonitor. Kode peristiwa RDS Custom dan nama peristiwa CloudMonitor untuk peristiwa yang sama mengikuti format penamaan tertentu:
Kode peristiwa RDS Custom: Berisi informasi tentang penyebab peristiwa dan dampaknya pada sumber daya, dalam format
<penyebab peristiwa>.<dampak pada sumber daya>.Nama peristiwa CloudMonitor: Berisi informasi tentang jenis sumber daya, penyebab peristiwa, dampaknya pada sumber daya, dan status peristiwa, dalam format
<jenis sumber daya>:<penyebab peristiwa>.<dampak pada sumber daya>:<status peristiwa>.
Tidak semua kode peristiwa RDS Custom dan nama peristiwa CloudMonitor mencakup semua informasi. Sebagai contoh, nama peristiwa CloudMonitor Disk:ErrorDetected:Executing menunjukkan bahwa kerusakan disk telah terdeteksi, sehingga informasi tentang dampak lebih lanjut pada sumber daya tidak diperlukan.
Peristiwa O&M Terjadwal
Saat Anda me-restart instans dari dalam sistem operasi, tindakan pemeliharaan yang sesuai dengan peristiwa tersebut tidak dapat berlaku. Oleh karena itu, operasi restart instans yang disebutkan dalam topik ini mengacu pada operasi yang dilakukan melalui Konsol RDS Custom atau dengan memanggil Operasi API. Untuk informasi lebih lanjut, lihat Restart an instance atau RebootRCInstance.
Kode Peristiwa | Nama Peristiwa | Tingkat Peristiwa | Nama event CloudMonitor | Deskripsi dan Dampak Peristiwa | Saran Penanganan |
SystemMaintenance.Reboot | Instans direstart karena pemeliharaan sistem | Kritis |
| Alibaba Cloud mendeteksi potensi risiko kegagalan perangkat lunak atau perangkat keras pada host tempat instans RDS Custom diterapkan. Risiko ini dapat menyebabkan instans RDS Custom restart. Risiko tersebut belum langsung menjadi kegagalan. Peristiwa sistem ini dikirim 24 hingga 48 jam sebelum waktu pemeliharaan sistem yang dijadwalkan. Catatan Risiko kegagalan meliputi hal-hal berikut:
| Manually restart the instance. Catatan Kami sarankan Anda memperhatikan perubahan status peristiwa. Jika status peristiwa tidak berubah setelah Anda me-restart instans, respons peristiwa gagal dan risiko belum dihilangkan. Kami sarankan Anda me-restart instans pada waktu yang sesuai nanti (lebih dari 12 jam setelah operasi ini) untuk menghindari risiko. |
SystemMaintenance.Stop | Instans berhenti karena pemeliharaan sistem | Kritis |
| Alibaba Cloud mendeteksi potensi risiko kegagalan perangkat lunak atau perangkat keras pada host tempat instans RDS Custom diterapkan. Risiko ini dapat menyebabkan instans RDS Custom dimatikan dan berhenti. Risiko tersebut belum langsung menjadi kegagalan. Peristiwa sistem ini dikirim 24 hingga 48 jam sebelum waktu pemeliharaan sistem yang dijadwalkan. | |
SystemMaintenance.Redeploy | Penerapan ulang instans karena pemeliharaan sistem | Kritis |
| Alibaba Cloud mendeteksi potensi risiko kegagalan perangkat lunak atau perangkat keras pada host tempat instans RDS Custom diterapkan. Risiko ini dapat menyebabkan instans RDS Custom diterapkan ulang. Risiko tersebut belum langsung menjadi kegagalan. Peristiwa sistem ini dikirim 24 hingga 48 jam sebelum waktu pemeliharaan sistem yang dijadwalkan. Penting Instans yang menggunakan SSD lokal atau HDD lokal akan memiliki disk data mereka diinisialisasi ulang, dan data pada disk lokal akan dihapus. | Kami sarankan Anda menyelesaikan persiapan, termasuk memodifikasi file konfigurasi /etc/fstab dan mencadangkan data. Kemudian, pilih salah satu metode respons berikut berdasarkan kebutuhan Anda:
Catatan Kami sarankan Anda memperhatikan perubahan status peristiwa. Jika status peristiwa tidak berubah setelah Anda menerapkan ulang instans, respons peristiwa gagal dan risiko belum dihilangkan. Kami sarankan Anda menerapkan ulang instans pada waktu yang sesuai nanti (lebih dari 12 jam setelah operasi ini) untuk menghindari risiko. |
SystemFailure.Redeploy | Penerapan ulang instans karena kesalahan sistem | Kritis |
| Saat Alibaba Cloud mengidentifikasi bahwa instans RDS Custom perlu diterapkan ulang karena kegagalan perangkat lunak atau perangkat keras pada host dasar, peristiwa sistem ini dikirim segera. Catatan Hanya instans yang bergantung pada dukungan perangkat keras host yang mendukung jenis peristiwa ini, seperti instans dengan disk lokal yang disambungkan atau instans yang mendukung komputasi terenkripsi SGX. | Kami sarankan Anda menyelesaikan persiapan, termasuk memodifikasi file konfigurasi /etc/fstab dan mencadangkan data. Kemudian, pilih salah satu metode respons berikut berdasarkan kebutuhan Anda:
|
SystemMaintenance.CleanReleasedDisks | Instans perlu membersihkan informasi konfigurasi disk yang telah dirilis | Peringatan |
| Saat Alibaba Cloud mengidentifikasi bahwa sistem operasi instans RDS Custom berisi informasi konfigurasi untuk satu atau lebih disk yang dirilis karena pembayaran tertunda, peristiwa sistem ini dikirim. | Kami sarankan Anda memilih waktu yang sesuai untuk mengizinkan Alibaba Cloud membersihkan informasi konfigurasi disk yang telah dirilis. Penting Alibaba Cloud akan mematikan instans pada waktu yang ditentukan saat Anda memberi izin, membersihkan disk, dan kemudian memulai instans kembali. |
Peristiwa O&M Tak Terduga
Kode Peristiwa | Nama Peristiwa | Tingkat Peristiwa | Nama event CloudMonitor | Deskripsi dan Dampak Peristiwa | Saran Penanganan |
SystemFailure.Reboot | Instans direstart karena kesalahan sistem | Kritis |
| Saat Alibaba Cloud mengidentifikasi bahwa instans RDS Custom direstart karena kegagalan perangkat lunak atau perangkat keras yang tidak terduga (seperti kerusakan perangkat keras CPU atau memori) pada host dasar, peristiwa sistem ini dikirim segera. | Kami sarankan Anda menunggu instans secara otomatis restart, lalu periksa apakah instans dan aplikasi berfungsi normal. Selama proses restart, Alibaba Cloud akan memigrasikan instans ke host sehat lainnya. |
InstanceFailure.Reboot | Instans perlu direstart karena kesalahan sistem operasi | Kritis |
| Saat Alibaba Cloud mengidentifikasi bahwa instans RDS Custom mogok karena masalah internal sistem operasi, termasuk kehabisan memori, layar biru, hang, pencetakan log port serial terus-menerus, atau kernel panic, peristiwa sistem ini dikirim segera. | Kami sarankan Anda menunggu instans secara otomatis restart, lalu periksa apakah instans dan aplikasi berfungsi normal. Anda dapat mengaktifkan layanan Kdump dalam sistem operasi untuk menganalisis penyebab crash dan menghindari masalah serupa di masa depan. Untuk informasi lebih lanjut, lihat Cara mengaktifkan layanan Kdump untuk instans Linux. |
SystemFailure.Stop | Instans berhenti karena kesalahan sistem | Kritis |
| Saat Alibaba Cloud mengidentifikasi bahwa instans RDS Custom dimatikan karena kegagalan perangkat lunak atau perangkat keras (seperti kerusakan perangkat keras CPU atau memori) pada host dasar, peristiwa sistem ini dikirim segera. | Kami sarankan Anda menunggu instans secara otomatis berhenti, lalu mulai instans tersebut. Saat Anda memulai instans, Alibaba Cloud akan memigrasikannya ke host sehat lainnya. |
SystemFailure.Delete | Pembatalan tagihan otomatis karena kegagalan pembuatan instans | Kritis |
| Saat Alibaba Cloud mengidentifikasi bahwa instans RDS Custom berhasil dipesan tetapi gagal dibuat, peristiwa sistem ini dikirim segera. | Kami sarankan Anda menunggu sistem secara otomatis melepaskan instans, yang biasanya terjadi dalam lima menit setelah kegagalan pembuatan. Catatan Jika Anda sudah membayar pesanan, Anda akan menerima pengembalian dana setelah instans dilepaskan. |
InstanceFailure.PerformanceImpact | Performa instans menurun karena kesalahan instans | Peringatan |
| Saat pengecualian tak terduga terjadi dalam instans (seperti GuestOS kernel hang) yang menurunkan performa instans, peristiwa sistem ini dikirim segera. | Kami sarankan Anda masuk ke instans untuk mengidentifikasi dan menyelesaikan pengecualian, lalu pantau status peristiwa sistem ini. Jika peristiwa sistem tidak lagi dilaporkan, itu menunjukkan bahwa penurunan performa telah diselesaikan. |