All Products
Search
Document Center

Container Service for Kubernetes:Aktifkan auto-healing untuk kelompok node Lingjun

Last Updated:Apr 25, 2026

Setelah Anda mengaktifkan auto-healing node, ACK secara otomatis memantau titik kegagalan pada node Lingjun. Jika terdeteksi kegagalan, ACK menggunakan kemampuan Approve O&M operations Lingjun untuk melakukan perbaikan. Untuk menggunakan fitur ini, Anda harus terlebih dahulu mengaktifkan konfigurasi terkelola untuk kelompok node Lingjun.

Mengaktifkan auto-healing node

ACK memungkinkan Anda mengaktifkan auto-healing node dan menentukan aturan auto-healing saat membuat kelompok node atau mengubah konfigurasi terkelola dari kelompok node yang sudah ada. Aturan tersebut dapat dikelola di halaman Self-Healing Rule. Untuk petunjuk konfigurasi, lihat Konfigurasi aturan auto-healing di bawah ini.

Penting
  • Fitur ini hanya tersedia untuk pengguna yang masuk dalam daftar allowlist. Untuk mengaktifkannya, hubungi dukungan teknis.

  • Fitur ini tidak didukung di wilayah Apsara Stack.

Metode 1: Kelompok node baru

  1. Pada halaman ACK Clusters, klik nama kluster Anda. Di panel navigasi kiri, klik Nodes > Node Pools.

  2. Klik Create Lingjun Node Pool. Di bagian Configure Managed Node Pool, aktifkan fitur terkelola, lalu ikuti petunjuk di layar untuk membuat aturan auto-healing dan mengaktifkan fitur tersebut.

    Untuk deskripsi lengkap item konfigurasi, lihat Buat kelompok node Lingjun.

Metode 2: Kelompok node yang sudah ada

  1. Pada halaman ACK Clusters, klik nama kluster Anda. Di panel navigasi kiri, klik Nodes > Node Pools.

  2. Pada kolom Actions untuk kelompok node Lingjun yang dituju, klik image lalu pilih Enable Managed Node Pool (jika belum diaktifkan) atau Configure Managed Node Pool (jika sudah diaktifkan). Ikuti petunjuk di layar untuk membuat aturan auto-healing dan mengaktifkan fitur tersebut.

    Untuk deskripsi lengkap item konfigurasi, lihat Buat kelompok node Lingjun.

Setelah mengaktifkan fitur ini, Anda dapat membuat dan mengelola semua aturan auto-healing di halaman Inspections and Diagnostics > Self-Healing Rule.

  1. Ikuti petunjuk di layar untuk mengklik Create Self-Healing Rule guna membuat aturan baru, atau kelola aturan yang sudah ada dalam daftar aturan.

Konfigurasi aturan auto-healing

Penting
  • Titik kegagalan diproses berdasarkan prioritas. Titik kegagalan berprioritas tinggi yang memerlukan maintenance akan diperbaiki terlebih dahulu. Titik kegagalan berprioritas rendah yang dapat diselesaikan dengan restart akan ditunda hingga semua titik kegagalan berprioritas tinggi selesai diperbaiki.

  • Kegagalan memberikan otorisasi tepat waktu akan menyebabkan ACK menghentikan sementara proses perbaikan, sehingga berpotensi membuat node tetap dalam kondisi tidak sehat.

  • Meskipun auto-healing node mengotomatiskan perbaikan, Anda tetap harus memantau kesehatan node Lingjun dan statusnya di kluster ACK untuk mencegah gangguan layanan berkepanjangan.

1. Akses halaman konfigurasi aturan

  1. Dari halaman pembuatan atau konfigurasi kelompok node, atau dari halaman Self-Healing Rule, klik Create Self-Healing Rule untuk membuka panel Create Self-Healing Rule.

  2. Ikuti petunjuk di layar untuk menentukan nama aturan dan mengonfigurasi aturan tersebut:

2. Konfigurasi sub-aturan

a. Select Fault Type

Auto-healing node mendeteksi titik kegagalan dengan memantau event CloudMonitor yang dilaporkan oleh node Lingjun dan melakukan perbaikan dengan memanggil kemampuan Approve O&M operations Lingjun.

Jenis titik kegagalan dan perilaku perbaikan:

Fault name

Lingjun event name

Kubernetes condition

Fault description

Repair behavior

Lingjun node underlying hardware exception

Node.HardwareFault.HOST:Inquiring

resourceType: Node
  • Type: Node.HardwareFault.HOST

  • Status: True

  • Reason:Node.HardwareFault.HOST:Inquiring

  • Message: <Fault details>

Terjadi kegagalan perangkat keras pada node Lingjun, dan diperlukan maintenance. Maintenance ini dapat menyebabkan kehilangan data pada disk lokal node. Jika direktori runtime kontainer dan kubelet berada di disk lokal, Anda harus menghapus node dari kluster ACK setelah maintenance selesai, lalu menambahkannya kembali.

Perbaiki node Lingjun.

Penting

Data pada disk lokal node Lingjun mungkin hilang selama perbaikan. Cadangkan data Anda terlebih dahulu.

Priority: High

Lingjun node underlying exception

Node.FaultNeedReboot.HOST:Inquiring

resourceType: Node
  • Type: Node.FaultNeedReboot.HOST

  • Status: True

  • Reason:Node.FaultNeedReboot.HOST:Inquiring

  • Message: <Fault details>

Terjadi pengecualian pada node Lingjun. Kami menyarankan untuk segera me-restart node guna menyelesaikan masalah tersebut.

Restart node Lingjun.

Priority: Medium

b. Custom Remediation Flow

Semua proses perbaikan berikut mendukung intervensi manual, yang diaktifkan melalui Authorize by Node Label. Setelah diaktifkan, ACK hanya akan menjalankan operasi setelah menerima konfirmasi otorisasi.

Parameter

Description

Node cordon

Menandai node yang bermasalah sebagai tidak dapat dijadwalkan (dengan mengatur spec.unschedulable menjadi true) untuk mencegah workload baru dijadwalkan ke node tersebut.

Node draining

Sebelum mengaktifkan ini, Anda harus terlebih dahulu mengaktifkan node cordon.

ACK mengeluarkan workload dari node yang bermasalah. Timeout default untuk node draining adalah 300 detik, tetapi dapat disesuaikan.

  • Node draining mengikuti protokol PDB. Pod berikut tidak akan dikeluarkan:

    • Pod yang dikelola oleh DaemonSet.

    • Pod yang dikelola oleh OpenKruise Advanced DaemonSet.

    • Pod dengan label alibabacloud.com/evict-pod=true.

  • Jika workload gagal dikeluarkan dalam periode timeout, ACK secara otomatis melanjutkan ke langkah berikutnya.

Auto repair

ACK menjalankan tindakan perbaikan sesuai dengan jenis titik kegagalan. Untuk informasi lebih lanjut, lihat Jenis titik kegagalan dan perilaku perbaikan.

Node uncordon

Sebelum mengaktifkan ini, Anda harus terlebih dahulu mengaktifkan node cordon.

Mengembalikan node ke status dapat dijadwalkan (dengan mengatur spec.unschedulable menjadi false).

Langkah ini tidak akan membuat node dapat dijadwalkan jika sebelumnya sudah ditandai sebagai tidak dapat dijadwalkan sebelum perbaikan dimulai.

Event penyembuhan otomatis node

Setelah Anda mengaitkan aturan auto-healing dengan kelompok node Lingjun, ACK mengonversi event titik kegagalan dari node Lingjun dalam kluster menjadi Kubernetes Events dan sebuah Condition. ACK juga menghasilkan Kubernetes Events untuk melacak perkembangan proses auto-healing node.

Event pemulihan otomatis umum

Event (reason)

Level

Description

DetectedLingJungCMSEvent

Warning

Terdeteksi adanya titik kegagalan pada node Lingjun, atau status titik kegagalan yang sudah ada diperbarui.

RepairPlanCreated

Warning

Rencana auto-healing telah dibuat.

WaitingApproveProcedure

Warning

Langkah saat ini dijeda, menunggu otorisasi manual. Pesan event memberikan detail tindakan yang diperlukan dan cara memberikan otorisasi tersebut.

RepairPlanProcedureWaitingForApproval

Warning

Label otorisasi telah ditambahkan ke node.

RepairPlanStatusUpdated

Normal

Status rencana auto-healing telah diperbarui. Event ini mencatat langkah yang sedang dieksekusi beserta hasilnya.

ApproveLingjunOperation

Normal

Lapisan kontrol Lingjun telah diotorisasi untuk menjalankan operasi perbaikan.

NodeNotRecovery

Warning

Dipicu jika node gagal pulih setelah perbaikan selesai. ACK memeriksa status node setiap 30 menit setelah perbaikan.

RepairPlanCompleted

Warning

Rencana auto-healing telah selesai. Pesan event menunjukkan apakah rencana tersebut berhasil atau gagal.

Event untuk skenario khusus

Event berikut mungkin terlibat dalam skenario tertentu.

Event (reason)

Level

Description

NodeRecoveryNeedSilence

Normal

Terjadi titik kegagalan baru dengan jenis berbeda pada node yang baru saja diperbaiki. Sistem akan menunggu periode diam selama 10 menit sebelum membuat rencana auto-healing baru.

NodeRecoveryHasProcessed

Warning

Rencana auto-healing telah memproses titik kegagalan ini, tetapi node belum pulih. Diperlukan intervensi manual.

RepairPlanFailed

Warning

Rencana auto-healing untuk titik kegagalan saat ini gagal, dan node belum pulih. Diperlukan intervensi manual.

RepairPlanStatusUpdateFailed

Warning

Gagal memperbarui status rencana auto-healing.

AddInquiringLabelFailed

Normal

Gagal menetapkan label otorisasi. Proses auto-healing dibatalkan.

Konfigurasi notifikasi

Setelah Anda mengaktifkan auto-healing node, Anda juga harus mengonfigurasi manajemen alarm. Aktifkan Alert Rules for Node Pool O&M Events dan Cluster Node Auto Repair Alert Rule Set untuk menerima notifikasi tepat waktu mengenai event abnormal.

Untuk petunjuk cara mengaktifkan kumpulan aturan ini, lihat Manajemen alarm untuk Container Service.