AKS node becomes Unreachable/NotReady - Kubelet stopped posting node status, ContainerRuntimeIsDown and high IO pressure

Roberto Marino 20 Punti di reputazione
2026-05-07T13:24:58.52+00:00

We are experiencing an issue on an AKS worker node that became unstable and was marked as unreachable by Kubernetes.

Affected cluster:

  • AKS Cluster: xxxxxxxxxxx
  • Region: West Europe
  • Node pool: worker
  • Node: aks-worker-25571251-vmss00000e
  • VMSS: aks-worker-25571251-vmss
  • VMSS instance ID: 14
  • VM size: Standard_D2as_v7
  • Resource Group: MC_xxxxxxxxx-aks-2026_westeurope

Symptoms observed:

  • The node is marked as unreachable with the following taints:
    • node.kubernetes.io/unreachable:NoExecute
    • node.kubernetes.io/unreachable:NoSchedule
  • Node condition:
    • Ready: Unknown
    • Message: Kubelet stopped posting node status
  • Container runtime issues:
    • ContainerRuntimeIsDown
    • crictl commands timing out
    • Kubelet service appears not to be running or not responding correctly
  • Disk / image filesystem issue:
    • InvalidDiskCapacity: invalid capacity 0 on image filesystem
  • Resource pressure observed:
    • Very high IO pressure / iowait
    • High system load
    • Memory usage close to the allocatable limit
    • Pod memory requests are close to the node allocatable memory

Impact:

The node is not schedulable and existing workloads on the node may be affected. New pods cannot reliably start on this node and Kubernetes may evict or reschedule workloads. This is impacting service reliability on the AKS cluster.

Actions already considered/performed:

  • Collected kubectl describe node output
  • Identified that the node is in Unknown/Unreachable state
  • Identified high IO pressure and container runtime/kubelet instability
  • We are considering cordon/drain/restart or reimage of the VMSS instance, but we would like Microsoft to confirm whether there are any underlying Azure platform, host, disk, VMSS, or AKS node image issues before proceeding.

Request:

Please help us investigate the root cause of this AKS node failure.

Specifically, please verify:

  1. Whether there were any Azure platform events affecting the VMSS instance or underlying host.
  2. Whether the OS disk, temporary disk, or image filesystem reported issues.
  3. Whether there are known AKS/node image/containerd/kubelet issues affecting this node version.
  4. Whether a restart/reimage of the VMSS instance is recommended.
  5. Whether the node size Standard_D2as_v7 is considered undersized for this workload based on the collected telemetry.
  6. Whether Microsoft can provide additional diagnostics from the AKS control plane and node health monitoring.

Attached:

  • kubectl describe node output
Servizio Azure Kubernetes
Servizio Azure Kubernetes

Servizio di Azure che fornisce Kubernetes serverless, un'esperienza di integrazione continua e recapito continuo integrata e sicurezza e governance di livello aziendale.


2 risposte

Ordina per: Più utili
  1. Roberto Marino 20 Punti di reputazione
    2026-05-11T09:34:26.77+00:00

    Buongiorno,

    a seguito delle verifiche effettuate e in linea con quanto indicato nella vostra analisi, confermiamo che la problematica era riconducibile a un guasto specifico del nodo, e non a un’anomalia del piano di controllo AKS o della piattaforma Azure.

    Abbiamo riscontrato che il nodo interessato presentava condizioni coerenti con un malfunzionamento a livello di VM/sistema operativo, con impatti su kubelet, runtime dei container e filesystem delle immagini container.

    Per risolvere la problematica, abbiamo quindi proceduto con la rimozione del nodo degradato e la sua sostituzione con un nuovo nodo all’interno del cluster.

    A seguito di questa attività, il problema è rientrato: il nuovo nodo risulta correttamente operativo e non sono più presenti le condizioni di errore precedentemente rilevate.

    Vi confermiamo quindi che l’intervento ha avuto esito positivo e che, allo stato attuale, non risultano ulteriori evidenze riconducibili a un problema lato Azure.

    Cordiali saluti,
    Roberto Marino.

    La risposta è stata utile?


  2. Anonimo
    2026-05-07T14:38:17.5933333+00:00

    Sulla base dei sintomi e degli indicatori forniti, il problema risulta coerente con un guasto a livello di nodo che interessa il kubelet e il runtime dei container, piuttosto che con un problema del piano di controllo di AKS.

    Stato di salute del nodo

    Il nodo viene attualmente segnalato come Ready: Unknown (Pronto: Sconosciuto), con la presenza di taints del tipo node.kubernetes.io/unreachable; ciò si verifica quando il nodo non è più in grado di comunicare con il server API di Kubernetes.

    Il messaggio "Kubelet stopped posting node status" (Il kubelet ha smesso di inviare lo stato del nodo) indica che il processo kubelet è interrotto, non risponde o non riesce a raggiungere il server API.

    Guasto del runtime dei container

    La condizione ContainerRuntimeIsDown e i timeout di crictl indicano che il runtime dei container (containerd) non è operativo.

    Kubernetes si affida sia al kubelet che al runtime dei container per mantenere lo stato di salute del nodo; quando uno dei due componenti non è disponibile, il nodo passa a uno stato Unreachable/NotReady (Irraggiungibile/Non Pronto).

    Segnali relativi a disco/filesystem

    L'errore InvalidDiskCapacity: invalid capacity 0 on image filesystem costituisce un forte indicatore del fatto che il nodo non è in grado di leggere o segnalare la capacità del filesystem delle immagini dei container.

    Nelle attività di troubleshooting su AKS, è noto che i problemi a livello di disco o filesystem (ad es. corruzione del disco, errori di mount o grave degrado delle prestazioni I/O) possano causare instabilità del kubelet e determinare condizioni di nodo NotReady.

    Correlazione con la pressione delle risorse

    L'elevato tempo di attesa I/O (IO wait), il carico di sistema elevato e la pressione sulla memoria osservati possono portare al guasto di componenti critici del nodo.

    In precedenti indagini su AKS, è emerso che l'esaurimento delle risorse (CPU/memoria/I/O) impedisce il corretto funzionamento dei componenti di sistema (inclusi i servizi di rete e di runtime), determinando instabilità del nodo.

    Considerazioni sulla piattaforma

    Quando si verificano attività di manutenzione della piattaforma Azure o problemi a livello di host, questi si manifestano tipicamente come stati temporanei di nodo NotReady, seguiti da una fase di ripristino (ad es. eventi di ridistribuzione della VM).

    Nel caso specifico, la presenza di guasti persistenti del runtime e di errori del filesystem indica un problema specifico del nodo a livello di VM/sistema operativo, piuttosto che un evento transitorio della piattaforma Azure.

    La risposta è stata utile?


Risposta

Le risposte possono essere contrassegnate come "Accettata" dall'autore della domanda e "Consigliata" dai moderatori, in modo da consentire agli utenti di sapere che la risposta ha risolto il problema dell'autore.