Sulla base dei sintomi e degli indicatori forniti, il problema risulta coerente con un guasto a livello di nodo che interessa il kubelet e il runtime dei container, piuttosto che con un problema del piano di controllo di AKS.
Stato di salute del nodo
Il nodo viene attualmente segnalato come Ready: Unknown (Pronto: Sconosciuto), con la presenza di taints del tipo node.kubernetes.io/unreachable; ciò si verifica quando il nodo non è più in grado di comunicare con il server API di Kubernetes.
Il messaggio "Kubelet stopped posting node status" (Il kubelet ha smesso di inviare lo stato del nodo) indica che il processo kubelet è interrotto, non risponde o non riesce a raggiungere il server API.
Guasto del runtime dei container
La condizione ContainerRuntimeIsDown e i timeout di crictl indicano che il runtime dei container (containerd) non è operativo.
Kubernetes si affida sia al kubelet che al runtime dei container per mantenere lo stato di salute del nodo; quando uno dei due componenti non è disponibile, il nodo passa a uno stato Unreachable/NotReady (Irraggiungibile/Non Pronto).
Segnali relativi a disco/filesystem
L'errore InvalidDiskCapacity: invalid capacity 0 on image filesystem costituisce un forte indicatore del fatto che il nodo non è in grado di leggere o segnalare la capacità del filesystem delle immagini dei container.
Nelle attività di troubleshooting su AKS, è noto che i problemi a livello di disco o filesystem (ad es. corruzione del disco, errori di mount o grave degrado delle prestazioni I/O) possano causare instabilità del kubelet e determinare condizioni di nodo NotReady.
Correlazione con la pressione delle risorse
L'elevato tempo di attesa I/O (IO wait), il carico di sistema elevato e la pressione sulla memoria osservati possono portare al guasto di componenti critici del nodo.
In precedenti indagini su AKS, è emerso che l'esaurimento delle risorse (CPU/memoria/I/O) impedisce il corretto funzionamento dei componenti di sistema (inclusi i servizi di rete e di runtime), determinando instabilità del nodo.
Considerazioni sulla piattaforma
Quando si verificano attività di manutenzione della piattaforma Azure o problemi a livello di host, questi si manifestano tipicamente come stati temporanei di nodo NotReady, seguiti da una fase di ripristino (ad es. eventi di ridistribuzione della VM).
Nel caso specifico, la presenza di guasti persistenti del runtime e di errori del filesystem indica un problema specifico del nodo a livello di VM/sistema operativo, piuttosto che un evento transitorio della piattaforma Azure.