Hallo zusammen,
wir haben seit einigen Monaten wiederkehrende Probleme in einem produktiven Windows Server 2022 Hyper-V Failover Cluster und würden gerne Erfahrungen oder Empfehlungen aus der Community einholen.
Umgebung
- Windows Server 2022 Datacenter
- 8-Knoten Hyper-V Failover Cluster
- Cluster Shared Volumes (CSV) (Datacore)
- Scale-Out File Server (SOFS)
- SQL Server Always On
- Fibre-Channel-Storage
- MPIO mit herstellerspezifischem DSM
- Intel X710 Netzwerkadapter
Problembeschreibung
Die Vorfälle treten typischerweise während monatlicher Wartungsfenster auf.
Das Muster sieht häufig wie folgt aus:
- Ein Clusterknoten wird mittels Drain/Pause für Wartungsarbeiten (z.B. monatliche Patches) vorbereitet
- Zu einem späteren Zeitpunkt verliert ein anderer Clusterknoten seine Cluster-Mitgliedschaft
- Anschließend folgen weitere Cluster- und CSV-bezogene Fehler.
Besonders interessant ist, dass der Fehler mindestens einmal auftrat, während der ursprünglich pausierte Knoten noch gar nicht wieder in den Cluster aufgenommen wurde.
Beobachtete Ereignisse
Vorfall 1
Folgende Ereignisse wurden nahezu zeitgleich registriert:
- Event ID 1795
- Physical Disk Resource failure
- Cause: ReleaseDiskPRFailure
- Event ID 1146
- Resource Hosting Subsystem (RHS) terminated
- Event ID 7024
- Cluster Service terminated (Internal Error)
- Event ID 7031
- Cluster Service terminated unexpectedly
- Event ID 1135
- Cluster node removed from active cluster membership
Vorfall 2
Vor dem eigentlichen Node-Ausfall wurden zusätzlich folgende Ereignisse festgestellt:
- Event ID 1127
- Disk operation failed even after retries
- Event ID 5120
- STATUS_VOLUME_DISMOUNTED
- Event ID 5157
- STATUS_CONNECTION_DISCONNECTED
- Event ID 1135
- Cluster node removed from membership
- Event ID 1146
Dabei waren mehrere CSVs betroffen.
Bisherige Analyse
Folgende Punkte wurden bereits überprüft:
- Identische Treiberstände auf allen Clusterknoten
- Identische HBA-Firmwarestände auf allen Clusterknoten
- Identische DSM-/MPIO-Konfigurationen auf allen Clusterknoten
- Keine offensichtlichen Hardwarefehler in den Server-Logs
- Keine eindeutigen Link- oder Fibre-Channel-Ausfälle unmittelbar vor den Vorfällen
- Keine Hinweise auf ein einzelnes betroffenes Hostsystem
Die Vorfälle betreffen unterschiedliche Clusterknoten und scheinen nicht an einen bestimmten Server gebunden zu sein.
Fragestellung
Hat jemand bereits eine ähnliche Ereigniskette beobachtet?
- Event 1795 (ReleaseDiskPRFailure)
- Event 1146 (RHS terminated)
- Event 1135 (Node Eviction)
- Event 5120 / 5157 (CSV-bezogene Fehler)
Insbesondere interessiert uns:
- Können Persistent-Reservation-Probleme (Event 1795) einen solchen Fehlerverlauf auslösen?
- Ist bekannt, dass RHS-Abstürze (Event 1146) in Zusammenhang mit Event 1795 auftreten?
- Gibt es bekannte Probleme in Windows Server 2022 Failover Clustering mit CSVs, Cluster Disks oder Persistent Reservations, die zu einer Node Eviction (1135) führen können?
- Welche zusätzlichen Diagnosen oder Logs würden für die weitere Ursachenanalyse empfohlen?
Vielen Dank im Voraus für jede Unterstützung.
Viele Grüße
Beobachtete Ereignisse
Vorfall 1
Folgende Ereignisse wurden nahezu zeitgleich registriert:
- Event ID 1795
- Physical Disk Resource failure
- Cause: ReleaseDiskPRFailure
- Event ID 1146
- Resource Hosting Subsystem (RHS) terminated
- Event ID 7024
- Cluster Service terminated (Internal Error)
- Event ID 7031
- Cluster Service terminated unexpectedly
- Event ID 1135
- Cluster node removed from active cluster membership
Vorfall 2
Vor dem eigentlichen Node-Ausfall wurden zusätzlich folgende Ereignisse festgestellt:
- Event ID 1127
- Disk operation failed even after retries
- Event ID 5120
- STATUS_VOLUME_DISMOUNTED
- Event ID 5157
- STATUS_CONNECTION_DISCONNECTED
- Event ID 1135
- Cluster node removed from membership
- Event ID 1146
Dabei waren mehrere CSVs betroffen.
Bisherige Analyse
Folgende Punkte wurden bereits überprüft:
- Identische Treiberstände auf allen Clusterknoten
- Identische HBA-Firmwarestände auf allen Clusterknoten
- Identische DSM-/MPIO-Konfigurationen auf allen Clusterknoten
- Keine offensichtlichen Hardwarefehler in den Server-Logs
- Keine eindeutigen Link- oder Fibre-Channel-Ausfälle unmittelbar vor den Vorfällen
- Keine Hinweise auf ein einzelnes betroffenes Hostsystem
Die Vorfälle betreffen unterschiedliche Clusterknoten und scheinen nicht an einen bestimmten Server gebunden zu sein.
Fragestellung
Hat jemand bereits eine ähnliche Ereigniskette beobachtet?
- Event 1795 (ReleaseDiskPRFailure)
- Event 1146 (RHS terminated)
- Event 1135 (Node Eviction)
- Event 5120 / 5157 (CSV-bezogene Fehler)
Insbesondere interessiert uns:
- Können Persistent-Reservation-Probleme (Event 1795) einen solchen Fehlerverlauf auslösen?
- Ist bekannt, dass RHS-Abstürze (Event 1146) in Zusammenhang mit Event 1795 auftreten?
- Gibt es bekannte Probleme in Windows Server 2022 Failover Clustering mit CSVs, Cluster Disks oder Persistent Reservations, die zu einer Node Eviction (1135) führen können?
- Welche zusätzlichen Diagnosen oder Logs würden für die weitere Ursachenanalyse empfohlen?
Vielen Dank im Voraus für jede Unterstützung.
Viele Grüße
Daniel