Windows Server 2022 Failover Cluster: Event 1795 (ReleaseDiskPRFailure), Event 1146 und Node Eviction (1135) während Wartungsfenstern

Daniel Stetzenbach 0 Zuverlässigkeitspunkte
2026-08-18T08:58:54.8066667+00:00

Hallo zusammen,

wir haben seit einigen Monaten wiederkehrende Probleme in einem produktiven Windows Server 2022 Hyper-V Failover Cluster und würden gerne Erfahrungen oder Empfehlungen aus der Community einholen.

Umgebung

  • Windows Server 2022 Datacenter
  • 8-Knoten Hyper-V Failover Cluster
  • Cluster Shared Volumes (CSV) (Datacore)
  • Scale-Out File Server (SOFS)
  • SQL Server Always On
  • Fibre-Channel-Storage
  • MPIO mit herstellerspezifischem DSM
  • Intel X710 Netzwerkadapter

Problembeschreibung

Die Vorfälle treten typischerweise während monatlicher Wartungsfenster auf.

Das Muster sieht häufig wie folgt aus:

  1. Ein Clusterknoten wird mittels Drain/Pause für Wartungsarbeiten (z.B. monatliche Patches) vorbereitet
  2. Zu einem späteren Zeitpunkt verliert ein anderer Clusterknoten seine Cluster-Mitgliedschaft
  3. Anschließend folgen weitere Cluster- und CSV-bezogene Fehler.

Besonders interessant ist, dass der Fehler mindestens einmal auftrat, während der ursprünglich pausierte Knoten noch gar nicht wieder in den Cluster aufgenommen wurde.

Beobachtete Ereignisse

Vorfall 1

Folgende Ereignisse wurden nahezu zeitgleich registriert:

  • Event ID 1795
    • Physical Disk Resource failure
      • Cause: ReleaseDiskPRFailure
      • Event ID 1146
        • Resource Hosting Subsystem (RHS) terminated
        • Event ID 7024
          • Cluster Service terminated (Internal Error)
          • Event ID 7031
            • Cluster Service terminated unexpectedly
            • Event ID 1135
              • Cluster node removed from active cluster membership

Vorfall 2

Vor dem eigentlichen Node-Ausfall wurden zusätzlich folgende Ereignisse festgestellt:

  • Event ID 1127
    • Disk operation failed even after retries
    • Event ID 5120
      • STATUS_VOLUME_DISMOUNTED
      • Event ID 5157
        • STATUS_CONNECTION_DISCONNECTED
        • Event ID 1135
          • Cluster node removed from membership
          • Event ID 1146
            • RHS process terminated

Dabei waren mehrere CSVs betroffen.

Bisherige Analyse

Folgende Punkte wurden bereits überprüft:

  • Identische Treiberstände auf allen Clusterknoten
  • Identische HBA-Firmwarestände auf allen Clusterknoten
  • Identische DSM-/MPIO-Konfigurationen auf allen Clusterknoten
  • Keine offensichtlichen Hardwarefehler in den Server-Logs
  • Keine eindeutigen Link- oder Fibre-Channel-Ausfälle unmittelbar vor den Vorfällen
  • Keine Hinweise auf ein einzelnes betroffenes Hostsystem

Die Vorfälle betreffen unterschiedliche Clusterknoten und scheinen nicht an einen bestimmten Server gebunden zu sein.

Fragestellung

Hat jemand bereits eine ähnliche Ereigniskette beobachtet?

  • Event 1795 (ReleaseDiskPRFailure)
  • Event 1146 (RHS terminated)
  • Event 1135 (Node Eviction)
  • Event 5120 / 5157 (CSV-bezogene Fehler)

Insbesondere interessiert uns:

  • Können Persistent-Reservation-Probleme (Event 1795) einen solchen Fehlerverlauf auslösen?
  • Ist bekannt, dass RHS-Abstürze (Event 1146) in Zusammenhang mit Event 1795 auftreten?
  • Gibt es bekannte Probleme in Windows Server 2022 Failover Clustering mit CSVs, Cluster Disks oder Persistent Reservations, die zu einer Node Eviction (1135) führen können?
  • Welche zusätzlichen Diagnosen oder Logs würden für die weitere Ursachenanalyse empfohlen?

Vielen Dank im Voraus für jede Unterstützung.

Viele Grüße

Beobachtete Ereignisse

Vorfall 1

Folgende Ereignisse wurden nahezu zeitgleich registriert:

  • Event ID 1795
    • Physical Disk Resource failure
      • Cause: ReleaseDiskPRFailure
      • Event ID 1146
        • Resource Hosting Subsystem (RHS) terminated
        • Event ID 7024
          • Cluster Service terminated (Internal Error)
          • Event ID 7031
            • Cluster Service terminated unexpectedly
            • Event ID 1135
              • Cluster node removed from active cluster membership

Vorfall 2

Vor dem eigentlichen Node-Ausfall wurden zusätzlich folgende Ereignisse festgestellt:

  • Event ID 1127
    • Disk operation failed even after retries
    • Event ID 5120
      • STATUS_VOLUME_DISMOUNTED
      • Event ID 5157
        • STATUS_CONNECTION_DISCONNECTED
        • Event ID 1135
          • Cluster node removed from membership
          • Event ID 1146
            • RHS process terminated

Dabei waren mehrere CSVs betroffen.

Bisherige Analyse

Folgende Punkte wurden bereits überprüft:

  • Identische Treiberstände auf allen Clusterknoten
  • Identische HBA-Firmwarestände auf allen Clusterknoten
  • Identische DSM-/MPIO-Konfigurationen auf allen Clusterknoten
  • Keine offensichtlichen Hardwarefehler in den Server-Logs
  • Keine eindeutigen Link- oder Fibre-Channel-Ausfälle unmittelbar vor den Vorfällen
  • Keine Hinweise auf ein einzelnes betroffenes Hostsystem

Die Vorfälle betreffen unterschiedliche Clusterknoten und scheinen nicht an einen bestimmten Server gebunden zu sein.

Fragestellung

Hat jemand bereits eine ähnliche Ereigniskette beobachtet?

  • Event 1795 (ReleaseDiskPRFailure)
  • Event 1146 (RHS terminated)
  • Event 1135 (Node Eviction)
  • Event 5120 / 5157 (CSV-bezogene Fehler)

Insbesondere interessiert uns:

  • Können Persistent-Reservation-Probleme (Event 1795) einen solchen Fehlerverlauf auslösen?
  • Ist bekannt, dass RHS-Abstürze (Event 1146) in Zusammenhang mit Event 1795 auftreten?
  • Gibt es bekannte Probleme in Windows Server 2022 Failover Clustering mit CSVs, Cluster Disks oder Persistent Reservations, die zu einer Node Eviction (1135) führen können?
  • Welche zusätzlichen Diagnosen oder Logs würden für die weitere Ursachenanalyse empfohlen?

Vielen Dank im Voraus für jede Unterstützung.

Viele Grüße

Daniel

Windows für Unternehmen | Windows Server | Speicher mit hoher Verfügbarkeit | Virtualisierung und Hyper-V
0 Kommentare Keine Kommentare

1 Antwort

Sortieren nach: Älteste
  1. Domic Vo 34,170 Zuverlässigkeitspunkte Unabhängiger Berater
    2026-08-21T02:08:17.59+00:00

    Hallo Daniel,

    die von dir beschriebene Ereigniskette mit Event 1795 (ReleaseDiskPRFailure), Event 1146 (RHS terminated) und Event 1135 (Node Eviction) deutet stark auf Probleme mit Persistent Reservations im Fibre‑Channel‑Storage hin. CSVs nutzen SCSI‑3 PRs, um den exklusiven Zugriff eines Clusterknotens auf ein Volume sicherzustellen. Wenn ein Knoten die PR nicht korrekt freigibt oder ein anderer Knoten sie nicht übernehmen kann, kommt es zu genau solchen Fehlern: Disk‑Ressource schlägt fehl, RHS beendet sich, Cluster Service bricht ab und der Knoten wird aus der Mitgliedschaft entfernt.

    Dass du zusätzlich Event 5120 (STATUS_VOLUME_DISMOUNTED) und 5157 (STATUS_CONNECTION_DISCONNECTED) siehst, bestätigt, dass die CSVs ihre Verbindung verlieren. In Kombination mit Event 1127 („Disk operation failed even after retries“) ist das ein klassisches Symptom für PR‑Inkonsistenzen oder ein Problem im Zusammenspiel von MPIO/DSM mit dem Storage. RHS‑Abstürze treten in diesem Kontext auf, weil der Ressourcensubsystemprozess die Disk‑Ressource nicht mehr verwalten kann, wenn die PR‑Operation fehlschlägt.

    Bekannte Ursachen in Windows Server 2022 Failover Clustering sind fehlerhafte oder nicht vollständig kompatible DSM‑Treiber, Firmware‑Bugs in HBAs oder Storage‑Controller, oder ein Timing‑Problem beim PR‑Release während Wartungsfenstern. Microsoft hat in mehreren kumulativen Updates Fixes für CSV‑ und PR‑Handling veröffentlicht, daher ist es zwingend, dass alle Clusterknoten auf dem neuesten Patchstand sind.

    Für die weitere Analyse solltest du die Cluster‑Debug‑Logs (cluster log /gen /span:30) ziehen und gezielt nach „PR“‑Operationen suchen. Auch die Storage‑Event‑Logs des Fibre‑Channel‑Arrays sind wichtig, um zu sehen, ob PR‑Release/Reserve‑Befehle fehlschlagen. Zusätzlich lohnt sich ein Blick auf HKLM\Cluster\Parameters und die Werte für UsePersistentReservations sowie die MPIO‑Policy, um sicherzustellen, dass alle Knoten identisch konfiguriert sind.

    Kurz gesagt: Ja, PR‑Probleme können genau diesen Fehlerverlauf auslösen, und RHS‑Abstürze sind eine direkte Folge davon. Node Evictions (1135) sind die Cluster‑Reaktion, wenn ein Knoten seine Disk‑Ressourcen nicht mehr verwalten kann. Der nächste Schritt ist eine tiefe Analyse der Cluster‑Logs und Storage‑Logs, kombiniert mit einem Abgleich der Treiber‑ und Firmwarestände mit den aktuell von Microsoft und dem Storage‑Hersteller freigegebenen Versionen

    Domic Vo.

    War diese Antwort hilfreich?

    0 Kommentare Keine Kommentare

Ihre Antwort

Antworten können von Fragestellenden als „Angenommen“ und von Moderierenden als „Empfohlen“ gekennzeichnet werden, wodurch Benutzende wissen, dass diese Antwort das Problem des Fragestellenden gelöst hat.