雙節點集群 Disk Witness 損壞(Event 1069),求驗證「零停機」切換 Cloud / File Share Witness 的可行性

龙鑫 Ltd 20 信誉分
2026-09-01T03:10:33.1+00:00

一、 故障背景與現狀

  • 現象:2-Node Failover Cluster 告警,底層 Quorum LUN 的 NTFS 文件系統損壞,集群報出 Event ID 1069,Disk Witness 資源處於 Failed 狀態
  • 風險:雖然目前 Dynamic Quorum 仍維持集群運行,但仲裁機制已失效,極易在網絡波動時引發腦裂(Split-brain)或集群整體 Down 機。
  • 約束:業務側明確指示不允許申請 Down 時間,必須完成熱變更(Live Migration / Hot-fix)。

二、 擬定的處置方案與疑慮 我們計畫繞過損壞的 LUN,直接在線重置 Quorum 仲裁模式(切換至 Cloud Witness 或 FSW)。但在執行前想向各位大佬請教以下細節:

指令執行的安全邊界:在 Disk Witness 已經 Corrupt 的情況下,直接運行 Set-ClusterQuorum -CloudWitness ... 是否會強制觸發 Cluster Service 重啟或重新選舉?

殘留資源清理:舊的 Disk Witness 資源在 Cluster Manager 裡如果無法正常 Offline/Remove,是否需要先剝離 Node Vote 再做清洗?

雲端/共享見證的最佳實踐:針對此類 2-Node 雙機熱備架構,改掛 Cloud Witness 還是傳統的 File Share Witness (FSW) 在抗網絡抖動上更穩健?

期待有處理過此類 HA 仲裁盤壞死經驗的同行幫忙 Review 一下流程,避免踩坑!

Windows 商业版 | Windows 365 企业版
0 个注释 无注释

1 个答案

排序依据: 非常有帮助
  1. Hoang Le 5,790 信誉分 独立顾问
    2026-09-01T04:05:45.52+00:00

    您好 龙鑫 Ltd,

    针对您的情况——即仲裁磁盘见证(Quorum Disk Witness)发生故障并报告事件 ID 1069——切换到其他仲裁机制(如云见证 Cloud Witness 或文件共享见证 File Share Witness)是完全可行的。 执行 Set-ClusterQuorum -CloudWitnessSet-ClusterQuorum -FileShareWitness 命令不会重启整个群集服务,而只会触发内部重新选举过程; 该过程速度很快,且不会中断正在运行的群集角色。 不过,在执行此操作前,请务必确保各节点仍拥有有效的投票权,以免群集暂时失去仲裁。

    关于旧的磁盘见证资源,如果无法在群集管理器中将其脱机或移除,您可以先暂时取消该节点的投票权(使用命令 Set-ClusterNode -Name <Node> -NodeWeight 0),然后再移除该资源。 在成功切换到云见证或文件共享见证后,您可以恢复该节点的投票权。 这是一种安全的方法,可避免在清理过程中出现群集不平衡的情况。

    关于双节点架构中云见证与文件共享见证的选择,微软推荐使用云见证,因为它消除了对本地站点的依赖,并且在局域网(LAN)网络波动时具有更高的稳定性。 虽然文件共享见证仍然可用,但在您描述的场景中(即网络不稳定时存在“脑裂”风险),云见证是更稳健的解决方案。

    如果我的回答对您有帮助,请点击**“接受回答”**以示支持。

    谢谢,

    HL。

    此答案是否有帮助?

    0 个注释 无注释

你的答案

提问者可以将答案标记为“已接受”,审查方可以将答案标记为“已推荐”,这有助于用户了解答案是否解决了提问者的问题。