안녕하세요 Minseo 님,
현재 상황은 멀티사이트 Active-Passive 클러스터에서 주 센터 정전으로 인해 Witness Disk가 정상적으로 이관되지 못하면서 보조 사이트 노드들이 쿼럼을 상실한 상태입니다. 이 경우 net start clussvc /forcequorum 또는 PowerShell의 Start-ClusterNode -ForceQuorum을 사용하는 것은 맞는 접근입니다. 다만, 강제 쿼럼을 구성하기 전에 반드시 Node Vote(노드 가중치)를 조정하는 것이 중요합니다.
멀티사이트 환경에서 베스트 프랙티스는 다음과 같습니다. 우선 보조 사이트에서 살아있는 노드들의 NodeWeight를 1로 유지하고, 주 센터의 노드들은 정전 상태이므로 NodeWeight를 0으로 설정해야 합니다. 이렇게 해야 보조 사이트에서 강제 쿼럼을 시작했을 때 클러스터가 정상적으로 온라인 상태로 올라옵니다. NodeWeight 변경은 PowerShell에서 Get-ClusterNode <NodeName> | Set-ClusterNode -Weight 0 명령으로 수행할 수 있습니다.
강제 쿼럼으로 클러스터를 복구한 이후에는 Split-Brain을 방지하기 위한 추가 조치가 필요합니다. 가장 중요한 것은 주 센터가 복구되기 전에 해당 노드들이 클러스터 서비스에 참여하지 못하도록 차단하는 것입니다. 즉, 주 센터 노드들의 Cluster Service를 수동으로 중지하거나, NodeWeight를 0으로 고정한 상태에서 복구를 진행해야 합니다. 주 센터가 완전히 복구된 뒤에는 Witness Disk를 다시 정상적으로 보조 사이트에서 주 사이트로 이동시키고, NodeWeight를 원래 값으로 되돌려 전체 클러스터가 정상적인 쿼럼 정책을 따르도록 해야 합니다.
Microsoft 공식 문서에서도 강조하는 부분은 “ForceQuorum은 최후의 수단이며, 반드시 Split-Brain 방지를 위한 노드 격리 조치와 함께 사용해야 한다”는 점입니다. 따라서 복구 절차는 보조 사이트에서 강제 쿼럼 → 서비스 정상화 → 주 센터 복구 시 노드 격리 → Witness Disk 정상화 → NodeWeight 복원 순으로 진행하는 것이 안전합니다.
HP.