Azure 및 온-프레미스 환경에서 원격 분석 데이터를 수집, 분석하고 조치를 취하는 데 사용되는 Azure 서비스입니다.
영어로 된 답변을 번역하는 과정에서 문법적으로 다소 어색한 부분이 있을 수 있으니 양해 부탁드립니다.
안녕하세요. @이재훈(KT협력사)
Microsoft Q&A를 찾아주셔서 감사합니다. 7월 9일 귀하의 VM(CVM-AZ01-PRD-TDTM-WEBWAS-01)에서 발생한 Azure Monitor 경고 [Health]TDTM_ResourceHealth와 관련하여 안내해 드립니다.
사용자 측면에서는 VM이 정상적으로 작동하는 것처럼 보였더라도, 이와 같은 Resource Health(리소스 상태) 경고는 종종 일시적인 플랫폼 이벤트로 인해 발생할 수 있습니다. Azure는 호스트 연결성, 디스크 액세스, 게스트 에이전트 하트비트 등의 신호를 지속적으로 모니터링합니다. 기반 호스트에서의 빠른 라이브 마이그레이션(live migration), 일시적인 스토리지 장애(blip) 또는 순간적인 네트워크 불안정 등이 발생하면, 애플리케이션이나 OS에 눈에 띄는 중단 시간이 없었더라도 일시적으로 "Degraded(성능 저하)" 또는 "Unavailable(사용 불가)" 상태가 될 수 있습니다.
이러한 현상은 VM에서 꽤 흔하게 발생하며 대개 자동으로 해결됩니다. 귀하의 사례에서 정확히 어떤 일이 있었는지 확인하려면, 해당 VM의 Resource Health 블레이드에서 7월 9일 17:55 UTC 전후의 타임라인을 살펴보시는 것을 권장합니다. 그러면 구체적인 주석(예: LiveMigrationSucceeded, StorageOffline 또는 하드웨어 관련 성능 저하 상태)과 해당 이벤트가 플랫폼에 의해 시작된 것인지 확인할 수 있습니다.
간단한 권장 사항
이번 건의 경우: VM이 신속하게 복구되었고 워크로드에 영향이 없었다면 별도의 추가 조치는 필요하지 않습니다. 해당 경고를 '해결됨(resolved)'으로 표시하셔도 됩니다.
유사한 경고를 줄이려면:
플랫폼에서 시작된 이벤트와 지속 시간이 긴 문제에만 초점을 맞추도록 경고 규칙을 수정하십시오.
Action Groups(작업 그룹)를 통해 더 스마트한 알림 로직을 추가하는 것을 고려해 보십시오(예: 매우 짧은 일시적 이벤트에 대한 알림 억제).
예방 조치: Azure VM 에이전트를 최신 상태로 유지하시고, 만약 이벤트가 반복적으로 발생한다면 저희에게 알려주셔서 호스트를 조사할 수 있도록 해주십시오.
참고 자료:
- Resource Health alerts in Azure
- VM Health Annotations (explains common events)
- Azure Resource Health Overview
답변이 도움이 되었다면 '답변 채택(Accept Answer)'을 클릭하고 추천(upvote)해 주시면 감사하겠습니다. 추가 질문이 있으시면 '댓글(Comment)'을 클릭해 주세요.