onprem site에서 private endpoint를 이용한 Azure openai 서비스 이용시 간헐적 TImeout 발생합니다

최동희 20 평판 포인트
2025-12-10T05:10:34.0066667+00:00

onprem site에서 private endpoint를 이용한 Azure openai 서비스 이용시 간헐적 Timeout 발생합니다.

같은 출발지에서 public endpoint를 이용하면 끊김 없이 Azure openai 서비스 이용이 가능합니다.

빈도는 약 10시간 측정시 API 전체 call 수는 3,110번이고, Timeout이 223번 발생했습니다. (error rate 7.3%)

Client: on-prem

Server: Azure OpenAI

Client~Server연결: Express Route

[현재 테스트 해본것]

Private DNS 쿼리 결과: 정상

Public endpoint 경로로 서비스: 정상

Private endpoint 경로로 서비스: 간헐적 TimeOut

특이사항으로 private endpoint 경로로 서비스 접근시 방화벽 확인해보면 tcp-rst form client 라는 로그가 발생합니다.

어디부터 짚어나가야할지, openai의 문제인지 파악이 안됩니다. 도움을 구하고자 질문을 게시합니다.

Foundry Tools
Foundry Tools

이전 명칭은 Azure AI Services 또는 Azure Cognitive Services였으며, Microsoft Foundry 플랫폼 내의 사전 구축된 AI 기능을 통합한 컬렉션입니다


답변 2개

정렬 기준: 가장 유용함
  1. 최동희 20 평판 포인트
    2025-12-22T00:48:01.4+00:00

    답변은 잘 확인하였습니다. 네트워크단 이슈로 점검하다보니 시간이 조금 걸리는부분 양해부탁드립니다. 추가 이슈발생시 공유/질문 드리겠습니다.

    이 대답이 도움이 되었나요?


  2. SRILAKSHMI C 19,735 평판 포인트 Microsoft 외부 직원 중재자
    2025-12-18T13:56:03.8666667+00:00

    안녕하세요. Choi Dong-hee,

    Microsoft Q&A에 오신 것을 환영하며 자세한 정보를 제공해 주셔서 감사합니다.

    제공해 주신 정보를 바탕으로 판단했을 때, 문제는 Azure OpenAI 서비스 자체의 문제가 아니라 온프레미스 환경에서 프라이빗 엔드포인트 연결 경로와 관련된 문제인 것으로 보입니다. 동일한 요청이 공용 엔드포인트를 사용할 때는 정상적으로 작동한다는 사실이 이러한 결론을 뒷받침합니다.

    관찰된 현상:

    타임아웃은 ExpressRoute를 통해 프라이빗 엔드포인트로 트래픽이 전송될 때만 발생합니다.

    프라이빗 DNS 확인은 정상적으로 작동합니다.

    방화벽 로그에는 클라이언트에서 TCP RST 패킷이 전송된 것으로 나타나는데, 이는 일반적으로 클라이언트 또는 중간 네트워크 장치(방화벽, 프록시, 로드 밸런서)에 의해 연결이 재설정되었음을 의미합니다.

    지속적인 트래픽에서 약 7.3%의 오류율이 발생하는 것은 서비스 스로틀링이나 모델 불안정성이 아닌 간헐적인 네트워크 수준의 문제임을 강력하게 시사합니다.

    Azure OpenAI는 요청 타임아웃 시 TCP 재설정 패킷을 능동적으로 전송하지 않으므로, 이러한 현상은 일반적으로 네트워크 경로상의 어딘가에서 발생합니다.

    프라이빗 엔드포인트에서만 이러한 문제가 발생하는 이유:

    프라이빗 엔드포인트 트래픽:

    프라이빗 IP 라우팅을 사용합니다.

    종종 추가적인 기업 방화벽, 프록시 또는 검사 장치를 통과합니다.

    ExpressRoute 정책, TCP 세션 처리 또는 타임아웃 설정의 영향을 받을 수 있습니다.

    공용 엔드포인트 트래픽은 이러한 제어 장치를 대부분 우회하기 때문에 안정적으로 작동합니다. 권장 문제 해결 영역

    네트워킹 팀과 함께 다음 사항을 검토해 보시기 바랍니다.

    방화벽 및 프록시 구성

    장시간 지속되는 HTTPS 연결을 재설정할 수 있는 규칙이 있는지 확인하세요.

    포트 443이 검사 또는 강제 재설정 없이 완전히 허용되는지 확인하세요.

    TCP RST를 삽입할 수 있는 장치가 있는지 검토하세요.

    TCP 유휴 및 세션 시간 초과 설정

    유휴 시간 초과 시간을 늘리세요(권장: 4~5분 이상).

    Azure OpenAI 요청은 부하가 높을 때 시간이 더 오래 걸릴 수 있습니다.

    ExpressRoute 라우팅

    개인 엔드포인트 IP에 대한 올바른 라우팅을 확인하세요.

    요청 및 응답 경로 간에 비대칭 라우팅이 없는지 확인하세요.

    SNAT/임시 포트 고갈

    높은 요청 볼륨으로 인해 포트가 일시적으로 고갈되어 재설정이 발생할 수 있습니다.

    TLS 검사

    활성화된 경우 Azure OpenAI 개인 엔드포인트 트래픽을 제외하는 것을 고려하세요.

    클라이언트 측 시간 초과 및 연결 재사용

    SDK 또는 클라이언트 시간 초과 값을 검토하세요.

    과도한 연결 변동을 방지하기 위해 적절한 연결 풀링을 사용하고 있는지 확인하세요.

    추가 유효성 검사 단계

    DNS 확인이 개인 엔드포인트 IP를 가리키는지 확인하세요.

    nslookup <your-openai-endpoint>

    개인 IP로 직접 연결을 테스트하세요.

    Test-NetConnection <Private-IP> -Port 443

    Azure Monitor를 사용하여 공용 및 개인 액세스 경로 간의 대기 시간 및 시간 초과 메트릭을 비교하세요.

    현재로서는 이 문제가 Azure OpenAI 서비스 자체의 문제가 아니라 온프레미스에서 개인 엔드포인트 트래픽과 관련된 네트워크 문제인 것으로 보입니다. 클라이언트에서 TCP RST가 발생하고 공용 엔드포인트를 통해 문제가 발생하지 않는다는 점이 이를 강력하게 뒷받침합니다.

    이 내용을 참조하세요.

    도움이 되셨기를 바랍니다. 추가 질문이 있으시면 언제든지 알려주세요.

    감사합니다!

    이 대답이 도움이 되었나요?

    댓글 0개 설명 없음

답변

질문 작성자는 답변을 '승인됨'으로 표시하고, 중재자는 답변을 '추천됨'으로 표시할 수 있습니다. 이를 통해 사용자는 해당 답변이 작성자의 문제를 해결했다는 것을 알 수 있습니다.