안녕하세요,Datadog Agent 로그 유실 문제는 크게 두 가지 방향으로 해결할 수 있습니다. 첫째, log_processing_rules를 활용해 불필요한 로그를 제외하는 방식입니다. 예를 들어 DEBUG 레벨이나 /health 엔드포인트 호출 로그를 exclude_at_match 규칙으로 걸러내면 전체 유입량을 크게 줄일 수 있습니다. 둘째, 버퍼 설정을 확장하거나 정책을 조정하는 것입니다. 기본적으로 Agent는 메모리 버퍼 15MB와 디스크 버퍼 2GB를 사용하며, forwarder_retry_queue_payloads_max_size와 forwarder_retry_queue_max_disk_size 값을 늘려 안정성을 확보할 수 있습니다. Vector를 사용하는 경우에는 디스크 버퍼를 활성화하고 buffer.on_full을 drop_newest로 지정해 급격한 트래픽 증가 시 애플리케이션 블로킹을 방지하는 것이 권장됩니다. 또한 로그 로테이션 주기를 Agent 재시도 정책과 맞추어야 유실을 최소화할 수 있습니다. 결국 핵심은 필터링으로 유입량을 줄이고, 버퍼 확장 및 정책 조정으로 급증 상황을 흡수하는 것입니다.여기서 유용한 정보를 얻으셨기를 바랍니다. 이 내용이 문제에 대한 통찰을 얻는 데 도움이 되었다면 답변을 채택해 주시면 감사하겠습니다. 추가로 궁금한 점이 있으시면 언제든지 메시지를 남겨 주세요. 좋은 하루 보내세요!
HP.