Hola a todos,
Tengo un problema de estabilidad con mi PC y estoy tratando de averiguar si puede estar relacionado con la GPU/controladores, la fuente (PSU), PCIe u otro componente.
Especificaciones:
- CPU: Ryzen 7 5700G
- GPU: MSI RTX 3060 Ventus 2X 12G OC LHR
- RAM: 16 GB (2×8 GB) DDR4-3200 CL16, actualmente funcionando a 3200 MT/s con A-XMP
- Placa base: MSI MPG B550 Gaming Plus
- PSU: Corsair CV650 650W 80+ Bronze
- Windows 11 Pro
- Monitor: ASUS ROG Swift PG27AQN, 2560×1440, 360 Hz, conectado por DisplayPort
El problema:
En algunos juegos el PC se reinicia de repente o aparece un BSOD, pero no ocurre con todos los juegos.
El caso más problemático fue The Blood of Dawnwalker (UE5/DX12), donde los reinicios eran muy frecuentes.
Fortnite también era inestable utilizando DX12, pero al cambiar a DX11/Modo Rendimiento se volvió estable durante sesiones largas.
También he tenido problemas con Aniimo: en una ocasión tuve un DPC_WATCHDOG_VIOLATION (0x133) y en otra ocasión la pantalla se quedó negra mientras el audio del juego y YouTube continuaban reproduciéndose.
Análisis de un minidump con WinDbg:
VIDEO_TDR_FAILURE (116)
Failure.Bucket: 0x116_IMAGE_nvlddmkm.sys
IMAGE_NAME: nvlddmkm.sys
MODULE_NAME: nvlddmkm
dxgkrnl!TdrBugcheckOnTimeout
El stack incluye:
dxgkrnl!ADAPTER_RENDER::Reset
nvlddmkm
BugCheck:
0x00000116 (0xffff97864f286010, 0xfffff8012c9da3a0, 0xffffffffc000009a, 0x0000000000000004)
También tuve posteriormente un DPC_WATCHDOG_VIOLATION (0x133) cuyo análisis apuntaba a dxgkrnl.sys, con PROCESS_NAME: NVIDIA Overlay.
Temperaturas:
La GPU normalmente está alrededor de 70–74 °C jugando.
En una prueba de VRAM de OCCT, después de más de 30 minutos, no se habían producido errores y la GPU estaba alrededor de 60 °C.
Pruebas realizadas:
- Windows 11 recién instalado/formateado.
- DISM /RestoreHealth → correcto.
- SFC /scannow → sin errores.
- Diagnóstico de memoria de Windows → sin errores.
- DDU en modo seguro + instalación limpia del controlador NVIDIA.
- Probé diferentes versiones de los controladores NVIDIA.
- A-XMP activado y RAM funcionando a 3200 MT/s.
- Prueba de VRAM con OCCT → sin errores después de más de 30 minutos (la prueba continúa hasta completar el tiempo configurado).
- He probado los juegos con OBS completamente desactivado.
La RTX 3060 también funciona correctamente durante sesiones largas en otros juegos, incluso con cargas importantes y grabación/streaming, por lo que el problema no parece producirse con cualquier carga 3D.
La PSU es una Corsair CV650 de 650 W. MSI recomienda 550 W para esta RTX 3060.
Mi pregunta:
¿Qué pruebas adicionales recomendarían para determinar si el origen está en el controlador/software, PCIe, alimentación, GPU u otro componente?
¿Hay alguna comprobación concreta que pueda ayudar a determinar si la RTX 3060 tiene un problema de hardware antes de considerar un RMA?
¡Gracias!
Actualización:
Desde que escribí el mensaje original he hecho más pruebas:
Test de Power de OCCT (no solo VRAM): 1 hora sin errores, temperaturas normales.
Hice DDU y volví al driver Game Ready 566.36 (versión de diciembre 2024, reportada ampliamente en foros como más estable que versiones posteriores). El problema persiste con este driver — de hecho, tuve un nuevo DPC_WATCHDOG_VIOLATION (0x133) con el bucket idéntico al que ya había tenido antes del cambio de driver (0x133_ISR_nvlddmkm!unknown_function), lo cual descarta que sea un bug específico de una versión concreta de driver.
El problema se sigue concentrando en juegos muy recientes (Dawnwalker, Fortnite DX12, y ahora también Aniimo, lanzado hace apenas unos días) — ningún juego con más de varios meses en el mercado me ha dado el problema, ni siquiera bajo cargas sostenidas de streaming a varias plataformas a la vez.
Confirmé que el mismo tipo de error ya ocurría también con el monitor limitado a 60Hz (antes de tener el DisplayPort funcionando a 360Hz), así que descarto que la frecuencia de refresco sea un factor.