Elasticsearch Cluster en estado Red por pérdida de Master

Sarah Julie Hammer 20 Puntos de reputación
2026-10-02T08:03:55.6666667+00:00

En nuestro entorno, el clúster de Elasticsearch pasa a estado Red cuando todos los nodos master-eligible dejan de estar disponibles y no se puede completar la elección de un nuevo master node. El clúster pierde temporalmente la capacidad de mantener un cluster state estable y las operaciones sobre los índices afectados dejan de funcionar correctamente.

Estamos intentando determinar cuál es el procedimiento recomendado para realizar una recuperación manual del master node. Antes de ejecutar cualquier acción de recuperación, queremos verificar el estado del cluster metadata, la disponibilidad de los nodos y la información persistida del cluster para evitar split-brain, pérdida de datos o corrupción del cluster state.

¿Cuál es el procedimiento más seguro para recuperar el master y restablecer la elección del cluster leader? ¿Qué logs, cluster state information y condiciones de quorum deberían comprobarse antes de realizar cualquier operación manual?

Windows para empresas | Windows 365 Business
0 comentarios No hay comentarios

Respuesta aceptada por el autor de la pregunta
Jason Nguyen Tran 27,370 Puntos de reputación Asesor independiente
2026-10-02T08:56:35.7766667+00:00

Hola Sarah Julie Hammer,

Cuando todos los nodos master-eligible dejan de estar disponibles, el enfoque más seguro es determinar primero si todavía existe un cluster state y metadatos válidos en alguno de los nodos supervivientes antes de realizar cualquier acción de recuperación manual. Recomiendo verificar el estado y la conectividad de todos los nodos master-eligible, así como revisar los logs de Elasticsearch en busca de eventos de master election, desconexiones de nodos, mensajes relacionados con quorum y cualquier indicio de fallos en la publicación del cluster state.

Antes de promover o reiniciar cualquier nodo, confirme qué nodo contiene los metadatos de clúster más recientes y consistentes, y asegúrese de que la mayoría de la configuración de votación original pueda participar en una nueva elección. También es importante validar que el cluster UUID, los metadatos de los índices y el estado persistido sean consistentes entre los nodos disponibles para evitar un escenario de split-brain. Si es posible restablecer el quorum, el método de recuperación preferido normalmente es restaurar la comunicación entre los nodos elegibles y permitir que el clúster realice una elección normal del líder, en lugar de forzar la formación del clúster.

Además, revise los logs ubicados en los directorios de datos y logs de Elasticsearch para identificar posibles network partitions, problemas de almacenamiento, unclean shutdowns o cambios de configuración que hayan provocado la pérdida del master elegido. Si no es posible recuperar el quorum original, se debe actuar con extrema precaución antes de utilizar cualquier procedimiento de cluster bootstrap o recuperación insegura, ya que estas operaciones pueden provocar divergencias de metadatos o pérdida de datos si se ejecutan incorrectamente.

Para realizar un análisis más detallado, proporcione las salidas de _cluster/health, _cluster/state, _cat/nodes?v y las entradas relevantes de los logs de master election de todos los nodos master-eligible durante el período en que ocurrió el incidente.

Espero que esta información le resulte útil. Si considera útil esta respuesta, haga clic en “Accept Answer” para que otros miembros de la comunidad que enfrenten un problema similar también puedan beneficiarse de ella.

Jason

¿Le ha resultado útil esta respuesta?

1 persona ha encontrado útil esta respuesta.
0 comentarios No hay comentarios

0 respuestas adicionales

Ordenar por: Muy útil

Su respuesta

Las respuestas pueden ser marcadas como "Aceptadas" por el autor de la pregunta y "Recomendadas" por los moderadores, lo que ayuda a los usuarios a saber que la respuesta ha resuelto el problema del autor.