AMTech Academy
Empieza ya gratis

vSphere HA: cómo funciona realmente la alta disponibilidad en clústeres VMware

vSphere HA: cómo funciona realmente la alta disponibilidad en clústeres VMware

vSphere HA es una de las primeras opciones que se activan al crear un clúster VMware. En muchos entornos se considera un requisito básico, pero no siempre se comprende con precisión qué aporta ni cómo actúa ante un fallo real.

vSphere HA es un mecanismo de recuperación automática ante la caída de un host ESXi. Su función no es evitar interrupciones, sino reducir el tiempo de indisponibilidad cuando un componente de la infraestructura falla.

En producción, la diferencia entre entender vSphere HA y asumir su funcionamiento suele reflejarse en tiempos de recuperación impredecibles, reinicios fallidos o una falsa sensación de seguridad.


1. Qué es vSphere HA y qué hace realmente

Qué es vSphere HA

vSphere HA (High Availability) es una funcionalidad de clúster que monitoriza el estado de los hosts ESXi y automatiza el reinicio de las máquinas virtuales cuando uno de esos hosts deja de estar disponible.

Opera a nivel de hipervisor y clúster.
No tiene visibilidad de la aplicación ni del sistema operativo invitado.

Qué hace vSphere HA

Ante la caída de un host ESXi, vSphere HA:

  1. Detecta que el host no responde.

  2. Determina si la pérdida es real o transitoria.

  3. Marca las máquinas virtuales del host como afectadas.

  4. Selecciona hosts alternativos dentro del clúster.

  5. Reinicia las máquinas virtuales en esos hosts.

Todo el proceso es automático, pero no inmediato. Siempre existe un tiempo de detección, decisión y arranque.

Qué NO hace vSphere HA

Uno de los puntos más importantes para evitar errores de diseño es entender qué queda fuera de su alcance:

  • No mantiene sesiones activas.

  • No protege aplicaciones.

  • No evita reinicios.

  • No detecta fallos dentro del sistema operativo.

  • No sustituye clústeres de base de datos ni soluciones de alta disponibilidad a nivel de aplicación.

vSphere HA no ofrece continuidad, ofrece recuperación.


2. Componentes y elementos clave de vSphere HA

Arquitectura master–agent

En cada clúster con HA habilitado existe:

  • Un host master.

  • Varios hosts secundarios con agentes HA.

El host master es el encargado de:

  • Monitorizar el estado del clúster.

  • Detectar fallos de hosts.

  • Decidir qué máquinas virtuales deben reiniciarse.

  • Seleccionar el host de destino.

Si el host master falla, se produce una reelección, durante la cual vSphere HA no toma decisiones.

Heartbeats de red

Los hosts ESXi intercambian señales periódicas a través de la red de management.

La pérdida de heartbeats de red no implica automáticamente que el host haya fallado.
Puede tratarse de:

  • Un problema de red.

  • Una interrupción en el switch.

  • Un fallo parcial de conectividad.

Por este motivo, vSphere HA utiliza mecanismos adicionales antes de actuar.

Heartbeats de datastore

Para reducir falsos positivos, vSphere HA utiliza datastores compartidos como referencia adicional.

Si un host:

  • Pierde conectividad de red,

  • pero sigue escribiendo en un datastore compartido,

entonces no se considera fallido de inmediato.

Este enfoque mejora la fiabilidad de las decisiones, pero aumenta el tiempo de detección ante una caída real.

Admission Control

Admission Control es el mecanismo que garantiza que el clúster tenga capacidad suficiente para recuperar máquinas virtuales tras un fallo.

Su función es impedir que se enciendan más máquinas virtuales de las que el clúster podría soportar en caso de perder uno o varios hosts.

Cuando está mal configurado o desactivado:

  • HA puede detectar correctamente el fallo.

  • Pero no puede reiniciar todas las máquinas virtuales.

Esto no genera un error técnico visible, pero sí un fallo funcional grave.


3. Uso de vSphere HA en entornos reales de producción

Casos habituales de uso

vSphere HA tiene sentido cuando:

  • Se acepta un reinicio de las máquinas virtuales.

  • El SLA permite varios minutos de indisponibilidad.

  • Las aplicaciones están diseñadas para arrancar de nuevo sin intervención manual.

  • Se busca automatizar la recuperación ante caídas de host.

Es común en:

  • Infraestructuras virtualizadas generales.

  • Servidores de aplicaciones.

  • Servicios internos no críticos a nivel de segundos.

Qué problemas resuelve en producción

vSphere HA elimina la dependencia de:

  • Intervención manual fuera de horario.

  • Reinicios improvisados tras una caída.

  • Decisiones humanas bajo presión.

Aporta consistencia operativa y reduce el impacto del error humano.

Cuándo no es suficiente

vSphere HA no cubre escenarios donde:

  • La continuidad debe ser inmediata.

  • No se permiten reinicios.

  • Las aplicaciones no toleran caídas.

  • No existe capacidad sobrante en el clúster.

En estos casos se requieren soluciones adicionales o arquitecturas diferentes.


4. Errores comunes en el uso de vSphere HA

Confundir alta disponibilidad con continuidad de servicio

El error más habitual es asumir que HA protege aplicaciones.
No lo hace.

Protege máquinas virtuales frente a fallos de host, nada más.

Desactivar Admission Control para “aprovechar recursos”

Esta decisión suele tomarse por presión de capacidad.

Consecuencia real:

  • El clúster funciona en condiciones normales.

  • Falla exactamente cuando ocurre una incidencia.

Infraestructura de management poco robusta

vSphere HA depende de la red de management.

Una red sin redundancia provoca:

  • Detecciones lentas.

  • Decisiones retrasadas.

  • Recuperaciones impredecibles.

No definir prioridades de reinicio

Sin prioridades claras:

  • Servicios críticos arrancan tarde.

  • Dependencias se rompen.

  • El impacto del fallo se amplifica.


5. Relación de vSphere HA con otros componentes del entorno

vSphere HA suele convivir con:

  • DRS, para redistribuir carga tras los reinicios.

  • Sistemas de backup, que deben tolerar reinicios no planificados.

  • Clústeres de aplicación, responsables de la alta disponibilidad real.

vSphere HA no sustituye estos elementos.
Actúa como capa base de recuperación de infraestructura.


6. Qué aprender después de vSphere HA

Una vez comprendido el funcionamiento real de vSphere HA, los siguientes pasos lógicos para un administrador de sistemas son:

vSphere HA es una herramienta madura y estable.
Su efectividad depende casi por completo del diseño del clúster que la rodea.