vSphere HA es una de las primeras opciones que se activan al crear un clúster VMware. En muchos entornos se considera un requisito básico, pero no siempre se comprende con precisión qué aporta ni cómo actúa ante un fallo real.
vSphere HA es un mecanismo de recuperación automática ante la caída de un host ESXi. Su función no es evitar interrupciones, sino reducir el tiempo de indisponibilidad cuando un componente de la infraestructura falla.
En producción, la diferencia entre entender vSphere HA y asumir su funcionamiento suele reflejarse en tiempos de recuperación impredecibles, reinicios fallidos o una falsa sensación de seguridad.
1. Qué es vSphere HA y qué hace realmente
Qué es vSphere HA
vSphere HA (High Availability) es una funcionalidad de clúster que monitoriza el estado de los hosts ESXi y automatiza el reinicio de las máquinas virtuales cuando uno de esos hosts deja de estar disponible.
Opera a nivel de hipervisor y clúster.
No tiene visibilidad de la aplicación ni del sistema operativo invitado.
Qué hace vSphere HA
Ante la caída de un host ESXi, vSphere HA:
-
Detecta que el host no responde.
-
Determina si la pérdida es real o transitoria.
-
Marca las máquinas virtuales del host como afectadas.
-
Selecciona hosts alternativos dentro del clúster.
-
Reinicia las máquinas virtuales en esos hosts.
Todo el proceso es automático, pero no inmediato. Siempre existe un tiempo de detección, decisión y arranque.
Qué NO hace vSphere HA
Uno de los puntos más importantes para evitar errores de diseño es entender qué queda fuera de su alcance:
-
No mantiene sesiones activas.
-
No protege aplicaciones.
-
No evita reinicios.
-
No detecta fallos dentro del sistema operativo.
-
No sustituye clústeres de base de datos ni soluciones de alta disponibilidad a nivel de aplicación.
vSphere HA no ofrece continuidad, ofrece recuperación.
2. Componentes y elementos clave de vSphere HA
Arquitectura master–agent
En cada clúster con HA habilitado existe:
-
Un host master.
-
Varios hosts secundarios con agentes HA.
El host master es el encargado de:
-
Monitorizar el estado del clúster.
-
Detectar fallos de hosts.
-
Decidir qué máquinas virtuales deben reiniciarse.
-
Seleccionar el host de destino.
Si el host master falla, se produce una reelección, durante la cual vSphere HA no toma decisiones.
Heartbeats de red
Los hosts ESXi intercambian señales periódicas a través de la red de management.
La pérdida de heartbeats de red no implica automáticamente que el host haya fallado.
Puede tratarse de:
-
Un problema de red.
-
Una interrupción en el switch.
-
Un fallo parcial de conectividad.
Por este motivo, vSphere HA utiliza mecanismos adicionales antes de actuar.
Heartbeats de datastore
Para reducir falsos positivos, vSphere HA utiliza datastores compartidos como referencia adicional.
Si un host:
-
Pierde conectividad de red,
-
pero sigue escribiendo en un datastore compartido,
entonces no se considera fallido de inmediato.
Este enfoque mejora la fiabilidad de las decisiones, pero aumenta el tiempo de detección ante una caída real.
Admission Control
Admission Control es el mecanismo que garantiza que el clúster tenga capacidad suficiente para recuperar máquinas virtuales tras un fallo.
Su función es impedir que se enciendan más máquinas virtuales de las que el clúster podría soportar en caso de perder uno o varios hosts.
Cuando está mal configurado o desactivado:
-
HA puede detectar correctamente el fallo.
-
Pero no puede reiniciar todas las máquinas virtuales.
Esto no genera un error técnico visible, pero sí un fallo funcional grave.
3. Uso de vSphere HA en entornos reales de producción
Casos habituales de uso
vSphere HA tiene sentido cuando:
-
Se acepta un reinicio de las máquinas virtuales.
-
El SLA permite varios minutos de indisponibilidad.
-
Las aplicaciones están diseñadas para arrancar de nuevo sin intervención manual.
-
Se busca automatizar la recuperación ante caídas de host.
Es común en:
-
Infraestructuras virtualizadas generales.
-
Servidores de aplicaciones.
-
Servicios internos no críticos a nivel de segundos.
Qué problemas resuelve en producción
vSphere HA elimina la dependencia de:
-
Intervención manual fuera de horario.
-
Reinicios improvisados tras una caída.
-
Decisiones humanas bajo presión.
Aporta consistencia operativa y reduce el impacto del error humano.
Cuándo no es suficiente
vSphere HA no cubre escenarios donde:
-
La continuidad debe ser inmediata.
-
No se permiten reinicios.
-
Las aplicaciones no toleran caídas.
-
No existe capacidad sobrante en el clúster.
En estos casos se requieren soluciones adicionales o arquitecturas diferentes.
4. Errores comunes en el uso de vSphere HA
Confundir alta disponibilidad con continuidad de servicio
El error más habitual es asumir que HA protege aplicaciones.
No lo hace.
Protege máquinas virtuales frente a fallos de host, nada más.
Desactivar Admission Control para “aprovechar recursos”
Esta decisión suele tomarse por presión de capacidad.
Consecuencia real:
-
El clúster funciona en condiciones normales.
-
Falla exactamente cuando ocurre una incidencia.
Infraestructura de management poco robusta
vSphere HA depende de la red de management.
Una red sin redundancia provoca:
-
Detecciones lentas.
-
Decisiones retrasadas.
-
Recuperaciones impredecibles.
No definir prioridades de reinicio
Sin prioridades claras:
-
Servicios críticos arrancan tarde.
-
Dependencias se rompen.
-
El impacto del fallo se amplifica.
5. Relación de vSphere HA con otros componentes del entorno
vSphere HA suele convivir con:
-
DRS, para redistribuir carga tras los reinicios.
-
Sistemas de backup, que deben tolerar reinicios no planificados.
-
Clústeres de aplicación, responsables de la alta disponibilidad real.
vSphere HA no sustituye estos elementos.
Actúa como capa base de recuperación de infraestructura.
6. Qué aprender después de vSphere HA
Una vez comprendido el funcionamiento real de vSphere HA, los siguientes pasos lógicos para un administrador de sistemas son:
-
Dimensionamiento realista de clústeres.
-
Diseño de dependencias entre servicios virtualizados.
-
Estrategias de recuperación alineadas con SLA reales.
vSphere HA es una herramienta madura y estable.
Su efectividad depende casi por completo del diseño del clúster que la rodea.
