AMTech Academy
Empieza ya gratis

vSphere HA vs Fault Tolerance: diferencias reales y cuándo usar cada uno

vSphere HA vs Fault Tolerance: diferencias reales y cuándo usar cada uno

1. Introducción técnica

Dentro del ecosistema VMware, vSphere HA y Fault Tolerance suelen mencionarse juntos, pero resuelven problemas distintos. En muchos entornos se confunden, se comparan de forma superficial o se descarta uno de ellos sin entender realmente su propósito.

Ambas tecnologías están diseñadas para mejorar la disponibilidad, pero actúan en momentos distintos del fallo y con implicaciones muy diferentes a nivel de infraestructura, rendimiento y coste operativo.

Este artículo explica qué hace realmente cada una, cuándo tiene sentido usarlas y por qué en producción casi nunca son intercambiables.

Fault Tolerance mantiene una máquina virtual secundaria sincronizada a nivel de ejecución para garantizar continuidad del servicio.


2. Qué problema resuelve cada tecnología

Qué problema resuelve vSphere HA

vSphere HA actúa después de un fallo.
Su función es recuperar máquinas virtuales cuando un host ESXi deja de estar disponible.

El proceso implica:

  • Detección del fallo

  • Decisión

  • Reinicio de la máquina virtual

Existe siempre un tiempo de indisponibilidad.

Qué problema resuelve Fault Tolerance

Fault Tolerance actúa durante el fallo.
Mantiene una máquina virtual secundaria ejecutándose en paralelo, sincronizada a nivel de CPU e instrucciones.

Cuando el host principal falla:

  • La VM secundaria continúa ejecutándose

  • No hay reinicio

  • No hay pérdida de estado

Esto supone continuidad real del servicio, no recuperación.


3. Cómo funciona vSphere HA frente a Fault Tolerance

Funcionamiento de vSphere HA

  • Monitoriza hosts ESXi

  • Detecta caídas completas

  • Reinicia VMs en otros hosts

  • Depende de Admission Control y capacidad sobrante

vSphere HA es reactivo.

Funcionamiento de Fault Tolerance

  • Ejecuta dos instancias idénticas de la misma VM

  • Sincroniza estado de ejecución constantemente

  • Requiere baja latencia y red estable

  • Duplica consumo de CPU y memoria

Fault Tolerance es preventivo.


4. Diferencias técnicas clave entre HA y FT

Tiempo de indisponibilidad

  • HA: minutos (detección + reinicio)

  • FT: prácticamente cero

Impacto en recursos

  • HA: consumo normal, capacidad reservada

  • FT: consumo duplicado por VM protegida

Complejidad operativa

  • HA: bajo

  • FT: medio–alto

Escalabilidad

  • HA: alta, pensado para muchos servidores

  • FT: limitada, pensado para pocos servicios críticos


5. Uso en entornos reales de producción

Cuándo usar vSphere HA

Tiene sentido cuando:

  • El reinicio es aceptable

  • El SLA permite interrupciones breves

  • Se busca simplicidad operativa

  • El entorno es grande y heterogéneo

Por eso vSphere HA es la base de casi todos los clústeres.

Cuándo usar Fault Tolerance

Tiene sentido cuando:

  • No se permiten caídas

  • La aplicación no tolera reinicios

  • El número de VMs críticas es reducido

  • El coste en recursos está justificado

Fault Tolerance no está pensado para proteger todo el entorno.


6. Errores comunes al comparar HA y FT

Pensar que Fault Tolerance sustituye a HA

No lo hace.
FT protege máquinas concretas, HA protege el clúster.

Intentar usar FT como solución general

Esto suele acabar en:

  • Problemas de rendimiento

  • Complejidad innecesaria

  • Coste operativo elevado

Diseñar sin tener en cuenta el SLA real

El error no es técnico, es de requisitos.
Elegir mal la tecnología suele indicar que el SLA no está bien definido.


7. Relación con otras áreas del entorno

Ambas tecnologías suelen combinarse con:

  • DRS para equilibrio de carga

  • Clústeres de aplicación

  • Estrategias de backup y DR

HA y FT no sustituyen una estrategia de continuidad completa.
Cubren capas distintas del problema.


8. Qué aprender después

Tras entender HA y FT, el siguiente paso lógico es:

  • Definir SLA realistas por servicio

  • Dimensionar clústeres en función de fallos asumidos

  • Evaluar costes de continuidad frente a impacto real

  • Diseñar arquitecturas que fallen de forma controlada

La alta disponibilidad no consiste en evitar fallos, sino en decidir cuáles puedes permitirte.

Si quieres aprender el funcionamiento real de HA, te recomiendo este post