Atlasingeniería

Fundamentos de cloudSeniorTema 3Senior

Recuperación ante desastres: RPO, RTO y estrategias

Dos números ordenan toda la discusión: cuántos datos se pueden perder y cuánto puede durar la caída. De ahí sale la estrategia, el costo y —lo más importante— si el plan que hay escrito alguna vez se ejecutó.

Datos de proveedores verificados contra la documentación oficial el 19 de sept de 2026.

Casi todas las conversaciones sobre desastres empiezan mal, porque empiezan por la solución: “¿replicamos a otra región?”. La conversación correcta empieza por dos preguntas que cualquiera del negocio puede contestar, y que ninguna decisión técnica debería preceder.

Cuántos datos se pueden perder, y cuánto tiempo puede estar caído. Los dos números tienen nombre y son lo único que hace comparable una estrategia con otra.

RPO y RTO

RPO — Recovery Point ObjectiveRTO — Recovery Time Objective
Qué mideCuántos datos se pueden perder, en tiempoCuánto puede durar la interrupción
La pregunta¿Hasta qué momento hacia atrás toleramos volver?¿En cuánto tiempo tenemos que estar sirviendo?
Lo determinaCada cuánto se copian los datosCuánto tarda reconstruir y redirigir
Ejemplo de 24 hRespaldo nocturno: se pierde el díaReconstruir a mano desde el respaldo
Ejemplo de minutosReplicación continuaInfraestructura secundaria ya prendida

Los dos son objetivos de negocio, no capacidades técnicas. Se fijan preguntando cuánto cuesta cada escenario, y recién después se busca la arquitectura que los cumple al menor costo. Al revés —mirar qué ofrece el proveedor y deducir de ahí qué se puede prometer— es como se llega a planes que no resisten la primera prueba.

Las cuatro estrategias, y qué compran

EstrategiaQué hay del otro ladoRTO típicoCosto
Respaldo y restauraciónSólo los respaldosHoras a díasMínimo
Luz pilotoLos datos replicándose y lo mínimo prendidoDecenas de minutosBajo
En espera tibiaTodo prendido, en tamaño reducidoMinutosMedio
Activo-activoTodo prendido y atendiendo tráficoCasi ceroAlto
Los cuatro escalones son los mismos en los tres proveedores; cambia cómo se llaman los servicios que los implementan.

La luz piloto es el escalón que mejor relación da y el menos conocido: los datos se replican continuamente y la infraestructura está definida como código pero apagada. Cuando hace falta, se aplica la definición, se promueve la base y se redirige el tráfico. El costo permanente es el del almacenamiento replicado, no el del cómputo.

Antes de seguir, predecí

Una tienda factura 20.000 dólares por hora. ¿Qué estrategia conviene?

Los respaldos que no son respaldos

Un respaldo sirve si sobrevive al evento que lo hace falta. Eso descarta varias cosas que la gente cuenta como respaldo.

Lo que hace que un respaldo cuente

  1. Está en otra cuenta o proyecto, no sólo en otra región. Si el incidente es una credencial comprometida, quien borró la base puede borrar las copias.
  2. Es inmutable por un plazo: los proveedores ofrecen bloqueo de objetos y bóvedas con retención que nadie —ni el administrador— puede acortar.
  3. Tiene copias de distintas antigüedades. Un error que corrompe datos de a poco se descubre tarde: sólo sirve una copia anterior a la corrupción.
  4. Se restauró alguna vez, entero, con cronómetro. Ese número es el RTO real; el del documento es una estimación.
  5. Incluye lo que no es la base: configuración, secretos, definiciones de infraestructura, DNS. Restaurar los datos y no tener dónde ponerlos es la mitad del trabajo.

El plan como procedimiento, no como documento

Qué tiene que decir

  1. Quién declara el desastre. Sin un nombre, la primera hora se va en decidir si esto amerita el plan.
  2. El orden de recuperación, que es un grafo de dependencias: identidad, red y secretos antes que la base, y la base antes que la aplicación.
  3. Los comandos concretos, no descripciones. Un procedimiento que dice “restaurar la base” no sirve a las tres de la mañana.
  4. Cómo se comunica, y por un canal que no dependa de lo que está caído.
  5. Cómo se vuelve atrás cuando la región original se recupera, que es la parte que nadie escribe y siempre cuesta más que la ida.
Más a fondo · nivel seniorProbar sin asustar a nadie

El ejercicio completo —conmutar producción a la región secundaria— es el que da certeza y el que más cuesta autorizar. Hay una escalera intermedia que sirve para llegar ahí:

  • Restaurar a un entorno aparte y correr las verificaciones de integridad. Se puede hacer todos los meses sin tocar producción, y es lo que convierte al respaldo en algo confiable.
  • Simulación de escritorio: reunir a quienes tendrían que actuar y recorrer el procedimiento paso por paso, sin ejecutar. Encuentra la mitad de los huecos en una hora.
  • Ejercicio parcial: conmutar un servicio no crítico de verdad, con su base incluida.
  • Ejercicio completo, planificado, en una ventana anunciada.

Y una regla que sale de todas las prácticas de este tema: si el plan de recuperación depende de una sola persona que sabe cómo se hace, entonces esa persona es el riesgo, no la región.

Cierre

Autoevaluación

¿Lo entendiste?

¿Qué mide el RPO?
¿Por qué una réplica no reemplaza a un respaldo?
¿Dónde tienen que estar los respaldos para servir ante una credencial comprometida?
¿Cuál es el RTO real de un sistema?