Recuperación ante desastres: RPO, RTO y estrategias
Dos números ordenan toda la discusión: cuántos datos se pueden perder y cuánto puede durar la caída. De ahí sale la estrategia, el costo y —lo más importante— si el plan que hay escrito alguna vez se ejecutó.
Datos de proveedores verificados contra la documentación oficial el 19 de sept de 2026.
Casi todas las conversaciones sobre desastres empiezan mal, porque empiezan por la solución: “¿replicamos a otra región?”. La conversación correcta empieza por dos preguntas que cualquiera del negocio puede contestar, y que ninguna decisión técnica debería preceder.
Cuántos datos se pueden perder, y cuánto tiempo puede estar caído. Los dos números tienen nombre y son lo único que hace comparable una estrategia con otra.
RPO y RTO
| RPO — Recovery Point Objective | RTO — Recovery Time Objective | |
|---|---|---|
| Qué mide | Cuántos datos se pueden perder, en tiempo | Cuánto puede durar la interrupción |
| La pregunta | ¿Hasta qué momento hacia atrás toleramos volver? | ¿En cuánto tiempo tenemos que estar sirviendo? |
| Lo determina | Cada cuánto se copian los datos | Cuánto tarda reconstruir y redirigir |
| Ejemplo de 24 h | Respaldo nocturno: se pierde el día | Reconstruir a mano desde el respaldo |
| Ejemplo de minutos | Replicación continua | Infraestructura secundaria ya prendida |
Los dos son objetivos de negocio, no capacidades técnicas. Se fijan preguntando cuánto cuesta cada escenario, y recién después se busca la arquitectura que los cumple al menor costo. Al revés —mirar qué ofrece el proveedor y deducir de ahí qué se puede prometer— es como se llega a planes que no resisten la primera prueba.
Las cuatro estrategias, y qué compran
| Estrategia | Qué hay del otro lado | RTO típico | Costo |
|---|---|---|---|
| Respaldo y restauración | Sólo los respaldos | Horas a días | Mínimo |
| Luz piloto | Los datos replicándose y lo mínimo prendido | Decenas de minutos | Bajo |
| En espera tibia | Todo prendido, en tamaño reducido | Minutos | Medio |
| Activo-activo | Todo prendido y atendiendo tráfico | Casi cero | Alto |
La luz piloto es el escalón que mejor relación da y el menos conocido: los datos se replican continuamente y la infraestructura está definida como código pero apagada. Cuando hace falta, se aplica la definición, se promueve la base y se redirige el tráfico. El costo permanente es el del almacenamiento replicado, no el del cómputo.
Antes de seguir, predecí
Los respaldos que no son respaldos
Un respaldo sirve si sobrevive al evento que lo hace falta. Eso descarta varias cosas que la gente cuenta como respaldo.
Lo que hace que un respaldo cuente
- Está en otra cuenta o proyecto, no sólo en otra región. Si el incidente es una credencial comprometida, quien borró la base puede borrar las copias.
- Es inmutable por un plazo: los proveedores ofrecen bloqueo de objetos y bóvedas con retención que nadie —ni el administrador— puede acortar.
- Tiene copias de distintas antigüedades. Un error que corrompe datos de a poco se descubre tarde: sólo sirve una copia anterior a la corrupción.
- Se restauró alguna vez, entero, con cronómetro. Ese número es el RTO real; el del documento es una estimación.
- Incluye lo que no es la base: configuración, secretos, definiciones de infraestructura, DNS. Restaurar los datos y no tener dónde ponerlos es la mitad del trabajo.
El plan como procedimiento, no como documento
Qué tiene que decir
- Quién declara el desastre. Sin un nombre, la primera hora se va en decidir si esto amerita el plan.
- El orden de recuperación, que es un grafo de dependencias: identidad, red y secretos antes que la base, y la base antes que la aplicación.
- Los comandos concretos, no descripciones. Un procedimiento que dice “restaurar la base” no sirve a las tres de la mañana.
- Cómo se comunica, y por un canal que no dependa de lo que está caído.
- Cómo se vuelve atrás cuando la región original se recupera, que es la parte que nadie escribe y siempre cuesta más que la ida.
Más a fondo · nivel seniorProbar sin asustar a nadie
El ejercicio completo —conmutar producción a la región secundaria— es el que da certeza y el que más cuesta autorizar. Hay una escalera intermedia que sirve para llegar ahí:
- Restaurar a un entorno aparte y correr las verificaciones de integridad. Se puede hacer todos los meses sin tocar producción, y es lo que convierte al respaldo en algo confiable.
- Simulación de escritorio: reunir a quienes tendrían que actuar y recorrer el procedimiento paso por paso, sin ejecutar. Encuentra la mitad de los huecos en una hora.
- Ejercicio parcial: conmutar un servicio no crítico de verdad, con su base incluida.
- Ejercicio completo, planificado, en una ventana anunciada.
Y una regla que sale de todas las prácticas de este tema: si el plan de recuperación depende de una sola persona que sabe cómo se hace, entonces esa persona es el riesgo, no la región.
Cierre
Autoevaluación
¿Lo entendiste?
Práctica