Atlasingeniería

Inglés técnicoEscritura profesional — Semi-SeniorTema 5Semi-Senior

Actualizaciones de incidentes y postmortems en inglés

Durante un incidente nadie tiene cabeza para redactar. Por eso las actualizaciones tienen un formato fijo de cuatro líneas, y el postmortem que viene después tiene una regla que lo define entero: se escribe sobre el sistema, no sobre la persona.

Un incidente en un equipo internacional se comunica por escrito y en inglés, mientras lo estás resolviendo, con gente mirando que no sabe nada de tu sistema. Es el peor momento posible para buscar palabras.

La salida es la misma que usan todos los equipos que hacen esto seguido: una plantilla de cuatro líneas que se completa igual siempre, y una cadencia fija de actualizaciones. Lo que se automatiza es la forma, para que la cabeza quede libre para el problema.

La actualización durante el incidente

Plantilla

Incident update

Impact

Checkout is failing for about 5% of orders. Users see a 500 after entering payment details.

Qué ven los usuarios y cuántos. Primero el impacto, nunca la causa: quien lee decide con esto si tiene que hacer algo.

Status

Investigating — we have narrowed it down to the payment provider's new API version.

Tres estados y nada más: investigating, identified, monitoring. Se usan siempre esas palabras porque la gente ya sabe qué significan.

What we are doing

Rolling back to the previous provider client. ETA 15 minutes.

La acción en curso, con una estimación. Si no tenés estimación, se dice: "no ETA yet".

Next update

Next update at 15:30 UTC, or sooner if anything changes.

El renglón que más ansiedad ahorra. Sin él, todo el mundo pregunta cada cinco minutos y te saca del problema.

Siempre con hora en UTC. En un equipo repartido en cuatro husos, «hace un rato» no significa nada.
EstadoQué significaEjemplo
InvestigatingSabemos que algo pasa, no sabemos por quéInvestigating elevated error rates on checkout
IdentifiedEncontramos la causa, estamos arreglandoIdentified: a bad config was deployed at 13:52 UTC
MonitoringAplicamos el arreglo, estamos observandoMonitoring: error rates back to normal since 15:10 UTC
ResolvedTerminó; el postmortem viene despuésResolved. A postmortem will follow within 48 hours
«Monitoring» no es «resolved»: existe justamente para no cantar victoria antes de tiempo, que es lo que después obliga a mandar un segundo aviso peor.

Antes de seguir, predecí

Durante un incidente escribís un mensaje con la causa raíz que sospechás. ¿Conviene?

El postmortem: sobre el sistema, no sobre la persona

La regla que define un postmortem sin culpables —blameless— es gramatical antes que cultural: el sujeto de las oraciones es el sistema, no la gente. Cambiar el sujeto cambia lo que se busca arreglar.

Con culpableSin culpableQué cambia
Juan deployed a bad configA config change with an invalid timeout reached productionDeja de buscarse una persona y se busca un cambio
The on-call engineer did not notice the alertThe alert fired to a channel nobody was watching at nightLa pregunta pasa a ser por qué la alerta iba ahí
Someone forgot to run the migrationDeploys do not verify that migrations have runAparece un arreglo posible; con «forgot», no hay ninguno
The team should be more carefulThere is no staging environment with production-like dataLo primero no es accionable; lo segundo es una tarea
Si la acción correctiva es «tener más cuidado», el postmortem está mal escrito: eso no es una acción, es un deseo.

Plantilla

Postmortem

Summary

One paragraph: what broke, for how long, and who was affected. "Between 13:52 and 15:10 UTC, about 5% of checkout attempts failed."

Escrito para alguien que no estuvo. Es la parte que va a leer la mayoría, y muchas veces la única.

Impact

Numbers: failed requests, affected customers, revenue, support tickets.

Los números evitan la discusión sobre si fue grave. También justifican el tiempo que se invierta en arreglarlo.

Timeline (UTC)

13:52 — config change deployed. 14:04 — error rate alert fires. 14:20 — on-call acknowledges. 15:10 — rollback completed.

Hechos con hora, sin interpretación. La distancia entre que algo rompe y que alguien se entera suele ser el hallazgo más importante.

Root cause

What in the system allowed this: "The deploy pipeline does not validate timeout values, and the config schema allows any integer."

Causa del sistema, no de la persona. Casi siempre hay más de una y conviene listarlas.

What went well

The alert fired within 12 minutes; the rollback procedure worked as documented.

No es consuelo: es lo que hay que proteger cuando se cambien cosas después.

Action items

Each one with an owner and a date: "Validate config against a schema in CI — @team-platform — Oct 10."

Sin responsable y sin fecha, un postmortem es un texto. Con eso, es un plan.

Los tiempos verbales: el resumen y la línea de tiempo en pasado, la causa raíz en presente (el sistema sigue siendo así hasta que se arregle), y las acciones en infinitivo.

Practicalo

Reescribilo

Una actualización de incidente escrita en caliente: empieza por la causa, no dice a quién afecta y busca un culpable. Reescribila con impacto, estado, acción y próxima actualización.

guys the DB is dying because someone deployed a change with a wrong timeout, I think it was the config from yesterday. we are looking at it, I will let you know when I know something

Las dos empiezan igual y ninguna nombra a nadie. Durante el incidente, quién lo desplegó no cambia nada de lo que hay que hacer.

  • outage

    /ˈaʊtɪdʒ/ · suena como áutich

    Error común: decir «autéich»

  • severity

    /sɪˈverəti/ · suena como sevériti

    Error común: decir «severíti», corriendo el acento

  • rollback

    /ˈrəʊlbæk/ · suena como róulbak

    Error común: decir «rólbak», con o corta

  • root cause

    /ruːt kɔːz/ · suena como rut kóoz

    Error común: decir «rut káus», con diptongo

  • postmortem

    /pəʊstˈmɔːtəm/ · suena como poustmórtem

    Error común: acentuar «póstmortem» como en español

Estas cinco aparecen en la primera reunión de incidente a la que entres.

Lo que preguntan sobre esto

En la práctica

Cierre

Autoevaluación

¿Lo entendiste?

¿Por qué el impacto va antes que la causa en una actualización de incidente?
¿Qué significa el estado «monitoring»?
¿Qué cambia gramaticalmente un postmortem sin culpables?
¿Cuándo una acción correctiva está mal escrita?