~/blog $ git show 2026-09-17
Who Checks the Outside Check?
· 3 min read · Victor Benavides
--ops--incidentsLa semana pasada escribí sobre una alerta que se cerró sola mientras producción seguía caída, y sobre mover los chequeos de disponibilidad fuera del clúster. Un lector hizo la pregunta más directa posible: ¿cómo te aseguras de que esos chequeos externos sigan siendo confiables con el tiempo?
La respuesta honesta es: en parte. Antes de explicar por qué, debo una corrección.
Primero, una corrección
Ese post decía que las alertas de apagón ya no se resuelven solas y quedan abiertas hasta que una persona las cierra. Antes de escribir esto fui a revisar las reglas reales, y esa frase está mal. La resolución automática sigue encendida.
Lo que sí cambió es la lista de servicios de los que la alerta espera noticias. Antes era lo que hubiera reportado en las últimas dos horas, y así los servicios muertos salían de la lista en silencio y la alerta cantaba victoria. Esa lista ahora es fija. Un servicio muerto sigue siendo esperado, así que la alerta ya no puede cerrarse en falso. Sí se va a cerrar sola cuando la telemetría vuelva de verdad. El comportamiento peligroso desapareció, y yo describí el arreglo de forma incorrecta.
Lo que existe
Tres nombres públicos se prueban desde cuatro ubicaciones cada cinco minutos, con un servicio que no corre dentro del clúster que está probando. Cada prueba está conectada a una alerta. Si el sitio se cae, algo fuera de la falla lo nota.
Eso cierra la brecha de la caída. No responde la pregunta, porque la pregunta es sobre el siguiente eslabón de la cadena.
Cómo falla un chequeo externo
Sacar un chequeo afuera no lo vuelve inmortal. Solo le da otras formas de morir. Una prueba puede deshabilitarse durante algún cambio ajeno y nunca volver a habilitarse. La alerta puede apuntar a un canal de notificaciones que dejó de entregar hace meses. Una credencial en algún lado vence. El proveedor de monitoreo tiene su propia mala tarde.
Todas producen el mismo resultado, que es silencio. Y el silencio es como suena un sistema sano. Es la falla de los últimos dos posts, un nivel más afuera.
Hoy nada vigila a los chequeos. Esa es la brecha que encontró tu pregunta.
La respuesta que daría
Invertir lo que significa el silencio. Que el chequeo mande un latido periódico a algo separado, idealmente en otro proveedor y con otras credenciales, y alertar cuando el latido deja de llegar. Así el silencio es la alarma y no la señal de que todo va bien.
Más allá de eso, el hábito más confiable es el menos técnico: romperlo a propósito de vez en cuando y confirmar que la alarma de verdad suena. Si nunca viste una alerta dispararse, no sabes si puede hacerlo.
No voy a fingir que esto termina limpio. Siempre algo tiene que vigilar al vigilante, y en la práctica la cadena termina en un tercero cuyo negocio entero es mantenerse arriba, más una persona que revisa de vez en cuando. Tú eliges dónde termina. No consigues que termine sola.
Gracias por preguntar. Era la pregunta correcta, y la respuesta verdadera fue más útil que la que habría dado sin revisar.