ForgeNEX Logo

Runbook de guardia on-call de TI: escalado y relevo

Guía para organizar guardias on-call de TI, clasificar alertas, mitigar impacto, escalar incidentes y transferir pendientes al siguiente turno con trazabilidad.

FORGENEX SOLUTIONS S.L.U.

Consultor Senior IT

Actualizado: 21 Sep, 2026
2 min de lectura
Runbook de guardia on-call de TI: escalado y relevo

Lo que aprenderás en esta guía

Este es un artículo técnico y profundo redactado por los ingenieros de ForgeNEX. Está diseñado para profesionales que buscan implementar soluciones sólidas y evitar los errores comunes que cuestan horas de producción.

Una guardia necesita límites y contexto

Una persona de guardia no debería tener que descubrir durante una interrupción qué servicio está afectado, quién puede autorizar una acción o cuándo pedir ayuda. El runbook convierte alertas conocidas en pasos seguros y define cómo transferir la responsabilidad entre turnos. La guía de Google SRE sobre trabajo on-call destaca responsabilidades, lectura del relevo, mitigación inicial y playbooks asociados a alertas; adapta sus prácticas al tamaño y al riesgo de cada organización.

Ficha del servicio

Antes de activar la rotación, completa:

Campo Valor a documentar
Servicio y propietario Nombre, responsable de negocio y responsable técnico
Cobertura Horario, calendario, respaldo y método de contacto
Alcance Sistemas cubiertos y límites del equipo de guardia
Severidad Impacto, urgencia, usuarios y criterio para cada nivel
Escalado Segundo nivel, proveedor, dirección y autoridad de decisión
Acciones seguras Diagnóstico, mitigaciones autorizadas y acciones prohibidas
Relevo Canal, formato, asuntos abiertos y confirmación de recepción

Secuencia de respuesta

  1. Validar la señal: consulta alerta, servicio afectado, hora, tendencia y cambios recientes. Evita reiniciar componentes solo para silenciar el monitor.
  2. Determinar impacto: registra usuarios, procesos, sedes y degradación. Comunica incertidumbre con claridad.
  3. Mitigar dentro de autorización: sigue el playbook; si no aplica o aumenta el riesgo, detente y escala.
  4. Coordinar: asigna una persona responsable del incidente, una de comunicaciones y especialistas según necesidad.
  5. Actualizar: informa qué cambió, qué sigue afectado y cuándo será el siguiente aviso.
  6. Cerrar o transferir: verifica recuperación con señales del servicio, registra acciones y entrega asuntos pendientes al siguiente turno.

Plantilla de relevo

Servicio / incidente:
Estado y severidad actual:
Impacto confirmado y pendiente de confirmar:
Últimas acciones y resultado:
Riesgos o cambios activos:
Próxima acción / responsable / plazo:
Personas notificadas y siguiente actualización:
Enlaces a ticket, panel y runbook:

Define un límite de tiempo o condición para escalar, una cobertura secundaria y un mecanismo para detener la rotación si falta capacidad. Revisa carga y falsos positivos de manera periódica; una guardia sostenible no depende de disponibilidad indefinida. Tras un incidente mayor, usa la plantilla de postmortem SRE y actualiza la preparación operativa del servicio.

¿Demasiado complejo para tu equipo?

En ForgeNEX gestionamos este tipo de soluciones tecnológicas todos los días. Evita riesgos y delega la implementación en nuestros expertos.

  • Respuesta en menos de 2 horas
  • Auditamos tu caso sin compromiso
  • Expertos certificados

Una forma práctica de avanzar

Revisamos el punto de partida, proponemos el siguiente paso y te acompañamos para ponerlo en marcha.

Entender la necesidad
antes de recomendar una solución
Ordenar el siguiente paso
con una propuesta fácil de entender
Acompañar la puesta en marcha
para que el cambio se sostenga

Otras soluciones tecnológicas

Software de Gestión (ERP/CRM) Ver solución → CRM para Telecomunicaciones Ver solución → Software para Empresas de Seguridad Ver solución →