DevOps

Alerting e Incident Response

Runbooks, paging, escalation, gestión de incidentes, prácticas on-call, postmortems, troubleshooting de alertas

20 preguntas de entrevista·
Mid-Level
1

¿Qué es un runbook en el contexto DevOps?

Respuesta

Un runbook es un documento operativo que contiene procedimientos estandarizados para gestionar incidentes o tareas de mantenimiento recurrentes. Permite a los equipos on-call seguir pasos predefinidos y validados para resolver rápidamente problemas conocidos, reduciendo así el tiempo de resolución y los errores humanos. Los runbooks pueden ser manuales o automatizados y constituyen un elemento fundamental de la gestión de incidentes.

2

¿Qué es el paging en el contexto de la gestión de incidentes?

Respuesta

El paging es el mecanismo de alerta que notifica a los ingenieros on-call cuando ocurre un incidente crítico. Este sistema utiliza varios canales de comunicación como SMS, llamadas telefónicas o aplicaciones dedicadas para garantizar que la persona responsable sea alertada rápidamente, incluso fuera del horario laboral. Un buen sistema de paging incluye políticas de escalation automáticas si la primera persona no responde.

3

¿Qué es un postmortem en el contexto de la gestión de incidentes?

Respuesta

Un postmortem es un análisis retrospectivo realizado después de un incidente significativo. Su objetivo es comprender las causas raíz del incidente, documentar la cronología de los eventos, identificar acciones correctivas y compartir los aprendizajes con el equipo. Un postmortem efectivo adopta un enfoque blameless, centrado en mejorar sistemas y procesos en lugar de la responsabilidad individual.

4

¿Cuál es la diferencia entre un event y un incident?

5

¿Qué significa MTTA (Mean Time To Acknowledge)?

+17 preguntas de entrevista

Otros temas de entrevista DevOps

Domina DevOps para tu próxima entrevista

Accede a todas las preguntas, flashcards, tests técnicos, ejercicios de code review y simuladores de entrevista.

Empieza gratis