
Alerting e Incident Response
Runbooks, paging, escalation, gestión de incidentes, prácticas on-call, postmortems, troubleshooting de alertas
1¿Qué es un runbook en el contexto DevOps?
¿Qué es un runbook en el contexto DevOps?
Respuesta
Un runbook es un documento operativo que contiene procedimientos estandarizados para gestionar incidentes o tareas de mantenimiento recurrentes. Permite a los equipos on-call seguir pasos predefinidos y validados para resolver rápidamente problemas conocidos, reduciendo así el tiempo de resolución y los errores humanos. Los runbooks pueden ser manuales o automatizados y constituyen un elemento fundamental de la gestión de incidentes.
2¿Qué es el paging en el contexto de la gestión de incidentes?
¿Qué es el paging en el contexto de la gestión de incidentes?
Respuesta
El paging es el mecanismo de alerta que notifica a los ingenieros on-call cuando ocurre un incidente crítico. Este sistema utiliza varios canales de comunicación como SMS, llamadas telefónicas o aplicaciones dedicadas para garantizar que la persona responsable sea alertada rápidamente, incluso fuera del horario laboral. Un buen sistema de paging incluye políticas de escalation automáticas si la primera persona no responde.
3¿Qué es un postmortem en el contexto de la gestión de incidentes?
¿Qué es un postmortem en el contexto de la gestión de incidentes?
Respuesta
Un postmortem es un análisis retrospectivo realizado después de un incidente significativo. Su objetivo es comprender las causas raíz del incidente, documentar la cronología de los eventos, identificar acciones correctivas y compartir los aprendizajes con el equipo. Un postmortem efectivo adopta un enfoque blameless, centrado en mejorar sistemas y procesos en lugar de la responsabilidad individual.
¿Cuál es la diferencia entre un event y un incident?
¿Qué significa MTTA (Mean Time To Acknowledge)?
+17 preguntas de entrevista
Otros temas de entrevista DevOps
Control de versiones & Git
Fundamentos de Linux
Shell Scripting & Bash
Fundamentos de Networking
Fundamentos de Docker
Fundamentos de CI/CD
GitHub Actions
GitLab CI/CD
Jenkins
Fundamentos de Kubernetes
Networking de Kubernetes
Kubernetes Avanzado
Ingress & API Gateway
Fundamentos de Terraform
Terraform Avanzado
Ansible & Configuration Management
Fundamentos de AWS
Fundamentos de Azure
Fundamentos de GCP
Monitoreo y Prometheus
Logging & ELK Stack
Cloud Identity & Secrets
Seguridad de Pipelines CI/CD
Helm & Kubernetes
Seguridad Runtime y Cluster
Container Supply Chain Security
Service Mesh & Istio
GitOps & ArgoCD
Progressive Delivery
Observabilidad Distribuida
Disaster Recovery & Backup
Optimización del Rendimiento
Optimización de Costos en la Nube
Principios de SRE
Chaos Engineering
Platform Engineering
Domina DevOps para tu próxima entrevista
Accede a todas las preguntas, flashcards, tests técnicos, ejercicios de code review y simuladores de entrevista.
Empieza gratis