DevOps

Alerting e Incident Response

Runbooks, paging, escalation, gestão de incidentes, práticas on-call, postmortems, troubleshooting de alertas

20 perguntas de entrevista·
Mid-Level
1

O que é um runbook no contexto DevOps?

Resposta

Um runbook é um documento operacional que contém procedimentos padronizados para lidar com incidentes ou tarefas de manutenção recorrentes. Permite que as equipes on-call sigam etapas predefinidas e validadas para resolver rapidamente problemas conhecidos, reduzindo assim o tempo de resolução e os erros humanos. Os runbooks podem ser manuais ou automatizados e constituem um elemento fundamental da gestão de incidentes.

2

O que é paging no contexto da gestão de incidentes?

Resposta

Paging é o mecanismo de alerta que notifica engenheiros on-call quando ocorre um incidente crítico. Este sistema utiliza diversos canais de comunicação como SMS, chamadas telefônicas ou aplicações dedicadas para garantir que a pessoa responsável seja alertada rapidamente, mesmo fora do horário de trabalho. Um bom sistema de paging inclui políticas de escalation automática se a primeira pessoa não responder.

3

O que é um postmortem no contexto da gestão de incidentes?

Resposta

Um postmortem é uma análise retrospectiva realizada após um incidente significativo. Seu objetivo é entender as causas raiz do incidente, documentar a linha do tempo dos eventos, identificar ações corretivas e compartilhar os aprendizados com a equipe. Um postmortem eficaz adota uma abordagem blameless, focada em melhorar sistemas e processos em vez de responsabilidade individual.

4

Qual é a diferença entre um event e um incident?

5

O que significa MTTA (Mean Time To Acknowledge)?

+17 perguntas de entrevista

Outros temas de entrevista DevOps

Domine DevOps para sua proxima entrevista

Acesse todas as perguntas, flashcards, testes tecnicos, exercicios de code review e simuladores de entrevista.

Comece gratis