DevOps

Alerting e Incident Response

Runbook, paging, escalation, gestione degli incidenti, pratiche on-call, postmortem, troubleshooting degli alert

20 domande da colloquio·
Mid-Level
1

Cos'è un runbook nel contesto DevOps?

Risposta

Un runbook è un documento operativo che contiene procedure standardizzate per gestire incidenti o attività di manutenzione ricorrenti. Consente ai team on-call di seguire passaggi predefiniti e validati per risolvere rapidamente problemi noti, riducendo così il tempo di risoluzione e gli errori umani. I runbook possono essere manuali o automatizzati e rappresentano un elemento fondamentale della gestione degli incidenti.

2

Cos'è il paging nel contesto della gestione degli incidenti?

Risposta

Il paging è il meccanismo di alerting che notifica gli ingegneri on-call quando si verifica un incidente critico. Questo sistema utilizza vari canali di comunicazione come SMS, chiamate telefoniche o applicazioni dedicate per garantire che la persona responsabile venga avvisata rapidamente, anche al di fuori dell'orario di lavoro. Un buon sistema di paging include politiche di escalation automatica se la prima persona non risponde.

3

Cos'è un postmortem nel contesto della gestione degli incidenti?

Risposta

Un postmortem è un'analisi retrospettiva condotta dopo un incidente significativo. Il suo obiettivo è comprendere le cause profonde dell'incidente, documentare la cronologia degli eventi, identificare azioni correttive e condividere gli insegnamenti con il team. Un postmortem efficace adotta un approccio blameless, focalizzato sul miglioramento dei sistemi e dei processi piuttosto che sulla responsabilità individuale.

4

Qual è la differenza tra un event e un incident?

5

Cosa significa MTTA (Mean Time To Acknowledge)?

+17 domande da colloquio

Padroneggia DevOps per il tuo prossimo colloquio

Accedi a tutte le domande, flashcards, test tecnici, esercizi di code review e simulatori di colloquio.

Inizia gratis