DevOps

Alerting & Incident Response

Runbooks, Paging, Eskalation, Incident-Management, On-Call-Praktiken, Postmortems, Alert-Troubleshooting

20 Interview-Fragen·
Mid-Level
1

Was ist ein Runbook im DevOps-Kontext?

Antwort

Ein Runbook ist ein operatives Dokument, das standardisierte Verfahren zur Behandlung von Incidents oder wiederkehrenden Wartungsaufgaben enthält. Es ermöglicht On-Call-Teams, vordefinierte und validierte Schritte zu befolgen, um bekannte Probleme schnell zu lösen, und reduziert dadurch die Lösungszeit und menschliche Fehler. Runbooks können manuell oder automatisiert sein und sind ein grundlegendes Element des Incident-Managements.

2

Was ist Paging im Kontext des Incident-Managements?

Antwort

Paging ist der Alarmierungsmechanismus, der On-Call-Engineers benachrichtigt, wenn ein kritischer Incident auftritt. Dieses System nutzt verschiedene Kommunikationskanäle wie SMS, Telefonanrufe oder dedizierte Anwendungen, um sicherzustellen, dass die verantwortliche Person auch außerhalb der Arbeitszeiten schnell alarmiert wird. Ein gutes Paging-System umfasst automatische Eskalationsrichtlinien, falls die erste Person nicht antwortet.

3

Was ist ein Postmortem im Kontext des Incident-Managements?

Antwort

Ein Postmortem ist eine retrospektive Analyse, die nach einem signifikanten Incident durchgeführt wird. Sein Ziel ist es, die Grundursachen des Incidents zu verstehen, die Zeitleiste der Ereignisse zu dokumentieren, Korrekturmaßnahmen zu identifizieren und Erkenntnisse mit dem Team zu teilen. Ein effektives Postmortem verfolgt einen Blameless-Ansatz, der sich auf die Verbesserung von Systemen und Prozessen statt auf individuelle Verantwortung konzentriert.

4

Was ist der Unterschied zwischen einem Event und einem Incident?

5

Was bedeutet MTTA (Mean Time To Acknowledge)?

+17 Interview-Fragen

Meistere DevOps für dein nächstes Interview

Zugang zu allen Fragen, Flashcards, technischen Tests, Code-Review-Übungen und Interview-Simulatoren.

Kostenlos starten