
SRE-Prinzipien
SLIs, SLOs, SLAs, Error Budgets, Toil-Reduzierung, Incident Management, On-Call, Blameless Postmortems
1Was ist ein SLI (Service Level Indicator) in SRE?
Was ist ein SLI (Service Level Indicator) in SRE?
Antwort
Ein SLI (Service Level Indicator) ist eine quantitative Metrik, die einen bestimmten Aspekt des den Nutzern bereitgestellten Service-Levels misst. Typische SLIs umfassen Verfügbarkeit (Uptime), Latency (Antwortzeit), Error Rate oder Throughput. Diese Indikatoren werden objektiv von Monitoring-Systemen gemessen und dienen als Grundlage für die Definition von SLOs. Beispielsweise könnte ein Verfügbarkeits-SLI der Prozentsatz erfolgreicher HTTP-Requests (2xx-Codes) an den Gesamt-Requests sein.
2Was ist der Hauptunterschied zwischen einem SLO und einem SLA?
Was ist der Hauptunterschied zwischen einem SLO und einem SLA?
Antwort
Ein SLO (Service Level Objective) ist ein internes Service-Level-Ziel, das vom Team zur Steuerung der SRE-Bemühungen definiert wird, ohne rechtliche Konsequenzen. Ein SLA (Service Level Agreement) ist ein formaler Vertrag mit dem Kunden, der Konsequenzen (Rückerstattungen, Strafen) enthält, wenn Ziele nicht erreicht werden. Das SLO ist in der Regel strenger als das SLA, um einen Sicherheitspuffer zu schaffen und SLA-Verletzungen zu vermeiden. Ein SLO von 99,9 % bei einem SLA von 99,5 % bietet beispielsweise einen Sicherheitsspielraum.
3Was ist ein Error Budget in SRE?
Was ist ein Error Budget in SRE?
Antwort
Ein Error Budget ist die akzeptable Menge an Ausfällen oder Nichtverfügbarkeit eines Service über einen bestimmten Zeitraum. Es wird als Differenz zwischen 100 % und dem SLO berechnet. Bei einem SLO von 99,9 % beträgt das Error Budget beispielsweise 0,1 % (etwa 43 Minuten Downtime pro Monat). Dieses Error Budget ermöglicht es, Innovation und Zuverlässigkeit auszubalancieren: Solange Budget verfügbar ist, kann das Team schnell neue Features bereitstellen. Ist es aufgebraucht, muss der Fokus auf Stabilität verlagert und Releases verschoben werden.
Wie berechnet man das verbleibende Error Budget für einen Service?
Was tun, wenn das Error Budget eines Service aufgebraucht ist?
+21 Interview-Fragen
Weitere DevOps-Interviewthemen
Versionskontrolle & Git
Linux-Grundlagen
Shell Scripting & Bash
Networking-Grundlagen
Docker-Grundlagen
CI/CD-Grundlagen
GitHub Actions
GitLab CI/CD
Jenkins
Kubernetes-Grundlagen
Kubernetes-Networking
Kubernetes Fortgeschritten
Ingress & API Gateway
Terraform-Grundlagen
Terraform Fortgeschritten
Ansible & Configuration Management
AWS-Grundlagen
Azure-Grundlagen
GCP-Grundlagen
Monitoring & Prometheus
Logging & ELK Stack
Alerting & Incident Response
Cloud Identity & Secrets
CI/CD-Pipeline-Sicherheit
Helm & Kubernetes
Runtime- und Cluster-Sicherheit
Container Supply Chain Security
Service Mesh & Istio
GitOps & ArgoCD
Progressive Delivery
Verteilte Observability
Disaster Recovery & Backup
Performance-Optimierung
Cloud-Kostenoptimierung
Chaos Engineering
Platform Engineering
Meistere DevOps für dein nächstes Interview
Zugang zu allen Fragen, Flashcards, technischen Tests, Code-Review-Übungen und Interview-Simulatoren.
Kostenlos starten