DevOps

Zasady SRE

SLI, SLO, SLA, error budget, redukcja toil, zarządzanie incydentami, on-call, blameless postmortem

24 pytań z rozmów·
Senior
1

Czym jest SLI (Service Level Indicator) w SRE?

Odpowiedź

SLI (Service Level Indicator) to ilościowa metryka mierząca konkretny aspekt poziomu usługi dostarczanej użytkownikom. Typowe SLI obejmują dostępność (uptime), latency (czas odpowiedzi), error rate lub throughput. Wskaźniki te są obiektywnie mierzone przez systemy monitoring i stanowią podstawę do definiowania SLO. Na przykład SLI dostępności może być procentem udanych żądań HTTP (kody 2xx) względem wszystkich żądań.

2

Jaka jest główna różnica między SLO a SLA?

Odpowiedź

SLO (Service Level Objective) to wewnętrzny cel poziomu usługi definiowany przez zespół, aby kierować działaniami SRE, bez konsekwencji prawnych. SLA (Service Level Agreement) to formalna umowa z klientem, która obejmuje konsekwencje (zwroty, kary), jeśli cele nie zostaną osiągnięte. SLO jest zwykle bardziej rygorystyczne niż SLA, aby utworzyć bufor bezpieczeństwa i uniknąć naruszeń SLA. Na przykład SLO na poziomie 99,9% przy SLA 99,5% zapewnia margines bezpieczeństwa.

3

Czym jest error budget w SRE?

Odpowiedź

Error budget to akceptowalna ilość awarii lub niedostępności usługi w danym okresie. Oblicza się go jako różnicę między 100% a SLO. Na przykład przy SLO na poziomie 99,9% error budget wynosi 0,1% (czyli około 43 minut downtime miesięcznie). Ten error budget pozwala równoważyć innowacyjność i niezawodność: dopóki budżet pozostaje, zespół może szybko wdrażać nowe funkcje. Gdy się wyczerpie, należy skupić się na stabilności i odłożyć release.

4

Jak obliczyć pozostały error budget dla usługi?

5

Co robić, gdy error budget usługi zostanie wyczerpany?

+21 pytań z rozmów

Opanuj DevOps na następną rozmowę

Uzyskaj dostęp do wszystkich pytań, flashcards, testów technicznych, ćwiczeń code review i symulatorów rozmów.

Zacznij za darmo