
Princípios de SRE
SLIs, SLOs, SLAs, error budgets, redução de toil, gerenciamento de incidentes, on-call, blameless postmortems
1O que é um SLI (Service Level Indicator) em SRE?
O que é um SLI (Service Level Indicator) em SRE?
Resposta
Um SLI (Service Level Indicator) é uma métrica quantitativa que mede um aspecto específico do nível de serviço fornecido aos usuários. SLIs típicos incluem disponibilidade (uptime), latency (tempo de resposta), error rate ou throughput. Esses indicadores são medidos de forma objetiva por sistemas de monitoring e servem de base para definir os SLOs. Por exemplo, um SLI de disponibilidade poderia ser a porcentagem de requisições HTTP bem-sucedidas (códigos 2xx) sobre o total de requisições.
2Qual é a principal diferença entre um SLO e um SLA?
Qual é a principal diferença entre um SLO e um SLA?
Resposta
Um SLO (Service Level Objective) é uma meta interna de nível de serviço definida pela equipe para guiar os esforços de SRE, sem consequências legais. Um SLA (Service Level Agreement) é um contrato formal com o cliente que inclui consequências (reembolsos, penalidades) caso as metas não sejam cumpridas. O SLO costuma ser mais rígido que o SLA para criar um buffer de segurança e evitar violações de SLA. Por exemplo, um SLO de 99.9% com um SLA de 99.5% oferece uma margem de segurança.
3O que é um error budget em SRE?
O que é um error budget em SRE?
Resposta
Um error budget é a quantidade aceitável de falhas ou indisponibilidade de um serviço durante um período determinado. É calculado como a diferença entre 100% e o SLO. Por exemplo, com um SLO de 99.9%, o error budget é de 0.1% (ou seja, cerca de 43 minutos de downtime por mês). Esse error budget permite equilibrar inovação e confiabilidade: enquanto houver orçamento, a equipe pode implantar novas funcionalidades rapidamente. Se esgotado, o foco deve passar para a estabilidade e os releases devem ser adiados.
Como calcular o error budget restante de um serviço?
O que fazer quando o error budget de um serviço se esgota?
+21 perguntas de entrevista
Outros temas de entrevista DevOps
Controle de versão & Git
Fundamentos do Linux
Shell Scripting & Bash
Fundamentos de Redes
Fundamentos do Docker
Fundamentos de CI/CD
GitHub Actions
GitLab CI/CD
Jenkins
Fundamentos do Kubernetes
Networking de Kubernetes
Kubernetes Avançado
Ingress & API Gateway
Fundamentos do Terraform
Terraform Avançado
Ansible & Configuration Management
Fundamentos do AWS
Fundamentos do Azure
Fundamentos do GCP
Monitoramento e Prometheus
Logging & ELK Stack
Alerting e Incident Response
Cloud Identity & Secrets
Segurança de Pipelines CI/CD
Helm & Kubernetes
Segurança Runtime e Cluster
Container Supply Chain Security
Service Mesh & Istio
GitOps & ArgoCD
Progressive Delivery
Observabilidade Distribuída
Disaster Recovery & Backup
Otimização de Desempenho
Otimização de Custos na Nuvem
Chaos Engineering
Platform Engineering
Domine DevOps para sua proxima entrevista
Acesse todas as perguntas, flashcards, testes tecnicos, exercicios de code review e simuladores de entrevista.
Comece gratis