
Principios de SRE
SLIs, SLOs, SLAs, error budgets, reducción de toil, gestión de incidentes, on-call, blameless postmortems
1¿Qué es un SLI (Service Level Indicator) en SRE?
¿Qué es un SLI (Service Level Indicator) en SRE?
Respuesta
Un SLI (Service Level Indicator) es una métrica cuantitativa que mide un aspecto específico del nivel de servicio brindado a los usuarios. Los SLIs típicos incluyen la disponibilidad (uptime), la latency (tiempo de respuesta), el error rate o el throughput. Estos indicadores se miden de forma objetiva mediante sistemas de monitoring y sirven de base para definir los SLOs. Por ejemplo, un SLI de disponibilidad podría ser el porcentaje de requests HTTP exitosas (códigos 2xx) sobre el total de requests.
2¿Cuál es la principal diferencia entre un SLO y un SLA?
¿Cuál es la principal diferencia entre un SLO y un SLA?
Respuesta
Un SLO (Service Level Objective) es un objetivo interno de nivel de servicio definido por el equipo para guiar los esfuerzos de SRE, sin consecuencias legales. Un SLA (Service Level Agreement) es un contrato formal con el cliente que incluye consecuencias (reembolsos, penalizaciones) si no se cumplen los objetivos. El SLO suele ser más estricto que el SLA para crear un buffer de seguridad y evitar violaciones del SLA. Por ejemplo, un SLO de 99.9% con un SLA de 99.5% proporciona un margen de seguridad.
3¿Qué es un error budget en SRE?
¿Qué es un error budget en SRE?
Respuesta
Un error budget es la cantidad aceptable de fallos o indisponibilidad de un servicio durante un período dado. Se calcula como la diferencia entre 100% y el SLO. Por ejemplo, con un SLO de 99.9%, el error budget es de 0.1% (es decir, alrededor de 43 minutos de downtime al mes). Este error budget permite equilibrar innovación y fiabilidad: mientras quede presupuesto, el equipo puede desplegar nuevas funcionalidades rápidamente. Si se agota, hay que centrarse en la estabilidad y posponer los releases.
¿Cómo calcular el error budget restante de un servicio?
¿Qué hacer cuando se agota el error budget de un servicio?
+21 preguntas de entrevista
Otros temas de entrevista DevOps
Control de versiones & Git
Fundamentos de Linux
Shell Scripting & Bash
Fundamentos de Networking
Fundamentos de Docker
Fundamentos de CI/CD
GitHub Actions
GitLab CI/CD
Jenkins
Fundamentos de Kubernetes
Networking de Kubernetes
Kubernetes Avanzado
Ingress & API Gateway
Fundamentos de Terraform
Terraform Avanzado
Ansible & Configuration Management
Fundamentos de AWS
Fundamentos de Azure
Fundamentos de GCP
Monitoreo y Prometheus
Logging & ELK Stack
Alerting e Incident Response
Cloud Identity & Secrets
Seguridad de Pipelines CI/CD
Helm & Kubernetes
Seguridad Runtime y Cluster
Container Supply Chain Security
Service Mesh & Istio
GitOps & ArgoCD
Progressive Delivery
Observabilidad Distribuida
Disaster Recovery & Backup
Optimización del Rendimiento
Optimización de Costos en la Nube
Chaos Engineering
Platform Engineering
Domina DevOps para tu próxima entrevista
Accede a todas las preguntas, flashcards, tests técnicos, ejercicios de code review y simuladores de entrevista.
Empieza gratis