
Nguyên tắc SRE
SLI, SLO, SLA, error budget, giảm toil, quản lý sự cố, on-call, blameless postmortem
1SLI (Service Level Indicator) trong SRE là gì?
SLI (Service Level Indicator) trong SRE là gì?
Câu trả lời
SLI (Service Level Indicator) là một chỉ số định lượng đo lường một khía cạnh cụ thể của mức độ dịch vụ cung cấp cho người dùng. Các SLI điển hình bao gồm tính khả dụng (uptime), latency (thời gian phản hồi), error rate hoặc throughput. Các chỉ số này được đo lường khách quan bởi hệ thống monitoring và là nền tảng để định nghĩa các SLO. Ví dụ, một SLI về tính khả dụng có thể là tỷ lệ phần trăm các request HTTP thành công (mã 2xx) trên tổng số request.
2Sự khác biệt chính giữa SLO và SLA là gì?
Sự khác biệt chính giữa SLO và SLA là gì?
Câu trả lời
SLO (Service Level Objective) là mục tiêu mức độ dịch vụ nội bộ do nhóm định nghĩa để định hướng các nỗ lực SRE, không có hậu quả pháp lý. SLA (Service Level Agreement) là hợp đồng chính thức với khách hàng bao gồm hậu quả (hoàn tiền, phạt) nếu mục tiêu không đạt được. SLO thường nghiêm ngặt hơn SLA để tạo ra một bộ đệm an toàn và tránh vi phạm SLA. Ví dụ, SLO 99,9% với SLA 99,5% mang lại một biên độ an toàn.
3Error budget trong SRE là gì?
Error budget trong SRE là gì?
Câu trả lời
Error budget là lượng lỗi hoặc thời gian không khả dụng chấp nhận được của một dịch vụ trong một khoảng thời gian nhất định. Nó được tính bằng chênh lệch giữa 100% và SLO. Ví dụ, với SLO 99,9%, error budget là 0,1% (tức khoảng 43 phút downtime mỗi tháng). Error budget này cho phép cân bằng giữa đổi mới và độ tin cậy: chừng nào còn ngân sách, nhóm có thể triển khai tính năng mới nhanh chóng. Nếu cạn kiệt, cần tập trung vào sự ổn định và hoãn các release.
Làm thế nào để tính error budget còn lại cho một dịch vụ?
Phải làm gì khi error budget của một dịch vụ cạn kiệt?
+21 câu hỏi phỏng vấn
Các chủ đề phỏng vấn DevOps khác
Quản lý phiên bản & Git
Cơ bản về Linux
Shell Scripting & Bash
Cơ bản về Networking
Kiến thức cơ bản về Docker
Nền tảng CI/CD
GitHub Actions
GitLab CI/CD
Jenkins
Kiến thức cơ bản về Kubernetes
Networking Kubernetes
Kubernetes Nâng cao
Ingress & API Gateway
Cơ bản về Terraform
Terraform Nâng cao
Ansible & Configuration Management
Kiến thức cơ bản AWS
Kiến thức cơ bản về Azure
Nền tảng GCP
Monitoring và Prometheus
Logging & ELK Stack
Alerting & Incident Response
Cloud Identity & Secrets
Bảo mật Pipeline CI/CD
Helm & Kubernetes
Bảo mật Runtime & Cluster
Container Supply Chain Security
Service Mesh & Istio
GitOps & ArgoCD
Progressive Delivery
Khả năng quan sát phân tán
Disaster Recovery & Backup
Tối ưu hóa hiệu suất
Tối ưu Chi phí Cloud
Chaos Engineering
Platform Engineering
Nắm vững DevOps cho lần phỏng vấn tiếp theo
Truy cập tất cả câu hỏi, flashcards, bài kiểm tra kỹ thuật, bài tập code review và mô phỏng phỏng vấn.
Bắt đầu miễn phí