
หลักการ SRE
SLI, SLO, SLA, error budget, การลด toil, การจัดการเหตุการณ์, on-call, blameless postmortem
1SLI (Service Level Indicator) ใน SRE คืออะไร?
SLI (Service Level Indicator) ใน SRE คืออะไร?
คำตอบ
SLI (Service Level Indicator) คือเมตริกเชิงปริมาณที่วัดแง่มุมเฉพาะของระดับบริการที่มอบให้แก่ผู้ใช้ SLI ทั่วไปได้แก่ ความพร้อมใช้งาน (uptime), latency (เวลาตอบสนอง), error rate หรือ throughput ตัวบ่งชี้เหล่านี้ถูกวัดอย่างเป็นกลางโดยระบบ monitoring และเป็นพื้นฐานสำหรับการกำหนด SLO ตัวอย่างเช่น SLI ของความพร้อมใช้งานอาจเป็นเปอร์เซ็นต์ของ request HTTP ที่สำเร็จ (โค้ด 2xx) จากจำนวน request ทั้งหมด
2ความแตกต่างหลักระหว่าง SLO และ SLA คืออะไร?
ความแตกต่างหลักระหว่าง SLO และ SLA คืออะไร?
คำตอบ
SLO (Service Level Objective) คือเป้าหมายระดับบริการภายในที่ทีมกำหนดเพื่อนำทางความพยายามของ SRE โดยไม่มีผลทางกฎหมาย SLA (Service Level Agreement) คือสัญญาอย่างเป็นทางการกับลูกค้าที่รวมถึงผลที่ตามมา (การคืนเงิน บทลงโทษ) หากไม่บรรลุเป้าหมาย โดยทั่วไป SLO จะเข้มงวดกว่า SLA เพื่อสร้างบัฟเฟอร์ด้านความปลอดภัยและหลีกเลี่ยงการละเมิด SLA ตัวอย่างเช่น SLO 99.9% กับ SLA 99.5% ให้ส่วนเผื่อด้านความปลอดภัย
3error budget ใน SRE คืออะไร?
error budget ใน SRE คืออะไร?
คำตอบ
error budget คือปริมาณความล้มเหลวหรือความไม่พร้อมใช้งานของบริการที่ยอมรับได้ในช่วงเวลาที่กำหนด คำนวณเป็นผลต่างระหว่าง 100% และ SLO ตัวอย่างเช่น ด้วย SLO 99.9% error budget คือ 0.1% (ประมาณ 43 นาทีของ downtime ต่อเดือน) error budget นี้ช่วยสร้างสมดุลระหว่างนวัตกรรมและความน่าเชื่อถือ ตราบใดที่ยังมีงบประมาณเหลือ ทีมสามารถ deploy ฟีเจอร์ใหม่ได้อย่างรวดเร็ว หากหมดลง ต้องหันมาเน้นความเสถียรและเลื่อน release ออกไป
จะคำนวณ error budget ที่เหลือสำหรับบริการได้อย่างไร?
ควรทำอย่างไรเมื่อ error budget ของบริการหมดลง?
+21 คำถามสัมภาษณ์
หัวข้อสัมภาษณ์ DevOps อื่นๆ
การควบคุมเวอร์ชัน & Git
พื้นฐาน Linux
Shell Scripting & Bash
พื้นฐาน Networking
พื้นฐาน Docker
พื้นฐาน CI/CD
GitHub Actions
GitLab CI/CD
Jenkins
พื้นฐาน Kubernetes
Networking ของ Kubernetes
Kubernetes ขั้นสูง
Ingress & API Gateway
พื้นฐาน Terraform
Terraform ขั้นสูง
Ansible & Configuration Management
พื้นฐาน AWS
พื้นฐาน Azure
พื้นฐาน GCP
การมอนิเตอร์และ Prometheus
Logging & ELK Stack
Alerting & Incident Response
Cloud Identity & Secrets
ความปลอดภัยของ CI/CD Pipeline
Helm & Kubernetes
ความปลอดภัย Runtime และ Cluster
Container Supply Chain Security
Service Mesh & Istio
GitOps & ArgoCD
Progressive Delivery
Observability แบบกระจาย
Disaster Recovery & Backup
การปรับแต่งประสิทธิภาพ
การเพิ่มประสิทธิภาพต้นทุน Cloud
Chaos Engineering
Platform Engineering
เชี่ยวชาญ DevOps สำหรับการสัมภาษณ์ครั้งถัดไป
เข้าถึงคำถามทั้งหมด flashcards แบบทดสอบเทคนิค แบบฝึกหัด code review และตัวจำลองสัมภาษณ์
เริ่มใช้ฟรี