
Alerting & Incident Response
Runbooks, paging, escalation, quản lý sự cố, thực hành on-call, postmortems, troubleshooting cảnh báo
1Runbook trong ngữ cảnh DevOps là gì?
Runbook trong ngữ cảnh DevOps là gì?
Câu trả lời
Runbook là một tài liệu vận hành chứa các quy trình chuẩn hóa để xử lý sự cố hoặc các tác vụ bảo trì lặp lại. Nó cho phép các nhóm on-call tuân theo các bước được xác định trước và đã được xác thực để giải quyết nhanh chóng các vấn đề đã biết, do đó giảm thời gian giải quyết và lỗi của con người. Runbook có thể là thủ công hoặc tự động và là một yếu tố cơ bản của quản lý sự cố.
2Paging trong ngữ cảnh quản lý sự cố là gì?
Paging trong ngữ cảnh quản lý sự cố là gì?
Câu trả lời
Paging là cơ chế cảnh báo thông báo cho các kỹ sư on-call khi xảy ra sự cố nghiêm trọng. Hệ thống này sử dụng nhiều kênh giao tiếp như SMS, cuộc gọi điện thoại hoặc các ứng dụng chuyên dụng để đảm bảo người chịu trách nhiệm được cảnh báo nhanh chóng, ngay cả ngoài giờ làm việc. Một hệ thống paging tốt bao gồm các chính sách escalation tự động nếu người đầu tiên không phản hồi.
3Postmortem trong ngữ cảnh quản lý sự cố là gì?
Postmortem trong ngữ cảnh quản lý sự cố là gì?
Câu trả lời
Postmortem là một phân tích hồi cứu được thực hiện sau một sự cố quan trọng. Mục tiêu của nó là hiểu các nguyên nhân gốc rễ của sự cố, ghi lại dòng thời gian của các sự kiện, xác định các hành động khắc phục và chia sẻ bài học với nhóm. Một postmortem hiệu quả áp dụng cách tiếp cận blameless, tập trung vào việc cải thiện hệ thống và quy trình thay vì trách nhiệm cá nhân.
Sự khác biệt giữa event và incident là gì?
MTTA (Mean Time To Acknowledge) có nghĩa là gì?
+17 câu hỏi phỏng vấn
Các chủ đề phỏng vấn DevOps khác
Quản lý phiên bản & Git
Cơ bản về Linux
Shell Scripting & Bash
Cơ bản về Networking
Kiến thức cơ bản về Docker
Nền tảng CI/CD
GitHub Actions
GitLab CI/CD
Jenkins
Kiến thức cơ bản về Kubernetes
Networking Kubernetes
Kubernetes Nâng cao
Ingress & API Gateway
Cơ bản về Terraform
Terraform Nâng cao
Ansible & Configuration Management
Kiến thức cơ bản AWS
Kiến thức cơ bản về Azure
Nền tảng GCP
Monitoring và Prometheus
Logging & ELK Stack
Cloud Identity & Secrets
Bảo mật Pipeline CI/CD
Helm & Kubernetes
Bảo mật Runtime & Cluster
Container Supply Chain Security
Service Mesh & Istio
GitOps & ArgoCD
Progressive Delivery
Khả năng quan sát phân tán
Disaster Recovery & Backup
Tối ưu hóa hiệu suất
Tối ưu Chi phí Cloud
Nguyên tắc SRE
Chaos Engineering
Platform Engineering
Nắm vững DevOps cho lần phỏng vấn tiếp theo
Truy cập tất cả câu hỏi, flashcards, bài kiểm tra kỹ thuật, bài tập code review và mô phỏng phỏng vấn.
Bắt đầu miễn phí