
Alerting та Incident Response
Runbooks, paging, ескалація, керування інцидентами, on-call практики, postmortems, troubleshooting сповіщень
1Що таке runbook у контексті DevOps?
Що таке runbook у контексті DevOps?
Відповідь
Runbook — це операційний документ, що містить стандартизовані процедури для обробки інцидентів або повторюваних завдань обслуговування. Він дозволяє on-call командам виконувати наперед визначені та валідовані кроки для швидкого вирішення відомих проблем, тим самим скорочуючи час вирішення та людські помилки. Runbook'и можуть бути ручними або автоматизованими та є фундаментальним елементом керування інцидентами.
2Що таке paging у контексті керування інцидентами?
Що таке paging у контексті керування інцидентами?
Відповідь
Paging — це механізм сповіщення, який повідомляє on-call інженерів про виникнення критичного інциденту. Ця система використовує різні канали зв'язку, такі як SMS, телефонні дзвінки або спеціалізовані застосунки, щоб гарантувати швидке сповіщення відповідальної особи, навіть поза робочим часом. Хороша система paging включає політики автоматичної ескалації, якщо перша особа не відповідає.
3Що таке postmortem у контексті керування інцидентами?
Що таке postmortem у контексті керування інцидентами?
Відповідь
Postmortem — це ретроспективний аналіз, що проводиться після значного інциденту. Його мета — зрозуміти першопричини інциденту, задокументувати хронологію подій, визначити коригувальні дії та поділитися здобутими знаннями з командою. Ефективний postmortem використовує blameless-підхід, зосереджений на покращенні систем і процесів, а не на індивідуальній відповідальності.
Яка різниця між event та інцидентом?
Що означає MTTA (Mean Time To Acknowledge)?
+17 питань зі співбесід
Інші теми співбесід DevOps
Контроль версій & Git
Основи Linux
Shell Scripting & Bash
Основи мереж
Основи Docker
Основи CI/CD
GitHub Actions
GitLab CI/CD
Jenkins
Основи Kubernetes
Networking Kubernetes
Kubernetes Просунутий
Ingress & API Gateway
Основи Terraform
Terraform Просунутий
Ansible & Configuration Management
Основи AWS
Основи Azure
Основи GCP
Моніторинг і Prometheus
Logging & ELK Stack
Cloud Identity & Secrets
Безпека CI/CD пайплайнів
Helm & Kubernetes
Безпека Runtime та Cluster
Container Supply Chain Security
Service Mesh та Istio
GitOps & ArgoCD
Progressive Delivery
Розподілена спостережуваність
Disaster Recovery & Backup
Оптимізація продуктивності
Оптимізація витрат на хмару
Принципи SRE
Chaos Engineering
Platform Engineering
Опануй DevOps для наступної співбесіди
Отримай доступ до всіх питань, flashcards, технічних тестів, вправ code review та симуляторів співбесід.
Почни безкоштовно