Learning Hub
DevOps & Hạ tầng

Alert, service-level objective và incident response

6 phút đọc·Cập nhật 2026-09-09

SLO nêu reliability target cho service indicator nhìn từ user; alert nên fire khi objective gặp risk có nghĩa; incident response khôi phục service, communicate và học hỏi không đổ lỗi.

SLO nêu reliability target cho service indicator nhìn từ user; alert nên fire khi objective gặp risk có nghĩa; incident response khôi phục service, communicate và học hỏi không đổ lỗi.

Nhìn nhanh

Câu hỏi Câu trả lời thực tế
Dùng khi nào? Checkout service đặt target 99,9% request thành công trong 30 ngày và page khi error-budget burn dự báo budget sẽ cạn quá nhanh.
Cần làm gì? Định nghĩa một indicator và SLO, tính error budget, viết symptom-based alert rồi chạy tabletop incident từ detection đến review.
Biết là đúng bằng cách nào? Alert actionable, có owner và runbook, không page vì internal noise vô hại và exercise tạo improvement được track.
Lỗi hay gặp? Target 100% không chừa chỗ cho change hay recovery và thường tạo noisy alert thay vì reliability tốt hơn.
flowchart LR
  A[Câu hỏi] --> B[Alert, service-level objective và incident]
  B --> C[Ví dụ nhỏ]
  C --> D[Bằng chứng]

Điểm quan trọng của sơ đồ là không dừng ở định nghĩa: hãy nối khái niệm với một ví dụ nhỏ và bằng chứng có thể quan sát.

Ví dụ đã phân tích

Checkout service đặt target 99,9% request thành công trong 30 ngày và page khi error-budget burn dự báo budget sẽ cạn quá nhanh.

Trước khi làm, hãy viết dấu hiệu thành công. Sau đó chỉ thay đổi một yếu tố, quan sát kết quả và ghi lại assumption. Với Alert, service-level objective và incident response, cách này giúp tách điều bạn biết khỏi điều bạn chỉ đang đoán.

Thực hành trong 20–30 phút

Mục tiêu: Định nghĩa một indicator và SLO, tính error budget, viết symptom-based alert rồi chạy tabletop incident từ detection đến review.

  1. Ghi lại trạng thái ban đầu và điều bạn dự đoán.
  2. Thực hiện phiên bản nhỏ nhất, không thêm công cụ chưa cần thiết.
  3. Thay đổi đúng một input hoặc constraint rồi chạy lại.
  4. Lưu command, screenshot, output hoặc checklist làm bằng chứng.

Kết quả mong đợi: Alert actionable, có owner và runbook, không page vì internal noise vô hại và exercise tạo improvement được track.

Sai ở đâu và sửa thế nào

Target 100% không chừa chỗ cho change hay recovery và thường tạo noisy alert thay vì reliability tốt hơn.

Khi kết quả khác dự đoán, đừng đổi nhiều thứ cùng lúc. Kiểm tra input, version, environment, quyền truy cập và log trước; sau đó lặp lại từ ví dụ nhỏ nhất.

Định nghĩa hoàn thành

  • Tôi giải thích được khái niệm bằng ngôn ngữ của mình.
  • Tôi đã hoàn thành ví dụ nhỏ và giữ bằng chứng.
  • Tôi biết một failure mode và cách kiểm tra nó.
  • Người khác có thể làm lại mà không phải đoán bước còn thiếu.

Đi sâu hơn

Mở resource hoặc repository đi kèm ở cuối trang khi bạn cần implementation đầy đủ. Hãy kiểm tra version hiện hành trước khi dùng command trong dự án thật.