Learning Hub
DevOps & Hạ tầng

Lab bắt đầu với Prometheus và Grafana

6 phút đọc·Cập nhật 2026-09-09

Prometheus scrape và lưu labeled time-series metric; Grafana query data source rồi trình bày dashboard và alert. Lab hữu ích bắt đầu bằng vài service-level signal chứ không phải hàng trăm panel.

Prometheus scrape và lưu labeled time-series metric; Grafana query data source rồi trình bày dashboard và alert. Lab hữu ích bắt đầu bằng vài service-level signal chứ không phải hàng trăm panel.

Nhìn nhanh

Câu hỏi Câu trả lời thực tế
Dùng khi nào? Sample HTTP service export request count, error count và duration; Prometheus scrape rồi Grafana graph rate, error ratio và latency percentile.
Cần làm gì? Chạy sample stack local, tạo normal và failing traffic, query một metric trực tiếp rồi làm dashboard ba panel có unit và description.
Biết là đúng bằng cách nào? Target up, query trả label set đúng, dashboard thay đổi rõ khi failure và alert condition khớp triệu chứng ảnh hưởng user.
Lỗi hay gặp? Label không giới hạn như user ID hoặc request ID tạo cardinality nguy hiểm; giữ detail này trong log hoặc trace.
flowchart LR
  A[Câu hỏi] --> B[Lab bắt đầu với Prometheus và Grafana]
  B --> C[Ví dụ nhỏ]
  C --> D[Bằng chứng]

Điểm quan trọng của sơ đồ là không dừng ở định nghĩa: hãy nối khái niệm với một ví dụ nhỏ và bằng chứng có thể quan sát.

Ví dụ đã phân tích

Sample HTTP service export request count, error count và duration; Prometheus scrape rồi Grafana graph rate, error ratio và latency percentile.

Trước khi làm, hãy viết dấu hiệu thành công. Sau đó chỉ thay đổi một yếu tố, quan sát kết quả và ghi lại assumption. Với Lab bắt đầu với Prometheus và Grafana, cách này giúp tách điều bạn biết khỏi điều bạn chỉ đang đoán.

Thực hành trong 20–30 phút

Mục tiêu: Chạy sample stack local, tạo normal và failing traffic, query một metric trực tiếp rồi làm dashboard ba panel có unit và description.

  1. Ghi lại trạng thái ban đầu và điều bạn dự đoán.
  2. Thực hiện phiên bản nhỏ nhất, không thêm công cụ chưa cần thiết.
  3. Thay đổi đúng một input hoặc constraint rồi chạy lại.
  4. Lưu command, screenshot, output hoặc checklist làm bằng chứng.

Kết quả mong đợi: Target up, query trả label set đúng, dashboard thay đổi rõ khi failure và alert condition khớp triệu chứng ảnh hưởng user.

Sai ở đâu và sửa thế nào

Label không giới hạn như user ID hoặc request ID tạo cardinality nguy hiểm; giữ detail này trong log hoặc trace.

Khi kết quả khác dự đoán, đừng đổi nhiều thứ cùng lúc. Kiểm tra input, version, environment, quyền truy cập và log trước; sau đó lặp lại từ ví dụ nhỏ nhất.

Định nghĩa hoàn thành

  • Tôi giải thích được khái niệm bằng ngôn ngữ của mình.
  • Tôi đã hoàn thành ví dụ nhỏ và giữ bằng chứng.
  • Tôi biết một failure mode và cách kiểm tra nó.
  • Người khác có thể làm lại mà không phải đoán bước còn thiếu.

Đi sâu hơn

Mở resource hoặc repository đi kèm ở cuối trang khi bạn cần implementation đầy đủ. Hãy kiểm tra version hiện hành trước khi dùng command trong dự án thật.