Gắn kiểm thử hiệu năng, bảo mật và khả năng phục hồi với workload thực tế, mục tiêu rõ ràng và hành vi production quan sát được.
Chất lượng phi chức năng phải gắn với workload thực tế, mục tiêu rõ ràng, ranh giới dữ liệu nhạy cảm, khả năng phục hồi sau lỗi và hành vi production quan sát được.
flowchart LR
A[Giai đoạn nghiệp vụ và vai trò người dùng] --> B[Tỷ lệ giao dịch và tốc độ đến]
B --> C[Khối lượng dữ liệu dependency và trạng thái cache]
C --> D[Test baseline load stress spike soak volume]
D --> E[Độ trễ throughput lỗi saturation và recovery]
E --> F{Đạt mục tiêu dưới tải thực tế}
F -->|Không| G[Tìm bottleneck sửa và chạy lại cùng workload]
F -->|Có| H[Bằng chứng năng lực và phát hành]
Đừng bắt đầu chỉ với một con số như "10.000 người dùng". Hãy định nghĩa vai trò, khu vực địa lý, tỷ lệ giao dịch, mức đồng thời hoặc tốc độ đến, tỷ lệ đọc/ghi, lịch sử dữ liệu, think time, background job, dependency bên ngoài, thời gian warm-up và trạng thái cache. Đo p50/p95/p99 latency, throughput, lỗi, saturation, CPU, memory, garbage collection, hành vi database, connection pool, lock, cache hit rate, độ sâu queue, Kafka lag, cuộc gọi dependency và khả năng phục hồi sau tải.
Áp dụng kiểm soát xuyên suốt SDLC: yêu cầu privacy và authorization, threat modeling, secure coding, quét SAST/SCA/secret/container/IaC, test API và tenant-isolation, penetration testing, kiểm tra khi triển khai, monitoring, incident response và review quyền truy cập.
Các test âm tính quan trọng gồm định danh xuyên user và xuyên tenant, role escalation, hành vi token/session/logout, authorization upload/download, rò rỉ qua export/search/cache/job/report/AI retrieval, prompt injection, và secret hoặc PII lộ trong repository, log, prompt, trace và lỗi.
flowchart TD
A[Định nghĩa SLO RTO RPO và steady state của service] --> B[Gây một lỗi có kiểm soát]
B --> C[Quan sát routing retry breaker queue alert và tác động người dùng]
C --> D[Phục hồi service]
D --> E[Đối soát state và dữ liệu]
E --> F[So sánh detection và recovery với mục tiêu]
F --> G[Tăng dần phạm vi ảnh hưởng]
Các thử nghiệm hữu ích gồm dừng một instance service, làm chậm nhà cung cấp thuế bên ngoài, làm banking sandbox không khả dụng, gián đoạn Kafka, gỡ một read replica, dừng batch giữa chừng, tạo backlog cho queue và restore từ backup. Với các luồng thay đổi trạng thái, hãy chứng minh idempotency và reconciliation sau khi phục hồi.
Kiểm tra số lượng test được phát hiện, đã chạy, bị skip và bị quarantine. Exit code bằng 0 một mình không đủ làm bằng chứng.
Sử dụng synthetic check, SLO và error budget, trace và correlation ID, đối soát payroll/payment, monitoring Kafka và queue, độ tươi của ETL, các chỉ số chất lượng/độ trễ/chi phí/drift của AI, canary rollout, tiêu chí rollback và incident review tạo ra test mới. Log và trace phải hỗ trợ chẩn đoán mà không tạo ra rò rỉ privacy.
Bắt đầu thực hành với Microsoft Playwright cho một nhóm nhỏ hành trình test browser quan trọng, dễ bảo trì.
Cách kiểm chứng data pipeline và migration để một job chạy thành công cũng đồng nghĩa dữ liệu nghiệp vụ là chính xác.
Một wiki thực hành, dựa trên rủi ro, cho việc kiểm thử phần mềm, dữ liệu, AI, bảo mật, hiệu năng và phát hành production.