Lập trình 22/09/2026 8 phút

Structured logging với slog: vì sao log chuỗi tự do là món nợ kỹ thuật bạn trả lúc 3 giờ sáng

Lúc sự cố xảy ra, bạn không đọc log — bạn truy vấn nó. Và log chuỗi tự do (fmt.Printf) không truy vấn được: mỗi dòng một định dạng, muốn lọc phải viết regex. Bài này đo thật với log/slog của Go 1.23: cùng một sự kiện in ra chuỗi tự do và JSON có cấu trúc, rồi dùng jq lọc 1000 dòng log theo nhiều field (đếm ERROR theo service, tính latency trung bình). Kèm số đo chi phí thật — và một sự thật ngược đời: log chuỗi nhanh hơn slog gần 1.7 lần.

Lập trình 22/09/2026 7 phút

Counter và gauge với expvar: hai loại metric nền tảng, và vì sao đếm không atomic mất 80% dữ liệu

Log trả lời 'chuyện gì đã xảy ra với request này', metric trả lời 'hệ thống đang thế nào tổng thể'. Bài này đo thật hai loại metric cơ bản nhất bằng expvar của thư viện chuẩn Go: counter (tổng cộng dồn, chỉ tăng) và gauge (mức tức thời, lên xuống). Kèm một bằng chứng đanh thép về tính đồng thời: 50 goroutine cùng ++ một biến int thường làm mất 81.9% số đếm, trong khi expvar.Int (atomic) đếm đúng tuyệt đối.

Lập trình 22/09/2026 7 phút

Prometheus client trong Go: expose /metrics, đọc định dạng exposition, và hiểu mô hình pull

expvar cho counter/gauge nhưng thiếu label và histogram — production cần nhiều hơn. Bài này đo thật với thư viện Prometheus client_golang: khai CounterVec (label method/status) và HistogramVec, tung 1000 request, rồi curl /metrics đọc output thật. Xem histogram tự sinh _bucket{le=...}/_sum/_count ra sao, kiểm số liệu khớp tải bằng grep, và hiểu vì sao Prometheus scrape (pull) thay vì nhận push.

Lập trình 22/09/2026 6 phút

Distributed tracing: metric nói 'request chậm 39ms', tracing chỉ đúng dbQuery mới là thủ phạm 80%

Metric cho biết một request chậm, nhưng không nói chậm ở CHẶNG nào. Tracing giải quyết điều đó bằng span lồng nhau: mỗi chặng một span, tất cả cùng traceID, mỗi span trỏ về cha để dựng lại cây. Bài này tự cài một tracer tối giản trong Go (không cần backend) và đo thật một request đi qua handler → auth → db → cache: cây span cho thấy dbQuery chiếm 31/39ms = 80%, đúng chặng cần tối ưu.

Lập trình 22/09/2026 6 phút

Ghép log + metric + trace: chẩn đoán một sự cố từ p99 cao tới dòng log lỗi, và cây quyết định debug

Mười một phần loạt Observability đi qua từng công cụ; bài cuối ghép chúng lại. Ba trụ cột — metric, trace, log — mỗi cái trả lời một câu hỏi khác nhau, và sức mạnh thật là dùng chúng nối tiếp. Bài này đo thật một sự cố đi qua cả ba: metric cho thấy p99=128ms và 2.8% lỗi, trace chỉ dbQuery chiếm 129ms là thủ phạm, log lọc theo trace_id cho biết chính xác lỗi gì — kèm một cây quyết định 'gặp triệu chứng X thì nhìn trụ cột nào trước'.