Cài đặt Node Exporter, thu thập metrics CPU, RAM, Disk I/O và thiết lập cảnh báo Telegram bot khi máy chủ gặp sự cố bất thường.
Vận hành website trên VPS tự quản lý mang lại sự tự do và tiết kiệm chi phí, nhưng đi kèm trách nhiệm tự theo dõi sức khỏe hệ thống. Nếu không có hệ thống cảnh báo sớm, bạn chỉ biết máy chủ bị tràn RAM hay nghẽn CPU khi khách hàng nhắn tin phàn nàn.
Thay vì dựng cụm giám sát cồng kềnh, chúng ta sử dụng bộ công cụ kinh điển tối ưu tài nguyên:
/metrics tốn chưa đầy 15MB RAM.global:
scrape_interval: 15s
evaluation_interval: 15s
rule_files:
- 'alerts.yml'
scrape_configs:
- job_name:
Đặt câu hỏi, chia sẻ ý kiến hoặc góp ý giải pháp kỹ thuật cùng cộng đồng.
Khám phá tiếp
Cấu hình Nginx reverse proxy cho Next.js: cache asset, nén gzip, giới hạn request và những lỗi timeout thường gặp khi chạy trên VPS nhỏ.
Dưới đây là rule cảnh báo khi CPU máy chủ duy trì mức sử dụng trên 85% trong liên tục 5 phút:
groups:
- name: HostAlerts
rules:
- alert: HighCpuUsage
expr: 100 - (avg by (instance) (rate(node_cpu_seconds_total{mode="idle"}[5m])) * 100) > 85
for: 5m
labels:
severity: warning
annotations:
summary: "Cảnh báo: Máy chủ CPU cao (> 85%)"
description: "Instance {{ $labels.instance }} đang duy trì tải CPU cao liên tục."# Kiểm tra Node Exporter đã hoạt động chưa
curl -s http://localhost:9100/metrics | grep node_cpu_seconds_total | head -n 5
# Khởi động Prometheus bằng systemd
sudo systemctl enable --now prometheus
sudo systemctl status prometheusHệ thống giám sát này tiêu thụ không quá 100MB RAM của VPS, nhưng đem lại sự an tâm tuyệt đối. Bạn sẽ luôn biết chính xác tình trạng tài nguyên và xử lý kịp thời trước khi hệ thống rơi vào trạng thái tê liệt.