Bỏ qua để đến nội dung

Logging & monitoring

Để vận hành ổn định, đội hạ tầng cần nhật ký (logging)giám sát (monitoring) cho các thành phần của Ataccama ONE — phát hiện sớm sự cố và phục vụ truy vết.

  • Cấu hình mức log (info/warn/error) hợp lý: đủ để truy vết, tránh quá nhiều nhiễu.
  • Thu thập log từ các thành phần: nền tảng, DPM/DPE, Runtime Server.
  • Cân nhắc tập trung log (gửi về hệ thống log doanh nghiệp) để tìm kiếm/cảnh báo dễ hơn.
  • Trong mô hình Hybrid, công cụ logging thường đặt phía bạn cùng DPE.
  • Theo dõi sức khỏe thành phần: DPE còn kết nối tới DPM không, job có chạy không.
  • Theo dõi tài nguyên: CPU/RAM của DPE/Runtime, hàng đợi job.
  • Trên Kubernetes: tận dụng giám sát cụm (metrics, liveness/readiness) cho pod DPE.
  • DPE mất kết nối tới nền tảng.
  • Job thất bại hoặc treo bất thường.
  • Tài nguyên chạm ngưỡng (sắp hết CPU/RAM/đĩa).
  • Chứng chỉ sắp hết hạn (xem HTTPS/TLS).
Chia sẻ: