Logging & monitoring
Để vận hành ổn định, đội hạ tầng cần nhật ký (logging) và giám sát (monitoring) cho các thành phần của Ataccama ONE — phát hiện sớm sự cố và phục vụ truy vết.
Logging
Phần tiêu đề “Logging”- Cấu hình mức log (info/warn/error) hợp lý: đủ để truy vết, tránh quá nhiều nhiễu.
- Thu thập log từ các thành phần: nền tảng, DPM/DPE, Runtime Server.
- Cân nhắc tập trung log (gửi về hệ thống log doanh nghiệp) để tìm kiếm/cảnh báo dễ hơn.
- Trong mô hình Hybrid, công cụ logging thường đặt phía bạn cùng DPE.
Monitoring
Phần tiêu đề “Monitoring”- Theo dõi sức khỏe thành phần: DPE còn kết nối tới DPM không, job có chạy không.
- Theo dõi tài nguyên: CPU/RAM của DPE/Runtime, hàng đợi job.
- Trên Kubernetes: tận dụng giám sát cụm (metrics, liveness/readiness) cho pod DPE.
Cảnh báo nên có
Phần tiêu đề “Cảnh báo nên có”- DPE mất kết nối tới nền tảng.
- Job thất bại hoặc treo bất thường.
- Tài nguyên chạm ngưỡng (sắp hết CPU/RAM/đĩa).
- Chứng chỉ sắp hết hạn (xem HTTPS/TLS).