High availability & DR cơ bản
Với hệ thống quản trị dữ liệu dùng chung toàn doanh nghiệp, tính sẵn sàng (HA) và khả năng khôi phục sau thảm họa (DR) là yêu cầu thực tế. Bài này nêu các khái niệm nền tảng để lập kế hoạch.
Phân chia trách nhiệm theo mô hình
Phần tiêu đề “Phân chia trách nhiệm theo mô hình”- Cloud (SaaS): phần lớn HA/DR của nền tảng do Ataccama đảm bảo theo cam kết dịch vụ.
- Hybrid: nền tảng do Ataccama lo; bạn chịu trách nhiệm HA/DR cho DPE phía mình.
- Self-managed: bạn lo toàn bộ HA/DR cho mọi thành phần.
Sẵn sàng cao (HA) cho DPE
Phần tiêu đề “Sẵn sàng cao (HA) cho DPE”- Nhiều DPE (mở rộng ngang): nếu một DPE gặp sự cố, các DPE còn lại tiếp tục xử lý — DPM phân phối lại job.
- Trên Kubernetes: dùng nhiều replica + tự phục hồi pod.
Khôi phục sau thảm họa (DR)
Phần tiêu đề “Khôi phục sau thảm họa (DR)”- Sao lưu định kỳ kho metadata (MMM) và cấu hình.
- Kiểm thử khôi phục: định kỳ thử phục hồi từ backup, đừng chỉ sao lưu.
- Tài liệu hóa runbook: các bước khôi phục, người chịu trách nhiệm, thứ tự ưu tiên.
Một vài câu hỏi cần trả lời khi lập kế hoạch
Phần tiêu đề “Một vài câu hỏi cần trả lời khi lập kế hoạch”- RPO/RTO mục tiêu là bao nhiêu (chấp nhận mất bao nhiêu dữ liệu / downtime)?
- Backup metadata được giữ ở đâu, bao lâu, ai khôi phục?
- Khi mất một DPE/khu vực, hệ thống còn xử lý được không?