Bỏ qua để đến nội dung

High availability & DR cơ bản

Với hệ thống quản trị dữ liệu dùng chung toàn doanh nghiệp, tính sẵn sàng (HA)khả năng khôi phục sau thảm họa (DR) là yêu cầu thực tế. Bài này nêu các khái niệm nền tảng để lập kế hoạch.

  • Cloud (SaaS): phần lớn HA/DR của nền tảng do Ataccama đảm bảo theo cam kết dịch vụ.
  • Hybrid: nền tảng do Ataccama lo; bạn chịu trách nhiệm HA/DR cho DPE phía mình.
  • Self-managed: bạn lo toàn bộ HA/DR cho mọi thành phần.
  • Nhiều DPE (mở rộng ngang): nếu một DPE gặp sự cố, các DPE còn lại tiếp tục xử lý — DPM phân phối lại job.
  • Trên Kubernetes: dùng nhiều replica + tự phục hồi pod.
  • Sao lưu định kỳ kho metadata (MMM) và cấu hình.
  • Kiểm thử khôi phục: định kỳ thử phục hồi từ backup, đừng chỉ sao lưu.
  • Tài liệu hóa runbook: các bước khôi phục, người chịu trách nhiệm, thứ tự ưu tiên.

Một vài câu hỏi cần trả lời khi lập kế hoạch

Phần tiêu đề “Một vài câu hỏi cần trả lời khi lập kế hoạch”
  • RPO/RTO mục tiêu là bao nhiêu (chấp nhận mất bao nhiêu dữ liệu / downtime)?
  • Backup metadata được giữ ở đâu, bao lâu, ai khôi phục?
  • Khi mất một DPE/khu vực, hệ thống còn xử lý được không?
Chia sẻ: