Bỏ qua để đến nội dung

Cloudera là gì? Nền tảng dữ liệu và AI hybrid cho doanh nghiệp

Clouderanền tảng dữ liệu và AI (Artificial Intelligence — trí tuệ nhân tạo) hybrid: một nền duy nhất để lưu trữ, xử lý, quản trị và khai thác dữ liệu ngay tại nơi dữ liệu đang nằm — trên đám mây công cộng, trong trung tâm dữ liệu của chính doanh nghiệp, và ở biên (edge). Thông điệp lõi của Cloudera rất gọn: đưa AI tới nơi dữ liệu đang nằm, thay vì bắt dữ liệu di chuyển tới nơi có AI.

Cách đặt vấn đề đó xuất phát từ một thực tế: dữ liệu của một ngân hàng hay một nhà mạng không nằm gọn ở một chỗ. Hệ thống lõi chạy trong trung tâm dữ liệu, ứng dụng số mới dựng trên đám mây, thiết bị và chi nhánh sinh dữ liệu ở biên. Mỗi lần cần phân tích hay huấn luyện mô hình, việc gom dữ liệu về một nơi lại sinh thêm một bản sao, thêm độ trễ, và thêm một câu hỏi về tuân thủ. Cloudera đưa cùng một bộ dịch vụ dữ liệu và cùng một lớp quản trị tới cả ba nơi, để bản gốc dữ liệu ở yên chỗ của nó.

flowchart LR
  subgraph NOI["Dữ liệu đang nằm ở nhiều nơi"]
    direction TB
    E1["Đám mây công cộng<br/>AWS · Azure · GCP"]
    E2["Trung tâm dữ liệu<br/>của doanh nghiệp"]
    E3["Biên — nhà máy · chi nhánh<br/>thiết bị IoT"]
  end
  subgraph CLD["Cloudera — một nền tảng hybrid"]
    direction TB
    P2["Các dịch vụ dữ liệu<br/>pipeline · kho · streaming"]
    P1["Lakehouse mở<br/>nền Apache Iceberg"]
    P3["SDX — lớp quản trị dùng chung<br/>bảo mật · phân quyền · truy vết"]
  end
  AI["Cloudera AI<br/>chạy ngay cạnh dữ liệu"]
  E1 --> P2
  E2 --> P2
  E3 --> P2
  P2 --> P1
  P3 -.- P1
  P1 --> AI

Một nền tảng dữ liệu doanh nghiệp phải làm được ba nhóm việc cùng lúc:

  1. Gom được mọi loại dữ liệu — bảng nghiệp vụ, log, sự kiện thời gian thực, dữ liệu thiết bị — mà không đẻ ra một kho riêng lẻ cho mỗi loại.
  2. Phục vụ nhiều kiểu công việc trên cùng một bản dữ liệu — pipeline làm sạch, kho phân tích, tra cứu thời gian thực, huấn luyện và suy luận mô hình.
  3. Giữ một bộ chính sách duy nhất — ai được thấy gì, dữ liệu đến từ đâu, ai đã truy cập — áp cho tất cả công việc trên, ở tất cả các nơi.

Cloudera đóng gói cả ba thành một nền tảng: lưu trữ mở + các dịch vụ dữ liệu + lớp quản trị dùng chung, triển khai được trên đám mây, tại chỗ, hoặc cả hai.

Phần lớn tổ chức lớn tại Việt Nam — ngân hàng, viễn thông, khu vực công — vận hành dưới những ràng buộc rất cụ thể:

  • Chủ quyền dữ liệu: dữ liệu khách hàng, dữ liệu công dân phải nằm trong phạm vi kiểm soát của tổ chức và trong lãnh thổ Việt Nam.
  • Nơi lưu trữ dữ liệu (data residency): quy định bảo vệ dữ liệu cá nhân và yêu cầu của cơ quan quản lý ngành nói rõ dữ liệu được lưu ở đâu và ai chạm được vào nó.
  • Hệ thống lõi còn ở trung tâm dữ liệu: core banking, hệ thống tính cước, hệ thống nghiệp vụ chuyên ngành đang chạy tại chỗ và sẽ còn chạy tại chỗ nhiều năm nữa.

Từ đó thường nảy ra một câu hỏi: chọn hiện đại hóa dữ liệu, hay chọn tuân thủ?

Đó là một lựa chọn giả. Cloudera cho phép giữ bản gốc dữ liệu trong trung tâm dữ liệu của tổ chức, chạy lakehouse, kho phân tích và cả AI ngay trên đó, đồng thời vẫn dùng đám mây cho phần việc phù hợp — với cùng một trải nghiệm quản trị ở hai phía. Hiện đại hóa và tuân thủ đi cùng nhau, không phải đánh đổi.

Trong nhiều dự án AI, phần tốn thời gian nhất không phải mô hình mà là đường đi của dữ liệu: xin phê duyệt, sao chép, che dữ liệu nhạy cảm, đồng bộ, rồi giải trình từng bản sao đang nằm ở đâu. Mỗi bản sao là một khoản chi phí và một điểm cần kiểm soát thêm.

Cloudera đảo thứ tự đó: hạ tầng AI đi tới dữ liệu. Môi trường phát triển, kho mô hình và dịch vụ suy luận chạy trên chính nền tảng đang giữ dữ liệu, dùng chung lớp phân quyền của nền tảng. Kết quả là quãng đường từ dữ liệu thô tới mô hình phục vụ nghiệp vụ ngắn lại, và số bản sao cần giải trình giảm xuống.

Bức tranh tổng thể: nền tảng gồm những gì

Phần tiêu đề “Bức tranh tổng thể: nền tảng gồm những gì”

Phần này chỉ điểm danh — mỗi mảng đều có một bài riêng đi sâu.

Open Data Lakehouse

Lakehouse mở trên Apache Iceberg — định dạng bảng mở, một bản dữ liệu dùng cho nhiều engine. Xem Iceberg.

Data Engineering

Pipeline Apache Spark chạy thẳng trên bảng Iceberg. Xem Data Engineering.

Data Warehouse

Kho phân tích SQL phục vụ hàng nghìn người dùng đồng thời. Xem Data Warehouse.

Operational Database

Cơ sở dữ liệu NoSQL thời gian thực, nền Apache HBase. Xem Operational Database.

Data Flow & Streaming

Thu thập và định tuyến bằng Apache NiFi; xử lý luồng bằng Apache Kafka + Apache Flink; quản lý thiết bị ở biên. Xem Data FlowStreaming.

SDX — quản trị dùng chung

SDX (Shared Data Experience): bảo mật, phân quyền, danh mục, truy vết nguồn gốc — đặt một lần, áp mọi dịch vụ. Xem SDX.

Cloudera AI

AI Workbench, AI Studios, AI Inference Service — phát triển và triển khai AI riêng tư ngay trên dữ liệu. Xem Cloudera AI.

Lưu trữ nền tảng

Cloudera Object Store tương thích S3, nền Apache Ozone, quy mô hàng tỉ đối tượng. Xem Kiến trúc nền tảng.

Các mức quy mô nêu trong phần này là theo Cloudera công bố. Điểm cần nhớ: tất cả các dịch vụ trên đọc chung một bản dữ liệuchịu chung một bộ chính sách của SDX. Đó là điều làm chúng trở thành một nền tảng, chứ không phải một bộ sưu tập công cụ.

Cloudera xuất thân từ hệ sinh thái Apache Hadoop — nền tảng dữ liệu lớn thế hệ trước. Rất nhiều tổ chức tại Việt Nam đang vận hành cụm Hadoop đã đầu tư từ nhiều năm trước: dữ liệu lịch sử quý giá nằm trong đó, quy trình nghiệp vụ đã gắn chặt vào đó.

Câu chuyện hiện đại hóa vì thế không phải là “bỏ đi làm lại”, mà là nâng cấp tại chỗ: đưa dữ liệu từ định dạng cũ lên bảng Apache Iceberg, giữ nguyên dữ liệu lịch sử, rồi mở khóa những năng lực mới trên chính bộ dữ liệu ấy — kho phân tích hiện đại, streaming, và AI. Xem Di trú từ Hadoop.

Với hệ thống lõi của ngân hàng hay viễn thông, vòng đời nền tảng là một tiêu chí chọn lựa nghiêm túc — không ai muốn dựng nền dữ liệu cho mười năm tới trên một thứ hết vòng đời sau ba năm.

Cloudera công bố cam kết hỗ trợ dài hạn tới năm 2032, kèm theo việc cập nhật đồng thời cho bản tại chỗ và bản trên đám mây — nghĩa là năng lực mới không chỉ dành riêng cho phía đám mây, và tổ chức không bị buộc phải đổi nền tảng (“re-platform”) để nhận tính năng mới. Chi tiết ở bài Triển khai và Cloud Bursting.

Chia sẻ: