Open Data Lakehouse
Lakehouse mở trên Apache Iceberg — định dạng bảng mở, một bản dữ liệu dùng cho nhiều engine. Xem Iceberg.
Cloudera là nền tảng dữ liệu và AI (Artificial Intelligence — trí tuệ nhân tạo) hybrid: một nền duy nhất để lưu trữ, xử lý, quản trị và khai thác dữ liệu ngay tại nơi dữ liệu đang nằm — trên đám mây công cộng, trong trung tâm dữ liệu của chính doanh nghiệp, và ở biên (edge). Thông điệp lõi của Cloudera rất gọn: đưa AI tới nơi dữ liệu đang nằm, thay vì bắt dữ liệu di chuyển tới nơi có AI.
Cách đặt vấn đề đó xuất phát từ một thực tế: dữ liệu của một ngân hàng hay một nhà mạng không nằm gọn ở một chỗ. Hệ thống lõi chạy trong trung tâm dữ liệu, ứng dụng số mới dựng trên đám mây, thiết bị và chi nhánh sinh dữ liệu ở biên. Mỗi lần cần phân tích hay huấn luyện mô hình, việc gom dữ liệu về một nơi lại sinh thêm một bản sao, thêm độ trễ, và thêm một câu hỏi về tuân thủ. Cloudera đưa cùng một bộ dịch vụ dữ liệu và cùng một lớp quản trị tới cả ba nơi, để bản gốc dữ liệu ở yên chỗ của nó.
flowchart LR
subgraph NOI["Dữ liệu đang nằm ở nhiều nơi"]
direction TB
E1["Đám mây công cộng<br/>AWS · Azure · GCP"]
E2["Trung tâm dữ liệu<br/>của doanh nghiệp"]
E3["Biên — nhà máy · chi nhánh<br/>thiết bị IoT"]
end
subgraph CLD["Cloudera — một nền tảng hybrid"]
direction TB
P2["Các dịch vụ dữ liệu<br/>pipeline · kho · streaming"]
P1["Lakehouse mở<br/>nền Apache Iceberg"]
P3["SDX — lớp quản trị dùng chung<br/>bảo mật · phân quyền · truy vết"]
end
AI["Cloudera AI<br/>chạy ngay cạnh dữ liệu"]
E1 --> P2
E2 --> P2
E3 --> P2
P2 --> P1
P3 -.- P1
P1 --> AI
Một nền tảng dữ liệu doanh nghiệp phải làm được ba nhóm việc cùng lúc:
Cloudera đóng gói cả ba thành một nền tảng: lưu trữ mở + các dịch vụ dữ liệu + lớp quản trị dùng chung, triển khai được trên đám mây, tại chỗ, hoặc cả hai.
Phần lớn tổ chức lớn tại Việt Nam — ngân hàng, viễn thông, khu vực công — vận hành dưới những ràng buộc rất cụ thể:
Từ đó thường nảy ra một câu hỏi: chọn hiện đại hóa dữ liệu, hay chọn tuân thủ?
Đó là một lựa chọn giả. Cloudera cho phép giữ bản gốc dữ liệu trong trung tâm dữ liệu của tổ chức, chạy lakehouse, kho phân tích và cả AI ngay trên đó, đồng thời vẫn dùng đám mây cho phần việc phù hợp — với cùng một trải nghiệm quản trị ở hai phía. Hiện đại hóa và tuân thủ đi cùng nhau, không phải đánh đổi.
Trong nhiều dự án AI, phần tốn thời gian nhất không phải mô hình mà là đường đi của dữ liệu: xin phê duyệt, sao chép, che dữ liệu nhạy cảm, đồng bộ, rồi giải trình từng bản sao đang nằm ở đâu. Mỗi bản sao là một khoản chi phí và một điểm cần kiểm soát thêm.
Cloudera đảo thứ tự đó: hạ tầng AI đi tới dữ liệu. Môi trường phát triển, kho mô hình và dịch vụ suy luận chạy trên chính nền tảng đang giữ dữ liệu, dùng chung lớp phân quyền của nền tảng. Kết quả là quãng đường từ dữ liệu thô tới mô hình phục vụ nghiệp vụ ngắn lại, và số bản sao cần giải trình giảm xuống.
Phần này chỉ điểm danh — mỗi mảng đều có một bài riêng đi sâu.
Open Data Lakehouse
Lakehouse mở trên Apache Iceberg — định dạng bảng mở, một bản dữ liệu dùng cho nhiều engine. Xem Iceberg.
Data Engineering
Pipeline Apache Spark chạy thẳng trên bảng Iceberg. Xem Data Engineering.
Data Warehouse
Kho phân tích SQL phục vụ hàng nghìn người dùng đồng thời. Xem Data Warehouse.
Operational Database
Cơ sở dữ liệu NoSQL thời gian thực, nền Apache HBase. Xem Operational Database.
Data Flow & Streaming
SDX — quản trị dùng chung
SDX (Shared Data Experience): bảo mật, phân quyền, danh mục, truy vết nguồn gốc — đặt một lần, áp mọi dịch vụ. Xem SDX.
Cloudera AI
AI Workbench, AI Studios, AI Inference Service — phát triển và triển khai AI riêng tư ngay trên dữ liệu. Xem Cloudera AI.
Lưu trữ nền tảng
Cloudera Object Store tương thích S3, nền Apache Ozone, quy mô hàng tỉ đối tượng. Xem Kiến trúc nền tảng.
Các mức quy mô nêu trong phần này là theo Cloudera công bố. Điểm cần nhớ: tất cả các dịch vụ trên đọc chung một bản dữ liệu và chịu chung một bộ chính sách của SDX. Đó là điều làm chúng trở thành một nền tảng, chứ không phải một bộ sưu tập công cụ.
Cloudera xuất thân từ hệ sinh thái Apache Hadoop — nền tảng dữ liệu lớn thế hệ trước. Rất nhiều tổ chức tại Việt Nam đang vận hành cụm Hadoop đã đầu tư từ nhiều năm trước: dữ liệu lịch sử quý giá nằm trong đó, quy trình nghiệp vụ đã gắn chặt vào đó.
Câu chuyện hiện đại hóa vì thế không phải là “bỏ đi làm lại”, mà là nâng cấp tại chỗ: đưa dữ liệu từ định dạng cũ lên bảng Apache Iceberg, giữ nguyên dữ liệu lịch sử, rồi mở khóa những năng lực mới trên chính bộ dữ liệu ấy — kho phân tích hiện đại, streaming, và AI. Xem Di trú từ Hadoop.
Với hệ thống lõi của ngân hàng hay viễn thông, vòng đời nền tảng là một tiêu chí chọn lựa nghiêm túc — không ai muốn dựng nền dữ liệu cho mười năm tới trên một thứ hết vòng đời sau ba năm.
Cloudera công bố cam kết hỗ trợ dài hạn tới năm 2032, kèm theo việc cập nhật đồng thời cho bản tại chỗ và bản trên đám mây — nghĩa là năng lực mới không chỉ dành riêng cho phía đám mây, và tổ chức không bị buộc phải đổi nền tảng (“re-platform”) để nhận tính năng mới. Chi tiết ở bài Triển khai và Cloud Bursting.