AI Workbench
Môi trường phát triển cộng tác — xây, huấn luyện, triển khai mô hình.
Cloudera AI là lớp trí tuệ nhân tạo (AI — Artificial Intelligence) của nền tảng Cloudera: nơi đội ngũ dữ liệu xây, huấn luyện, triển khai và vận hành mô hình ngay trên dữ liệu đã được quản trị, trong cùng vành đai bảo mật với kho dữ liệu. Không phải trích dữ liệu ra, gửi sang một dịch vụ bên ngoài, rồi mang kết quả về.
Thông điệp lõi của Cloudera là “đưa AI tới nơi dữ liệu đang nằm”. Với phần lớn tổ chức tại Việt Nam — ngân hàng, viễn thông, khu vực công — dữ liệu nhạy cảm nằm trong trung tâm dữ liệu và phải ở lại đó. Cloudera AI được thiết kế cho đúng tình huống này: AI chạy tại chỗ, trên hạ tầng của doanh nghiệp, dưới chính sách quản trị của doanh nghiệp.
flowchart TD
subgraph DC["Vành đai của doanh nghiệp − trung tâm dữ liệu"]
L["Open Data Lakehouse − bảng Apache Iceberg"]
S["SDX − chính sách bảo mật · phân quyền · nhãn dữ liệu"]
W["AI Workbench − phát triển và huấn luyện"]
T["AI Studios − ít mã và đầy đủ mã"]
I["AI Inference Service − phục vụ mô hình riêng tư"]
A["AI Assistants − trả lời kèm căn cứ"]
end
L --> W
L --> T
W --> I
T --> I
I --> A
S -.-> W
S -.-> T
S -.-> I
A --> U["Người dùng nghiệp vụ"]
AI Workbench
Môi trường phát triển cộng tác — xây, huấn luyện, triển khai mô hình.
AI Studios
Đường ít mã và đầy đủ mã cho AI tạo sinh & luồng tác tử.
AI Inference Service
Phục vụ ứng dụng / tác tử / trợ lý AI riêng tư, quy mô lớn, an toàn.
AI Assistants
Thông tin truy vết được, giải thích được, đáng tin.
AI Workbench là không gian làm việc cho nhà khoa học dữ liệu và kỹ sư máy học (ML — Machine Learning): tạo dự án, chọn môi trường, cấp tài nguyên tính toán gồm cả GPU (Graphics Processing Unit — bộ xử lý đồ họa), viết notebook, huấn luyện, theo dõi thí nghiệm và đưa mô hình lên vận hành.
Điểm đáng chú ý không nằm ở “có notebook” — mà ở chỗ dữ liệu huấn luyện được đọc thẳng từ lakehouse, đúng quyền, không cần sao chép ra máy trạm hay ra một môi trường thứ ba.
| Việc thường ngày | Cách làm trong AI Workbench |
|---|---|
| Chuẩn bị dữ liệu | Đọc trực tiếp bảng Iceberg trong lakehouse, không tạo bản sao trôi nổi |
| Thử nghiệm | Notebook cùng môi trường tùy chọn, tài nguyên cấp theo nhu cầu từng dự án |
| Huấn luyện | Chạy theo job có lịch, mở rộng bằng container, dùng GPU khi cần |
| Theo dõi | Ghi nhận phiên bản mô hình, tham số và kết quả của từng lần chạy |
| Đưa vào dùng | Đóng gói mô hình rồi chuyển sang lớp phục vụ suy luận |
AI Studios là các xưởng dựng sẵn cho AI tạo sinh (generative AI) và luồng tác tử (agentic workflow):
Đường ít mã cho người thạo nghiệp vụ dựng bản thử trong vài ngày. Đường đầy đủ mã cho kỹ sư kiểm soát tới từng chi tiết. Cả hai chạy trên cùng một nền, chịu cùng một bộ chính sách — nên bản thử của phòng nghiệp vụ không trở thành một hệ thống ngoài luồng.
Huấn luyện xong mới là nửa đường. AI Inference Service triển khai mô hình, ứng dụng, tác tử và trợ lý thành dịch vụ riêng tư ở quy mô lớn: endpoint có xác thực, tự co giãn theo tải, chạy trên GPU trong trung tâm dữ liệu, có nhật ký từng lượt gọi.
Chữ “riêng tư” ở đây rất cụ thể: mô hình chạy trên hạ tầng của doanh nghiệp, nên câu hỏi và câu trả lời cũng không đi ra ngoài — điều này quan trọng ngang với bản thân dữ liệu, vì câu hỏi của một cán bộ tín dụng đã đủ để lộ thông tin khách hàng.
Cloudera đặt trọng tâm ở chỗ trợ lý AI đưa ra thông tin truy vết được, giải thích được và đáng tin: trả lời kèm trích dẫn nguồn, chỉ ra dữ liệu đứng sau kết luận.
Trong môi trường có thanh tra, đây không phải chi tiết kỹ thuật mà là điều kiện để dùng được. Một câu trả lời không nêu được căn cứ thì cán bộ không dám dùng, lãnh đạo không dám ký, và hệ thống dừng ở mức trình diễn.
Đây là lý do Cloudera AI hợp với thị trường Việt Nam hơn là một tính năng nghe hay.
| Ràng buộc có thật | Cloudera AI đáp ứng thế nào |
|---|---|
| Dữ liệu khách hàng không được rời trung tâm dữ liệu | Mô hình chạy tại chỗ, ngay cạnh lakehouse |
| Không được gửi dữ liệu sang dịch vụ AI công cộng | Suy luận riêng tư trên hạ tầng nội bộ |
| Phải chứng minh ai xem được gì khi thanh tra | Kế thừa chính sách SDX kèm nhật ký truy cập |
| Kết luận của mô hình phải giải trình được | Trợ lý trích nguồn, dữ liệu có lineage |
| Hạ tầng đã đầu tư cần được tận dụng | Triển khai ngay trên hạ tầng sẵn có |
Cách nói ngắn gọn: AI đi tới dữ liệu, dữ liệu không phải đi đâu cả.
SDX (Shared Data Experience) là lớp quản trị dùng chung của Cloudera: bảo mật, phân quyền và chính sách đặt một lần, áp cho mọi dịch vụ trên nền. Cloudera AI là một dịch vụ trên chính nền đó, nên nó thừa hưởng bộ chính sách ấy thay vì tự dựng một bộ quyền riêng.
Hệ quả thực tế:
Điều này chặn một rủi ro rất thật của các dự án AI nội bộ: gom toàn bộ tài liệu và dữ liệu vào một chỉ mục dùng chung cho tiện, rồi trợ lý vô tình trả lời cho người vốn không có quyền xem phần đó. Khi phân quyền nằm ở tầng nền chứ không nằm trong từng ứng dụng, lỗi này khó xảy ra hơn nhiều.
| Tình huống | Dựng bằng gì | Vì sao phải làm tại chỗ |
|---|---|---|
| Trợ lý tra cứu quy định nội bộ — nhân viên hỏi “hồ sơ mở tài khoản doanh nghiệp cần những gì”, trợ lý trả lời kèm trích đúng điều khoản | AI Studios, mẫu RAG trên kho quy chế, quy trình, văn bản của Ngân hàng Nhà nước (NHNN) | Quy chế nội bộ là tài sản nghiệp vụ, không đưa lên dịch vụ ngoài |
| Chấm điểm rủi ro — chấm điểm tín dụng hoặc cảnh báo gian lận trên dòng giao dịch | AI Workbench huấn luyện trên dữ liệu giao dịch trong lakehouse, phục vụ qua AI Inference Service | Dữ liệu giao dịch nhạy cảm nhất; kết quả phải giải trình được |
| Tổng hợp hồ sơ khách hàng — gom thông tin rải rác nhiều hệ thống thành bản tóm tắt cho cán bộ quan hệ khách hàng | Truy vấn lakehouse rồi để mô hình tóm tắt, chạy dưới đúng quyền người xem | Thông tin định danh cá nhân (PII — Personally Identifiable Information) không được rời vành đai |
Điểm chung của cả ba: toàn bộ vòng đời diễn ra trong trung tâm dữ liệu — dữ liệu, mô hình, câu hỏi, câu trả lời và nhật ký.