AI trong data governance: làm quản trị dữ liệu khả thi ở quy mô lớn
Một doanh nghiệp dữ liệu thực tế không có vài chục bảng — mà có hàng nghìn bảng, hàng trăm nghìn cột, dữ liệu mới đổ về mỗi ngày. Nếu phải để con người ngồi mô tả từng cột, gắn từng thuật ngữ, dò từng chỗ có số chứng minh nhân dân hay số thẻ, kiểm từng dòng xem có bất thường không — thì quản trị dữ liệu sẽ không bao giờ làm xong. Đây chính là lý do AI xuất hiện trong data governance: không phải để thay người, mà để làm phần việc nặng nề, lặp lại ở quy mô lớn mà con người không kham nổi bằng tay, để con người tập trung vào phán đoán và quyết định. Trang này giải thích AI giúp gì cho quản trị dữ liệu, vì sao con người vẫn phải duyệt, và một sự thật ngược chiều quan trọng: quản trị dữ liệu tốt lại chính là nền móng cho AI tốt.
Vì sao governance thủ công không còn khả thi
Phần tiêu đề “Vì sao governance thủ công không còn khả thi”Hãy hình dung một ngân hàng hoặc tập đoàn bán lẻ với dữ liệu rải khắp hệ thống lõi, kho dữ liệu, hàng loạt ứng dụng và file Excel. Một chương trình quản trị “đúng sách” đòi hỏi mỗi tập dữ liệu phải có mô tả rõ, gắn đúng thuật ngữ, biết chỗ nào chứa dữ liệu cá nhân, có luật kiểm tra chất lượng và người chịu trách nhiệm. Làm thủ công toàn bộ là bất khả thi:
- Khối lượng quá lớn — không đội ngũ nào đủ người mô tả tay hàng trăm nghìn cột.
- Dữ liệu luôn thay đổi — bảng mới, cột mới liên tục; làm xong hôm nay, ngày mai đã lạc hậu.
- Con người không nhất quán — cùng một cột, mười người mô tả mười kiểu; dễ bỏ sót chỗ nhạy cảm.
Kết quả quen thuộc: doanh nghiệp mua công cụ governance nhưng danh mục trống rỗng, vì không ai đủ sức điền. AI sinh ra để phá vỡ thế bế tắc này.
AI giúp gì trong nền tảng Ataccama ONE
Phần tiêu đề “AI giúp gì trong nền tảng Ataccama ONE”Ataccama ONE nhúng AI vào xuyên suốt các trụ cột quản trị dữ liệu. Điểm chung của mọi tính năng dưới đây: AI làm phần nặng, đề xuất sẵn — con người chỉ việc xem và duyệt, thay vì bắt đầu từ con số không.
Gợi ý mô tả và thuật ngữ nghiệp vụ
Phần tiêu đề “Gợi ý mô tả và thuật ngữ nghiệp vụ”AI đọc tên cột, kiểu dữ liệu, dữ liệu mẫu và bối cảnh xung quanh để đề xuất sẵn mô tả cho từng tập dữ liệu, đồng thời gợi ý gắn đúng thuật ngữ trong từ điển nghiệp vụ (business glossary). Thay vì phải tự nghĩ “cột cust_dob này là gì”, quản gia dữ liệu (data steward) nhận được đề xuất sẵn — chẳng hạn “ngày sinh khách hàng” — chỉ cần xác nhận hoặc sửa. Một việc lẽ ra mất nhiều tháng được rút xuống còn vài tuần soát xét.
Phân loại dữ liệu nhạy cảm và PII
Phần tiêu đề “Phân loại dữ liệu nhạy cảm và PII”AI tự động nhận diện và gắn nhãn những chỗ chứa dữ liệu cá nhân hoặc nhạy cảm — số căn cước, số điện thoại, email, số tài khoản, thông tin sức khỏe — kể cả khi tên cột đặt khó hiểu hay viết tắt. Đây là việc gần như không thể làm tay trên hàng nghìn bảng, nhưng lại là điều kiện bắt buộc để tuân thủ quy định bảo vệ dữ liệu cá nhân: bạn không thể bảo vệ thứ mình không biết nằm ở đâu.
Phát hiện bất thường trong dữ liệu
Phần tiêu đề “Phát hiện bất thường trong dữ liệu”Thay vì chỉ kiểm tra theo luật cứng do con người viết sẵn, AI học hành vi bình thường của dữ liệu rồi cảnh báo khi có điều khác lạ — doanh số tụt bất thường, số lượng bản ghi đột ngột tăng vọt, một trường vốn luôn đầy đủ bỗng trống rỗng. Cách làm này bắt được cả những lỗi mà không ai nghĩ ra để viết luật kiểm tra trước, giúp đội dữ liệu phát hiện sự cố trước khi nó lan vào báo cáo.
Đối sánh và gộp dữ liệu chủ (MDM)
Phần tiêu đề “Đối sánh và gộp dữ liệu chủ (MDM)”Trong dữ liệu chủ, bài toán khó nhất là nhận ra “Nguyễn Văn A” ở hệ thống này và “NGUYEN VAN A” ở hệ thống kia là cùng một người, dù tên viết khác, địa chỉ lệch, ngày sinh thiếu. AI thực hiện đối sánh thông minh (fuzzy matching) để ghép các bản ghi tưởng khác mà thực ra là một, tạo nên một hồ sơ khách hàng duy nhất — chính xác hơn nhiều so với so khớp cứng từng ký tự.
Nguyên tắc cốt lõi: con người vẫn là người duyệt
Phần tiêu đề “Nguyên tắc cốt lõi: con người vẫn là người duyệt”Điểm quan trọng nhất cần hiểu cho đúng: trong quản trị dữ liệu, AI đề xuất, con người quyết định — mô hình thường gọi là human-in-the-loop (con người trong vòng lặp).
AI không tự ý sửa nghĩa nghiệp vụ, không tự gộp hai khách hàng, không tự đóng dấu “đây là dữ liệu nhạy cảm” rồi áp dụng luôn. Nó chuẩn bị sẵn đề xuất kèm mức độ tin cậy, còn data steward hay data owner mới là người xem lại, chấp nhận, sửa hoặc bác bỏ. Lý do: quyết định về dữ liệu phải có người chịu trách nhiệm giải trình, không thể đổ cho máy; chỉ con người mới nắm bối cảnh nghiệp vụ riêng mà AI không đoán được; và khi sai — gộp nhầm khách hàng hay phân loại sót dữ liệu nhạy cảm — hậu quả pháp lý đòi hỏi phải có người gác cổng.
Nói cách khác, AI tăng tốc và mở rộng quy mô cho con người, chứ không thay con người cầm lái. Đây cũng là điều giúp doanh nghiệp tin tưởng kết quả: mọi nhãn, mọi quy tắc quan trọng đều đã qua mắt một người có thẩm quyền.
Chiều ngược lại: governance tốt là nền cho AI tốt
Phần tiêu đề “Chiều ngược lại: governance tốt là nền cho AI tốt”Phần lớn người ta hỏi “AI giúp gì cho quản trị dữ liệu”, nhưng câu hỏi quan trọng không kém là chiều ngược lại: quản trị dữ liệu giúp gì cho AI? Câu trả lời quyết định thành bại của mọi dự án AI trong doanh nghiệp.
Nguyên tắc kinh điển “rác vào, rác ra” (garbage in, garbage out) đúng với mọi hệ thống — và đúng gấp bội với AI. Một mô hình AI, dù thông minh đến đâu, cũng chỉ tốt bằng dữ liệu nuôi nó: dữ liệu bẩn và mâu thuẫn khiến AI học sai, dự đoán sai; không biết dữ liệu từ đâu tới thì không kiểm chứng được kết quả; dùng nhầm dữ liệu cá nhân để huấn luyện thì vi phạm quy định; mỗi phòng một định nghĩa “doanh thu” thì AI tổng hợp ra con số vô nghĩa.
Vì thế, trước khi mơ về AI, doanh nghiệp cần một nền dữ liệu được quản trị: dữ liệu sạch và đo được, có danh mục để biết dùng gì, có nguồn gốc để truy vết, biết rõ chỗ nào nhạy cảm để loại trừ. Quản trị dữ liệu không phải việc “làm sau khi đã có AI” — nó là điều kiện đi trước để AI thực sự dùng được. Đây cũng là thông điệp BSD Insight nhấn mạnh với doanh nghiệp đang muốn “làm AI”: hãy lo cho nền dữ liệu trước, AI sẽ theo sau một cách bền vững.
Ví dụ tại Việt Nam
Phần tiêu đề “Ví dụ tại Việt Nam”- Ngân hàng làm khách hàng-360: AI đối sánh hàng triệu bản ghi từ tài khoản tiền gửi, thẻ, vay tiêu dùng để gộp về một hồ sơ khách hàng duy nhất, đồng thời tự gắn nhãn các trường KYC nhạy cảm; đội tuân thủ chỉ soát những trường hợp AI không chắc.
- Tập đoàn bán lẻ chuẩn hóa danh mục: thay vì để hàng nghìn bảng dữ liệu không ai hiểu, AI đề xuất sẵn mô tả và thuật ngữ cho từng bảng, giúp phòng phân tích tìm và dùng đúng dữ liệu trong vài ngày thay vì vài tháng.
- Doanh nghiệp bảo hiểm chuẩn bị cho AI: trước khi triển khai mô hình dự báo bồi thường, họ dùng phát hiện bất thường để làm sạch dữ liệu lịch sử và phân loại loại bỏ dữ liệu cá nhân không được phép dùng — để mô hình về sau vừa chính xác vừa hợp quy.
Tiếp theo
Phần tiêu đề “Tiếp theo”AI thể hiện rõ nhất qua ba việc dưới đây — hãy xem chi tiết từng việc:
Sau khi đã thấy AI làm governance khả thi ở quy mô lớn, bước kế tiếp là hiểu mặt an toàn và pháp lý: dữ liệu nhạy cảm nằm ở đâu, ai được xem, và làm sao chứng minh tuân thủ — trong Bảo mật, quyền riêng tư và tuân thủ.