Bỏ qua để đến nội dung

Đánh giá chất lượng và xem bản ghi lỗi (invalid samples)

Bạn đã định nghĩa được “thế nào là dữ liệu tốt” qua các quy tắc chất lượng. Bước tiếp theo là bấm chạy để biết dữ liệu thật của mình đạt bao nhiêu phần — và quan trọng hơn, những bản ghi nào đang sai. Đó chính là việc của đánh giá (evaluation). Trang này viết cho người mới: giải thích đánh giá là gì, kết quả gồm những gì, và vì sao việc nhìn tận mắt từng bản ghi lỗi (invalid samples) mới là chìa khóa để sửa dữ liệu, chứ không chỉ là một con số đẹp trên dashboard.

Đánh giá là hành động lấy các quy tắc chất lượng đã gắn cho một tập dữ liệu rồi chạy chúng trên dữ liệu thật, để cho ra kết quả cụ thể. Nếu ví quy tắc chất lượng như đề thi (“email phải đúng định dạng”, “mã số thuế đủ số”), thì đánh giá là lúc chấm bài trên toàn bộ bảng dữ liệu của bạn.

Trước khi đánh giá, bạn mới chỉ có mong muốn về chất lượng. Sau khi đánh giá, bạn có bằng chứng: bao nhiêu bản ghi đạt, bao nhiêu bản ghi rớt, và rớt ở quy tắc nào. Đây là bước biến chất lượng dữ liệu từ cảm tính thành thứ đo được, theo dõi được, sửa được.

Data governance cần niềm tin có cơ sở. Lãnh đạo không thể chỉ nghe “dữ liệu khách hàng của mình khá ổn”; họ cần một con số và cần biết con số đó từ đâu ra. Đánh giá cung cấp đúng điều đó: một điểm chất lượng kèm danh sách bản ghi vi phạm để bất kỳ ai cũng truy ngược lại được. Không có đánh giá, mọi quy tắc bạn viết chỉ nằm trên giấy.

Ataccama ONE cho bạn hai cách chạy đánh giá, dùng cho hai tình huống khác nhau:

  • Tức thời (theo yêu cầu): bạn bấm chạy ngay tại thời điểm cần. Phù hợp khi vừa viết xong một quy tắc và muốn thử ngay trên dữ liệu thật, hoặc khi sếp hỏi gấp “tỷ lệ khách hàng thiếu số điện thoại đang là bao nhiêu phần trăm”.
  • Theo lịch: bạn đặt đánh giá tự chạy định kỳ — mỗi đêm, mỗi tuần, hoặc sau mỗi lần dữ liệu được nạp mới. Phù hợp khi muốn theo dõi xu hướng chất lượng theo thời gian mà không phải nhớ bấm tay.

Mỗi lần đánh giá xong, bạn nhận về hai phần bổ sung cho nhau:

Một con số tổng hợp — thường tính theo phần trăm — cho biết tỷ lệ dữ liệu đạt so với toàn bộ. Điểm này có thể xem ở nhiều mức:

  • Theo từng quy tắc: quy tắc “email hợp lệ” đạt 92 phần trăm, quy tắc “mã số thuế đủ số” đạt 78 phần trăm.
  • Theo từng cột / từng chiều chất lượng: ví dụ chiều “tính đầy đủ” của bảng khách hàng đạt 85 phần trăm.
  • Theo cả tập dữ liệu: một điểm chung để báo cáo nhanh cho lãnh đạo.

Điểm chất lượng cho bạn bức tranh tổng: nhìn vào là biết chỗ nào đang yếu nhất cần ưu tiên xử lý trước.

Song song với con số, đánh giá lập ra danh sách những bản ghi không đạt — tức các dòng dữ liệu cụ thể đã rớt ở ít nhất một quy tắc. Đây mới là phần “biết phải sửa cái gì”. Một điểm chất lượng 78 phần trăm tự nó không giúp bạn sửa được gì; nhưng danh sách 22 phần trăm bản ghi còn lại, kèm lý do rớt, thì sửa được ngay.

Invalid samples — nhìn tận mắt bản ghi lỗi

Phần tiêu đề “Invalid samples — nhìn tận mắt bản ghi lỗi”

Đây là phần quan trọng nhất của trang này. Invalid samples (mẫu bản ghi không hợp lệ) là tính năng cho bạn mở ra xem chính những dòng dữ liệu đã rớt, thay vì chỉ thấy con số tổng.

Vì sao điều này đáng giá đến vậy? Vì con số nói “có sai”, còn bản ghi cụ thể nói “sai ở đâu và vì sao”. Hai ví dụ cho thấy khác biệt:

  • Bạn thấy quy tắc “mã số thuế hợp lệ” chỉ đạt 78 phần trăm. Con số này khiến bạn lo, nhưng không biết hành động gì. Khi mở invalid samples, bạn thấy phần lớn bản ghi rớt là vì người nhập gõ thừa dấu cách hoặc dấu gạch ngang trong mã số thuế — một lỗi định dạng có thể chuẩn hóa tự động, không phải dữ liệu sai bản chất.
  • Quy tắc “email hợp lệ” rớt 8 phần trăm. Mở mẫu lỗi ra, bạn phát hiện hầu hết là các email kết thúc bằng @gmai.com (thiếu chữ “l”) — một lỗi gõ tay rất phổ biến mà chỉ khi nhìn dữ liệu thật mới nhận ra để xử lý đúng nguồn.

Nếu chỉ dừng ở con số, bạn dễ chẩn đoán sai bệnh và “chữa” nhầm chỗ. Nhìn được bản ghi lỗi cụ thể mới biết đúng nguyên nhân — và mới sửa trúng. Đây là khác biệt giữa một báo cáo để ngắm và một công cụ để hành động.

Từ đánh giá đến khắc phục: xuất sang ONE Data

Phần tiêu đề “Từ đánh giá đến khắc phục: xuất sang ONE Data”

Xem được bản ghi lỗi mới chỉ là chẩn đoán. Bước chữa trị là đưa những bản ghi đó vào quy trình sửa. Ataccama ONE cho phép xuất danh sách bản ghi vi phạm sang ONE Data — không gian để người phụ trách dữ liệu (data steward) xem, lọc, sửa và theo dõi đến khi sạch.

Điểm hay là việc khắc phục trở nên có chủ đích: thay vì “rà soát lại cả bảng khách hàng” (tốn hàng tuần), bạn chỉ làm việc trên đúng tập bản ghi đã rớt, đã biết lý do. Ví dụ: xuất 1.200 bản ghi khách hàng có mã số thuế sai định dạng sang ONE Data, giao cho bộ phận kế toán chuẩn hóa, rồi chạy lại đánh giá để xác nhận điểm chất lượng đã lên.

  1. Chạy đánh giá trên tập dữ liệu (tức thời để thử, theo lịch để theo dõi).
  2. Đọc điểm chất lượng để biết quy tắc/cột/chiều nào đang yếu nhất.
  3. Mở invalid samples của quy tắc yếu nhất để hiểu nguyên nhân thật của lỗi.
  4. Xuất bản ghi vi phạm sang ONE Data để giao cho người phụ trách sửa.
  5. Chạy lại đánh giá để xác nhận điểm đã cải thiện và lỗi không tái diễn.
  • Chỉ nhìn điểm, bỏ qua bản ghi lỗi. Điểm chất lượng giúp xếp ưu tiên, nhưng không cho bạn biết phải sửa gì. Luôn mở invalid samples trước khi quyết định hành động.
  • Vội kết luận “dữ liệu hỏng nặng” khi điểm thấp. Rất nhiều trường hợp điểm thấp đến từ một lỗi định dạng nhỏ lặp lại — chuẩn hóa một lần là điểm vọt lên.
  • Đánh giá một lần rồi thôi. Dữ liệu mới được nạp mỗi ngày, lỗi mới cũng sinh ra mỗi ngày. Hãy chuyển sang đánh giá theo lịch để chất lượng được theo dõi liên tục, không phải kiểm tra một lần cho có.
Chia sẻ: