Bỏ qua để đến nội dung

Phát hiện bất thường bằng AI (Anomaly Detection)

Quy tắc chất lượng cứng rất giỏi bắt những lỗi bạn đã biết trước — nhưng còn những vấn đề bạn chưa từng nghĩ tới để viết quy tắc thì sao? Trang này dành cho người mới, giải thích Anomaly Detection trong Ataccama ONE: cách dùng AI để tự học hành vi bình thường của dữ liệu rồi cảnh báo khi có điều gì đó bất thường — kể cả khi không có quy tắc nào mô tả nổi “bất thường” đó.

Vấn đề: quy tắc cứng chỉ bắt được cái bạn đã đoán trước

Phần tiêu đề “Vấn đề: quy tắc cứng chỉ bắt được cái bạn đã đoán trước”

Một quy tắc chất lượng (DQ rule) luôn kiểm một điều kiện biết trước: “email phải đúng định dạng”, “tuổi phải từ 0 đến 120”. Cực kỳ hữu ích — nhưng có một điểm mù lớn: nó chỉ bắt được những lỗi mà bạn đã nghĩ tới và viết thành quy tắc.

Hãy xét một ví dụ rất Việt Nam. Một sàn thương mại điện tử mỗi ngày ghi nhận khoảng 50.000 đơn hàng. Một sáng, do lỗi tích hợp với cổng thanh toán, hệ thống chỉ ghi nhận 5.000 đơn. Từng đơn trong số 5.000 đó đều hoàn toàn hợp lệ — đúng định dạng, đủ trường, không vi phạm quy tắc nào. Mọi DQ rule đều báo “đạt”. Nhưng rõ ràng có chuyện lớn đã xảy ra: số lượng tụt 90 phần trăm so với bình thường.

Đây chính là khoảng trống mà Anomaly Detection lấp vào: nó không kiểm “dữ liệu có đúng quy tắc không” mà hỏi “hôm nay dữ liệu có hành xử khác thường so với mọi khi không?”

Anomaly Detection (phát hiện bất thường) dùng AI / học máy để học hành vi bình thường của dữ liệu theo thời gian, rồi tự động cảnh báo khi có sai lệch đáng kể. Điểm cốt lõi: bạn không cần định nghĩa trước thế nào là bất thường — AI tự xây “đường nền” từ lịch sử và phát hiện cái nằm ngoài đó.

Quan trọng là Ataccama áp AI này lên metadata và các chỉ số chất lượng (data quality metrics) — tức là theo dõi các con số mô tả dữ liệu theo thời gian, ví dụ:

  • Số bản ghi mỗi lần nạp (như ví dụ 50.000 đơn ở trên).
  • Tỷ lệ rỗng của một cột.
  • Điểm chất lượng (DQ score) của một tài sản.
  • Phân bố giá trị, độ tươi, và các chỉ số vận hành khác.

Khi một trong các chỉ số này “nhảy” ra ngoài vùng AI cho là bình thường, hệ thống đánh dấu đó là bất thường (anomaly) và cảnh báo.

Ataccama hỗ trợ hai cách AI nhìn vào dữ liệu, phục vụ hai loại bất thường khác nhau:

Chế độ này so sánh giá trị hiện tại với xu hướng lịch sử của chính chỉ số đó. AI học mẫu hành vi theo thời gian — kể cả các chu kỳ và mùa vụ:

  • Đơn hàng cuối tuần thường cao hơn ngày thường → AI hiểu điều đó, không báo động nhầm vào mỗi thứ Bảy.
  • Lượng giao dịch tăng vọt dịp Tết là bình thường theo mùa → AI không coi đó là bất thường.

Nhờ vậy, một con số “cao bất thường” vào thứ Ba lại có thể là “hoàn toàn bình thường” vào Chủ nhật — và AI phân biệt được. Đây là chế độ hợp với các chỉ số có nhịp điệu theo thời gian rõ rệt.

Chế độ này không nhìn xu hướng theo thời gian, mà đánh giá một giá trị so với điều gì là hợp lý về bản chất của chỉ số đó — phát hiện giá trị nằm ngoài khoảng kỳ vọng dù không cần lịch sử dài. Hữu ích khi dữ liệu chưa có đủ lịch sử để dựng xu hướng, hoặc khi bản thân con số đã lệch tới mức vô lý bất kể thời điểm.

Trong thực tế bạn có thể dùng kết hợp: chế độ phụ thuộc thời gian cho các chỉ số có chu kỳ (khối lượng giao dịch), chế độ độc lập thời gian cho các chỉ số cần một ngưỡng hợp lý ổn định.

Có thể bạn nghĩ: “Sao không viết hẳn một quy tắc — số đơn phải trên 40.000?” Trên thực tế cách đó rất khó bền vì:

  • Ngưỡng cứng nhanh chóng lỗi thời. Doanh nghiệp tăng trưởng, “bình thường” của tháng này khác tháng sau. Bạn sẽ phải đi sửa ngưỡng thủ công liên tục cho hàng trăm chỉ số — bất khả thi.
  • Ngưỡng cứng không hiểu mùa vụ. Một ngưỡng “trên 40.000” sẽ báo động giả mỗi ngày thấp điểm và bỏ sót sụt giảm trong mùa cao điểm.
  • Bạn không thể đoán trước mọi loại bất thường. Cái nguy hiểm nhất thường là cái bạn chưa từng nghĩ tới — đúng loại mà quy tắc viết tay bỏ sót.

AI giải quyết cả ba: nó tự cập nhật đường nền khi dữ liệu thay đổi, hiểu mùa vụ, và không cần bạn liệt kê trước từng kịch bản. Nói ngắn gọn: quy tắc cứng bắt lỗi đã biết, còn Anomaly Detection bắt bất thường chưa biết — hai thứ bổ sung cho nhau, không thay thế nhau.

Khi AI phát hiện một bất thường, nó tạo cảnh báo để đội dữ liệu xem xét. Quy trình xử lý lành mạnh thường gồm:

  • Xem ngữ cảnh: chỉ số nào bất thường, lệch bao nhiêu so với đường nền, xảy ra lúc nào.
  • Phân loại: đây là sự cố thật (pipeline hỏng, nguồn lỗi) hay là thay đổi hợp lệ (vừa ra mắt sản phẩm mới nên đơn tăng vọt)?
  • Phản hồi cho hệ thống: xác nhận đúng/sai giúp mô hình ngày càng hiểu rõ “bình thường” của riêng dữ liệu của bạn, giảm dần báo động giả.

Một lưu ý quan trọng cho người mới: không phải bất thường nào cũng là lỗi. Một cú tăng đột biến có thể là tin tốt (chiến dịch marketing thành công). Vai trò của AI là chỉ chỗ đáng chú ý, còn con người mới là người diễn giải và quyết định. Đặt kỳ vọng đúng ngay từ đầu sẽ giúp đội bạn tin và dùng công cụ lâu dài, thay vì bực bội rồi tắt cảnh báo.

Anomaly Detection không đứng một mình mà là lớp thông minh nhất trong chiến lược giám sát chất lượng, bên cạnh hai trang anh em:

  • Monitoring Projects chấm điểm chất lượng theo quy tắc nghiệp vụ bạn chọn, cho các tài sản trọng yếu.
  • Data Observability tự động canh sức khỏe vận hành (tươi, khối lượng, cấu trúc) trên diện rộng.
  • Anomaly Detection dùng AI bắt những bất thường tinh vi mà cả hai cách trên dựa-trên-ngưỡng có thể bỏ sót.

Ba lớp này chồng lên nhau tạo thành một mạng lưới an toàn nhiều tầng cho dữ liệu của bạn.

Chia sẻ: