Bỏ qua để đến nội dung

Profiling & Documentation Flows

Profiling là bước “soi” dữ liệu để hiểu nó thực sự chứa gì — nền tảng cho mọi việc tiếp theo (chất lượng, phân loại, gắn thuật ngữ).

  • Thống kê cột: số bản ghi, tỷ lệ rỗng, số giá trị phân biệt (distinct), min/max…
  • Mẫu & phân bố giá trị: dạng dữ liệu phổ biến, ngoại lệ.
  • Gợi ý kiểu/định dạng: giúp nhận diện email, số điện thoại, mã… để gắn thuật ngữ/quy tắc phù hợp.

Đây là các luồng tự động làm giàu metadata sau khi quét/profiling: ví dụ tự đề xuất mô tả, gắn thuật ngữ, phân loại. Mục tiêu là giảm công sức thủ công khi catalog lớn dần.

  • Hiểu trước khi quản: không thể đặt quy tắc chất lượng đúng nếu chưa biết dữ liệu trông thế nào.
  • Cơ sở cho gợi ý AI: nhiều gợi ý (thuật ngữ, quy tắc) dựa trên kết quả profiling.
  • Nhớ rằng: theo kiến trúc Ataccama, profiling chạy ở DPE gần nguồn, kết quả là metadata mô tả.
Chia sẻ: