Profiling & Documentation Flows
Profiling là bước “soi” dữ liệu để hiểu nó thực sự chứa gì — nền tảng cho mọi việc tiếp theo (chất lượng, phân loại, gắn thuật ngữ).
Profiling cho biết điều gì
Phần tiêu đề “Profiling cho biết điều gì”- Thống kê cột: số bản ghi, tỷ lệ rỗng, số giá trị phân biệt (distinct), min/max…
- Mẫu & phân bố giá trị: dạng dữ liệu phổ biến, ngoại lệ.
- Gợi ý kiểu/định dạng: giúp nhận diện email, số điện thoại, mã… để gắn thuật ngữ/quy tắc phù hợp.
Documentation Flows
Phần tiêu đề “Documentation Flows”Đây là các luồng tự động làm giàu metadata sau khi quét/profiling: ví dụ tự đề xuất mô tả, gắn thuật ngữ, phân loại. Mục tiêu là giảm công sức thủ công khi catalog lớn dần.
Vì sao quan trọng
Phần tiêu đề “Vì sao quan trọng”- Hiểu trước khi quản: không thể đặt quy tắc chất lượng đúng nếu chưa biết dữ liệu trông thế nào.
- Cơ sở cho gợi ý AI: nhiều gợi ý (thuật ngữ, quy tắc) dựa trên kết quả profiling.
- Nhớ rằng: theo kiến trúc Ataccama, profiling chạy ở DPE gần nguồn, kết quả là metadata mô tả.