Bỏ qua để đến nội dung

Langfuse — AI Observability, Evaluation & Continuous Improvement của DataValue

Một AI application đầu tiên có vẻ đơn giản (User → Prompt → LLM → Answer; chưa tốt thì sửa prompt thử lại). Nhưng khi AI vào một Enterprise Data Platform như DataValue, architecture nhanh chóng phức tạp — một Customer Intelligence Agent có thể LangGraph → Query Cube → Retrieve Knowledge → Call LLM → Use Another Tool → Reason Again → Generate Recommendation → n8n → Business Action. Lúc này xuất hiện câu hỏi quan trọng: làm sao chúng ta biết AI thực sự đã làm gì? Nếu Agent recommend sai — sai ở dữ liệu? retrieval? prompt? model? một tool call? hay chọn sai reasoning path? Nếu bản mới tệ hơn — làm sao phát hiện? Nếu response tốt hơn nhưng chi phí gấp ba — có đáng không? Nếu Agent tốt trong development nhưng gặp edge case trong production — làm sao biến edge case đó thành test cho bản sau? Đây là lúc DataValue cần AI Observability, Evaluation & Continuous Improvement — capability được thực hiện bằng Langfuse.

AI khác phần mềm truyền thống ở điểm nào?

Phần tiêu đề “AI khác phần mềm truyền thống ở điểm nào?”

Phần mềm truyền thống: Input → Business Logic → Output (cùng input → cùng output nếu code không đổi). LLM application khác — chất lượng output phụ thuộc Prompt Version, Model, Temperature/Configuration, Retrieved Context, Tool Result, Conversation History, Agent State, Reasoning Path. Do đó monitoring AI không thể chỉ hỏi “service up hay down?” mà còn “AI có đang hoạt động tốt hay không?” — bài toán AI Observability.

Traditional application monitoring quan tâm CPU/Memory/Errors/Requests/Response Time (vẫn cần). Nhưng với AI còn phải quan sát Prompt, Model Call, Input, Output, Token Usage, Latency, Cost, Retrieval, Tool Calls, Agent Steps, Evaluation Score, User Feedback. Có thể nhìn: Application Observability (is the system running? → Latency/Errors/Infrastructure) + AI Observability (is the AI behaving well? → Trace/Prompt/Model/Tools/Quality/Cost/Outcome). Langfuse tập trung lớp thứ hai — hierarchical traces ghi đầy đủ các bước (LLM call, tool invocation, retrieval) trong AI workflow.

Trace — nhìn thấy toàn bộ hành trình một AI request

Phần tiêu đề “Trace — nhìn thấy toàn bộ hành trình một AI request”

Với “tại sao doanh thu tháng này giảm?”, phía sau có thể: Agent Start → Cube Query → Revenue −12% → Cube Query → Region Analysis → Knowledge Retrieval → Pricing Policy → LLM Reasoning → Recommendation → Response. Nếu chỉ lưu final response, ta không biết AI đến kết luận đó bằng cách nào. Langfuse ghi toàn bộ execution dưới dạng Trace:

flowchart TB
  T["TRACE"] --> AG["Agent"] & RE["Retrieval"] & CU["Cube Tool"] & LL["LLM Call"] & TO["Another Tool"] & FR["Final Response"]

AI từ black box trở thành hệ thống quan sát được. Khác Log (dòng sự kiện phẳng: 10:01 Request Started, 10:01 API Called, 10:02 Model Called…), Trace nhìn theo cấu trúc (Request → {Step A → Tool A, Step B → {Retrieval, LLM}, Step C → Final Answer}). Đặc biệt hữu ích với Agent (15 reasoning steps, 8 tool calls, 4 retrievals, 3 model calls): agent đi path nào? bước nào tốn thời gian? tool nào thất bại? model call nào chi phí cao? context nào đã đưa vào model?

“Revenue tháng 8 giảm bao nhiêu?” → Agent trả “giảm 23%” nhưng Dashboard “giảm 12%”. Không có observability, developer chỉ biết Expected −12% vs AI −23% rồi đoán. Nhưng Trace có thể cho thấy: (a) Cube trả đúng −12% → LLM ra −23% ⇒ lỗi model reasoning/prompt; hoặc (b) Cube nhận Period = July + August → Wrong Data ⇒ lỗi tool parameters; hoặc (c) Knowledge Retrieval → Old Pricing Policy ⇒ lỗi retrieval/freshness. Observability thay đổi hoàn toàn cách debug AI.

Một trace có thể hoàn hảo về kỹ thuật (No Error, Latency 2.3s, Tool Calls Successful) nhưng final answer vẫn có thể không chính xác/đầy đủ/hữu ích/tuân thủ instruction. Do đó cần Evaluation — trả lời AI application đang hoạt động tốt đến mức nào? (ví dụ Customer Service Agent: Answer Correctness 0.94, Policy Compliance 1.00, Relevance 0.91, Helpfulness 0.88; hoặc Used Correct Metric? YES, Used Current Policy? YES, Unsupported Claim? NO, Correct Action Selected? YES). Langfuse hỗ trợ nhiều kiểu evaluation — điểm làm nó vượt ngoài một tracing tool:

LLM-as-a-Judge

Dùng model khác chấm output (Question + Business Context + Expected Criteria + Agent Answer → Relevance 0.95, Faithfulness 0.91, Completeness 0.87), cho cả development và production traces.

Code Evaluators

Deterministic rule (Revenue in Response == Revenue from Cube; Discount Recommendation <= 10%; Response must contain source citation) — không dùng AI để đánh giá điều mà rule đơn giản đánh giá chính xác được.

Human Evaluation

Domain expert (Sales Director: Recommendation Useful? 1–5; Finance: Explanation Correct/Partially/Incorrect) qua manual annotation & annotation queues — quan trọng khi xây Domain Intelligence.

User Feedback

👍/👎, Accepted/Rejected/Edited Recommendation → AI Recommendation → Business User → Feedback/Action → Langfuse → Evaluation Data, liên kết AI Output với Business Acceptance.

Offline (trước deploy): Test Dataset → New Agent Version → Run Experiment → Evaluate → Good Enough? → No: Improve / Yes: Deploy — mục tiêu bắt regression trước production. Online (sau deploy): Production Traffic → Real Traces → Evaluation → Detect Problems — bắt vấn đề chỉ xuất hiện thực tế. Langfuse hỗ trợ cả hai như một continuous evaluation loop.

Phần mềm có Unit/Integration/Regression Tests; AI cũng cần test cases. Ví dụ Sales Agent Dataset: “Why did Revenue decline?” → Expected: correct period, correct customer segment, correct metric; “Which customers need follow-up?” → Top declining customers, no inactive customer; “Can we apply 15% discount?” → Must require approval. Langfuse hỗ trợ datasets để kiểm thử AI applications có hệ thống.

Pattern cực quan trọng. Traditional: Fix Bug → Deploy. DataValue nên: Production Failure → Add to Dataset → Fix Agent → Run Experiments → Ensure Old Failure is Fixed → Deploy (tài liệu Langfuse mô tả chính vòng lặp này — edge cases từ live traces đưa vào dataset để experiment sau kiểm tra lại). Điều này làm AI học về mặt engineering kể cả khi model không được fine-tune.

Experiment — thay đổi có thật sự tốt hơn?

Phần tiêu đề “Experiment — thay đổi có thật sự tốt hơn?”

Agent Version A vs Agent Version B (prompt/retrieval/model mới) — B có thực sự tốt hơn? Không trả lời bằng cảm giác: EVALUATION DATASET → {Version A → Scores, Version B → Scores} → Compare. Langfuse Experiments hỗ trợ chạy application/prompts trên datasets và áp evaluators để so sánh. Model Selection cũng vậy — không dựa public benchmark chung: Finance Agent Dataset → {Model A: Accuracy 94% Cost 100, Model B: Accuracy 92% Cost 40} → có thể Model B hợp hơn. Langfuse chuyển model selection từ general benchmark sang business-specific evaluation.

Ở giai đoạn thử nghiệm, prompt nằm trong code. Khi lớn lên có Sales/Finance/Customer Agent Prompt, Retrieval/Decision/Evaluation Prompt, mỗi prompt nhiều version → prompt thành một managed asset. Langfuse có Prompt Management để lưu/version/deploy prompts thay vì hard-code, link version với traces để theo dõi performance theo version (Prompt Version → Production Traces → Latency/Cost/Evaluation Score). Và prompt & code không nên luôn deploy cùng nhau — Prompt Management cho phép tách lifecycle (Prompt Repository → Version → Label/Environment → Application; SDK cache prompt ở client để tránh prompt retrieval thành dependency mỗi request). A/B Testing (50% Users → Prompt A, 50% → Prompt B → so sánh Quality/Latency/Cost/User Feedback/Business Outcome) — nhưng với DataValue phải dùng chọn lọc: use case rủi ro cao (Financial Decision, Pricing, Contract, Procurement Approval) phải offline evaluation trước, không đưa variation chưa kiểm thử vào production.

Một Enterprise Agent có thể 1 User Request → 5 Model Calls + 3 Retrievals + 4 Tool Calls; với 10.000 Requests/Day, chi phí đáng kể. Cần nhìn Cost per Request/Agent/Model/User/Business Use Case. Langfuse theo dõi cost/usage/latency trong traces (query được qua Metrics API) — mở ra concept AI FinOps. Nhưng cost không nên đo một mình: Model A: Cost $0.02, Quality 70% vs Model B: Cost $0.04, Quality 94% — không thể kết luận A tốt hơn vì rẻ hơn. DataValue tối ưu Quality + Latency + Cost, xa hơn Quality + Cost + Business Outcome.

Từ AI Metrics đến Business Metrics & Decision-to-Outcome Traceability

Phần tiêu đề “Từ AI Metrics đến Business Metrics & Decision-to-Outcome Traceability”

Langfuse đo Accuracy, Latency, Cost, Evaluation Score; n8n và business systems cho biết CRM Task Created, Customer Contacted, Offer Accepted, Customer Returned, Revenue Recovered. Nối hai phía (AI Trace → Agent Recommendation → Business Action → Business Outcome), DataValue có thể hỏi agent nào thực sự tạo ra business value? — cấp observability cao hơn nhiều. Traditional AI monitoring: Prompt → Response; DataValue hướng tới Data → Context → Agent Reasoning → Decision → Business Action → Outcome. Ví dụ AI: Customer A high churn risk → n8n: CRM Task → Sales: customer contacted → Outcome: customer ordered again → trace được AI Recommendation → Business Outcome — gọi là Decision-to-Outcome Traceability, đích đến có giá trị của AI observability.

Trách nhiệm
OpenMetadataData Trust & Governance (Datasets/Tables/Columns/Pipelines/Lineage/Owners/Data Quality)
LangfuseAI Trust & Improvement (Prompts/LLM Calls/Agent Runs/Retrievals/Tool Calls/AI Outputs/Evaluation Scores)
CubeTrusted Meaning (metric nghĩa là gì, Revenue tính ra sao)
LangfuseTrusted AI Operation (agent dùng metric nào, gọi tool gì, prompt version nào, response tốt không)
LlamaIndex/RAGFlowKnowledge nào cần đưa cho AI
LangfuseRetrieval đó hoạt động tốt không? (Relevant? Correct Source? Correct Version? Enough Context?)
n8nAct (Decision → Business Workflow → Action)
LangfuseObserve/Evaluate/Improve (quan sát AI trước & xung quanh quyết định)
  • Langfuse không chạy Agent — nó không phải agent runtime, không host/run agents. Đúng: User → LangGraph Agent → LLM/Tools/Knowledge → (bắn sang) Langfuse Observe. Sai: User → Langfuse → Agent.
  • Không chỉ “logging cho LLM” — Langfuse kết hợp Tracing + Prompt Management + Evaluation + Datasets + Experiments thành một AI engineering loop, biến từ AI Debugging Tool thành AI Continuous Improvement Platform.

Điểm hợp nhất với triết lý DataValue: BUILD → TEST → DEPLOY → OBSERVE → EVALUATE → LEARN → IMPROVE → BUILD AGAIN (Langfuse mô tả gần đúng vòng lặp này giữa tracing, monitoring, datasets, experiments, evaluation). Không còn “deploy AI rồi hy vọng nó hoạt động” mà Measure → Learn → Improve.

Ví dụ end-to-end (Customer Retention Agent): LangGraph → Cube (Revenue ↓42%, Frequency ↓55%, Last Purchase 48 days) → LlamaIndex (Contract, Pricing Policy, Service Notes) → Model reasoning (Churn Risk High) → Recommendation → n8n (Create CRM Task, Assign Owner, Notify Manager). Trong toàn bộ, Langfuse Trace: ai hỏi? agent nào? Cube query nào? documents nào retrieved? model nào? prompt version nào? tools nào? mất bao lâu? chi phí bao nhiêu? kết quả gì? đúng không? — end-to-end AI observability. Sau đó Business Outcome quay lại: Customer Contacted → Offer Accepted → New Order 500M; nối Agent Trace → Recommendation → CRM Task → Customer Outcome → metric Business Value generated by AI — evaluation không còn chỉ hỏi “answer có hay không?” mà “AI có giúp doanh nghiệp đạt outcome tốt hơn không?”. (Tương tự Finance Agent: trace AR Metrics/Contract Context/Reasoning/Recommendation/Model/Cost → Collection → Payment Received; Procurement Agent: Cube Lead Time/Delivery + Knowledge Contract/Quality Report + LLM Risk Reasoning → biết supplier nào phân tích, data/document nào dùng, risk score đúng không, bản Agent mới có tốt hơn.)

Không thể governance một hệ thống nếu không quan sát được nó: muốn biết AI dùng model nào, gọi tool gì, dùng prompt nào, nhận context gì, tạo output gì thì trước hết phải có trace — OBSERVABILITY → EVALUATION → CONTROL → GOVERNANCE. Langfuse không tự thay toàn bộ AI Governance nhưng cung cấp phần dữ liệu quan trọng để governance thành thực tế. Và Explainability → Accountability: đôi khi người dùng hỏi “tại sao Agent recommend thế này?” — không phải lúc nào cũng giải thích được nội tại model, nhưng có thể cung cấp execution evidence (Input → Business Data Used → Knowledge Retrieved → Tools Called → Prompt Version → Model → Output) — tạo Operational Explainability và hỗ trợ AI Accountability.

Langfuse nằm ở đâu — cross-cutting AI engineering layer

Phần tiêu đề “Langfuse nằm ở đâu — cross-cutting AI engineering layer”

Langfuse không nằm như một bước tuần tự (Cube → Langfuse → n8n) mà là cross-cutting AI engineering layer quan sát xuyên suốt AI lifecycle:

flowchart TB
  U["User"] --> LG["LANGGRAPH · Reason · Orchestrate"]
  LG --> CUBE["Cube"] & LI["LlamaIndex"] & TOOLS["Tools"]
  LG --> MODEL["Model"] --> DEC["Decision"] --> N8N["n8n · Act"] --> OUT["Outcome"]
  LF["LANGFUSE · Trace · Evaluate · Experiment · Prompt Management · Improve"] -. quan sát xuyên suốt .-> LG

DataValue có một symmetry đẹp — hai cross-cutting foundations: ở Data Layer OpenMetadata (Discover · Govern · Trust → Data Trust); ở AI Layer Langfuse (Observe · Evaluate · Improve → AI Trust). Cả hai là cross-cutting trust layers, không phải bước nối tiếp. AI application cần thêm một lifecycle so với DevOps truyền thống (CODE → TEST → DEPLOY → MONITOR): PROMPT/MODEL/CONTEXT/RETRIEVAL/AGENT → TRACE → EVALUATE → EXPERIMENT → IMPROVE — Langfuse tự định vị là một open-source AI engineering platform (open source, self-hostable, public APIs), không chỉ observability.

Từ AI Prototype đến Production AI & Kết luận

Phần tiêu đề “Từ AI Prototype đến Production AI & Kết luận”

Xây một AI demo tương đối dễ (một prompt + một model + một UI). Nhưng để AI thành enterprise capability, câu hỏi không còn chỉ “AI có trả lời được không?” mà: AI đã dùng dữ liệu gì? context nào? tool nào? prompt version nào? model nào? response chính xác không? chất lượng có giảm không? bản mới tốt hơn không? chi phí hợp lý không? người dùng có chấp nhận recommendation không? và quan trọng nhất — AI có tạo ra Business Outcome không?. Đó là khoảng cách giữa AI DEMO và PRODUCTION AI — Langfuse giúp DataValue quản lý khoảng cách đó.

Langfuse không reasoning (đó là Model/LangGraph), không cung cấp Enterprise Knowledge (LlamaIndex/RAGFlow), không định nghĩa Business Metrics (Cube), không thực hiện Business Action (n8n). Vai trò: giúp biết AI đang làm gì, đánh giá AI làm tốt đến đâu, tạo vòng lặp để AI liên tục cải thiện. Langfuse — Observe · Evaluate · Improve. Điểm quan trọng nhất: AI không đáng tin chỉ vì model ngày càng thông minh — AI đáng tin khi doanh nghiệp có khả năng quan sát → đo lường → đánh giá → thử nghiệm → học hỏi → cải thiện. Langfuse khép thêm vòng lặp đưa DataValue từ Data-to-Action Platform thành Learning Data & AI Platform: Data → Trusted Meaning → Knowledge → AI Reasoning → Decision → Action → Outcome → Observe → Evaluate → Learn → Improve → Better AI → Value.

Chia sẻ: