Đánh giá chất lượng LLM 2026: RAGAs, G-Eval, LLM-as-judge
"LLM hoạt động tốt" là câu không thể chấp nhận trong production. Đây là cách đo lường chặt chẽ, không tốn 1 tuần review manual.
Vì sao eval lại khó?
Output LLM không như classifier — không có 1 "đúng" duy nhất. "Paris" vs "thủ đô Pháp là Paris" đều đúng. Eval truyền thống (exact match, BLEU) quá strict hoặc quá rộng.
3 metric framework đáng dùng
1. RAGAs — eval RAG pipeline
Chuẩn cho RAG. Đo 4 metric:
- context_precision: retrieved chunks có liên quan không?
- context_recall: chunks có đủ thông tin trả lời không?
- answer_relevancy: câu trả lời có đúng câu hỏi không?
- faithfulness: câu trả lời có dựa trên context (không hallucinate)?
Setup 1 dòng:
from ragas import evaluate
from ragas.metrics import context_precision, context_recall, answer_relevancy, faithfulness
result = evaluate(dataset, metrics=[context_precision, context_recall, answer_relevancy, faithfulness])
Score < 0.7 trên bất kỳ metric nào → retrieval/generation có vấn đề.
2. G-Eval — scoring tuỳ chỉnh
Bạn viết rubric, LLM chấm. Ví dụ đánh giá "câu trả lời support customer":
Score 1–5 dựa trên:
- Có giải quyết vấn đề cốt lõi không? (40%)
- Tone có thân thiện không? (20%)
- Có đề xuất bước tiếp theo không? (20%)
- Ngôn ngữ chuyên nghiệp (không lỗi chính tả)? (20%)
GPT-5 chấm 100 sample ~ $0.5 + 3 phút. Thay cho 1 ngày review manual.
3. LLM-as-judge (pairwise)
Tốt nhất cho so sánh A vs B. Cho 2 output và 1 prompt:
Output A: ...
Output B: ...
Câu hỏi: ...
Output nào tốt hơn, vì sao? Trả lời: "A", "B", hoặc "Tie".
Chạy cả 2 chiều (A trước B, B trước A) để cancel position bias. Dùng cho A/B test model versions trong production.
Khi auto-eval SAI
Auto-eval vẫn có bias. Luôn có 50–100 sample human-eval để calibrate. Nếu auto-eval nói model A tốt hơn B 15%, nhưng human eval nói ngược lại → rubric có vấn đề.
Golden dataset
Build 1 bộ 100–500 câu hỏi có câu trả lời chuẩn:
- Đa dạng (easy/medium/hard, edge case)
- Immutable (không đổi khi model update)
- Versioned (git commit)
Run golden dataset trước mỗi deploy. Nếu score tụt > 3% → rollback.
CI/CD cho LLM eval
GitHub Action mẫu:
- name: LLM regression eval
run: python eval.py --dataset golden.jsonl --threshold 0.85
# Fail build nếu dưới ngưỡng
Chi phí ngân sách
- Golden dataset 200 câu: 1 ngày build + $5 LLM eval/lần run
- Weekly regression eval: $20/tuần
- Per-PR eval: $1/PR (chạy 50 câu subset)
Total: ~$100/tháng cho confidence vào production model quality.
Kết luận
Eval không phải "nice to have" — là điều kiện đủ để deploy LLM production. RAGAs cho RAG, G-Eval cho task tuỳ chỉnh, pairwise cho A/B. Human eval 50–100 sample mỗi lần major update.
LLM Quest Academy Level 9 có module evaluation + monitoring chi tiết.