LLM Quest Academy
← Quay lại Blog

Đánh giá chất lượng LLM 2026: RAGAs, G-Eval, LLM-as-judge

LLM Quest Editorial·20 thg 4, 2026·1 phút đọc
Đánh giá chất lượng LLM 2026: RAGAs, G-Eval, LLM-as-judge
Đánh giá chất lượng LLM 2026: RAGAs, G-Eval, LLM-as-judge

"LLM hoạt động tốt" là câu không thể chấp nhận trong production. Đây là cách đo lường chặt chẽ, không tốn 1 tuần review manual.

Vì sao eval lại khó?

Output LLM không như classifier — không có 1 "đúng" duy nhất. "Paris" vs "thủ đô Pháp là Paris" đều đúng. Eval truyền thống (exact match, BLEU) quá strict hoặc quá rộng.

3 metric framework đáng dùng

1. RAGAs — eval RAG pipeline

Chuẩn cho RAG. Đo 4 metric:

  • context_precision: retrieved chunks có liên quan không?
  • context_recall: chunks có đủ thông tin trả lời không?
  • answer_relevancy: câu trả lời có đúng câu hỏi không?
  • faithfulness: câu trả lời có dựa trên context (không hallucinate)?

Setup 1 dòng:

from ragas import evaluate
from ragas.metrics import context_precision, context_recall, answer_relevancy, faithfulness

result = evaluate(dataset, metrics=[context_precision, context_recall, answer_relevancy, faithfulness])

Score < 0.7 trên bất kỳ metric nào → retrieval/generation có vấn đề.

2. G-Eval — scoring tuỳ chỉnh

Bạn viết rubric, LLM chấm. Ví dụ đánh giá "câu trả lời support customer":

Score 1–5 dựa trên:
- Có giải quyết vấn đề cốt lõi không? (40%)
- Tone có thân thiện không? (20%)
- Có đề xuất bước tiếp theo không? (20%)
- Ngôn ngữ chuyên nghiệp (không lỗi chính tả)? (20%)

GPT-5 chấm 100 sample ~ $0.5 + 3 phút. Thay cho 1 ngày review manual.

3. LLM-as-judge (pairwise)

Tốt nhất cho so sánh A vs B. Cho 2 output và 1 prompt:

Output A: ...
Output B: ...
Câu hỏi: ...

Output nào tốt hơn, vì sao? Trả lời: "A", "B", hoặc "Tie".

Chạy cả 2 chiều (A trước B, B trước A) để cancel position bias. Dùng cho A/B test model versions trong production.

Khi auto-eval SAI

Auto-eval vẫn có bias. Luôn có 50–100 sample human-eval để calibrate. Nếu auto-eval nói model A tốt hơn B 15%, nhưng human eval nói ngược lại → rubric có vấn đề.

Golden dataset

Build 1 bộ 100–500 câu hỏi có câu trả lời chuẩn:

  • Đa dạng (easy/medium/hard, edge case)
  • Immutable (không đổi khi model update)
  • Versioned (git commit)

Run golden dataset trước mỗi deploy. Nếu score tụt > 3% → rollback.

CI/CD cho LLM eval

GitHub Action mẫu:

- name: LLM regression eval
  run: python eval.py --dataset golden.jsonl --threshold 0.85
  # Fail build nếu dưới ngưỡng

Chi phí ngân sách

  • Golden dataset 200 câu: 1 ngày build + $5 LLM eval/lần run
  • Weekly regression eval: $20/tuần
  • Per-PR eval: $1/PR (chạy 50 câu subset)

Total: ~$100/tháng cho confidence vào production model quality.

Kết luận

Eval không phải "nice to have" — là điều kiện đủ để deploy LLM production. RAGAs cho RAG, G-Eval cho task tuỳ chỉnh, pairwise cho A/B. Human eval 50–100 sample mỗi lần major update.

LLM Quest Academy Level 9 có module evaluation + monitoring chi tiết.

#LLM evaluation#RAGAs#LLM-as-judge#benchmarking#RAG
Advertisement