Cheat sheet LLM 2026: Transformer · Attention · RAG · Fine-tuning · PPO · DPO · Speculative decoding
TL;DR. Transformer là kiến trúc, Attention là cơ chế tính tương tác bên trong. RAG cho LLM tra cứu tài liệu. Fine-tuning dạy model phong cách / kỹ năng. PPO và DPO căn chỉnh model theo sở thích con người. Speculative decoding tăng tốc inference 2–3×. Bài này quét nhanh 7 khái niệm — mỗi cái 1 đoạn ngắn, 1 ví dụ cụ thể, 1 paper gốc, và một dòng "khi nào dùng".
Bảng tóm tắt
| Khái niệm | Hiểu đơn giản | Dùng để | Ví dụ |
|---|---|---|---|
| Transformer | Kiến trúc nền của LLM hiện đại | Đọc, sinh, dịch, tóm tắt văn bản | "Bộ não" của ChatGPT, Llama, Claude, DeepSeek |
| Attention | Token A "nhìn" token B với độ chú ý alpha_AB | Nắm quan hệ giữa các từ | Trong "Nam đưa sách cho Minh vì cậu ấy cần học", attention học ra "cậu ấy" = Minh |
| RAG | LLM + truy xuất tài liệu | Trả lời theo tài liệu riêng, có nguồn | Chatbot doanh nghiệp đọc PDF nội bộ rồi trả lời |
| Fine-tuning | Train tiếp model trên dữ liệu riêng | Học phong cách / nhiệm vụ cụ thể | Dạy Llama trả lời theo văn phong CSKH |
| PPO | RL với reward model (RLHF) | Align model theo human feedback | InstructGPT (Ouyang 2022) |
| DPO | RL trực tiếp từ cặp (chosen, rejected) | Như PPO nhưng đơn giản hơn | Rafailov 2023 |
| Speculative decoding | Draft model nhỏ + verify model lớn | Tăng tốc inference 2–3× | Leviathan 2022 |
1. Transformer
Transformer (Vaswani et al. 2017) là kiến trúc nền của hầu hết LLM hiện đại — Llama, Qwen, Mistral, GPT, Claude, DeepSeek đều xây trên đó.
Trước Transformer, RNN và LSTM xử lý câu theo thứ tự từng token. Mỗi từ phải đợi từ trước xử lý xong → chậm + dễ "quên" thông tin xa.
Transformer xử lý toàn bộ câu cùng lúc và để mỗi token tự quyết định "tôi nên chú ý đến token nào" qua attention. Ba hệ quả lớn:
- Train song song trên GPU — mỗi sample là một chuỗi matmul, không phải vòng lặp sequential
- Không "quên" thông tin xa — mỗi token attend trực tiếp đến mọi token khác
- Scale rất tốt — gần như mọi thứ tăng được mà chất lượng vẫn tăng đều
Cách nhớ: Transformer = kiến trúc · Attention = trái tim.
→ Đào sâu trong Lesson L5-4: Transformer architecture.
2. Attention (Q, K, V)
Attention là cơ chế cho mỗi token "hỏi" tất cả token khác và tổng hợp thông tin về. Mỗi token sản xuất 3 vector:
| Vector | Hỏi gì? |
|---|---|
| Query (Q) | "Tôi đang tìm thông tin gì?" |
| Key (K) | "Tôi có đặc điểm gì để được tìm thấy?" |
| Value (V) | "Nội dung thật sự tôi mang theo?" |
Công thức scaled dot-product attention:
Attention(Q, K, V) = softmax(Q @ K^T / sqrt(d_k)) @ V
Ba bước:
- Q · K^T → ma trận điểm "khớp" giữa mọi cặp (query, key)
- softmax từng hàng → biến điểm thành xác suất chú ý (mỗi hàng cộng = 1)
- × V → mỗi token nhận trung bình có trọng số của tất cả value
Code thực:
import torch
import torch.nn.functional as F
Q = torch.tensor([[1., 0.], [0., 1.]])
K = torch.tensor([[1., 1.], [1., 0.]])
V = torch.tensor([[0.5, 0.2], [0.1, 0.9]])
scores = Q @ K.T / (K.size(-1) ** 0.5)
attn = F.softmax(scores, dim=-1)
output = attn @ V
# attn = [[0.50, 0.50], [0.67, 0.33]]
# output = [[0.30, 0.55], [0.37, 0.43]]
Đọc đầu ra: token 2 "khớp" với key 1 hơn → output token 2 nghiêng về value 1.
Cách nhớ: Query hỏi, Key khớp, Value được lấy.
→ Đào sâu: Lesson L4-2: Self-attention. Các paper đáng đọc tiếp: RoPE, Flash Attention, MLA của DeepSeek.
3. RAG — Retrieval-Augmented Generation
RAG (Lewis et al. 2020) cho LLM truy xuất tài liệu trước khi trả lời. Pipeline 4 bước cơ bản:
Câu hỏi → embed → vector DB → top-K chunks → inject vào prompt → LLM trả lời
Khi nào nên dùng RAG (chứ không fine-tune):
- Cần trả lời theo tài liệu cập nhật — cập nhật DB rẻ hơn retrain model rất nhiều
- Cần trích nguồn ("theo điều X mục Y...")
- Muốn giảm hallucination
- Dataset quá nhỏ để fine-tune
Khi RAG không phù hợp: cần dạy model một phong cách viết hoặc một format đầu ra cố định → fine-tune tốt hơn.
5 lỗi production hay gặp:
- Chunk size sai — chunk quá ngắn mất ngữ cảnh, quá dài lẫn nhiễu
- Embed model rẻ — recall thấp, top-K không có câu trả lời
- Không có reranker — noise vào prompt, model trả lời sai
- Top-K quá lớn — tốn token + nhiễu hơn ích
- Không có guardrail "không tìm được → nói không biết" → model bịa
→ Đọc thêm: bài blog RAG 2026 — 5 sai lầm trong production.
Cách nhớ: RAG = LLM + tìm kiếm.
4. Fine-tuning
Fine-tuning là train tiếp một model đã pretrained, trên dữ liệu riêng — thường vài nghìn đến vài chục nghìn cặp (instruction, response).
Ví dụ một dòng dataset:
{
"instruction": "Giải thích hoá đơn điện tử là gì",
"output": "Hoá đơn điện tử là chứng từ kế toán dạng dữ liệu điện tử..."
}
Ba phương pháp phổ biến nhất:
- Full fine-tuning — update mọi tham số. Quality cao nhất, nhưng tốn GPU và memory rất nhiều.
- LoRA (Hu et al. 2021) — thêm low-rank adapter, freeze backbone. Train chỉ 0.1–1% tham số, tiết kiệm ~90% memory.
- QLoRA (Dettmers et al. 2023) — LoRA chạy trên 4-bit quantized backbone. Fine-tune Llama-7B trên 1 GPU 16 GB.
Khi nào fine-tune (vs RAG):
- Cần model học phong cách (giọng văn, format JSON cố định)
- Cần model giỏi một task hẹp (đọc hoá đơn, classify ticket)
- Cần model hiểu thuật ngữ chuyên ngành không có sẵn trong pretrain
Khi nào KHÔNG fine-tune:
- Cần cập nhật kiến thức thường xuyên → RAG rẻ + nhanh hơn
- Dataset < 500 examples → underfit, không bõ công
→ Đào sâu: bài blog Fine-tune LoRA zero-to-deploy.
Cách nhớ: RAG cho model "tra cứu" · Fine-tune cho model "học thói quen".
5. PPO — Proximal Policy Optimization
PPO (Schulman et al. 2017) là thuật toán RL được dùng trong RLHF. InstructGPT (Ouyang et al. 2022) chia quy trình thành 3 stage:
- SFT — fine-tune trên dataset
(instruction, response)chất lượng cao - Reward model — train 1 model phụ chấm điểm response (từ ranking của con người)
- PPO — optimize policy LLM để tối đa reward, kèm KL penalty với reference (tránh trôi xa)
Loss của PPO clipped (rút gọn):
L = E[ min( r_t * A_t, clip(r_t, 1 - eps, 1 + eps) * A_t ) ]
trong đó:
r_t = pi_theta(a|s) / pi_old(a|s) — tỷ số xác suất giữa policy mới và cũ
A_t — advantage (reward - baseline)
PPO mạnh nhưng rất phức tạp: cần policy + reward + reference + value model + RL stable. Nhiều team chuyển sang DPO vì dễ hơn (xem mục 6).
Cách nhớ: PPO = thử trả lời, được chấm điểm, optimize để được điểm cao hơn.
6. DPO — Direct Preference Optimization
DPO (Rafailov et al. 2023) bỏ qua reward model — học trực tiếp từ cặp (chosen, rejected):
Prompt: "Giải thích Attention là gì?"
Chosen: <câu trả lời rõ ràng, đúng>
Rejected: <câu trả lời lan man, sai>
Loss DPO (rút gọn):
L = -log sigma( beta * log pi_theta(y_w|x) / pi_ref(y_w|x)
- beta * log pi_theta(y_l|x) / pi_ref(y_l|x) )
y_w = chosen (winner), y_l = rejected (loser)
Lợi thế so với PPO:
- Không cần reward model riêng → ít một stage train
- Stable hơn — không có RL noise
- Cùng dataset preference, train nhanh hơn 2–3×
- Dễ debug, dễ reproduce
Hiện 2026 đa số open-source align flow đã chuyển sang DPO và biến thể (IPO, KTO, ORPO). PPO vẫn được dùng khi reward signal không có sẵn dưới dạng pairwise.
Cách nhớ: DPO = dạy bằng "câu A tốt hơn câu B".
7. Speculative decoding
Speculative decoding (Leviathan et al. 2022) tăng tốc inference 2–3× mà không hy sinh chất lượng. Ý tưởng:
Draft model (nhỏ, nhanh) → đoán K token tiếp theo
Target model (lớn, chậm) → verify K token đó song song trong 1 forward
accept đoạn đầu match draft
reject từ chỗ đầu tiên sai → tự sinh từ đó
Ví dụ: target = Llama-70B, draft = Llama-1B. Draft sinh "Transformer là kiến trúc..." (5 token). Target verify trong 1 forward pass. Nếu 4/5 token match → accept 4 token cùng lúc + sinh 1 token mới = 5 token / forward thay vì 1 token / forward.
Đảm bảo toán học: output distribution giống hệt chạy target model trực tiếp. Không có trade-off chất lượng.
Khi nào hiệu quả:
- Draft và target cùng họ (ví dụ Llama-1B + Llama-70B) — vocab + tokenizer khớp
- Acceptance rate > 50% → tăng tốc 2–3×; thấp hơn thì marginal
Mở rộng đáng đọc:
- Medusa — multi-head speculative trong 1 model duy nhất
- EAGLE — train 1 draft head riêng, hiệu quả hơn
Cách nhớ: Draft đoán nháp, target duyệt nhanh nhiều token cùng lúc.
Quyết định nhanh: dùng cái nào?
| Câu hỏi | Trả lời |
|---|---|
| Kiến trúc nền LLM là gì? | Transformer |
| Cơ chế cho token "chú ý" lẫn nhau? | Attention |
| Cần LLM trả lời theo tài liệu riêng / cập nhật? | RAG |
| Cần model học phong cách / format / thuật ngữ riêng? | Fine-tuning (LoRA / QLoRA) |
| Align bằng human feedback + reward model? | PPO |
| Align bằng cặp (tốt, xấu) đơn giản hơn? | DPO |
| Inference quá chậm? | Speculative decoding |
Một câu nhớ toàn bộ
Transformer là kiến trúc, Attention là cơ chế chú ý bên trong nó. RAG giúp model tra cứu tài liệu, Fine-tuning giúp model học thêm kỹ năng. PPO và DPO giúp model trả lời hợp ý người. Speculative decoding giúp model trả lời nhanh hơn.
Đào sâu
- 📚 Khoá học LLM Quest — 53 bài foundation → ops, dạy kỹ từng khái niệm trên
- 📝 RAG 2026 — 5 sai lầm production
- 📝 Fine-tune LoRA zero-to-deploy
- 📝 Prompt caching: giảm 90% chi phí token
- 📝 So sánh 5 vector DB phổ biến
- 📝 Đánh giá chất lượng LLM với RAGAs / G-Eval