LLM Quest Academy
← Quay lại Blog

Cheat sheet LLM 2026: Transformer · Attention · RAG · Fine-tuning · PPO · DPO · Speculative decoding

LLM Quest Editorial·5 thg 5, 2026·8 phút đọc
Cheat sheet LLM 2026: Transformer · Attention · RAG · Fine-tuning · PPO · DPO · Speculative decoding
Cheat sheet LLM 2026: 7 khái niệm bắt buộc nhớ

TL;DR. Transformer là kiến trúc, Attention là cơ chế tính tương tác bên trong. RAG cho LLM tra cứu tài liệu. Fine-tuning dạy model phong cách / kỹ năng. PPO và DPO căn chỉnh model theo sở thích con người. Speculative decoding tăng tốc inference 2–3×. Bài này quét nhanh 7 khái niệm — mỗi cái 1 đoạn ngắn, 1 ví dụ cụ thể, 1 paper gốc, và một dòng "khi nào dùng".

Bảng tóm tắt

Khái niệm Hiểu đơn giản Dùng để Ví dụ
Transformer Kiến trúc nền của LLM hiện đại Đọc, sinh, dịch, tóm tắt văn bản "Bộ não" của ChatGPT, Llama, Claude, DeepSeek
Attention Token A "nhìn" token B với độ chú ý alpha_AB Nắm quan hệ giữa các từ Trong "Nam đưa sách cho Minh vì cậu ấy cần học", attention học ra "cậu ấy" = Minh
RAG LLM + truy xuất tài liệu Trả lời theo tài liệu riêng, có nguồn Chatbot doanh nghiệp đọc PDF nội bộ rồi trả lời
Fine-tuning Train tiếp model trên dữ liệu riêng Học phong cách / nhiệm vụ cụ thể Dạy Llama trả lời theo văn phong CSKH
PPO RL với reward model (RLHF) Align model theo human feedback InstructGPT (Ouyang 2022)
DPO RL trực tiếp từ cặp (chosen, rejected) Như PPO nhưng đơn giản hơn Rafailov 2023
Speculative decoding Draft model nhỏ + verify model lớn Tăng tốc inference 2–3× Leviathan 2022

1. Transformer

Transformer (Vaswani et al. 2017) là kiến trúc nền của hầu hết LLM hiện đại — Llama, Qwen, Mistral, GPT, Claude, DeepSeek đều xây trên đó.

Trước Transformer, RNN và LSTM xử lý câu theo thứ tự từng token. Mỗi từ phải đợi từ trước xử lý xong → chậm + dễ "quên" thông tin xa.

Transformer xử lý toàn bộ câu cùng lúc và để mỗi token tự quyết định "tôi nên chú ý đến token nào" qua attention. Ba hệ quả lớn:

  • Train song song trên GPU — mỗi sample là một chuỗi matmul, không phải vòng lặp sequential
  • Không "quên" thông tin xa — mỗi token attend trực tiếp đến mọi token khác
  • Scale rất tốt — gần như mọi thứ tăng được mà chất lượng vẫn tăng đều

Cách nhớ: Transformer = kiến trúc · Attention = trái tim.

→ Đào sâu trong Lesson L5-4: Transformer architecture.


2. Attention (Q, K, V)

Attention là cơ chế cho mỗi token "hỏi" tất cả token khác và tổng hợp thông tin về. Mỗi token sản xuất 3 vector:

Vector Hỏi gì?
Query (Q) "Tôi đang tìm thông tin gì?"
Key (K) "Tôi có đặc điểm gì để được tìm thấy?"
Value (V) "Nội dung thật sự tôi mang theo?"

Công thức scaled dot-product attention:

Attention(Q, K, V) = softmax(Q @ K^T / sqrt(d_k)) @ V

Ba bước:

  1. Q · K^T → ma trận điểm "khớp" giữa mọi cặp (query, key)
  2. softmax từng hàng → biến điểm thành xác suất chú ý (mỗi hàng cộng = 1)
  3. × V → mỗi token nhận trung bình có trọng số của tất cả value

Code thực:

import torch
import torch.nn.functional as F

Q = torch.tensor([[1., 0.], [0., 1.]])
K = torch.tensor([[1., 1.], [1., 0.]])
V = torch.tensor([[0.5, 0.2], [0.1, 0.9]])

scores = Q @ K.T / (K.size(-1) ** 0.5)
attn   = F.softmax(scores, dim=-1)
output = attn @ V

# attn   = [[0.50, 0.50], [0.67, 0.33]]
# output = [[0.30, 0.55], [0.37, 0.43]]

Đọc đầu ra: token 2 "khớp" với key 1 hơn → output token 2 nghiêng về value 1.

Cách nhớ: Query hỏi, Key khớp, Value được lấy.

→ Đào sâu: Lesson L4-2: Self-attention. Các paper đáng đọc tiếp: RoPE, Flash Attention, MLA của DeepSeek.


3. RAG — Retrieval-Augmented Generation

RAG (Lewis et al. 2020) cho LLM truy xuất tài liệu trước khi trả lời. Pipeline 4 bước cơ bản:

Câu hỏi  →  embed  →  vector DB  →  top-K chunks  →  inject vào prompt  →  LLM trả lời

Khi nào nên dùng RAG (chứ không fine-tune):

  • Cần trả lời theo tài liệu cập nhật — cập nhật DB rẻ hơn retrain model rất nhiều
  • Cần trích nguồn ("theo điều X mục Y...")
  • Muốn giảm hallucination
  • Dataset quá nhỏ để fine-tune

Khi RAG không phù hợp: cần dạy model một phong cách viết hoặc một format đầu ra cố định → fine-tune tốt hơn.

5 lỗi production hay gặp:

  1. Chunk size sai — chunk quá ngắn mất ngữ cảnh, quá dài lẫn nhiễu
  2. Embed model rẻ — recall thấp, top-K không có câu trả lời
  3. Không có reranker — noise vào prompt, model trả lời sai
  4. Top-K quá lớn — tốn token + nhiễu hơn ích
  5. Không có guardrail "không tìm được → nói không biết" → model bịa

→ Đọc thêm: bài blog RAG 2026 — 5 sai lầm trong production.

Cách nhớ: RAG = LLM + tìm kiếm.


4. Fine-tuning

Fine-tuning là train tiếp một model đã pretrained, trên dữ liệu riêng — thường vài nghìn đến vài chục nghìn cặp (instruction, response).

Ví dụ một dòng dataset:

{
  "instruction": "Giải thích hoá đơn điện tử là gì",
  "output": "Hoá đơn điện tử là chứng từ kế toán dạng dữ liệu điện tử..."
}

Ba phương pháp phổ biến nhất:

  • Full fine-tuning — update mọi tham số. Quality cao nhất, nhưng tốn GPU và memory rất nhiều.
  • LoRA (Hu et al. 2021) — thêm low-rank adapter, freeze backbone. Train chỉ 0.1–1% tham số, tiết kiệm ~90% memory.
  • QLoRA (Dettmers et al. 2023) — LoRA chạy trên 4-bit quantized backbone. Fine-tune Llama-7B trên 1 GPU 16 GB.

Khi nào fine-tune (vs RAG):

  • Cần model học phong cách (giọng văn, format JSON cố định)
  • Cần model giỏi một task hẹp (đọc hoá đơn, classify ticket)
  • Cần model hiểu thuật ngữ chuyên ngành không có sẵn trong pretrain

Khi nào KHÔNG fine-tune:

  • Cần cập nhật kiến thức thường xuyên → RAG rẻ + nhanh hơn
  • Dataset < 500 examples → underfit, không bõ công

→ Đào sâu: bài blog Fine-tune LoRA zero-to-deploy.

Cách nhớ: RAG cho model "tra cứu" · Fine-tune cho model "học thói quen".


5. PPO — Proximal Policy Optimization

PPO (Schulman et al. 2017) là thuật toán RL được dùng trong RLHF. InstructGPT (Ouyang et al. 2022) chia quy trình thành 3 stage:

  1. SFT — fine-tune trên dataset (instruction, response) chất lượng cao
  2. Reward model — train 1 model phụ chấm điểm response (từ ranking của con người)
  3. PPO — optimize policy LLM để tối đa reward, kèm KL penalty với reference (tránh trôi xa)

Loss của PPO clipped (rút gọn):

L = E[ min( r_t * A_t,  clip(r_t, 1 - eps, 1 + eps) * A_t ) ]

trong đó:
  r_t = pi_theta(a|s) / pi_old(a|s)  — tỷ số xác suất giữa policy mới và cũ
  A_t                                 — advantage (reward - baseline)

PPO mạnh nhưng rất phức tạp: cần policy + reward + reference + value model + RL stable. Nhiều team chuyển sang DPO vì dễ hơn (xem mục 6).

Cách nhớ: PPO = thử trả lời, được chấm điểm, optimize để được điểm cao hơn.


6. DPO — Direct Preference Optimization

DPO (Rafailov et al. 2023) bỏ qua reward model — học trực tiếp từ cặp (chosen, rejected):

Prompt:    "Giải thích Attention là gì?"
Chosen:    <câu trả lời rõ ràng, đúng>
Rejected:  <câu trả lời lan man, sai>

Loss DPO (rút gọn):

L = -log sigma( beta * log pi_theta(y_w|x) / pi_ref(y_w|x)
              - beta * log pi_theta(y_l|x) / pi_ref(y_l|x) )

y_w = chosen (winner), y_l = rejected (loser)

Lợi thế so với PPO:

  • Không cần reward model riêng → ít một stage train
  • Stable hơn — không có RL noise
  • Cùng dataset preference, train nhanh hơn 2–3×
  • Dễ debug, dễ reproduce

Hiện 2026 đa số open-source align flow đã chuyển sang DPO và biến thể (IPO, KTO, ORPO). PPO vẫn được dùng khi reward signal không có sẵn dưới dạng pairwise.

Cách nhớ: DPO = dạy bằng "câu A tốt hơn câu B".


7. Speculative decoding

Speculative decoding (Leviathan et al. 2022) tăng tốc inference 2–3×không hy sinh chất lượng. Ý tưởng:

Draft model (nhỏ, nhanh)  →  đoán K token tiếp theo
Target model (lớn, chậm)  →  verify K token đó song song trong 1 forward
                             accept đoạn đầu match draft
                             reject từ chỗ đầu tiên sai → tự sinh từ đó

Ví dụ: target = Llama-70B, draft = Llama-1B. Draft sinh "Transformer là kiến trúc..." (5 token). Target verify trong 1 forward pass. Nếu 4/5 token match → accept 4 token cùng lúc + sinh 1 token mới = 5 token / forward thay vì 1 token / forward.

Đảm bảo toán học: output distribution giống hệt chạy target model trực tiếp. Không có trade-off chất lượng.

Khi nào hiệu quả:

  • Draft và target cùng họ (ví dụ Llama-1B + Llama-70B) — vocab + tokenizer khớp
  • Acceptance rate > 50% → tăng tốc 2–3×; thấp hơn thì marginal

Mở rộng đáng đọc:

  • Medusa — multi-head speculative trong 1 model duy nhất
  • EAGLE — train 1 draft head riêng, hiệu quả hơn

Cách nhớ: Draft đoán nháp, target duyệt nhanh nhiều token cùng lúc.


Quyết định nhanh: dùng cái nào?

Câu hỏi Trả lời
Kiến trúc nền LLM là gì? Transformer
Cơ chế cho token "chú ý" lẫn nhau? Attention
Cần LLM trả lời theo tài liệu riêng / cập nhật? RAG
Cần model học phong cách / format / thuật ngữ riêng? Fine-tuning (LoRA / QLoRA)
Align bằng human feedback + reward model? PPO
Align bằng cặp (tốt, xấu) đơn giản hơn? DPO
Inference quá chậm? Speculative decoding

Một câu nhớ toàn bộ

Transformer là kiến trúc, Attention là cơ chế chú ý bên trong nó. RAG giúp model tra cứu tài liệu, Fine-tuning giúp model học thêm kỹ năng. PPO và DPO giúp model trả lời hợp ý người. Speculative decoding giúp model trả lời nhanh hơn.

Đào sâu

#cheat sheet#Transformer#Attention#RAG#fine-tuning#PPO#DPO#speculative decoding
Advertisement