Giảm 90% chi phí token API với prompt caching và compression
Token cost là "silent killer" của dự án LLM. 1 chatbot vừa launch có thể đốt $5k/tháng. Có 3 kỹ thuật giảm 50–90% chi phí mà không đổi quality.
1. Prompt caching (cache system prompt)
System prompt thường giống nhau mỗi request (role, rules, few-shot examples). Truyền lại mỗi request = đốt token vô ích.
Anthropic prompt caching: đánh dấu cache_control: {"type": "ephemeral"} ở block muốn cache. Từ request 2 trở đi, phần đó tính 10% giá gốc.
messages=[
{
"role": "system",
"content": [
{
"type": "text",
"text": "Long system prompt 3000 tokens...",
"cache_control": {"type": "ephemeral"}
}
]
},
{"role": "user", "content": "Câu hỏi ngắn..."}
]
OpenAI: auto-cache nếu prompt > 1024 token và giống ≥ 50% tiền tố. Không cần code.
Tiết kiệm thực tế: 70–90% cost trên conversation dài, 40–60% trên chatbot 1-turn có system prompt lớn.
2. Prompt compression (LLMLingua)
Compress prompt giữ nguyên meaning. LLMLingua-2 nén 5–10× trên prompt dài:
from llmlingua import PromptCompressor
compressor = PromptCompressor(model_name="llmlingua2", device_map="cuda")
result = compressor.compress_prompt(
context=["long document 1", "long document 2"],
instruction="Summarize",
question="...",
target_token=2000, # từ 10000 → 2000
)
Chi phí: model chạy local ~$0.001 per 10k token. So với GPT-5 $0.05 per 10k → 50× rẻ hơn.
Mất mát: < 3% trên summarization, ~5% trên Q&A phức tạp. Chấp nhận được cho đa số case.
3. Model tiering
Không dùng GPT-5 cho mọi thứ. Route theo độ khó:
| Task | Model | Cost/1M token |
|---|---|---|
| Classification, simple extraction | Haiku / 4o-mini | $0.25 |
| Conversation, summarization | Sonnet / 4o | $3 |
| Complex reasoning, code | Opus / GPT-5 | $15–30 |
Logic routing:
- Haiku classify task type
- Simple → Haiku handle luôn
- Medium → Sonnet
- Complex → Opus (chỉ khi thật cần)
Ước tính thực tế: 70% request hết ở tier 1, 25% tier 2, 5% tier 3 → save 80% cost so với "GPT-5 everything".
4. Batch API
OpenAI/Anthropic có Batch API: submit job, chờ tối đa 24h, giá 50% off. Hữu ích cho:
- Nightly content generation
- Weekly analytics report
- Bulk data labeling
5. Output token control
Output token đắt gấp 3–5× input. Limit output mạnh:
max_tokens=300thay vì default 4000- JSON schema force concise output
- Stop sequences nghiêm
Monitoring cost
Dùng LangSmith, Helicone, hoặc Langfuse để track:
- Cost per user
- Cost per feature
- Alert khi spike > 2×
Setup 30 phút, save 1 ngày debug mỗi tháng.
Tổng kết số
Chatbot 10k users, 5 messages/day, system prompt 2000 tokens:
| Strategy | Monthly cost |
|---|---|
| Naive (GPT-5, no cache) | $4500 |
| + Prompt caching | $1600 |
| + Compression | $900 |
| + Model tiering | $350 |
| + Batch API (analytics) | $280 |
90% reduction mà user không cảm thấy khác biệt.
LLM Quest Academy Level 6–7 có boss project tối ưu cost trên pipeline RAG thật.