LLM Quest Academy
← Quay lại Blog

Giảm 90% chi phí token API với prompt caching và compression

LLM Quest Editorial·20 thg 4, 2026·2 phút đọc
Giảm 90% chi phí token API với prompt caching và compression
Giảm 90% chi phí token API với prompt caching và compression

Token cost là "silent killer" của dự án LLM. 1 chatbot vừa launch có thể đốt $5k/tháng. Có 3 kỹ thuật giảm 50–90% chi phí mà không đổi quality.

1. Prompt caching (cache system prompt)

System prompt thường giống nhau mỗi request (role, rules, few-shot examples). Truyền lại mỗi request = đốt token vô ích.

Anthropic prompt caching: đánh dấu cache_control: {"type": "ephemeral"} ở block muốn cache. Từ request 2 trở đi, phần đó tính 10% giá gốc.

messages=[
  {
    "role": "system",
    "content": [
      {
        "type": "text",
        "text": "Long system prompt 3000 tokens...",
        "cache_control": {"type": "ephemeral"}
      }
    ]
  },
  {"role": "user", "content": "Câu hỏi ngắn..."}
]

OpenAI: auto-cache nếu prompt > 1024 token và giống ≥ 50% tiền tố. Không cần code.

Tiết kiệm thực tế: 70–90% cost trên conversation dài, 40–60% trên chatbot 1-turn có system prompt lớn.

2. Prompt compression (LLMLingua)

Compress prompt giữ nguyên meaning. LLMLingua-2 nén 5–10× trên prompt dài:

from llmlingua import PromptCompressor
compressor = PromptCompressor(model_name="llmlingua2", device_map="cuda")

result = compressor.compress_prompt(
    context=["long document 1", "long document 2"],
    instruction="Summarize",
    question="...",
    target_token=2000,  # từ 10000 → 2000
)

Chi phí: model chạy local ~$0.001 per 10k token. So với GPT-5 $0.05 per 10k → 50× rẻ hơn.

Mất mát: < 3% trên summarization, ~5% trên Q&A phức tạp. Chấp nhận được cho đa số case.

3. Model tiering

Không dùng GPT-5 cho mọi thứ. Route theo độ khó:

Task Model Cost/1M token
Classification, simple extraction Haiku / 4o-mini $0.25
Conversation, summarization Sonnet / 4o $3
Complex reasoning, code Opus / GPT-5 $15–30

Logic routing:

  1. Haiku classify task type
  2. Simple → Haiku handle luôn
  3. Medium → Sonnet
  4. Complex → Opus (chỉ khi thật cần)

Ước tính thực tế: 70% request hết ở tier 1, 25% tier 2, 5% tier 3 → save 80% cost so với "GPT-5 everything".

4. Batch API

OpenAI/Anthropic có Batch API: submit job, chờ tối đa 24h, giá 50% off. Hữu ích cho:

  • Nightly content generation
  • Weekly analytics report
  • Bulk data labeling

5. Output token control

Output token đắt gấp 3–5× input. Limit output mạnh:

  • max_tokens=300 thay vì default 4000
  • JSON schema force concise output
  • Stop sequences nghiêm

Monitoring cost

Dùng LangSmith, Helicone, hoặc Langfuse để track:

  • Cost per user
  • Cost per feature
  • Alert khi spike > 2×

Setup 30 phút, save 1 ngày debug mỗi tháng.

Tổng kết số

Chatbot 10k users, 5 messages/day, system prompt 2000 tokens:

Strategy Monthly cost
Naive (GPT-5, no cache) $4500
+ Prompt caching $1600
+ Compression $900
+ Model tiering $350
+ Batch API (analytics) $280

90% reduction mà user không cảm thấy khác biệt.

LLM Quest Academy Level 6–7 có boss project tối ưu cost trên pipeline RAG thật.

#prompt caching#LLMLingua#cost optimization#LLM#Batch API
Advertisement