Tiết kiệm bằng cache¶
Vì sao token vào nhiều hơn token ra¶
Mỗi lượt gọi, bạn gửi lại toàn bộ ngữ cảnh: lời dẫn hệ thống, lịch sử hội thoại, tài liệu đính kèm. Model không nhớ lượt trước — nó chỉ đọc những gì bạn gửi kèm lần này. Nên một cuộc hội thoại dài có token vào tăng dần, trong khi token ra vẫn chỉ là một câu trả lời.
Đây là lý do hóa đơn thường nằm ở phía token vào, không phải token ra.
Cache làm gì¶
Khi bạn gửi lại một đoạn ngữ cảnh giống hệt lần trước, phần đó được đọc từ cache thay vì xử lý lại. Nhìn bảng giá ở Bảng model, cột Cache đọc rẻ hơn cột Vào rất nhiều — với Claude là khoảng một phần mười.
Cache hoạt động tự động, kể cả khi bạn gọi qua /v1/chat/completions. Bạn không
phải bật gì.
Làm sao tận dụng¶
- Đặt phần cố định lên đầu. Lời dẫn hệ thống, tài liệu tham chiếu, ví dụ mẫu — để nguyên một chỗ, đừng chèn ngày giờ hay số ngẫu nhiên vào giữa. Chỉ cần một ký tự khác là cả khối sau đó mất cache.
- Giữ đoạn đầu ổn định giữa các lượt. Thêm tin nhắn mới vào cuối, đừng sửa phần trên.
- Cắt bớt lịch sử khi đã dài. Một hội thoại 50 lượt thường chỉ cần 10 lượt gần nhất cộng một bản tóm tắt. Nhiều công cụ gọi việc này là compact.
- Đặt
max_tokens. Nó chặn phía token ra, là phần đắt nhất trên các model Claude.
Kiểm chứng¶
GET /v1/usage cho biết mỗi lượt đã dùng bao nhiêu token vào, token ra và bao
nhiêu trong số đó là cache. Nếu bạn sửa lại cấu trúc prompt mà con số cache
không tăng, tức là phần đầu vẫn đang bị thay đổi ở đâu đó.
curl https://revidapi.com/v1/usage -H "X-API-Key: sk_KEY_CUA_BAN"