Prompt Caching
Khi bạn trò chuyện với một Space được đính kèm, một phần lớn tin nhắn của bạn — ngữ cảnh nền được lấy từ Space đó — giữ nguyên qua từng lượt. Prompt caching cho phép nhà cung cấp AI ghi nhớ phần lặp lại đó thay vì phải đọc lại (và tính phí lại) mỗi lần. Kết quả: chi phí thấp hơn và, thường là, phản hồi nhanh hơn, mà không thay đổi chất lượng câu trả lời bạn nhận được.
Rephlo chủ động bật prompt caching cho Anthropic (Claude) — mặc định bật sẵn, với thời gian sống có thể cấu hình. Trang này giải thích khi nào caching được kích hoạt và cách xem lợi ích của nó.
Cách hoạt động (nói đơn giản)
Một yêu cầu gửi tới AI được xây dựng theo từng lớp: một chỉ dẫn ổn định, ngữ cảnh nền của Space, rồi tới phần mới của cuộc trò chuyện. Ngữ cảnh nền lặp lại mỗi lượt chính là phần được cache.
- Tiền tố ổn định (chỉ dẫn + ngữ cảnh Space) được tái sử dụng từ cache.
- Chỉ nội dung mới trong mỗi lượt mới được xử lý lại từ đầu.
- Với ngữ cảnh lặp lại, điều này có thể cắt giảm đáng kể chi phí của các token đầu vào đó.