Prompt Caching
Quando você conversa no chat com uma Space anexada, uma grande parte da sua mensagem — o contexto de fundo obtido dessa Space — permanece igual a cada turno. O Prompt Caching permite que o provedor de IA se lembre desse trecho repetido em vez de reler (e recobrar por) ele a cada vez. O resultado: custo menor e, muitas vezes, respostas mais rápidas, sem nenhuma mudança nas respostas que você recebe.
A Rephlo ativa o prompt caching de forma proativa para Anthropic (Claude) — ele vem ativado por padrão, com um tempo de vida configurável. Esta página explica quando o caching entra em ação e como ver o benefício.
Como funciona (em termos simples)
Uma solicitação para a IA é construída em camadas: uma instrução estável, o contexto de fundo da sua Space e, em seguida, a parte nova da conversa. O contexto de fundo que se repete a cada turno é o que fica em cache.
- O prefixo estável (instrução + contexto da Space) é reutilizado a partir do cache.
- Apenas o conteúdo novo de cada turno é processado do zero.
- Para contexto repetido, isso pode reduzir drasticamente o custo desses tokens de entrada.
Quando o caching se aplica
O caching entra em ação quando as duas condições a seguir são verdadeiras:
- Uma Space está anexada à conversa. O contexto da Space é o que cria um prefixo grande e repetível que vale a pena colocar em cache. Sem uma Space anexada, não há um bloco estável para armazenar em cache, então o caching não tem o que fazer.
- Você está em um provedor que faz caching. A Rephlo conduz o caching para Anthropic (Claude), de modo que o contexto repetido é servido a partir do cache em turnos posteriores. Alguns outros provedores de nuvem fazem cache do contexto repetido automaticamente, do próprio lado deles — esse é o comportamento deles, não algo controlado pela Rephlo. Modelos on-device rodam localmente e não fazem cache, então o caching simplesmente não se aplica ali.
Também existe um piso prático: o contexto em cache precisa ser razoavelmente grande antes que os provedores realmente o sirvam a partir do cache. Spaces pequenas podem não cruzar esse limite, caso em que você verá pouco ou nenhum benefício de caching — o que é inofensivo, apenas não representa economia.
Especificidades da Anthropic (Claude)
Provedores diferentes fazem caching de formas diferentes. A maioria dos fornecedores de nuvem faz cache do contexto repetido automaticamente. A Anthropic (Claude) é um pouco diferente — a Rephlo conduz o caching para ela e oferece duas configurações na configuração do provedor Anthropic:
| Configuração | O que faz |
|---|---|
| Prompt caching enabled | Ativa o caching da Anthropic. Ativado por padrão. |
| Cache lifetime (TTL) | Por quanto tempo o cache permanece entre turnos: ephemeral (cerca de 5 minutos, o padrão) ou extended (cerca de 1 hora). Um tempo de vida mais longo custa um pouco mais para escrever o cache, mas o mantém ativo por mais tempo. |
O padrão de caching ephemeral ativado é uma boa opção para a maioria das conversas, nas quais suas mensagens de acompanhamento chegam poucos minutos uma da outra. Se você costuma se afastar e voltar a um chat bem mais tarde, o modo extended mantém o cache ativo para que a próxima mensagem ainda obtenha um acerto de cache.
Você encontra essas opções na tela Providers, na sua configuração da Anthropic. Para entender como modelos e provedores se encaixam, veja Models & Inference.
Vendo a economia
A Rephlo rastreia quantos tokens de entrada foram servidos a partir do cache versus processados do zero em cada resposta. Com o registro detalhado de cache ativado (o padrão para a Anthropic), essa informação é gravada para que você possa confirmar que o caching está fazendo o seu trabalho — uma alta proporção de tokens em cache em turnos posteriores significa que o cache está sendo reutilizado como esperado.
A economia vem do provedor cobrar menos por entrada em cache do que por entrada nova, então conversas mais longas com um contexto de Space estável são onde o caching mais compensa.
Dicas rápidas
- Anexe uma Space a um chat para tornar o caching possível — é o que o aciona.
- Mantenha o contexto da Space estável entre os turnos. A Rephlo cuida disso para você, adicionando apenas contexto genuinamente novo a cada turno em vez de reconstruir o bloco inteiro.
- Não se preocupe com um cache "frio". O primeiro turno grava o cache; não há penalidade se um turno posterior acabar não acertando o cache — ele simplesmente é processado normalmente.
Páginas relacionadas
- Models & Inference — como provedores e modelos funcionam.
- Data Modes & Compaction — como o contexto da Space e os orçamentos de tokens são gerenciados.
- Providers Settings — onde ficam as opções de caching da Anthropic.
- Chat & Conversations — como anexar uma Space a um chat.
- Credits & Usage — como o uso é contado.