Pular para o conteúdo principal

Prompt Caching

Quando você conversa no chat com uma Space anexada, uma grande parte da sua mensagem — o contexto de fundo obtido dessa Space — permanece igual a cada turno. O Prompt Caching permite que o provedor de IA se lembre desse trecho repetido em vez de reler (e recobrar por) ele a cada vez. O resultado: custo menor e, muitas vezes, respostas mais rápidas, sem nenhuma mudança nas respostas que você recebe.

A Rephlo ativa o prompt caching de forma proativa para Anthropic (Claude) — ele vem ativado por padrão, com um tempo de vida configurável. Esta página explica quando o caching entra em ação e como ver o benefício.

Como funciona (em termos simples)

Uma solicitação para a IA é construída em camadas: uma instrução estável, o contexto de fundo da sua Space e, em seguida, a parte nova da conversa. O contexto de fundo que se repete a cada turno é o que fica em cache.

  • O prefixo estável (instrução + contexto da Space) é reutilizado a partir do cache.
  • Apenas o conteúdo novo de cada turno é processado do zero.
  • Para contexto repetido, isso pode reduzir drasticamente o custo desses tokens de entrada.

Quando o caching se aplica

O caching entra em ação quando as duas condições a seguir são verdadeiras:

  1. Uma Space está anexada à conversa. O contexto da Space é o que cria um prefixo grande e repetível que vale a pena colocar em cache. Sem uma Space anexada, não há um bloco estável para armazenar em cache, então o caching não tem o que fazer.
  2. Você está em um provedor que faz caching. A Rephlo conduz o caching para Anthropic (Claude), de modo que o contexto repetido é servido a partir do cache em turnos posteriores. Alguns outros provedores de nuvem fazem cache do contexto repetido automaticamente, do próprio lado deles — esse é o comportamento deles, não algo controlado pela Rephlo. Modelos on-device rodam localmente e não fazem cache, então o caching simplesmente não se aplica ali.

Também existe um piso prático: o contexto em cache precisa ser razoavelmente grande antes que os provedores realmente o sirvam a partir do cache. Spaces pequenas podem não cruzar esse limite, caso em que você verá pouco ou nenhum benefício de caching — o que é inofensivo, apenas não representa economia.

Especificidades da Anthropic (Claude)

Provedores diferentes fazem caching de formas diferentes. A maioria dos fornecedores de nuvem faz cache do contexto repetido automaticamente. A Anthropic (Claude) é um pouco diferente — a Rephlo conduz o caching para ela e oferece duas configurações na configuração do provedor Anthropic:

ConfiguraçãoO que faz
Prompt caching enabledAtiva o caching da Anthropic. Ativado por padrão.
Cache lifetime (TTL)Por quanto tempo o cache permanece entre turnos: ephemeral (cerca de 5 minutos, o padrão) ou extended (cerca de 1 hora). Um tempo de vida mais longo custa um pouco mais para escrever o cache, mas o mantém ativo por mais tempo.

O padrão de caching ephemeral ativado é uma boa opção para a maioria das conversas, nas quais suas mensagens de acompanhamento chegam poucos minutos uma da outra. Se você costuma se afastar e voltar a um chat bem mais tarde, o modo extended mantém o cache ativo para que a próxima mensagem ainda obtenha um acerto de cache.

Você encontra essas opções na tela Providers, na sua configuração da Anthropic. Para entender como modelos e provedores se encaixam, veja Models & Inference.

Vendo a economia

A Rephlo rastreia quantos tokens de entrada foram servidos a partir do cache versus processados do zero em cada resposta. Com o registro detalhado de cache ativado (o padrão para a Anthropic), essa informação é gravada para que você possa confirmar que o caching está fazendo o seu trabalho — uma alta proporção de tokens em cache em turnos posteriores significa que o cache está sendo reutilizado como esperado.

A economia vem do provedor cobrar menos por entrada em cache do que por entrada nova, então conversas mais longas com um contexto de Space estável são onde o caching mais compensa.

Dicas rápidas

  • Anexe uma Space a um chat para tornar o caching possível — é o que o aciona.
  • Mantenha o contexto da Space estável entre os turnos. A Rephlo cuida disso para você, adicionando apenas contexto genuinamente novo a cada turno em vez de reconstruir o bloco inteiro.
  • Não se preocupe com um cache "frio". O primeiro turno grava o cache; não há penalidade se um turno posterior acabar não acertando o cache — ele simplesmente é processado normalmente.

Páginas relacionadas