Saltar al contenido principal

Prompt Caching

Cuando chateas con un Space adjunto, una gran parte de tu mensaje — el contexto de fondo tomado de ese Space — se mantiene igual turno tras turno. Prompt caching permite que el proveedor de IA recuerde ese fragmento repetido en lugar de volver a leerlo (y volver a cobrarlo) cada vez. El resultado: menor costo y, a menudo, respuestas más rápidas, sin ningún cambio en las respuestas que recibes.

Rephlo activa prompt caching de forma proactiva para Anthropic (Claude) — está activado por defecto, con una vida útil configurable. Esta página explica cuándo se activa el caching y cómo ver el beneficio.

Cómo funciona (en términos simples)

Una solicitud a la IA se construye por capas: una instrucción estable, el contexto de fondo de tu Space, y luego la parte nueva de la conversación. El contexto de fondo que se repite en cada turno es lo que se cachea.

  • El prefijo estable (instrucción + contexto del Space) se reutiliza desde el caché.
  • Solo el contenido nuevo de cada turno se procesa de cero.
  • Para contexto repetido, esto puede reducir drásticamente el costo de esos tokens de entrada.

Cuándo aplica el caching

El caching se activa cuando se cumplen ambas condiciones:

  1. Hay un Space adjunto a la conversación. El contexto del Space es lo que crea un prefijo grande y repetible que vale la pena cachear. Sin un Space adjunto, no hay un bloque estable que cachear, así que el caching no tiene nada que hacer.
  2. Estás usando un proveedor que cachea. Rephlo gestiona el caching para Anthropic (Claude), de modo que el contexto repetido se sirve desde el caché en turnos posteriores. Algunos otros proveedores en la nube cachean el contexto repetido automáticamente por su cuenta — eso es su propio comportamiento, no algo que Rephlo controle. Los modelos on-device se ejecutan localmente y no cachean, así que el caching simplemente no aplica ahí.

También hay un umbral práctico: el contexto cacheado necesita ser razonablemente grande antes de que los proveedores realmente lo sirvan desde el caché. Los Spaces pequeños pueden no superar ese umbral, en cuyo caso verás poco o ningún beneficio de caching — lo cual es inofensivo, simplemente no es un ahorro.

Particularidades de Anthropic (Claude)

Distintos proveedores cachean de distintas formas. La mayoría de los proveedores en la nube cachean el contexto repetido automáticamente. Anthropic (Claude) es un poco diferente — Rephlo gestiona el caching para él y te da dos ajustes en la configuración del proveedor Anthropic:

AjusteQué hace
Prompt caching enabledActiva el caching de Anthropic. Activado por defecto.
Cache lifetime (TTL)Cuánto tiempo vive el caché entre turnos: ephemeral (unos 5 minutos, el valor por defecto) o extended (alrededor de 1 hora). Una vida útil más larga cuesta un poco más al escribir el caché, pero lo mantiene activo por más tiempo.

El valor por defecto de caching ephemeral activado es adecuado para la mayoría de las conversaciones, donde tus mensajes de seguimiento llegan a los pocos minutos uno del otro. Si sueles alejarte y volver a un chat mucho más tarde, extended mantiene el caché activo para que el siguiente mensaje aún obtenga un acierto de caché.

Encontrarás estas opciones en la pantalla Providers, dentro de tu configuración de Anthropic. Para ver cómo encajan los modelos y los proveedores, consulta Modelos e inferencia.

Ver el ahorro

Rephlo hace seguimiento de cuántos tokens de entrada se sirvieron desde el caché frente a los procesados de cero en cada respuesta. Con el registro detallado de caché activado (el valor por defecto para Anthropic), esta información se guarda para que puedas confirmar que el caching está haciendo su trabajo — una alta proporción de tokens cacheados en turnos posteriores significa que el caché se está reutilizando como se espera.

El ahorro proviene de que el proveedor cobra menos por entrada cacheada que por entrada nueva, así que las conversaciones más largas con un contexto de Space estable son donde el caching rinde más.

Consejos rápidos

  • Adjunta un Space a un chat para hacer posible el caching — es el disparador.
  • Mantén estable el contexto del Space entre turnos. Rephlo hace esto por ti, añadiendo únicamente contexto genuinamente nuevo en cada turno en lugar de reconstruir todo el bloque.
  • No te preocupes por un caché "frío". El primer turno escribe el caché; no hay penalización si un turno posterior falla el acierto — simplemente se procesa con normalidad.

Páginas relacionadas