Mise en cache des prompts
Lorsque vous discutez avec un Space attaché, une grande partie de votre message — le contexte d'arrière-plan tiré de ce Space — reste identique tour après tour. La mise en cache des prompts permet au fournisseur d'IA de se souvenir de ce segment répété plutôt que de le relire (et de le refacturer) à chaque fois. Résultat : un coût plus faible et, souvent, des réponses plus rapides, sans changement dans les réponses que vous obtenez.
Rephlo active activement la mise en cache des prompts pour Anthropic (Claude) — elle est activée par défaut, avec une durée de vie configurable. Cette page explique quand la mise en cache s'active et comment en observer le bénéfice.
Comment ça marche (en termes simples)
Une requête vers l'IA est construite en couches : une instruction stable, le contexte d'arrière-plan de votre Space, puis la nouvelle partie de la conversation. C'est le contexte d'arrière-plan qui se répète à chaque tour qui est mis en cache.
- Le préfixe stable (instruction + contexte du Space) est réutilisé depuis le cache.
- Seul le nouveau contenu de chaque tour est traité à neuf.
- Pour un contexte répété, cela peut réduire considérablement le coût de ces tokens d'entrée.
Quand la mise en cache s'applique
La mise en cache s'active lorsque ces deux conditions sont réunies :
- Un Space est attaché à la conversation. C'est le contexte du Space qui crée un préfixe volumineux et répétable qui vaut la peine d'être mis en cache. Sans Space attaché, il n'y a pas de bloc stable à mettre en cache, donc la mise en cache n'a rien à faire.
- Vous utilisez un fournisseur qui met en cache. Rephlo pilote la mise en cache pour Anthropic (Claude), de sorte que le contexte répété est servi depuis le cache lors des tours suivants. Certains autres fournisseurs cloud mettent automatiquement en cache le contexte répété de leur propre côté — c'est leur comportement, pas quelque chose que Rephlo contrôle. Les modèles sur l'appareil s'exécutent localement et ne mettent pas en cache, donc la mise en cache ne s'applique tout simplement pas dans ce cas.
Il existe aussi un seuil pratique : le contexte mis en cache doit être suffisamment volumineux avant que les fournisseurs ne le servent réellement depuis le cache. Les petits Spaces peuvent ne pas franchir ce seuil, auquel cas vous verrez peu ou pas de bénéfice de mise en cache — ce qui est sans conséquence, simplement pas d'économie.
Spécificités d'Anthropic (Claude)
Différents fournisseurs mettent en cache de différentes manières. La plupart des fournisseurs cloud mettent en cache le contexte répété automatiquement. Anthropic (Claude) est un peu différent — Rephlo pilote la mise en cache pour ce fournisseur et vous propose deux paramètres dans la configuration du fournisseur Anthropic :
| Paramètre | Ce qu'il fait |
|---|---|
| Prompt caching enabled | Active la mise en cache Anthropic. Activé par défaut. |
| Cache lifetime (TTL) | Durée de vie du cache entre les tours : ephemeral (environ 5 minutes, par défaut) ou extended (environ 1 heure). Une durée de vie plus longue coûte légèrement plus cher pour écrire le cache mais le garde actif plus longtemps. |
Le réglage par défaut de mise en cache ephemeral convient à la plupart des conversations, où vos messages de suivi arrivent quelques minutes après les précédents. Si vous avez tendance à vous absenter et à revenir à un chat bien plus tard, extended garde le cache actif afin que le message suivant obtienne quand même un cache hit.
Vous trouverez ces options sur l'écran Providers, dans votre configuration Anthropic. Pour comprendre comment modèles et fournisseurs s'articulent, consultez Modèles & Inférence.
Observer les économies
Rephlo suit combien de tokens d'entrée ont été servis depuis le cache par rapport à ceux traités à neuf sur chaque réponse. Avec la journalisation détaillée du cache activée (par défaut pour Anthropic), cette information est enregistrée afin que vous puissiez confirmer que la mise en cache fait son travail — une proportion élevée de tokens en cache lors des tours suivants signifie que le cache est réutilisé comme prévu.
Les économies proviennent du fait que le fournisseur facture moins cher l'entrée en cache que l'entrée fraîche, donc les conversations longues avec un contexte de Space stable sont là où la mise en cache est la plus rentable.
Astuces rapides
- Attachez un Space à un chat pour rendre la mise en cache possible — c'est le déclencheur.
- Gardez le contexte du Space stable d'un tour à l'autre. Rephlo s'en charge pour vous en n'ajoutant que le contexte réellement nouveau à chaque tour plutôt qu'en reconstruisant tout le bloc.
- Ne vous inquiétez pas d'un cache « froid ». Le premier tour écrit le cache ; il n'y a aucune pénalité si un tour ultérieur venait à le manquer — il est simplement traité normalement.
Pages associées
- Modèles & Inférence — comment fonctionnent les fournisseurs et les modèles.
- Modes de données & Compaction — comment le contexte du Space et les budgets de tokens sont gérés.
- Paramètres des fournisseurs — où se trouvent les options de mise en cache Anthropic.
- Chat & Conversations — attacher un Space à un chat.
- Crédits & utilisation — comment l'utilisation est comptabilisée.