Zum Hauptinhalt springen

Prompt Caching

Wenn Sie mit einem angehängten Space chatten, bleibt ein großer Teil Ihrer Nachricht — der aus diesem Space stammende Hintergrundkontext — von Turn zu Turn gleich. Prompt Caching ermöglicht es dem KI-Provider, sich diesen wiederkehrenden Teil zu merken, anstatt ihn jedes Mal erneut zu lesen (und Ihnen dafür erneut in Rechnung zu stellen). Das Ergebnis: geringere Kosten und oft schnellere Antworten, ohne dass sich die Antworten selbst ändern.

Rephlo aktiviert Prompt Caching aktiv für Anthropic (Claude) — es ist standardmäßig eingeschaltet, mit einer konfigurierbaren Lebensdauer. Diese Seite erklärt, wann das Caching greift und wie Sie den Nutzen erkennen.

Wie es funktioniert (einfach erklärt)

Eine Anfrage an die KI ist in Schichten aufgebaut: eine feste Anweisung, der Hintergrundkontext Ihres Space und dann der neue Teil der Unterhaltung. Der Hintergrundkontext, der sich bei jedem Turn wiederholt, ist das, was gecacht wird.

  • Das stabile Präfix (Anweisung + Space-Kontext) wird aus dem Cache wiederverwendet.
  • Nur der neue Inhalt in jedem Turn wird frisch verarbeitet.
  • Bei wiederkehrendem Kontext kann dies die Kosten für diese Input-Token drastisch senken.

Wann Caching greift

Caching greift, wenn beide der folgenden Bedingungen erfüllt sind:

  1. Der Unterhaltung ist ein Space angehängt. Der Space-Kontext ist es, der ein großes, wiederholbares Präfix erzeugt, das sich für das Caching lohnt. Ohne einen angehängten Space gibt es keinen stabilen Block zum Cachen, sodass Caching hier nichts zu tun hat.
  2. Sie verwenden einen Provider, der cacht. Rephlo steuert das Caching für Anthropic (Claude), sodass wiederkehrender Kontext bei späteren Turns aus dem Cache bedient wird. Manche anderen Cloud-Provider cachen wiederkehrenden Kontext automatisch auf ihrer eigenen Seite — das ist deren Verhalten, nicht etwas, das Rephlo steuert. On-Device-Modelle laufen lokal und cachen nicht, sodass Caching dort schlicht nicht zutrifft.

Es gibt auch eine praktische Untergrenze: Der gecachte Kontext muss angemessen groß sein, damit Provider ihn tatsächlich aus dem Cache bedienen. Kleine Spaces überschreiten diese Schwelle möglicherweise nicht — in diesem Fall sehen Sie wenig bis keinen Caching-Vorteil, was harmlos ist, aber eben keine Ersparnis bringt.

Besonderheiten von Anthropic (Claude)

Unterschiedliche Provider cachen auf unterschiedliche Weise. Die meisten Cloud-Anbieter cachen wiederkehrenden Kontext automatisch. Anthropic (Claude) ist etwas anders — Rephlo steuert das Caching dafür und bietet Ihnen zwei Einstellungen in der Anthropic-Provider-Konfiguration:

EinstellungWas sie bewirkt
Prompt caching enabledSchaltet das Anthropic-Caching ein. Standardmäßig aktiviert.
Cache lifetime (TTL)Wie lange der Cache zwischen den Turns bestehen bleibt: ephemeral (etwa 5 Minuten, die Standardeinstellung) oder extended (etwa 1 Stunde). Eine längere Lebensdauer kostet beim Schreiben des Caches etwas mehr, hält ihn aber länger warm.

Die Standardeinstellung mit aktiviertem ephemeral-Caching passt für die meisten Unterhaltungen gut, bei denen Ihre Folgenachrichten innerhalb weniger Minuten aufeinanderfolgen. Wenn Sie eher dazu neigen, einen Chat zu verlassen und viel später zurückzukehren, hält extended den Cache warm, sodass die nächste Nachricht weiterhin einen Cache-Treffer erzielt.

Diese Optionen finden Sie im Tab LLM Providers unter Ihrer Anthropic-Konfiguration. Wo Modelle und Provider zusammenspielen, erfahren Sie unter Modelle & Inferenz.

Die Einsparungen erkennen

Rephlo verfolgt, wie viele Input-Token bei jeder Antwort aus dem Cache bedient wurden im Vergleich zu frisch verarbeiteten. Bei aktiviertem detailliertem Cache-Logging (Standard für Anthropic) wird diese Information erfasst, sodass Sie bestätigen können, dass das Caching seine Aufgabe erfüllt — ein hoher Anteil gecachter Token bei späteren Turns bedeutet, dass der Cache wie vorgesehen wiederverwendet wird.

Die Ersparnis entsteht dadurch, dass der Provider für gecachten Input weniger berechnet als für frischen Input — daher zahlt sich Caching am meisten bei längeren Unterhaltungen mit stabilem Space-Kontext aus.

Kurztipps

  • Hängen Sie einen Space an einen Chat an, um Caching überhaupt zu ermöglichen — das ist der Auslöser.
  • Halten Sie den Space-Kontext über die Turns hinweg stabil. Rephlo übernimmt das für Sie, indem bei jedem Turn nur wirklich neuer Kontext hinzugefügt wird, statt den gesamten Block neu aufzubauen.
  • Machen Sie sich keine Sorgen über einen „kalten" Cache. Der erste Turn schreibt den Cache; es gibt keine Strafe, falls ein späterer Turn zufällig daneben trifft — er wird einfach normal verarbeitet.

Verwandte Seiten