Zum Hauptinhalt springen

Erweiterte Konfiguration

Für erfahrene Benutzer bietet Rephlo eine feinere Kontrolle über Leistung, KI-Verhalten und Prompt-Caching. Anders als bei den Grundeinstellungen sind diese Einstellungen auf mehrere Stellen verteilt — einige gelten pro Space, einige pro Anbieter oder pro Command, und einige gelten für die gesamte App. Diese Seite zeigt, wo sich welche Einstellung befindet und was sie bewirkt.

Der Abschnitt „Leistung" im Tab „Allgemein" — Einstellungen für das Standard-Token-Budget für Spaces und das Chat-Anzeigefenster

Token-Budgets

Das Default Space Token Budget befindet sich unter Settings → General → Performance. Es legt das anfängliche Token-Limit für jeden neuen Space fest — wie viel Dokumentinhalt der Space aufnehmen kann, bevor Datenmodi und Kompaktierung relevant werden.

  • Schieberegler-Bereich: 5.000 bis 1.000.000 Token (das Eingabefeld erlaubt Werte bis hinunter zu 1.000).
  • Standard: 100.000 Token.
  • Gilt nur für neue Spaces. Jeder Space kann anschließend individuell neu budgetiert werden, und eine Änderung dieses Standardwerts schreibt bestehende Spaces nie um.

Eine separate Einstellung für die Größe des Chat-Anzeigefensters im selben Abschnitt legt fest, wie viele aktuelle Unterhaltungen gleichzeitig in die Chat-Seitenleiste geladen werden (10–5.000; ältere Chats bleiben über die Suche erreichbar). Dies ist ein Leistungs-Feintuning-Regler, kein Datenlimit.

Kompaktierungsstrategie

Kompaktierung hält einen Space token-schonend, indem seine Dokumente zusammengefasst werden. Sie greift, wenn für einen Space der Datenmodus 🗜️ Compact eingestellt ist (ausgewählt über den Datenmodus-Selektor pro Space — es gibt keinen separaten globalen Schalter dafür):

  • Wenn Sie einen Space auf Compact umstellen, bietet Rephlo an, die vorhandenen Dateien zusammenzufassen; neu hinzugefügte Dateien können aus der Space-Ansicht heraus kompaktiert werden. Das Erstellen von Zusammenfassungen verbraucht Credits, daher lässt Rephlo Sie die Credit-Kosten immer zuerst bestätigen — Kompaktierung geschieht nie unbemerkt.
  • Credit-Schutz: Bei einem großen Space (Rohgesamtwert ≈ 128.000 Token oder mehr) ist Compact deaktiviert und die Kompaktierung wird blockiert; stattdessen werden Sie zur kostenlosen Smart Search geleitet. Das Kompaktieren einer einzelnen großen Datei (≈ 50.000 Token oder mehr) erfordert eine zusätzliche Bestätigung.
  • Beim Kompaktieren bittet Rephlo Sie, eine Strategie sowie das Modell auszuwählen, das die Zusammenfassung erstellen soll. Die Modellwahl wird für den Rest Ihrer Sitzung gespeichert.

Die drei Strategien wägen Genauigkeit gegen Token-Ersparnis ab:

StrategieWas sie bewirktAm besten geeignet für
ConservativeBehält die meisten Details; geringste Token-Reduzierung.Wenn Genauigkeit wichtiger ist als das Einsparen von Token.
BalancedFasst ältere Dokumente zusammen — der empfohlene Mittelweg (Standard).Die meisten Projekte.
AggressiveBehält nur die aktuellsten Kernpunkte; maximale Ersparnis, größerer Detailverlust.Sehr umfangreiches Material in ein kleines Kontextfenster einzupassen.

Unabhängig davon, welchen Modus ein Space verwendet, verfolgt Rephlo sowohl einen Roh-Token-Gesamtwert als auch einen kompaktierten Token-Gesamtwert pro Space, sodass Sie die Wirkung der Kompaktierung erkennen können. Ein vollständiges Bild von Smart Search im Vergleich zu Compact-Daten und wie die Kompaktierung mit dem geräteinternen Retrieval (RAG) zusammenspielt, finden Sie unter Datenmodi & Kompaktierung.

Anbieter- und Modell-Feinabstimmung

Temperature, maximale Antwortlänge und Kontextfenster sind Einstellungen pro Anbieter und pro Modell (mit optionalen Überschreibungen pro Command) — es handelt sich nicht um eine einzelne globale Einstellung. Konfigurieren Sie diese im Tab LLM Providers; siehe Anbieter und Anbieter verwalten.

Temperature

Steuert, wie deterministisch bzw. kreativ die Antworten ausfallen. Der Standardwert ist 0,7 (ausgewogen).

  • 0,0–0,3 — präzise und reproduzierbar. Gut für Code und Fakten.
  • ~0,7 — ausgewogen. Gut für allgemeines Schreiben.
  • 1,0+ — kreativer und abwechslungsreicher. Gut zum Brainstorming.

Max Response Tokens

Begrenzt die Länge der KI-Antwort, damit sie keinen Aufsatz schreibt, wenn Sie nur einen Satz wollten. Ein Wert um 2.000 ist ein typischer Standardwert.

Kontextfenster-Limit

Bei BYOK-/Cloud- und Ollama-artigen Anbietermodellen ist dies das Feld Context Length im Dialog „Add/Edit Model". Es begrenzt, wie viel Text an das Modell gesendet wird. Belassen Sie es auf Auto, um den Standardwert des Anbieters zu verwenden, oder legen Sie ein manuelles Limit fest, um die Kosten bei kostenpflichtigen APIs zu steuern.

On-device-Modelle verwenden dieses Feld nicht — der kuratierte On-Device-Katalog ignoriert es. Stattdessen besitzen sie eine eigene Einstellung Context Window (Settings → LLM Providers → On-Device, in der Model-Memory-Karte): ein Bereich von 2.048–262.144 Token, Standard ~32.768. Eine Erhöhung verbraucht mehr RAM/VRAM und lädt das aktive Modell neu.

Pro-Command-Überschreibungen

Einzelne Commands können den globalen Anbieter, das Modell, die Temperature und die maximale Token-Anzahl überschreiben. Bei der Ausführung haben die eigenen Einstellungen eines Commands Vorrang vor den globalen Anbieter-Standardwerten. Siehe Execution Workflows.

Prompt-Caching

Rephlo kann ein zwischengespeichertes (gecachtes) Präfix Ihres Prompts wiederverwenden, um Kosten und Latenz bei unterstützten Anbietern zu senken. Die Caching-Einstellungen befinden sich bei der Anbieterkonfiguration:

  • Enable prompt caching — aktiviert Caching für unterstützte Anfragen (standardmäßig aktiviert).
  • Cache TTL — wie lange ein Cache-Eintrag gültig bleibt:
    • Ephemeral — etwa 5 Minuten.
    • Extended — etwa 1 Stunde.
  • Cache logging — zeichnet detaillierte Informationen zur Cache-Leistung auf.

Cache-Lesevorgänge werden stark vergünstigt abgerechnet, und die Detailansicht unter History zeigt Cache-Erstellungs- und Cache-Lese-Token pro Anfrage an, sodass Sie die Ersparnis erkennen können. Caching greift nur, wenn die Anfrage über ein cachefähiges Präfix verfügt (zum Beispiel ein Chat mit angehängtem Space). Das vollständige Verhalten finden Sie unter Prompt Caching.

Entwicklertools

Dies sind Hilfsmittel zur Fehlerbehebung, keine alltäglichen Einstellungen:

  • Debug Mode — aktiviert ausführliches Logging in die Log-Datei der App. Nützlich bei der Diagnose von Verbindungsproblemen mit Anbietern.
  • Prompt Inspection — zeigt die genaue an den Anbieter gesendete JSON-Payload an, einsehbar in den Details unter History.

Environment switching (Production / Staging / lokale API-Endpunkte) ist nur in Debug-Builds verfügbar und nicht Teil der regulären Benutzererfahrung.


Siehe auch: Datenmodi & Kompaktierung · Anbieter · Prompt Caching · Verlauf & Audit