LLM Providers
Der Tab LLM Providers in den Settings ist der Ort, an dem Sie Rephlo mit den KI-Modellen verbinden, die Ihre Commands und Chats antreiben. Sie können Ihre eigenen Konten bei den großen KI-Anbietern einbinden, Modelle lokal für vollständige Privatsphäre ausführen oder Rephlo alles für Sie verwalten lassen – ganz ohne eigene Schlüssel.
Öffnen Sie ihn über Settings → LLM Providers.

Zwei Wege, Provider zu nutzen
| Modus | Funktionsweise | Am besten geeignet für |
|---|---|---|
| Login (Dedicated API) | Rephlo führt die Inferenz für Sie aus. Keine API-Schlüssel zu verwalten – die Nutzung wird von den Credits Ihres Plans abgezogen. | Alle, die keinerlei Einrichtung wünschen. |
| BYOK (Bring Your Own Key) | Sie fügen Ihren eigenen API-Schlüssel eines Anbieters hinzu (OpenAI, Anthropic usw.). Sie zahlen direkt an diesen Anbieter und nutzen dessen neueste Modelle. | Power-User, die bereits Provider-Konten besitzen. |
Sie können beides kombinieren: für den täglichen Gebrauch angemeldet bleiben und für ein bestimmtes Modell einen BYOK-Provider hinzufügen. Wie Abrechnung und Credits funktionieren, erfahren Sie unter Credits & Nutzung und Pläne & Preise.
Unterstützte Provider
Rephlo unterstützt acht BYOK-Providertypen – sieben Cloud-Anbieter plus das lokal laufende Ollama (läuft auf Ihrem eigenen Rechner unter localhost:11434) – zusätzlich zu On-Device- und verwalteten Optionen:
| Provider | Was Sie bereitstellen |
|---|---|
| OpenAI | API-Schlüssel (optional benutzerdefinierter Endpunkt) |
| Anthropic | API-Schlüssel (optional Base-URL); unterstützt Prompt Caching |
| API-Schlüssel (optional Base-URL) | |
| Groq | API-Schlüssel |
| xAI (Grok) | API-Schlüssel (optional Live Search) |
| OpenRouter | API-Schlüssel (optional Site-URL/Name für das OpenRouter-Dashboard) |
| OpenAI-Compatible | Base-URL + API-Schl üssel + Modellname (Azure OpenAI, vLLM, LocalAI, LiteLLM und Ähnliches) |
| Ollama | Base-URL (Standard http://localhost:11434); optionaler Schlüssel für die Websuche |
| On-Device | Nichts – Modelle laufen lokal. Siehe On-Device-Modelle. |
| Dedicated API | Nichts – wird von Rephlo verwaltet, sobald Sie sich anmelden. |
Azure OpenAI wird über den Typ OpenAI-Compatible verbunden – richten Sie die Base-URL auf Ihren Azure-Deployment-Endpunkt – und nicht als eigener Eintrag in der Liste zum Hinzufügen von Providern.
Einen konzeptionellen Überblick darüber, wie Providers und Modelle zusammenhängen, finden Sie unter Providers und Models & Inference.
Einen Provider hinzufügen
- Klicken Sie auf Add Provider.
- Wählen Sie den Providertyp. Das Formular passt sich an und zeigt nur die Felder, die dieser Provider benötigt.
- Geben Sie Ihre Zugangsdaten ein (zum Beispiel einen API-Schlüssel oder einen Azure-Endpunkt + Deployment-Namen).
- Legen Sie optional einen benutzerdefinierten Namen fest, damit der Provider in Listen leicht wiederzuerkennen ist.
- Klicken Sie auf Test Connection, um vor dem Speichern zu bestätigen, dass der Schlüssel funktioniert.
- Klicken Sie auf Save.
Ihre Schlüssel werden verschlüsselt
API-Schlüssel und Tokens werden verschlüsselt, bevor sie auf Ihrem Rechner gespeichert werden. Sie werden nie in Logs geschrieben und sind von Datenexporten ausgeschlossen. Behandeln Sie Ihre Schlüssel wie Passwörter – Rephlo hält sie lokal und geschützt.
Modelle
Jeder Provider stellt ein oder mehrere Modelle bereit (zum Beispiel kann ein OpenAI-Provider mehrere GPT-Modelle anbieten). Sie können einem einzelnen Provider mehrere Modelle hinzufügen und eines davon als Standard festlegen. Wenn Sie einen Command oder Chat ausführen, verwendet Rephlo das Standardmodell des aktiven Providers, sofern der Command oder die Unterhaltung kein anderes Modell festlegt.
Im Modellauswahl-Menü zeigen gesperrte Dedicated-(Gateway-)Modelle, die Ihr Plan nicht einschließt, ein Tier-Badge (zum Beispiel PRO oder ENTERPRISE) und ein Schloss-Symbol, sodass Sie auf einen Blick sehen, welche Modelle Ihr Plan abdeckt. Beim Start eines völlig neuen Chats oder beim Öffnen von Chat ohne bereits festgelegtes Modell für diese Unterhaltung wird das zuletzt global verwendete Modell fortgesetzt – ein eigener Speicher, getrennt von der Modellwahl je Unterhaltung.
Wie Modell-Überschreibungen je Command und je Unterhaltung – sowie dieser globale "zuletzt verwendet"-Speicher – funktionieren, erfahren Sie unter Models & Inference.
Online-Modelle von Rephlo Gateway ausblenden
Die Unter-Tabs On-Device und BYOK Providers enthalten beide einen Schalter Hide online models from Rephlo Gateway (Tooltip: "When enabled, hides online models from Rephlo Gateway"). Das Aktivieren blendet Dedicated-(Gateway-)Modelle aus jeder Modellauswahl-Oberfläche aus – der Statusleiste, dem Chat und dem Overlay.
Seit v1.4.1 wechselt Rephlo Sie automatisch zu einem erreichbaren On-Device- oder BYOK-Modell, falls Ihr aktives Modell beim Aktivieren des Schalters ein Gateway-Modell ist – statt Sie stillschweigend auf dem nun ausgeblendeten Modell zu belassen – oder deaktiviert das Modell, falls keines verfügbar ist.
Fähigkeiten
Jede Provider-Konfiguration führt eine Reihe von Fähigkeits-Flags mit, die Rephlo mitteilen, was das Modell kann:
- Text generation – immer aktiv.
- Vision – Bilder analysieren (nur für vision-fähige Modelle wie GPT-4o, Claude, Gemini).
- Function calling / tools – strukturierte Tool-Nutzung, erforderlich für MCP-Connectors.
- Long context – sehr große Eingaben verarbeiten (>100K Tokens).
- Streaming – Antworten Token für Token anzeigen (standardmäßig aktiv).
- Web search und Thinking – sofern vom Modell unterst ützt.
Fähigkeiten werden zur Laufzeit gegen die tatsächlichen Fähigkeiten des Modells validiert, sodass das Aktivieren eines Flags, das ein Modell nicht unterstützt, zu keinem Fehler führt – Rephlo führt diesen Vorgang einfach nicht aus.
Modellparameter
Sie können das Generierungsverhalten pro Modell anpassen:
- Temperature – niedrigere Werte sind präziser und reproduzierbarer; höhere Werte sind kreativer.
- Max tokens – begrenzt die Länge jeder Antwort.
- Top-p / top-k – zusätzliche Sampling-Einstellungen für fortgeschrittene Nutzer.
Ein Command kann diese für seine eigenen Ausführungen überschreiben, sodass Sie einen ruhigen Standard mit niedriger Temperature beibehalten können, während ein Brainstorming-Command experimenteller sein darf.
Anthropic Prompt Caching
Anthropic-Provider unterstützen Prompt Caching, was die Kosten für wiederholten Kontext erheblich senken kann. Es ist standardmäßig aktiviert, mit einem "ephemeral"-Cache (etwa 5 Minuten). Eine "extended"-Option (etwa 1 Stunde) ist ebenfalls verfügbar. Caching greift nur, wenn eine Anfrage tatsächlich cachefähigen Kontext enthält – die vollständigen Hintergründe finden Sie unter Prompt Caching.
Ollama und lokale Modelle
Legen Sie für Ollama die Base-URL fest (Standard http://localhost:11434). Achten Sie auf leistungsschwächeren Rechnern auf das Kontextfenster, damit Ihnen der Speicher nicht ausgeht. Wenn Sie lieber Rephlo lokale Modelle für Sie herunterladen und verwalten lassen möchten, nutzen Sie stattdessen den integrierten Katalog On-Device-Modelle.
Bearbeiten, Testen und Entfernen
- Edit Sie einen Provider, um dessen Schlüssel zu aktualisieren, Modelle hinzuzufügen oder Parameter zu ändern.
- Test Connection validiert einen Provider nach einer Schlüsselrotation erneut.
- Remove Sie einen Provider, den Sie nicht mehr verwenden. Das Entfernen eines Providers löscht nicht Ihre Commands – sie fallen auf Ihren aktiven Provider zurück.
Gemeinsame Einstellungen
Jeder Provider verfügt außerdem über gemeinsame Optionen:
- Request timeout (Standard 60 Sekunden)
- Max retries für vorübergehende Fehler (Standard 3)
- Streaming an/aus