Zum Hauptinhalt springen

LLM Providers

Der Tab LLM Providers in den Settings ist der Ort, an dem Sie Rephlo mit den KI-Modellen verbinden, die Ihre Commands und Chats antreiben. Sie können Ihre eigenen Konten bei den großen KI-Anbietern einbinden, Modelle lokal für vollständige Privatsphäre ausführen oder Rephlo alles für Sie verwalten lassen – ganz ohne eigene Schlüssel.

Öffnen Sie ihn über Settings → LLM Providers.

Der Tab LLM Providers in den Settings, mit den Unter-Tabs On-Device und BYOK Providers

Zwei Wege, Provider zu nutzen

ModusFunktionsweiseAm besten geeignet für
Login (Dedicated API)Rephlo führt die Inferenz für Sie aus. Keine API-Schlüssel zu verwalten – die Nutzung wird von den Credits Ihres Plans abgezogen.Alle, die keinerlei Einrichtung wünschen.
BYOK (Bring Your Own Key)Sie fügen Ihren eigenen API-Schlüssel eines Anbieters hinzu (OpenAI, Anthropic usw.). Sie zahlen direkt an diesen Anbieter und nutzen dessen neueste Modelle.Power-User, die bereits Provider-Konten besitzen.

Sie können beides kombinieren: für den täglichen Gebrauch angemeldet bleiben und für ein bestimmtes Modell einen BYOK-Provider hinzufügen. Wie Abrechnung und Credits funktionieren, erfahren Sie unter Credits & Nutzung und Pläne & Preise.

Unterstützte Provider

Rephlo unterstützt acht BYOK-Providertypen – sieben Cloud-Anbieter plus das lokal laufende Ollama (läuft auf Ihrem eigenen Rechner unter localhost:11434) – zusätzlich zu On-Device- und verwalteten Optionen:

ProviderWas Sie bereitstellen
OpenAIAPI-Schlüssel (optional benutzerdefinierter Endpunkt)
AnthropicAPI-Schlüssel (optional Base-URL); unterstützt Prompt Caching
GoogleAPI-Schlüssel (optional Base-URL)
GroqAPI-Schlüssel
xAI (Grok)API-Schlüssel (optional Live Search)
OpenRouterAPI-Schlüssel (optional Site-URL/Name für das OpenRouter-Dashboard)
OpenAI-CompatibleBase-URL + API-Schlüssel + Modellname (Azure OpenAI, vLLM, LocalAI, LiteLLM und Ähnliches)
OllamaBase-URL (Standard http://localhost:11434); optionaler Schlüssel für die Websuche
On-DeviceNichts – Modelle laufen lokal. Siehe On-Device-Modelle.
Dedicated APINichts – wird von Rephlo verwaltet, sobald Sie sich anmelden.

Azure OpenAI wird über den Typ OpenAI-Compatible verbunden – richten Sie die Base-URL auf Ihren Azure-Deployment-Endpunkt – und nicht als eigener Eintrag in der Liste zum Hinzufügen von Providern.

Einen konzeptionellen Überblick darüber, wie Providers und Modelle zusammenhängen, finden Sie unter Providers und Models & Inference.

Einen Provider hinzufügen

  1. Klicken Sie auf Add Provider.
  2. Wählen Sie den Providertyp. Das Formular passt sich an und zeigt nur die Felder, die dieser Provider benötigt.
  3. Geben Sie Ihre Zugangsdaten ein (zum Beispiel einen API-Schlüssel oder einen Azure-Endpunkt + Deployment-Namen).
  4. Legen Sie optional einen benutzerdefinierten Namen fest, damit der Provider in Listen leicht wiederzuerkennen ist.
  5. Klicken Sie auf Test Connection, um vor dem Speichern zu bestätigen, dass der Schlüssel funktioniert.
  6. Klicken Sie auf Save.

Ihre Schlüssel werden verschlüsselt

API-Schlüssel und Tokens werden verschlüsselt, bevor sie auf Ihrem Rechner gespeichert werden. Sie werden nie in Logs geschrieben und sind von Datenexporten ausgeschlossen. Behandeln Sie Ihre Schlüssel wie Passwörter – Rephlo hält sie lokal und geschützt.

Modelle

Jeder Provider stellt ein oder mehrere Modelle bereit (zum Beispiel kann ein OpenAI-Provider mehrere GPT-Modelle anbieten). Sie können einem einzelnen Provider mehrere Modelle hinzufügen und eines davon als Standard festlegen. Wenn Sie einen Command oder Chat ausführen, verwendet Rephlo das Standardmodell des aktiven Providers, sofern der Command oder die Unterhaltung kein anderes Modell festlegt.

Im Modellauswahl-Menü zeigen gesperrte Dedicated-(Gateway-)Modelle, die Ihr Plan nicht einschließt, ein Tier-Badge (zum Beispiel PRO oder ENTERPRISE) und ein Schloss-Symbol, sodass Sie auf einen Blick sehen, welche Modelle Ihr Plan abdeckt. Beim Start eines völlig neuen Chats oder beim Öffnen von Chat ohne bereits festgelegtes Modell für diese Unterhaltung wird das zuletzt global verwendete Modell fortgesetzt – ein eigener Speicher, getrennt von der Modellwahl je Unterhaltung.

Wie Modell-Überschreibungen je Command und je Unterhaltung – sowie dieser globale "zuletzt verwendet"-Speicher – funktionieren, erfahren Sie unter Models & Inference.

Online-Modelle von Rephlo Gateway ausblenden

Die Unter-Tabs On-Device und BYOK Providers enthalten beide einen Schalter Hide online models from Rephlo Gateway (Tooltip: "When enabled, hides online models from Rephlo Gateway"). Das Aktivieren blendet Dedicated-(Gateway-)Modelle aus jeder Modellauswahl-Oberfläche aus – der Statusleiste, dem Chat und dem Overlay.

Seit v1.4.1 wechselt Rephlo Sie automatisch zu einem erreichbaren On-Device- oder BYOK-Modell, falls Ihr aktives Modell beim Aktivieren des Schalters ein Gateway-Modell ist – statt Sie stillschweigend auf dem nun ausgeblendeten Modell zu belassen – oder deaktiviert das Modell, falls keines verfügbar ist.

Fähigkeiten

Jede Provider-Konfiguration führt eine Reihe von Fähigkeits-Flags mit, die Rephlo mitteilen, was das Modell kann:

  • Text generation – immer aktiv.
  • Vision – Bilder analysieren (nur für vision-fähige Modelle wie GPT-4o, Claude, Gemini).
  • Function calling / tools – strukturierte Tool-Nutzung, erforderlich für MCP-Connectors.
  • Long context – sehr große Eingaben verarbeiten (>100K Tokens).
  • Streaming – Antworten Token für Token anzeigen (standardmäßig aktiv).
  • Web search und Thinking – sofern vom Modell unterstützt.

Fähigkeiten werden zur Laufzeit gegen die tatsächlichen Fähigkeiten des Modells validiert, sodass das Aktivieren eines Flags, das ein Modell nicht unterstützt, zu keinem Fehler führt – Rephlo führt diesen Vorgang einfach nicht aus.

Modellparameter

Sie können das Generierungsverhalten pro Modell anpassen:

  • Temperature – niedrigere Werte sind präziser und reproduzierbarer; höhere Werte sind kreativer.
  • Max tokens – begrenzt die Länge jeder Antwort.
  • Top-p / top-k – zusätzliche Sampling-Einstellungen für fortgeschrittene Nutzer.

Ein Command kann diese für seine eigenen Ausführungen überschreiben, sodass Sie einen ruhigen Standard mit niedriger Temperature beibehalten können, während ein Brainstorming-Command experimenteller sein darf.

Anthropic Prompt Caching

Anthropic-Provider unterstützen Prompt Caching, was die Kosten für wiederholten Kontext erheblich senken kann. Es ist standardmäßig aktiviert, mit einem "ephemeral"-Cache (etwa 5 Minuten). Eine "extended"-Option (etwa 1 Stunde) ist ebenfalls verfügbar. Caching greift nur, wenn eine Anfrage tatsächlich cachefähigen Kontext enthält – die vollständigen Hintergründe finden Sie unter Prompt Caching.

Ollama und lokale Modelle

Legen Sie für Ollama die Base-URL fest (Standard http://localhost:11434). Achten Sie auf leistungsschwächeren Rechnern auf das Kontextfenster, damit Ihnen der Speicher nicht ausgeht. Wenn Sie lieber Rephlo lokale Modelle für Sie herunterladen und verwalten lassen möchten, nutzen Sie stattdessen den integrierten Katalog On-Device-Modelle.

Bearbeiten, Testen und Entfernen

  • Edit Sie einen Provider, um dessen Schlüssel zu aktualisieren, Modelle hinzuzufügen oder Parameter zu ändern.
  • Test Connection validiert einen Provider nach einer Schlüsselrotation erneut.
  • Remove Sie einen Provider, den Sie nicht mehr verwenden. Das Entfernen eines Providers löscht nicht Ihre Commands – sie fallen auf Ihren aktiven Provider zurück.

Gemeinsame Einstellungen

Jeder Provider verfügt außerdem über gemeinsame Optionen:

  • Request timeout (Standard 60 Sekunden)
  • Max retries für vorübergehende Fehler (Standard 3)
  • Streaming an/aus

Verwandte Seiten