On-Device-Modelle
Rephlo kann KI-Modelle direkt auf Ihrem Computer ausführen — ganz ohne Internetverbindung, ohne Credits pro Nachricht, und Ihr Text verlässt niemals Ihr Gerät. Der Bildschirm On-Device-Modelle ermöglicht es Ihnen, einen kuratierten Katalog lokaler Modelle zu durchsuchen, die gewünschten Modelle herunterzuladen und zu steuern, wie sie den Arbeitsspeicher Ihres Rechners nutzen.
Dieser Bildschirm befindet sich im Bereich LLM Providers der Settings. On-Device-Inferenz verwendet das GGUF-Modellformat und läuft über Rephlos integrierte lokale Engine.
Keine integrierte Websuche. Da On-Device-Modelle vollständig offline laufen, können sie nicht selbstständig suchen oder aktuelle Informationen abrufen. Ein Web-Search-Connector (MCP) befindet sich in Entwicklung, der es On-Device-Modellen ermöglichen wird, sobald verfügbar, aktuelle Daten abzurufen. Nutzen Sie für die Websuche heute einen Cloud-Provider, der dies unterstützt (siehe Chat & Conversations).
Anhänge lesen. Seit v1.4.1 können On-Device-Modelle im Chat angehängte PDFs, Textdateien und Office-Dokumente lesen — der Text wird lokal extrahiert und in den Prompt eingefügt. Bild- oder Vision-Anhänge werden nicht unterstützt.
Wer kann On-Device-Modelle nutzen?
On-Device-Modelle erfordern Pro, Enterprise oder eine Perpetual License — die Pläne Free und Starter beinhalten sie nicht.
Wenn Ihr Plan sie nicht beinhaltet, erscheint über dem Katalog ein Upgrade-Banner: "On-device models require Pro, Enterprise, or a perpetual license." Der Katalog bleibt sichtbar — das Herunterladen und Aktivieren von Modellen ist deaktiviert, aber Sie können weiterhin bereits heruntergeladene Modelle löschen, um Speicherplatz freizugeben. Der Banner zeigt eine einzelne Schaltfläche:
| Ihre Situation | Schaltfläche |
|---|---|
| Sie sind für die kostenlose Testphase berechtigt | Start free trial or view plans |
| Sie haben Ihre Testphase bereits genutzt (oder sind nicht berechtigt) | View plans |
Ein Klick öffnet den Upgrade-Hinweis, in dem Sie Ihre Testphase starten oder Pläne vergleichen können. Sobald Ihr Plan die Funktion freischaltet, verschwindet der Banner und das Herunterladen wird verfügbar — ohne dass ein Neustart nötig ist.
Unter License & Trial können Sie eine Testphase starten, oder Sie vergleichen die Optionen auf der Preisseite.
Check my machine (Hardware-Vorabprüfung)
Bevor Sie irgendetwas herunterladen, nutzen Sie die Hardware-Vorabprüfung, um zu sehen, was Ihr Computer problemlos ausführen kann. Rephlo liest Ihre Hardware aus und zeigt eine kurze Zusammenfassung wie:
16 GB RAM · 8 Kerne · Apple Silicon (Unified Memory)
Anschließend bewertet es den Katalog und hebt die am besten passende Option hervor, indem es sie direkt auf der Download-Schaltfläche benennt (zum Beispiel Download Phi-4 Mini 3.8B). Ein Klick lädt das empfohlene Modell herunter.
Die Prüfung ist eine Empfehlung, keine Sperre:
- Passt das empfohlene Modell, erhalten Sie eine eindeutige Empfehlung.
- Benötigt ein Modell mehr Arbeitsspeicher, als Sie haben, zeigt Rephlo eine sanfte Warnung ("This model may be slow or may not load") an und lässt Sie trotzdem über Download anyway herunterladen — es blockiert Sie nie vollständig.
- Schlägt die Hardwareprüfung aus irgendeinem Grund fehl, können Sie darunter weiterhin manuell Modelle durchsuchen und herunterladen.
Modelle herunterladen und verwalten
Jedes Modell im Katalog zeigt seine Downloadgröße, eine kurze Beschreibung sowie Geschwindigkeits- und Genauigkeitsbewertungen (als Punktereihe dargestellt, mehr ist besser). In einer Modellzeile können Sie:
- Download — lädt die Modelldatei mit einem Live-Fortschrittsbalken herunter. Schlägt ein Download fehl, zeigt die Zeile den Fehler an, sodass Sie es erneut versuchen können.
- Use (Activate) — markiert ein heruntergeladenes Modell als aktives On-Device-Modell für Chat und Commands. Das Aktivieren eines Modells deaktiviert die anderen; das aktive Modell wird oben im Bildschirm angezeigt.
- Delete — entfernt die Modelldatei, um Speicherplatz freizugeben. (Sie können auch bei einem Plan löschen, bei dem die Funktion inzwischen gesperrt wurde, sodass Sie jederzeit Speicherplatz zurückgewinnen können.)
Modell-Lebenszyklus
Speicher
Heruntergeladene Modelle werden je nach Plattform in Ihrem App-Datenordner gespeichert:
| Plattform | Speicherort |
|---|---|
| macOS | ~/Library/Application Support/Rephlo/models/llm |
| Windows | %LOCALAPPDATA%\Rephlo\models\llm |
Der Bildschirm zeigt Ihre gesamte Speichernutzung über alle heruntergeladenen Modelle hinweg, und jede Zeile zeigt die individuelle Größe des jeweiligen Modells. Modelldateien sind groß (oft mehrere Gigabyte pro Modell), behalten Sie also den freien Speicherplatz im Auge — stellen Sie sicher, dass genug Platz vorhanden ist, bevor Sie herunterladen.
Arbeitsspeicher: Modelle geladen halten oder entladen
Das Laden eines Modells in den Arbeitsspeicher dauert einen Moment und beansprucht RAM, solange es aktiv ist. Sie legen mit einer Speicherstrategie fest, wie Rephlo dies handhabt:
| Strategie | Was sie bewirkt | Am besten geeignet für |
|---|---|---|
| Always Loaded | Hält das aktive Modell jederzeit im Speicher, für sofortige Antworten. | Leistungsstarke Rechner, auf denen Sie On-Device-KI ständig nutzen. |
| Auto Unload (Recommended) | Hält das Modell geladen, solange Sie es verwenden, und gibt den Speicher dann automatisch nach einer Leerlaufzeit frei (Standard 10 Minuten). | Die meisten Nutzer — schnell bei aktiver Nutzung, ressourcenschonend im Leerlauf. |
| Manual | Lädt bei Bedarf und entlädt nur, wenn Sie es festlegen. | Fortgeschrittene Benutzer, die volle Kontrolle wünschen. |
Bei Auto Unload können Sie das Idle-Timeout (in Minuten) anpassen. Nach dieser Zeit ohne Nutzung wird das Modell automatisch entladen, um den Arbeitsspeicher für andere Anwendungen freizugeben. Die nächste Anfrage lädt es automatisch erneut.
Dieselbe Karte Model Memory enthält außerdem ein Context Window-Steuerelement — die maximale Anzahl an Tokens, die das On-Device-Modell pro Anfrage berücksichtigen kann. Der Standardwert ist 32.768 Tokens (~32K) und kann zwischen 2.048 und 262.144 eingestellt werden. Hier gibt es keine Option Auto — anders als beim Feld Context Length für BYOK-/Cloud- und Ollama-artige Provider-Modelle verwenden On-Device-Modelle immer diese explizite Einstellung. Ein höheres Context Window benötigt mehr RAM/VRAM und lädt das aktive Modell neu.
Erhalten Sie einen Out-of-Context-Fehler? Passt eine Anfrage nicht in den Speicher, zeigt Rephlo einen umsetzbaren Fehler an (manchmal mit Verweis auf
NoKvSlot). Erhöhen Sie das oben beschriebene Context Window, um dies zu beheben.

Der Bildschirm On-Device-Modelle: das Vorabprüfungs-Panel „Check my machine" oben, ein Auswahlfeld für die Speicherstrategie, die gesamte Speichernutzung und der scrollbare Modellkatalog mit Download-/Nutzungs-/Löschaktionen pro Zeile.
Verwandte Seiten
- Models & Inference — wie Rephlo zwischen Cloud- und On-Device-Modellen wählt
- LLM Providers — Cloud-Provider und API-Schlüssel konfigurieren
- License & Trial — starten Sie eine Testphase, um On-Device-Modelle freizuschalten
- Privacy & Data — warum lokale Modelle Ihren Text auf dem Gerät behalten