Aller au contenu principal

Modèles sur l'appareil

Rephlo peut exécuter des modèles d'IA directement sur votre ordinateur — sans connexion Internet, sans credits par message, et votre texte ne quitte jamais votre appareil. L'écran On-Device Models vous permet de parcourir un catalogue sélectionné de modèles locaux, de télécharger ceux que vous souhaitez, et de contrôler la façon dont ils utilisent la mémoire de votre machine.

Cet écran se trouve dans la section LLM Providers des Settings. L'inférence sur l'appareil utilise le format de modèle GGUF et s'exécute via le moteur local intégré de Rephlo.

Aucune recherche web intégrée. Comme les modèles sur l'appareil s'exécutent entièrement hors ligne, ils ne peuvent pas rechercher ni récupérer d'informations en direct par eux-mêmes. Un connecteur de recherche web (MCP) est en cours de développement et permettra aux modèles sur l'appareil de récupérer des données à jour dès qu'il sera disponible. Pour la recherche web dès aujourd'hui, utilisez un fournisseur cloud qui la prend en charge (voir Chat & Conversations).

Lecture des pièces jointes. Depuis la v1.4.1, les modèles sur l'appareil peuvent lire les PDF, fichiers texte et documents Office joints dans le chat — le texte est extrait localement et inclus dans le prompt. Ils ne prennent pas en charge les pièces jointes d'image ou de vision.

Qui peut utiliser les modèles sur l'appareil ?

Les modèles sur l'appareil nécessitent un plan Pro, Enterprise, ou une licence perpétuelle — les plans Free et Starter ne les incluent pas.

Si votre plan ne les inclut pas, une bannière de mise à niveau apparaît au-dessus du catalogue : « On-device models require Pro, Enterprise, or a perpetual license. » Le catalogue reste visible — le téléchargement et l'activation des modèles sont désactivés, mais vous pouvez toujours supprimer les modèles déjà téléchargés pour libérer de l'espace disque. La bannière affiche un seul bouton :

Votre situationBouton
Vous êtes éligible à l'essai gratuitStart free trial or view plans
Vous avez déjà utilisé votre essai (ou n'y êtes pas éligible)View plans

Cliquer dessus ouvre l'invite de mise à niveau, où vous pouvez démarrer votre essai ou comparer les plans. Dès que votre plan débloque la fonctionnalité, la bannière disparaît et le téléchargement devient disponible — aucun redémarrage n'est nécessaire.

Consultez License & Trial pour démarrer un essai, ou comparez les options sur la page tarifaire.

Check my machine (vérification préalable)

Avant de télécharger quoi que ce soit, utilisez la vérification matérielle préalable pour voir ce que votre ordinateur peut exécuter confortablement. Rephlo analyse votre matériel et affiche un court résumé du type :

16 GB RAM · 8 cores · Apple Silicon (unified memory)

Il classe ensuite le catalogue et met en évidence le modèle le plus adapté, en le nommant directement sur le bouton de téléchargement (par exemple, Download Phi-4 Mini 3.8B). Un seul clic télécharge ce modèle recommandé.

Cette vérification est indicative, ce n'est pas un verrou :

  • Si le modèle recommandé convient, vous obtenez une recommandation nette.
  • Si un modèle nécessite plus de mémoire que vous n'en avez, Rephlo affiche un avertissement discret (« This model may be slow or may not load ») et vous laisse Download anyway — il ne vous bloque jamais complètement.
  • Si la détection matérielle échoue pour une raison quelconque, vous pouvez toujours parcourir et télécharger des modèles manuellement ci-dessous.

Télécharger et gérer les modèles

Chaque modèle du catalogue affiche sa taille de téléchargement, une courte description, ainsi que des notes de vitesse et de précision (représentées par une rangée de points, plus il y en a, mieux c'est). Depuis la ligne d'un modèle, vous pouvez :

  • Download — récupère le fichier du modèle avec une barre de progression en direct. Si un téléchargement échoue, la ligne affiche l'erreur afin que vous puissiez réessayer.
  • Use (Activate) — marque un modèle téléchargé comme le modèle sur l'appareil actif pour le chat et les commandes. Activer un modèle désactive les autres ; le modèle actif est affiché en haut de l'écran.
  • Delete — supprime le fichier du modèle pour libérer de l'espace disque. (Vous pouvez supprimer même sur un plan qui a depuis verrouillé la fonctionnalité, afin de toujours pouvoir récupérer de l'espace de stockage.)

Cycle de vie du modèle

Stockage

Les modèles téléchargés sont stockés dans le dossier de données de l'application, selon la plateforme :

PlateformeEmplacement
macOS~/Library/Application Support/Rephlo/models/llm
Windows%LOCALAPPDATA%\Rephlo\models\llm

L'écran affiche votre utilisation totale du disque pour l'ensemble des modèles téléchargés, et chaque ligne indique la taille individuelle de ce modèle. Les fichiers de modèle sont volumineux (souvent plusieurs gigaoctets chacun), alors surveillez l'espace disponible — assurez-vous d'avoir de la place avant de télécharger.

Mémoire : garder les modèles chargés ou les décharger

Charger un modèle en mémoire prend un instant et consomme de la RAM tant qu'il est actif. Vous choisissez comment Rephlo gère cela via une stratégie de mémoire :

StratégieCe qu'elle faitIdéale pour
Always LoadedGarde le modèle actif en mémoire en permanence pour des réponses instantanées.Les machines puissantes où vous utilisez l'IA sur l'appareil en continu.
Auto Unload (Recommended)Garde le modèle chargé pendant que vous l'utilisez, puis libère automatiquement la mémoire après une période d'inactivité (par défaut 10 minutes).La plupart des utilisateurs — rapide en activité, léger en ressources au repos.
ManualCharge à la demande et ne décharge que lorsque vous le décidez.Les utilisateurs avancés qui veulent un contrôle total.

Avec Auto Unload, vous pouvez ajuster le délai d'inactivité (en minutes). Passé ce délai sans utilisation, le modèle se décharge de lui-même pour rendre la mémoire aux autres applications. La requête suivante le recharge automatiquement.

La même carte Model Memory comprend aussi un contrôle Context Window — le nombre maximal de tokens que le modèle sur l'appareil peut prendre en compte par requête. Il est fixé par défaut à 32 768 tokens (~32K) et peut être réglé entre 2 048 et 262 144. Il n'y a pas d'option Auto ici — contrairement au champ Context Length des fournisseurs BYOK/cloud et des modèles de type Ollama, les modèles sur l'appareil utilisent toujours ce réglage explicite. Augmenter le Context Window utilise plus de RAM/VRAM et recharge le modèle actif.

Une erreur de dépassement de contexte ? Si une requête ne tient pas en mémoire, Rephlo affiche une erreur exploitable (faisant parfois référence à NoKvSlot). Augmentez le Context Window ci-dessus pour résoudre le problème.

Settings → LLM Providers → On-Device — espace de stockage utilisé, Check my machine, Model Memory, et le catalogue de modèles sur l'appareil avec Activate/Delete

L'écran On-Device Models : le panneau préalable « Check my machine » en haut, un sélecteur de stratégie de mémoire, l'utilisation totale du stockage, et le catalogue de modèles défilant avec les actions de téléchargement/utilisation/suppression par ligne.

Pages associées

  • Models & Inference — comment Rephlo choisit entre les modèles cloud et sur l'appareil
  • LLM Providers — configurez les fournisseurs cloud et les clés API
  • License & Trial — démarrez un essai pour débloquer les modèles sur l'appareil
  • Privacy & Data — pourquoi les modèles locaux gardent votre texte sur l'appareil