Modèles et inférence
Un provider (fournisseur) est celui qui exécute l'IA (OpenAI, Anthropic, votre propre machine, ou Rephlo). Un model (modèle) est le moteur réel qui produit le texte. Un fournisseur propose généralement plusieurs modèles, et vous choisissez lequel exécute chaque commande ou chat.
Bien comprendre cette distinction est la clé pour contrôler la vitesse, la qualité, la confidentialité et le coût.
Les trois façons dont Rephlo exécute l'IA
Rephlo peut exécuter une requête de trois façons différentes. Vous choisissez celle qui correspond à vos besoins.
| Façon d'exécuter l'IA | Où cela s'exécute | Qui paie | Plan requis | Idéal pour |
|---|---|---|---|---|
| Cloud (votre propre clé) | Les serveurs du fournisseur (OpenAI, Anthropic, Google, etc.) | Vous — facturé par le fournisseur sur votre propre clé API | Plan Pro ou licence perpétuelle | Modèles de premier plan, contrôle total |
| On-device (sur l'appareil) | Votre propre ordinateur, entièrement hors ligne | Personne — aucun credit, aucune facture fournisseur | Plan Pro ou licence perpétuelle | Confidentialité, sans internet, sans coût d'usage |
| Hébergé par Rephlo | Le service d'inférence de Rephlo | Credits Rephlo de votre plan | Inclus avec les plans payants | Simplicité, aucune clé à gérer |
Restriction de plan : Les fournisseurs bring-your-own-key (cloud et Ollama) et les modèles on-device sont des fonctionnalités de niveau Pro — ils nécessitent un plan Pro actif (ou supérieur) ou une licence perpétuelle pour être utilisés. Pour les modèles on-device, cette restriction couvre à la fois le téléchargement et l'exécution ; une fois débloqués, ils s'exécutent sans coût d'usage et entièrement hors ligne. La Dedicated API hébergée par Rephlo est incluse avec les plans payants et consomme des credits.
1. Fournisseurs cloud (apportez votre propre clé)
Vous collez une clé API d'un fournisseur chez qui vous avez déjà un compte. Rephlo prend en charge huit types de fournisseurs BYOK — sept fournisseurs cloud (OpenAI, Anthropic, Google, Groq, xAI (Grok), OpenRouter, et tout point de terminaison compatible OpenAI — y compris Azure OpenAI) plus Ollama en local, qui s'exécute sur votre propre machine à localhost:11434. Chacun expose sa propre liste de modèles — vous choisissez parmi tout ce que ce fournisseur propose actuellement (les derniers GPT, Claude, Gemini et autres modèles).
L'usage est facturé par le fournisseur, sur votre clé — Rephlo ne facture jamais de credits pour ces appels. Configurez cela dans Fournisseurs.
2. Modèles on-device (privés, gratuits, hors ligne)
Rephlo peut exécuter des modèles ouverts entièrement sur votre propre ordinateur en utilisant des fichiers de modèle GGUF via un moteur intégré. Une fois qu'un modèle est téléchargé :
- Il s'exécute avec zéro connexion internet — rien n'est envoyé à un serveur.
- Il n'utilise aucun credit et ne coûte rien à l'exécution.
- Tout reste entièrement privé sur votre machine.
L'utilisation des modèles on-device — à la fois le téléchargement et l'exécution — nécessite un plan Pro actif (ou supérieur) ou une licence perpétuelle, tout comme les fournisseurs cloud BYOK et Ollama. Une fois débloqués, ils s'exécutent sans credit et entièrement hors ligne.
Chaque modèle on-device possède des métadonnées pour vous aider à choisir le bon : une taille de téléchargement, une note de vitesse et une note de précision (1 à 10), et la RAM nécessaire (un minimum et une quantité recommandée). Choisissez un modèle plus petit et plus rapide si votre machine a une mémoire limitée, ou un modèle plus grand et plus précis si vous avez de la RAM à revendre.
Certains modèles on-device prennent en charge un mode réflexion (thinking mode ; raisonnement visible avant la réponse finale). Les modèles capables de raisonnement comme Qwen et Gemma produisent leurs réflexions dans des blocs spéciaux ; Rephlo le détecte automatiquement pour que le raisonnement soit géré correctement.
Parcourez, téléchargez et gérez ces modèles sous Modèles on-device.
3. Inférence hébergée par Rephlo (utilise des credits)
Si vous ne voulez gérer aucune clé, Rephlo peut exécuter l'inférence pour vous sur son propre service hébergé. Ces requêtes consomment des credits de votre plan Rephlo. Les réponses arrivent en streaming en temps réel afin que vous voyiez le résultat au fur et à mesure de sa génération.
Les credits, les soldes et ce qu'inclut chaque plan se trouvent sur le web — consultez Credits et usage et Plans et tarifs.
Comment un modèle est choisi
Rephlo décide quel modèle utiliser selon un ordre de priorité clair :
- La substitution de modèle propre à une commande, si la commande en spécifie une.
- Le modèle choisi pour la conversation en cours (en chat), qui est mémorisé par conversation.
- Le modèle par défaut du fournisseur actif, utilisé comme solution de repli — par exemple, les actions rapides du menu contextuel (overlay) s'exécutent sur le modèle par défaut du fournisseur actif, sauf si la commande le remplace.
Nouveau départ : Un tout nouveau chat — ou l'ouverture de Chat depuis la barre latérale avant qu'un modèle n'ait été défini pour cette conversation précise — reprend le modèle que vous avez utilisé en dernier n'importe où dans Rephlo. Cette mémoire globale du dernier modèle utilisé est distincte de la mémoire par conversation : une fois que vous changez de modèle au sein d'une conversation donnée, cette conversation mémorise son propre choix de manière indépendante.
Changer de modèle à la volée
En chat, un sélecteur de modèle unifié dans la barre d'outils vous permet de changer le modèle pour la conversation en cours. Votre choix est mémorisé pour cette conversation, donc la rouvrir conserve le même modèle. Consultez Chat et conversations pour plus de détails.
Le sélecteur indique aussi quels modèles votre plan inclut : les modèles Dedicated API verrouillés ou inaccessibles affichent un badge de niveau (comme PRO ou ENTERPRISE) et une icône de cadenas, afin que vous voyiez d'un coup d'œil ce qui est disponible sur votre plan.
Rephlo ne vous laisse jamais silencieusement sur un modèle que votre plan n'inclut plus — si votre modèle actif devient inaccessible (par exemple après une rétrogradation de plan), il vous bascule automatiquement vers un modèle accessible.
Paramètres du modèle
Au-delà du choix du modèle, vous pouvez ajuster son comportement avec des paramètres tels que temperature (aléatoire), max tokens (longueur de la réponse), top-p et top-k. Tous les modèles ne prennent pas en charge tous les paramètres, et certains imposent des limites — Rephlo valide et ajuste vos réglages pour respecter les contraintes de chaque modèle, afin que vous n'ayez pas à mémoriser les règles. Vous les trouverez dans l'éditeur de paramètres du modèle et dans Configuration avancée.
Réduire les coûts avec le prompt caching
Lorsque vous utilisez Anthropic (Claude) avec un contexte répété — les mêmes longues instructions ou documents sur de nombreuses requêtes — Rephlo peut réutiliser une copie mise en cache de ce contexte plutôt que de le renvoyer à chaque fois. Cela est activé par défaut et peut réduire considérablement le coût des tâches répétitives. Certains autres fournisseurs cloud mettent en cache le contexte répété automatiquement de leur côté, et les modèles on-device ne mettent jamais en cache. Pour en savoir plus, consultez Prompt Caching.
Choisir la bonne approche
- Vous voulez la meilleure qualité et avez déjà une clé API ? Utilisez un fournisseur cloud (BYOK — une fonctionnalité de niveau Pro).
- La confidentialité ou le travail hors ligne comptent avant tout ? Utilisez un modèle on-device — gratuit et local à l'exécution (l'accès est une fonctionnalité de niveau Pro).
- Vous ne voulez gérer aucune clé ? Utilisez l'inférence hébergée par Rephlo (incluse avec les plans payants ; utilise des credits).