Aller au contenu principal

Fournisseurs LLM

L'onglet LLM Providers dans Settings est l'endroit où vous connectez Rephlo aux modèles d'IA qui alimentent vos commandes et vos chats. Vous pouvez brancher vos propres comptes chez les principaux fournisseurs d'IA, exécuter des modèles en local pour une confidentialité totale, ou laisser Rephlo tout gérer pour vous sans aucune clé.

Ouvrez-le depuis Settings → LLM Providers.

L'onglet LLM Providers dans Settings, montrant les sous-onglets On-Device et BYOK Providers

Deux façons d'utiliser les fournisseurs

ModeFonctionnementIdéal pour
Login (Dedicated API)Rephlo exécute l'inférence pour vous. Aucune clé API à gérer — l'utilisation puise dans les crédits de votre plan.Tous ceux qui veulent une configuration à zéro effort.
BYOK (Bring Your Own Key)Vous ajoutez votre propre clé API d'un fournisseur (OpenAI, Anthropic, etc.). Vous payez directement ce fournisseur et utilisez ses derniers modèles.Les utilisateurs avancés qui ont déjà des comptes fournisseurs.

Vous pouvez combiner les deux : rester connecté pour un usage quotidien et ajouter un fournisseur BYOK pour un modèle spécifique. Pour comprendre le fonctionnement de la facturation et des crédits, consultez Crédits & utilisation et Plans & tarifs.

Fournisseurs pris en charge

Rephlo prend en charge huit types de fournisseurs BYOK — sept fournisseurs cloud plus Ollama en local (qui s'exécute sur votre propre machine à localhost:11434) — en plus des options sur l'appareil et gérées :

FournisseurCe que vous fournissez
OpenAIClé API (point de terminaison personnalisé facultatif)
AnthropicClé API (URL de base facultative) ; prend en charge la mise en cache des prompts
GoogleClé API (URL de base facultative)
GroqClé API
xAI (Grok)Clé API (Live Search facultative)
OpenRouterClé API (URL/nom de site facultatifs pour le tableau de bord OpenRouter)
OpenAI-CompatibleURL de base + clé API + nom du modèle (Azure OpenAI, vLLM, LocalAI, LiteLLM, et similaires)
OllamaURL de base (par défaut http://localhost:11434) ; clé facultative pour la recherche web
On-DeviceRien — les modèles s'exécutent en local. Consultez Modèles sur l'appareil.
Dedicated APIRien — géré par Rephlo lorsque vous vous connectez.

Azure OpenAI se connecte via le type OpenAI-Compatible — pointez l'URL de base vers votre point de terminaison de déploiement Azure — et non comme une entrée distincte dans la liste d'ajout de fournisseur.

Pour une vue d'ensemble conceptuelle de la relation entre fournisseurs et modèles, consultez Fournisseurs et Modèles & inférence.

Ajouter un fournisseur

  1. Cliquez sur Add Provider.
  2. Choisissez le type de fournisseur. Le formulaire s'adapte pour n'afficher que les champs dont ce fournisseur a besoin.
  3. Saisissez vos identifiants (par exemple, une clé API, ou un point de terminaison Azure + un nom de déploiement).
  4. Facultatif : définissez un nom personnalisé pour reconnaître facilement le fournisseur dans les listes.
  5. Cliquez sur Test Connection pour confirmer que la clé fonctionne avant d'enregistrer.
  6. Cliquez sur Save.

Vos clés sont chiffrées

Les clés API et jetons sont chiffrés avant d'être stockés sur votre machine. Ils ne sont jamais écrits dans les journaux et sont exclus des exportations de données. Traitez vos clés comme des mots de passe — Rephlo les conserve en local et protégées.

Modèles

Chaque fournisseur expose un ou plusieurs modèles (par exemple, un fournisseur OpenAI peut proposer plusieurs modèles GPT). Vous pouvez ajouter plusieurs modèles à un même fournisseur et en marquer un comme celui par défaut. Lorsque vous exécutez une commande ou un chat, Rephlo utilise le modèle par défaut du fournisseur actif, sauf si la commande ou la conversation en spécifie un autre.

Dans le sélecteur de modèles, les modèles Dedicated (Gateway) verrouillés que votre plan n'inclut pas affichent un badge de palier (par exemple PRO ou ENTERPRISE) et une icône de verrou, afin que vous puissiez voir en un coup d'œil quels modèles votre plan couvre. Démarrer un tout nouveau chat, ou ouvrir Chat sans modèle déjà défini pour cette conversation, reprend le modèle que vous avez utilisé en dernier de façon globale — une mémoire distincte du choix de modèle par conversation.

Pour comprendre comment fonctionnent les remplacements de modèle par commande et par conversation — ainsi que cette mémoire globale « dernier utilisé » —, consultez Modèles & inférence.

Masquer les modèles en ligne de Rephlo Gateway

Les sous-onglets On-Device et BYOK Providers incluent tous deux un bouton Hide online models from Rephlo Gateway (infobulle : « When enabled, hides online models from Rephlo Gateway »). L'activer masque les modèles Dedicated (Gateway) de toutes les surfaces du sélecteur de modèles — la barre d'état, le chat et la superposition.

Depuis la v1.4.1, si votre modèle actif est un modèle Gateway lorsque vous activez le bouton, Rephlo vous fait automatiquement basculer vers un modèle accessible sur l'appareil ou BYOK au lieu de vous laisser silencieusement sur celui désormais masqué — ou désactive le modèle si aucun n'est disponible.

Capacités

Chaque configuration de fournisseur comporte un ensemble d'indicateurs de capacité qui indiquent à Rephlo ce que le modèle peut faire :

  • Text generation — toujours activé.
  • Vision — analyser des images (uniquement pour les modèles capables de vision comme GPT-4o, Claude, Gemini).
  • Function calling / tools — utilisation structurée d'outils, requise pour les connecteurs MCP.
  • Long context — traiter des entrées très volumineuses (>100 000 tokens).
  • Streaming — afficher les réponses token par token (activé par défaut).
  • Web search et Thinking — lorsque le modèle les prend en charge.

Les capacités sont validées par rapport aux capacités réelles du modèle au moment de l'exécution, donc activer un indicateur qu'un modèle ne prend pas en charge ne cassera rien — Rephlo n'essaiera simplement pas cette opération.

Paramètres du modèle

Vous pouvez ajuster le comportement de génération par modèle :

  • Temperature — des valeurs plus basses sont plus précises et reproductibles ; des valeurs plus hautes sont plus créatives.
  • Max tokens — plafonne la longueur de chaque réponse.
  • Top-p / top-k — contrôles d'échantillonnage supplémentaires pour les utilisateurs avancés.

Une commande peut remplacer ces valeurs pour ses propres exécutions, afin que vous puissiez conserver un réglage par défaut calme et à faible température tout en laissant une commande de brainstorming être plus audacieuse.

Mise en cache des prompts Anthropic

Les fournisseurs Anthropic prennent en charge la mise en cache des prompts, ce qui peut réduire considérablement le coût du contexte répété. Elle est activée par défaut avec un cache « ephemeral » (environ 5 minutes). Une option « extended » (environ 1 heure) est également disponible. La mise en cache ne s'active que lorsqu'une requête contient réellement un contexte pouvant être mis en cache — consultez Mise en cache des prompts pour l'histoire complète.

Ollama et modèles locaux

Pour Ollama, définissez l'URL de base (par défaut http://localhost:11434). Sur les machines aux ressources limitées, surveillez la fenêtre de contexte pour ne pas manquer de mémoire. Si vous préférez que Rephlo télécharge et gère les modèles locaux pour vous, utilisez plutôt le catalogue intégré Modèles sur l'appareil.

Modifier, tester et supprimer

  • Edit n'importe quel fournisseur pour mettre à jour sa clé, ajouter des modèles ou modifier des paramètres.
  • Test Connection revalide un fournisseur après une rotation de clé.
  • Remove un fournisseur que vous n'utilisez plus. Supprimer un fournisseur ne supprime pas vos commandes — elles reviennent à votre fournisseur actif.

Paramètres communs

Chaque fournisseur dispose également d'options partagées :

  • Request timeout (60 secondes par défaut)
  • Max retries en cas d'échecs transitoires (3 par défaut)
  • Streaming activé/désactivé

Pages associées