Configuration avancée
Pour les utilisateurs avancés, Rephlo offre un contrôle plus fin sur les performances, le comportement de l'IA et la mise en cache des prompts. Contrairement aux réglages de base, ces paramètres sont répartis à plusieurs endroits — certains sont propres à chaque Space, d'autres sont par fournisseur ou par commande, et d'autres s'appliquent à toute l'application. Cette page indique où se trouve chaque paramètre et ce qu'il fait.

Budgets de tokens
Le paramètre Default Space Token Budget se trouve dans Settings → General → Performance. Il définit la limite de tokens de départ pour chaque nouveau Space — la quantité de contenu documentaire que le Space peut contenir avant que les modes de données et la compaction n'entrent en jeu.
- Plage du curseur : de 5,000 à 1,000,000 tokens (le champ de saisie permet de descendre jusqu'à 1,000).
- Valeur par défaut : 100,000 tokens.
- S'applique uniquement aux nouveaux Spaces. Chaque Space peut ensuite être rebudgété individuellement, et la modification de cette valeur par défaut ne réécrit jamais les Spaces existants.
Un paramètre distinct dans la même section, la taille de la fenêtre de navigation du chat, contrôle le nombre de conversations récentes chargées à la fois dans la barre latérale du chat (10–5,000 ; les conversations plus anciennes restent accessibles via la recherche). C'est un réglage de performance, pas une limite de données.
Stratégie de compaction
La compaction permet de garder un Space léger en tokens en résumant ses documents. Elle s'applique lorsqu'un Space est réglé sur le mode de données 🗜️ Compact (choisi via le sélecteur de mode de données propre à chaque Space — il n'existe pas de bascule globale distincte) :
- Passer un Space en mode Compact propose de résumer ses fichiers actuels, et les fichiers nouvellement ajoutés peuvent être compactés depuis la vue du Space. La création de résumés consomme des credits, donc Rephlo vous demande toujours de confirmer le coût en credits au préalable — la compaction n'est jamais silencieuse.
- Garde-fou de credits : pour un grand Space (total brut ≈ 128,000 tokens ou plus), le mode Compact est désactivé et la compaction est bloquée, ce qui vous oriente vers la Smart Search gratuite. Compacter un seul fichier volumineux (≈ 50,000 tokens ou plus) déclenche une confirmation supplémentaire.
- Lors de la compaction, Rephlo vous demande de choisir une stratégie et le modèle qui doit effectuer le résumé. Le choix du modèle est mémorisé pour le reste de votre session.
Les trois stratégies mettent en balance la fidélité et l'économie de tokens :
| Stratégie | Ce qu'elle fait | Idéale pour |
|---|---|---|
| Conservative | Conserve le plus de détails ; réduction de tokens minimale. | Quand la précision compte plus que l'économie de tokens. |
| Balanced | Résume les documents les plus anciens — le compromis recommandé (par défaut). | La plupart des projets. |
| Aggressive | Ne conserve que les points clés les plus récents ; économies maximales, plus de perte de détail. | Faire tenir un contenu très long dans une petite fenêtre de contexte. |
Quel que soit le mode utilisé par un Space, Rephlo suit à la fois un total de tokens brut et un total de tokens compacté par Space, afin que vous puissiez constater l'effet de la compaction. Pour une vue complète de Smart Search face aux données Compact et de la manière dont la compaction interagit avec la récupération sur l'appareil (RAG), consultez Modes de données et compaction.
Réglage des fournisseurs et des modèles
La température, la longueur maximale de réponse et la fenêtre de contexte sont des paramètres par fournisseur et par modèle (avec des surcharges optionnelles par commande) — ce ne sont pas des réglages globaux uniques. Configurez-les dans l'onglet LLM Providers ; consultez Fournisseurs (Providers) et Gestion des fournisseurs (Managing Providers).
Température
Contrôle si les réponses sont plus déterministes ou plus créatives. La valeur par défaut est 0.7 (équilibrée).
- 0.0 – 0.3 — précis et reproductible. Idéal pour le code et les faits.
- ~0.7 — équilibré. Idéal pour l'écriture générale.
- 1.0+ — plus créatif et varié. Idéal pour le brainstorming.
Nombre maximal de tokens de réponse
Limite la longueur de la réponse de l'IA pour qu'elle n'écrive pas un essai quand vous vouliez une phrase. Une valeur d'environ 2,000 est une valeur par défaut typique.
Limite de la fenêtre de contexte
Pour les modèles de fournisseurs BYOK/cloud et de type Ollama, il s'agit du champ Context Length dans la boîte de dialogue Add/Edit Model. Il limite la quantité de texte envoyée au modèle. Laissez-le sur Auto pour utiliser la valeur par défaut du fournisseur, ou définissez une limite manuelle pour contrôler le coût sur les API payantes.
Les modèles sur l'appareil (on-device) n'utilisent pas ce champ — le catalogue on-device organisé par Rephlo l'ignore. Leur fenêtre de contexte est plutôt un paramètre dédié Context Window (Settings → LLM Providers → On-Device, dans la carte Model Memory) : une plage de 2,048–262,144 tokens, valeur par défaut ~32,768. L'augmenter consomme plus de RAM/VRAM et recharge le modèle actif.
Surcharges par commande
Chaque commande peut surcharger le fournisseur, le modèle, la température et le nombre maximal de tokens définis globalement. Les paramètres propres à une commande prennent le pas sur les valeurs par défaut du fournisseur global lors de son exécution. Consultez Flux d'exécution (Execution Workflows).
Mise en cache des prompts
Rephlo peut réutiliser un préfixe mis en cache de votre prompt pour réduire le coût et la latence chez les fournisseurs pris en charge. Les paramètres de cache se trouvent dans la configuration du fournisseur :
- Enable prompt caching — active la mise en cache pour les requêtes prises en charge (activé par défaut).
- Cache TTL — durée de vie d'une entrée de cache :
- Ephemeral — environ 5 minutes.
- Extended — environ 1 heure.
- Cache logging — enregistre des informations détaillées sur les performances du cache.
Les lectures de cache sont fortement réduites en coût, et la vue détaillée de l'Historique (History) affiche les tokens de création et de lecture de cache par requête, afin que vous puissiez constater les économies. La mise en cache ne se déclenche que lorsque la requête possède un préfixe pouvant être mis en cache (par exemple, un chat avec un Space attaché). Pour le comportement complet, consultez Mise en cache des prompts.
Outils de développement
Ce sont des aides au dépannage, pas des réglages courants :
- Debug Mode — active une journalisation détaillée dans le fichier journal de l'application. Utile pour diagnostiquer les problèmes de connexion aux fournisseurs.
- Prompt Inspection — affiche la charge utile JSON exacte envoyée au fournisseur, consultable dans les détails de l'Historique (History).
Le changement d'environnement (Production / Staging / points de terminaison d'API locaux) n'est disponible que dans les builds de débogage et ne fait pas partie de l'expérience utilisateur habituelle.
Voir aussi : Modes de données et compaction · Fournisseurs (Providers) · Mise en cache des prompts · Historique et audit (History & Audit)