Comment Rephlo lit vos fichiers
Vous pouvez confier un fichier à Rephlo de plusieurs façons : en le joignant à un message du chat, en l'ajoutant à un Knowledge Space, ou en collant une capture d'écran. Ce qui se passe ensuite dépend de la nature du fichier et de l'endroit où vous le placez — deux questions faciles à confondre.
Cette page répond à une seule chose : j'ai donné un fichier à Rephlo — qu'en a-t-il fait exactement ?
En bref
Chaque fichier que vous confiez à Rephlo emprunte l'une de trois voies :
| Voie | Quand elle s'applique | Ce que fait Rephlo |
|---|---|---|
| Texte | Le fichier contient déjà du texte — un PDF ordinaire, un document Word, du Markdown, un CSV, du code | Lit le texte directement dans le fichier |
| OCR | Le fichier est une image de texte — un PDF numérisé, la photo d'une page, un fax | Reconnaît le texte sur votre ordinateur, puis le traite comme la voie Texte |
| Vision | Le fichier est une véritable image — un graphique, une capture d'écran, une photo | Envoie l'image elle-même à un modèle capable de voir |
La différence entre les deux premières compte davantage qu'il n'y paraît. Un PDF issu d'un scanner ressemble exactement à un PDF produit par Word quand vous l'ouvrez, mais pour un logiciel l'un est du texte et l'autre une photographie de texte. Avant que Rephlo ne sache faire de l'OCR, un PDF numérisé n'était qu'une image illisible : rien à rechercher, rien à citer.
La deuxième question : pièce jointe ou Space ?
La voie détermine comment le fichier est lu. L'endroit où vous le placez détermine combien de temps il subsiste et comment il est utilisé.
| Joindre à un message | Ajouter à un Knowledge Space | |
|---|---|---|
| Durée de vie | Cette conversation uniquement | Conservé jusqu'à ce que vous le supprimiez |
| Réutilisation | À rejoindre à chaque fois | Disponible pour chaque chat et chaque commande qui utilise ce Space |
| Mode d'utilisation | Inséré dans le prompt de ce message | Découpé en fragments et indexé, pour que Rephlo ne récupère que les parties pertinentes |
| Idéal pour | Une question ponctuelle sur un document | Des documents de référence que vous consultez régulièrement : un manuel, un ensemble de contrats, des notes de recherche |
Les deux empruntent les mêmes trois voies. Un PDF numérisé passe par l'OCR que vous le joigniez ou que vous l'ajoutiez à un Space ; la différence tient à ce qu'il advient du texte ensuite.
Pourquoi les Spaces n'envoient pas simplement tout le document. Un document volumineux n'entre pas dans la fenêtre de contexte d'un modèle, et l'y forcer serait lent et coûteux. Les Spaces indexent le texte afin que Rephlo puisse extraire uniquement les quelques passages qui répondent réellement à votre question. Voir Récupération RAG et réglages.
Les deux questions réunies
| Ce que vous donnez à Rephlo | Où vous le placez | Ce qui se passe |
|---|---|---|
| PDF avec couche de texte, Word, Markdown, CSV, code | Joint à un message | Le texte est lu et intégré à ce message |
| Le même fichier | Ajouté à un Space | Le texte est lu, découpé et indexé pour la récupération |
| PDF numérisé (sans couche de texte) | Joint à un message | Le texte est reconnu sur votre appareil, puis intégré |
| PDF numérisé | Ajouté à un Space | Le texte est reconnu sur votre appareil, puis découpé et indexé |
| Capture d'écran, graphique, photo | Joint à un message | L'image part vers un modèle doté de vision |
| Capture d'écran, graphique, photo | Ajouté à un Space | Le texte qui s'y trouve est indexé ; l'image elle-même n'est pas récupérable |
Lire les documents numérisés (OCR)
L'OCR — reconnaissance optique de caractères — est la technique qui retransforme une image de texte en texte. Rephlo le fait entièrement sur votre propre ordinateur. Le document n'est jamais téléversé où que ce soit pour être reconnu.
Activer et désactiver
Rendez-vous dans Settings ▸ Privacy ▸ Read scanned documents on this device.
L'option est activée par défaut. Lorsqu'elle est désactivée, Rephlo saute la reconnaissance et envoie le fichier directement au modèle d'IA — un choix raisonnable si vous utilisez un modèle qui lit bien les documents par lui-même et préférez ne pas consacrer de temps de traitement local.
Le téléchargement unique
Au premier usage de l'OCR, Rephlo télécharge un petit modèle de reconnaissance de texte — environ 15 Mo — et vous prévient quand il est prêt. Cela n'arrive qu'une fois, en arrière-plan. Si le téléchargement échoue (généralement un problème de connexion), Rephlo le signale ; les documents numérisés ne seront pas lus tant qu'il n'aura pas abouti.
Choisir la langue du document
Sous le même réglage se trouve Scanned document language. Par défaut sur Auto, il suit la langue de l'application : la plupart des utilisateurs n'ont donc jamais besoin d'y toucher.
Modifiez-le lorsque les documents que vous numérisez sont rédigés dans une langue différente de celle de l'interface. C'est plus important qu'il n'y paraît : reconnaître des pages en japonais ou en coréen avec un moteur pour alphabet latin produit un texte inutilisable, et non un texte simplement un peu moins bon.
La reconnaissance est optimisée pour ces langues :
| Langues | |
|---|---|
| Anglais, français, espagnol, allemand, portugais | Moteur latin partagé |
| Japonais, chinois (simplifié) | |
| Coréen | |
| Vietnamien |
Les autres langues continuent de fonctionner au mieux, mais la précision n'y est pas garantie.
Documents très longs : la mention « Partial OCR »
Reconnaître une page demande un vrai travail à votre machine : l'indexation est donc plafonnée à 200 pages par document. Si un document numérisé dépasse cette limite, Rephlo indexe le texte que le fichier contenait déjà et le signale dans le Space par la mention Partial OCR.
Cette mention existe pour que vous ne soyez jamais induit en erreur. Si vous la voyez, des pages de ce document manquent dans les résultats de recherche — vous en consultez une partie, plutôt que de passer silencieusement à côté du reste. Pour un document numérisé très long, la solution pratique consiste à le découper en fichiers plus petits.
Images
Les images fonctionnent différemment des documents, car une image peut porter un sens qu'aucune extraction de texte ne capture : la forme d'un graphique, la disposition d'un schéma, le sujet d'une photographie.
Si votre modèle peut voir
Les modèles dotés de vision reçoivent l'image elle-même. Rephlo ne lui applique pas d'OCR et ne la remplace pas par du texte. C'est délibéré : extraire le texte jetterait précisément la compréhension visuelle pour laquelle vous avez joint l'image.
Si votre modèle ne peut pas voir
Tous les modèles ne traitent pas les images — les modèles exécutés sur votre appareil ne le peuvent pas, ni beaucoup de modèles cloud uniquement textuels. Auparavant, joindre une image à l'un d'eux signifiait que l'image était silencieusement écartée et que vous receviez une réponse assurée d'un modèle qui n'avait jamais vu votre image.
Désormais, lorsque le modèle ne peut pas voir, Rephlo lit sur votre appareil le texte contenu dans l'image et transmet celui-ci à la place. Si l'image ne contient aucun texte lisible — la photo d'une personne, par exemple — vous obtenez un avertissement visible plutôt qu'un silence, de sorte que le modèle puisse dire qu'il n'a pas pu voir l'image au lieu d'en inventer une.
Il s'agit d'un repli, non d'une amélioration. Le texte reconnu sur un graphique n'équivaut pas à comprendre ce graphique. Si le détail visuel compte, utilisez un modèle doté de vision.
Images et masquage des données
Si vous avez activé Remove personal info before cloud requests, les images sont également couvertes.
Rephlo analyse une image jointe par OCR sur l'appareil avant qu'elle ne parte vers un modèle cloud. S'il y trouve des informations personnelles, l'image est remplacée par son texte masqué. S'il n'y a rien à masquer, l'image est envoyée telle quelle.
Ayez les limites en tête. L'OCR lit du texte ; il ne peut pas capter les visages, les signatures ni une écriture manuscrite qu'il ne parvient pas à lire. Pour les images où ce risque est inacceptable, activez Block send if redaction uncertain : Rephlo retiendra les images qu'il ne peut pas lire au lieu de les envoyer.
Voir Confidentialité et données pour l'ensemble des réglages de masquage.
Réponses rapides
| Question | Réponse |
|---|---|
| J'ai ajouté un PDF numérisé et la recherche ne trouve rien | Vérifiez Settings ▸ Privacy : « Read scanned documents on this device » est-il activé, et le téléchargement unique du modèle est-il terminé ? |
| Le texte reconnu est illisible | La langue du document ne correspond probablement pas. Définissez explicitement Scanned document language. |
| Mon document affiche la mention « Partial OCR » | Il dépasse la limite d'indexation de 200 pages. Découpez-le en fichiers plus petits. |
| J'ai joint une image et le modèle l'a ignorée | Le modèle ne voit probablement pas les images. Rephlo transmet désormais le texte qu'il y trouve ; pour une compréhension visuelle, passez à un modèle doté de vision. |
| Mon document numérisé est-il téléversé pour l'OCR ? | Non. La reconnaissance a lieu sur votre ordinateur. |
| Puis-je utiliser l'OCR avec un modèle exécuté sur mon appareil ? | Oui. L'OCR est indépendant du modèle utilisé : il s'exécute localement dans tous les cas. |
Pages associées
- Spaces — ce qu'est un Knowledge Space et comment il stocke les documents
- Gérer les Spaces — ajouter et retirer des documents
- Récupération RAG et réglages — comment Rephlo choisit les passages à utiliser
- Confidentialité et données — masquage, traitement local et ce qui reste sur votre appareil
- Modèles sur l'appareil et modèles cloud — quel modèle utiliser, et pourquoi