Aller au contenu principal

Comment Rephlo lit vos fichiers

Vous pouvez confier un fichier à Rephlo de plusieurs façons : en le joignant à un message du chat, en l'ajoutant à un Knowledge Space, ou en collant une capture d'écran. Ce qui se passe ensuite dépend de la nature du fichier et de l'endroit où vous le placez — deux questions faciles à confondre.

Cette page répond à une seule chose : j'ai donné un fichier à Rephlo — qu'en a-t-il fait exactement ?

En bref

Chaque fichier que vous confiez à Rephlo emprunte l'une de trois voies :

VoieQuand elle s'appliqueCe que fait Rephlo
TexteLe fichier contient déjà du texte — un PDF ordinaire, un document Word, du Markdown, un CSV, du codeLit le texte directement dans le fichier
OCRLe fichier est une image de texte — un PDF numérisé, la photo d'une page, un faxReconnaît le texte sur votre ordinateur, puis le traite comme la voie Texte
VisionLe fichier est une véritable image — un graphique, une capture d'écran, une photoEnvoie l'image elle-même à un modèle capable de voir

La différence entre les deux premières compte davantage qu'il n'y paraît. Un PDF issu d'un scanner ressemble exactement à un PDF produit par Word quand vous l'ouvrez, mais pour un logiciel l'un est du texte et l'autre une photographie de texte. Avant que Rephlo ne sache faire de l'OCR, un PDF numérisé n'était qu'une image illisible : rien à rechercher, rien à citer.

La deuxième question : pièce jointe ou Space ?

La voie détermine comment le fichier est lu. L'endroit où vous le placez détermine combien de temps il subsiste et comment il est utilisé.

Joindre à un messageAjouter à un Knowledge Space
Durée de vieCette conversation uniquementConservé jusqu'à ce que vous le supprimiez
RéutilisationÀ rejoindre à chaque foisDisponible pour chaque chat et chaque commande qui utilise ce Space
Mode d'utilisationInséré dans le prompt de ce messageDécoupé en fragments et indexé, pour que Rephlo ne récupère que les parties pertinentes
Idéal pourUne question ponctuelle sur un documentDes documents de référence que vous consultez régulièrement : un manuel, un ensemble de contrats, des notes de recherche

Les deux empruntent les mêmes trois voies. Un PDF numérisé passe par l'OCR que vous le joigniez ou que vous l'ajoutiez à un Space ; la différence tient à ce qu'il advient du texte ensuite.

Pourquoi les Spaces n'envoient pas simplement tout le document. Un document volumineux n'entre pas dans la fenêtre de contexte d'un modèle, et l'y forcer serait lent et coûteux. Les Spaces indexent le texte afin que Rephlo puisse extraire uniquement les quelques passages qui répondent réellement à votre question. Voir Récupération RAG et réglages.

Les deux questions réunies

Ce que vous donnez à RephloOù vous le placezCe qui se passe
PDF avec couche de texte, Word, Markdown, CSV, codeJoint à un messageLe texte est lu et intégré à ce message
Le même fichierAjouté à un SpaceLe texte est lu, découpé et indexé pour la récupération
PDF numérisé (sans couche de texte)Joint à un messageLe texte est reconnu sur votre appareil, puis intégré
PDF numériséAjouté à un SpaceLe texte est reconnu sur votre appareil, puis découpé et indexé
Capture d'écran, graphique, photoJoint à un messageL'image part vers un modèle doté de vision
Capture d'écran, graphique, photoAjouté à un SpaceLe texte qui s'y trouve est indexé ; l'image elle-même n'est pas récupérable

Lire les documents numérisés (OCR)

L'OCR — reconnaissance optique de caractères — est la technique qui retransforme une image de texte en texte. Rephlo le fait entièrement sur votre propre ordinateur. Le document n'est jamais téléversé où que ce soit pour être reconnu.

Activer et désactiver

Rendez-vous dans Settings ▸ Privacy ▸ Read scanned documents on this device.

L'option est activée par défaut. Lorsqu'elle est désactivée, Rephlo saute la reconnaissance et envoie le fichier directement au modèle d'IA — un choix raisonnable si vous utilisez un modèle qui lit bien les documents par lui-même et préférez ne pas consacrer de temps de traitement local.

Le téléchargement unique

Au premier usage de l'OCR, Rephlo télécharge un petit modèle de reconnaissance de texte — environ 15 Mo — et vous prévient quand il est prêt. Cela n'arrive qu'une fois, en arrière-plan. Si le téléchargement échoue (généralement un problème de connexion), Rephlo le signale ; les documents numérisés ne seront pas lus tant qu'il n'aura pas abouti.

Choisir la langue du document

Sous le même réglage se trouve Scanned document language. Par défaut sur Auto, il suit la langue de l'application : la plupart des utilisateurs n'ont donc jamais besoin d'y toucher.

Modifiez-le lorsque les documents que vous numérisez sont rédigés dans une langue différente de celle de l'interface. C'est plus important qu'il n'y paraît : reconnaître des pages en japonais ou en coréen avec un moteur pour alphabet latin produit un texte inutilisable, et non un texte simplement un peu moins bon.

La reconnaissance est optimisée pour ces langues :

Langues
Anglais, français, espagnol, allemand, portugaisMoteur latin partagé
Japonais, chinois (simplifié)
Coréen
Vietnamien

Les autres langues continuent de fonctionner au mieux, mais la précision n'y est pas garantie.

Documents très longs : la mention « Partial OCR »

Reconnaître une page demande un vrai travail à votre machine : l'indexation est donc plafonnée à 200 pages par document. Si un document numérisé dépasse cette limite, Rephlo indexe le texte que le fichier contenait déjà et le signale dans le Space par la mention Partial OCR.

Cette mention existe pour que vous ne soyez jamais induit en erreur. Si vous la voyez, des pages de ce document manquent dans les résultats de recherche — vous en consultez une partie, plutôt que de passer silencieusement à côté du reste. Pour un document numérisé très long, la solution pratique consiste à le découper en fichiers plus petits.

Images

Les images fonctionnent différemment des documents, car une image peut porter un sens qu'aucune extraction de texte ne capture : la forme d'un graphique, la disposition d'un schéma, le sujet d'une photographie.

Si votre modèle peut voir

Les modèles dotés de vision reçoivent l'image elle-même. Rephlo ne lui applique pas d'OCR et ne la remplace pas par du texte. C'est délibéré : extraire le texte jetterait précisément la compréhension visuelle pour laquelle vous avez joint l'image.

Si votre modèle ne peut pas voir

Tous les modèles ne traitent pas les images — les modèles exécutés sur votre appareil ne le peuvent pas, ni beaucoup de modèles cloud uniquement textuels. Auparavant, joindre une image à l'un d'eux signifiait que l'image était silencieusement écartée et que vous receviez une réponse assurée d'un modèle qui n'avait jamais vu votre image.

Désormais, lorsque le modèle ne peut pas voir, Rephlo lit sur votre appareil le texte contenu dans l'image et transmet celui-ci à la place. Si l'image ne contient aucun texte lisible — la photo d'une personne, par exemple — vous obtenez un avertissement visible plutôt qu'un silence, de sorte que le modèle puisse dire qu'il n'a pas pu voir l'image au lieu d'en inventer une.

Il s'agit d'un repli, non d'une amélioration. Le texte reconnu sur un graphique n'équivaut pas à comprendre ce graphique. Si le détail visuel compte, utilisez un modèle doté de vision.

Images et masquage des données

Si vous avez activé Remove personal info before cloud requests, les images sont également couvertes.

Rephlo analyse une image jointe par OCR sur l'appareil avant qu'elle ne parte vers un modèle cloud. S'il y trouve des informations personnelles, l'image est remplacée par son texte masqué. S'il n'y a rien à masquer, l'image est envoyée telle quelle.

Ayez les limites en tête. L'OCR lit du texte ; il ne peut pas capter les visages, les signatures ni une écriture manuscrite qu'il ne parvient pas à lire. Pour les images où ce risque est inacceptable, activez Block send if redaction uncertain : Rephlo retiendra les images qu'il ne peut pas lire au lieu de les envoyer.

Voir Confidentialité et données pour l'ensemble des réglages de masquage.

Réponses rapides

QuestionRéponse
J'ai ajouté un PDF numérisé et la recherche ne trouve rienVérifiez Settings ▸ Privacy : « Read scanned documents on this device » est-il activé, et le téléchargement unique du modèle est-il terminé ?
Le texte reconnu est illisibleLa langue du document ne correspond probablement pas. Définissez explicitement Scanned document language.
Mon document affiche la mention « Partial OCR »Il dépasse la limite d'indexation de 200 pages. Découpez-le en fichiers plus petits.
J'ai joint une image et le modèle l'a ignoréeLe modèle ne voit probablement pas les images. Rephlo transmet désormais le texte qu'il y trouve ; pour une compréhension visuelle, passez à un modèle doté de vision.
Mon document numérisé est-il téléversé pour l'OCR ?Non. La reconnaissance a lieu sur votre ordinateur.
Puis-je utiliser l'OCR avec un modèle exécuté sur mon appareil ?Oui. L'OCR est indépendant du modèle utilisé : il s'exécute localement dans tous les cas.

Pages associées