Zum Hauptinhalt springen

Wie Rephlo Ihre Dateien liest

Sie können Rephlo eine Datei auf mehreren Wegen übergeben — als Anhang an eine Chat-Nachricht, als Dokument in einem Knowledge Space oder als eingefügten Screenshot. Was dann passiert, hängt davon ab, um welche Art Datei es sich handelt und wo Sie sie ablegen. Diese beiden Fragen werden leicht verwechselt.

Diese Seite beantwortet genau eine Sache: Ich habe Rephlo eine Datei gegeben — was ist damit tatsächlich passiert?

Die Kurzfassung

Jede Datei, die Sie Rephlo übergeben, nimmt einen von drei Wegen:

WegWann er genommen wirdWas Rephlo tut
TextDie Datei enthält bereits Text — eine normale PDF, ein Word-Dokument, Markdown, CSV, CodeLiest den Text direkt aus der Datei
OCRDie Datei ist ein Bild von Text — eine gescannte PDF, das Foto einer Seite, ein FaxErkennt den Text auf Ihrem Computer und behandelt ihn dann wie den Text-Weg
Bild (Vision)Die Datei ist ein echtes Bild — ein Diagramm, ein Screenshot, ein FotoSendet das Bild selbst an ein Modell, das sehen kann

Der Unterschied zwischen den ersten beiden ist wichtiger, als er klingt. Eine PDF aus dem Scanner sieht beim Öffnen genauso aus wie eine PDF aus Word, aber für Software ist das eine Text und das andere eine Fotografie von Text. Bevor Rephlo OCR beherrschte, war eine gescannte PDF schlicht ein unlesbares Bild — es gab nichts zu durchsuchen und nichts zu zitieren.

Die zweite Frage: Anhang oder Space?

Der Weg entscheidet, wie die Datei gelesen wird. Wo Sie sie ablegen, entscheidet, wie lange sie bestehen bleibt und wie sie genutzt wird.

An eine Nachricht anhängenZu einem Knowledge Space hinzufügen
LebensdauerNur diese UnterhaltungGespeichert, bis Sie sie löschen
WiederverwendungJedes Mal neu anhängenFür jeden Chat und jeden Command verfügbar, der den Space nutzt
Wie sie genutzt wirdIn den Prompt dieser Nachricht eingefügtIn Abschnitte zerlegt und indexiert, sodass Rephlo nur die relevanten Teile abruft
Gut fürEine einmalige Frage zu einem DokumentReferenzmaterial, auf das Sie zurückkommen — ein Handbuch, Verträge, Forschungsnotizen

Beide nehmen dieselben drei Wege. Eine gescannte PDF wird per OCR gelesen, egal ob Sie sie anhängen oder zu einem Space hinzufügen; der Unterschied liegt darin, was danach mit dem Text geschieht.

Warum Spaces nicht einfach das ganze Dokument senden. Ein großes Dokument passt nicht in das Kontextfenster eines Modells, und es hineinzuzwängen wäre langsam und teuer. Spaces indexieren den Text, damit Rephlo genau die wenigen Passagen herausziehen kann, die Ihre Frage tatsächlich beantworten. Siehe RAG-Abruf & Feinabstimmung.

Beide Fragen zusammengenommen

Was Sie Rephlo gebenWohin Sie es legenWas passiert
PDF mit Textebene, Word, Markdown, CSV, CodeAn eine Nachricht angehängtDer Text wird gelesen und in diese Nachricht aufgenommen
Dieselbe DateiZu einem Space hinzugefügtDer Text wird gelesen, zerlegt und für den Abruf indexiert
Gescannte PDF (ohne Textebene)An eine Nachricht angehängtDer Text wird auf Ihrem Gerät erkannt und dann aufgenommen
Gescannte PDFZu einem Space hinzugefügtDer Text wird auf Ihrem Gerät erkannt, dann zerlegt und indexiert
Screenshot, Diagramm, FotoAn eine Nachricht angehängtDas Bild geht an ein Modell mit Bildverständnis
Screenshot, Diagramm, FotoZu einem Space hinzugefügtGefundener Text wird indexiert; das Bild selbst ist nicht abrufbar

Gescannte Dokumente lesen (OCR)

OCR — optische Zeichenerkennung — ist die Technik, die ein Bild von Text wieder in Text verwandelt. Rephlo erledigt das vollständig auf Ihrem eigenen Computer. Das Dokument wird zur Erkennung nirgendwohin hochgeladen.

Ein- und ausschalten

Gehen Sie zu Settings ▸ Privacy ▸ Read scanned documents on this device.

Die Option ist standardmäßig aktiviert. Ist sie aus, überspringt Rephlo die Erkennung und sendet die Datei stattdessen direkt an das KI-Modell — eine sinnvolle Wahl, wenn Sie ein Modell verwenden, das Dokumente selbst gut liest, und die lokale Rechenzeit sparen möchten.

Der einmalige Download

Bei der ersten OCR-Nutzung lädt Rephlo ein kleines Texterkennungsmodell herunter — etwa 15 MB — und meldet, wenn es bereit ist. Das geschieht einmalig im Hintergrund. Schlägt der Download fehl (meist ein Verbindungsproblem), sagt Rephlo das; bis er gelingt, werden gescannte Dokumente nicht gelesen.

Die Dokumentsprache wählen

Unter derselben Einstellung finden Sie Scanned document language. Standardmäßig steht sie auf Auto und folgt Ihrer App-Sprache, sodass die meisten Menschen hier nie etwas ändern müssen.

Ändern Sie sie, wenn die Dokumente, die Sie scannen, in einer anderen Sprache als die Oberfläche verfasst sind. Das ist wichtiger, als es scheint: Japanische oder koreanische Seiten mit einer Erkennung für lateinische Schrift zu lesen, liefert unbrauchbaren Text — nicht bloß etwas schlechteren.

Die Erkennung ist auf diese Sprachen abgestimmt:

Sprachen
Englisch, Französisch, Spanisch, Deutsch, PortugiesischGemeinsame lateinische Erkennung
Japanisch, Chinesisch (vereinfacht)
Koreanisch
Vietnamesisch

Andere Sprachen funktionieren weiterhin nach bestem Bemühen, für sie wird die Genauigkeit jedoch nicht zugesichert.

Sehr lange Dokumente: der Hinweis „Partial OCR“

Eine Seite zu erkennen kostet Ihre Maschine echte Arbeit, deshalb ist die Indexierung auf 200 Seiten pro Dokument begrenzt. Läuft ein gescanntes Dokument über diese Grenze hinaus, indexiert Rephlo den Text, den die Datei bereits hatte, und kennzeichnet sie im Space mit dem Hinweis Partial OCR.

Der Hinweis existiert, damit Sie nie in die Irre geführt werden. Sehen Sie ihn, fehlen Seiten dieses Dokuments in den Suchergebnissen — Sie sehen einen Teil davon, statt den Rest stillschweigend zu verpassen. Bei einem sehr langen gescannten Dokument ist die praktische Lösung, es in kleinere Dateien aufzuteilen.

Bilder

Bilder funktionieren anders als Dokumente, denn ein Bild kann Bedeutung tragen, die keine Textextraktion einfängt — die Form eines Diagramms, das Layout einer Skizze, das Motiv einer Fotografie.

Wenn Ihr Modell sehen kann

Modelle mit Bildverständnis erhalten das Bild selbst. Rephlo führt darauf keine OCR aus und ersetzt es nicht durch Text. Das ist Absicht: Eine Textextraktion würde genau das visuelle Verständnis wegwerfen, wegen dem Sie das Bild angehängt haben.

Wenn Ihr Modell nicht sehen kann

Nicht jedes Modell kann Bilder verarbeiten — On-Device-Modelle können es nicht, und viele reine Textmodelle in der Cloud ebenso wenig. Früher bedeutete ein Bild an einem solchen Modell, dass es stillschweigend verworfen wurde und Sie eine selbstbewusste Antwort von einem Modell erhielten, das Ihr Bild nie gesehen hat.

Jetzt liest Rephlo in diesem Fall jeden Text auf Ihrem Gerät aus dem Bild aus und gibt diesen stattdessen weiter. Enthält das Bild überhaupt keinen lesbaren Text — etwa das Foto einer Person —, erhalten Sie einen sichtbaren Hinweis statt Schweigen, sodass das Modell sagen kann, dass es das Bild nicht sehen konnte, statt sich eines auszudenken.

Das ist ein Rückfallweg, keine Verbesserung. Erkannter Text aus einem Diagramm ist nicht dasselbe wie das Diagramm zu verstehen. Wenn es auf visuelle Details ankommt, nutzen Sie ein Modell mit Bildverständnis.

Bilder und Schwärzung

Haben Sie Remove personal info before cloud requests aktiviert, sind Bilder ebenfalls abgedeckt.

Rephlo prüft ein angehängtes Bild mit OCR auf dem Gerät, bevor es an ein Cloud-Modell geht. Werden personenbezogene Daten gefunden, wird das Bild durch seinen geschwärzten Text ersetzt. Gibt es nichts zu schwärzen, wird das Bild unverändert gesendet.

Seien Sie sich über die Grenzen im Klaren. OCR liest Text; sie kann keine Gesichter, Unterschriften oder nicht lesbare Handschrift erfassen. Für Bilder, bei denen Sie dieses Risiko nicht akzeptieren können, aktivieren Sie Block send if redaction uncertain — Rephlo hält dann Bilder zurück, die es nicht lesen kann.

Alle Schwärzungseinstellungen im Detail finden Sie unter Datenschutz & Daten.

Schnelle Antworten

FrageAntwort
Ich habe eine gescannte PDF hinzugefügt, die Suche findet nichtsPrüfen Sie Settings ▸ Privacy — ist „Read scanned documents on this device“ aktiviert, und ist der einmalige Download abgeschlossen?
Der erkannte Text ist KauderwelschWahrscheinlich passt die Sprache nicht. Stellen Sie Scanned document language ausdrücklich ein.
Mein Dokument zeigt den Hinweis „Partial OCR“Es überschreitet die Indexierungsgrenze von 200 Seiten. Teilen Sie es in kleinere Dateien auf.
Ich habe ein Bild angehängt, das Modell hat es ignoriertDas Modell kann vermutlich keine Bilder sehen. Rephlo gibt jetzt gefundenen Text weiter; für visuelles Verständnis wechseln Sie zu einem Modell mit Bildverständnis.
Wird mein gescanntes Dokument für OCR hochgeladen?Nein. Die Erkennung findet auf Ihrem Computer statt.
Kann ich OCR mit einem On-Device-Modell nutzen?Ja. OCR ist unabhängig vom verwendeten Modell — sie läuft in jedem Fall lokal.

Verwandte Seiten