跳到主要内容

Rephlo 如何读取你的文件

你可以用好几种方式把文件交给 Rephlo——附加到聊天消息、加入 Knowledge Space,或者粘贴一张截图。接下来会发生什么,取决于这是什么类型的文件以及你把它放在哪里,而这两件事很容易混为一谈。

本页只回答一件事:我把文件交给了 Rephlo——它究竟对这个文件做了什么?

简要说明

你交给 Rephlo 的每个文件,都会走三条路中的一条:

路径何时走这条路Rephlo 做什么
文本文件本身就含有文字——普通 PDF、Word 文档、Markdown、CSV、代码直接从文件中读取文字
OCR文件是文字的图片——扫描版 PDF、书页照片、传真在你自己的电脑上识别文字,然后按“文本”路径处理
视觉文件是真正的图像——图表、截图、照片把图片本身发给能“看见”的模型

前两条路的区别,比听上去要重要得多。扫描仪产出的 PDF 打开后看起来和 Word 导出的 PDF 一模一样,但对软件来说,一个是文字,另一个是文字的照片。在 Rephlo 支持 OCR 之前,扫描版 PDF 只是一张读不出内容的图片——没有东西可搜索,也没有东西可引用。

第二个问题:附件还是 Space?

走哪条路决定了文件如何被读取。放在哪里则决定了它能保留多久、以及如何被使用

附加到消息加入 Knowledge Space
存续时间仅限本次对话一直保存到你删除为止
复用每次都要重新附加使用该 Space 的每个聊天和命令都能用到
使用方式放入这条消息的提示词中切分成块并建立索引,Rephlo 只取回相关的部分
适合针对某一份文档的一次性提问需要反复查阅的参考资料——手册、合同集、研究笔记

两者都走同样的三条路。扫描版 PDF 不论是附加还是加入 Space 都会经过 OCR;区别在于文字之后如何被处理。

为什么 Space 不直接把整份文档发过去。 大文档装不进模型的上下文窗口,硬塞进去既慢又贵。Space 会为文字建立索引,让 Rephlo 只取出真正能回答你问题的那几段。参见 RAG 检索与调优

把两个问题放在一起

你给 Rephlo 什么放在哪里会发生什么
带文本层的 PDF、Word、Markdown、CSV、代码附加到消息读取文字并放入该条消息
同一个文件加入 Space读取文字,切块并建立检索索引
扫描版 PDF(无文本层)附加到消息在你的设备上识别文字,然后放入
扫描版 PDF加入 Space在你的设备上识别文字,然后切块并建立索引
截图、图表、照片附加到消息图片发给具备视觉能力的模型
截图、图表、照片加入 Space其中识别到的文字会被索引;图片本身无法被检索

读取扫描件(OCR)

OCR——光学字符识别——是把文字的图片还原成文字的技术。Rephlo 完全在你自己的电脑上完成这件事。文档绝不会为了识别而被上传到任何地方。

开启与关闭

前往 Settings ▸ Privacy ▸ Read scanned documents on this device

该选项默认开启关闭后,Rephlo 会跳过识别,直接把文件发给 AI 模型——如果你用的模型本身就很擅长读文档,又不想花本地算力,这是个合理的选择。

一次性下载

首次运行 OCR 时,Rephlo 会下载一个约 15 MB 的小型文字识别模型,并在就绪后告知你。此过程只发生一次,在后台进行。若下载失败(通常是网络问题),Rephlo 会提示你;在成功之前,扫描件不会被读取。

选择文档语言

同一设置下方是 Scanned document language。默认为 Auto,跟随应用语言,因此大多数人无需改动。

当你扫描的文档所用语言与应用界面语言不同时才需要更改。这比看上去更要紧:用拉丁字母识别器去读日文或韩文页面,得到的不是稍差一些的文字,而是完全无法使用的文字。

识别针对以下语言做了优化:

语言
英语、法语、西班牙语、德语、葡萄牙语共用拉丁字母识别器
日语、简体中文
韩语
越南语

其他语言仍会尽力处理,但不保证准确度。

超长文档:“Partial OCR” 徽标

识别每一页都要消耗你机器的实际算力,因此索引上限为每份文档 200 页。若扫描件超出该上限,Rephlo 会索引这个文件原本已有的文字,并在 Space 中标记 Partial OCR 徽标。

这个徽标的存在是为了不让你被误导。看到它,就说明该文档有部分页面不在搜索结果里——你看到的是其中一部分,而不是在毫不知情中漏掉其余内容。对于很长的扫描件,实用的做法是把它拆成更小的文件。

图片

图片与文档不同,因为一张图可以承载任何文字提取都无法捕捉的含义——图表的形状、示意图的布局、照片的主体。

如果你的模型能看见

具备视觉能力的模型会拿到图片本身。 Rephlo 不会对它做 OCR,也不会用文字替换它。这是刻意为之:文字提取会恰好丢掉你之所以附上这张图的视觉理解。

如果你的模型看不见

并非所有模型都能处理图像——本机模型不能,许多纯文本的云端模型也不能。以前,把图片附给这类模型意味着图片被悄悄丢弃,而你会从一个从未看过你图片的模型那里得到一个信心十足的回答。

现在,当模型看不见时,Rephlo 会在你的设备上读出图片中的文字,并转而把这些文字传过去。如果图片里根本没有可读的文字——比如一张人物照片——你会看到一条明确的提示,而不是沉默,这样模型就能告诉你它看不到这张图,而不是凭空编造。

这是一种兜底,而非升级。从图表中识别出的文字,不等于理解了那张图表。如果视觉细节很重要,请使用具备视觉能力的模型。

图片与脱敏

如果你开启了 Remove personal info before cloud requests,图片同样在覆盖范围内。

在附加的图片发往云端模型之前,Rephlo 会用设备上的 OCR 扫描它。如果发现个人信息,图片会被替换为脱敏后的文字;如果没有需要脱敏的内容,图片将原样发送。

请清楚它的边界。OCR 读取的是文字,无法识别人脸、签名或它读不出的手写内容。对于无法承受这种风险的图片,请开启 Block send if redaction uncertain——Rephlo 会扣下它读不出的图片,而不是把它发出去。

完整的脱敏设置参见隐私与数据

快速解答

问题解答
我加了一份扫描版 PDF,但搜索不到内容检查 Settings ▸ Privacy——“Read scanned documents on this device” 开着吗?那次一次性的模型下载完成了吗?
识别出的文字是乱码多半是文档语言不匹配。请明确设置 Scanned document language
我的文档显示 “Partial OCR” 徽标它超过了 200 页的索引上限。请拆分成更小的文件。
我附上了图片,但模型忽略了它该模型很可能看不见图片。Rephlo 现在会转交它找到的文字;若需要视觉理解,请换用具备视觉能力的模型。
我的扫描件会为了 OCR 被上传吗?不会。识别在你的电脑上进行。
我可以在本机模型上使用 OCR 吗?可以。OCR 与你使用哪个模型无关——无论如何它都在本地运行。

相关页面