Rephlo 如何读取你的文件
你可以用好几种方式把文件交给 Rephlo——附加到聊天消息、加入 Knowledge Space,或者粘贴一张截图。接下来会发生什么,取决于这是什么类型的文件以及你把它放在哪里,而这两件事很容易混为一谈。
本页只回答一件事:我把文件交给了 Rephlo——它究竟对这个文件做了什么?
简要说明
你交给 Rephlo 的每个文件,都会走三条路中的一条:
| 路径 | 何时走这条路 | Rephlo 做什么 |
|---|---|---|
| 文本 | 文件本身就含有文字——普通 PDF、Word 文档、Markdown、CSV、代码 | 直接从文件中读取文字 |
| OCR | 文件是文字的图片——扫描版 PDF、书页照片、传真 | 在你自己的电脑上识别文字,然后按“文本”路径处理 |
| 视觉 | 文件是真正的图像——图表、截图、照片 | 把图片本身发给能“看见”的模型 |
前两条路的区别,比听上去要重要得多。扫描仪产出的 PDF 打开后看起来和 Word 导出的 PDF 一模一样,但对软件来说,一个是文字,另一个是文字的照片。在 Rephlo 支持 OCR 之前,扫描版 PDF 只是一张读不出内容的图片——没有东西可搜索,也没有东西可引用。
第二个问题:附件还是 Space?
走哪条路决定了文件如何被读取。放在哪里则决定了它能保留多久、以及如何被使用。
| 附加到消息 | 加入 Knowledge Space | |
|---|---|---|
| 存续时间 | 仅限本次对话 | 一直保存到你删除为止 |
| 复用 | 每次都要重新附加 | 使用该 Space 的每个聊天和命令都能用到 |
| 使用方式 | 放入这条消息的提示词中 | 切分成块并建立索引,Rephlo 只取回相关的部分 |
| 适合 | 针对某一份文档的一次性提问 | 需要反复查阅的参考资料——手册、合同集、研究笔记 |
两者都走同样的三条路。扫描版 PDF 不论是附加还是加入 Space 都会经过 OCR;区别在于文字之后如何被处理。
为什么 Space 不直接把整份文档发过去。 大文档装不进模型的上下文窗口,硬塞进去既慢又贵。Space 会为文字建立索引,让 Rephlo 只取出真正能回答你问题的那几段。参见 RAG 检索与调优。
把两个问题放在一起
| 你给 Rephlo 什么 | 放在哪里 | 会发生什么 |
|---|---|---|
| 带文本层的 PDF、Word、Markdown、CSV、代码 | 附加到消息 | 读取文字并放入该条消息 |
| 同一个文件 | 加入 Space | 读取文字,切块并建立检索索引 |
| 扫描版 PDF(无文本层) | 附加到消息 | 在你的设备上识别文字,然后放入 |
| 扫描版 PDF | 加入 Space | 在你的设备上识别文字,然后切块并建立索引 |
| 截图、图表、照片 | 附加到消息 | 图片发给具备视觉能力的模型 |
| 截图、图表、照片 | 加入 Space | 其中识别到的文字会被索引;图片本身无法被检索 |
读取扫描件(OCR)
OCR——光学字符识别——是把文字的图片还原成文字的技术。Rephlo 完全在你自己的电脑上完成这件事。文档绝不会为了识别而被上传到任何地方。
开启与关闭
前往 Settings ▸ Privacy ▸ Read scanned documents on this device。
该选项默认开启。关闭后,Rephlo 会跳过识别,直接把文 件发给 AI 模型——如果你用的模型本身就很擅长读文档,又不想花本地算力,这是个合理的选择。
一次性下载
首次运行 OCR 时,Rephlo 会下载一个约 15 MB 的小型文字识别模型,并在就绪后告知你。此过程只发生一次,在后台进行。若下载失败(通常是网络问题),Rephlo 会提示你;在成功之前,扫描件不会被读取。
选择文档语言
同一设置下方是 Scanned document language。默认为 Auto,跟随应用语言,因此大多数人无需改动。
当你扫描的文档所用语言与应用界面语言不同时才需要更改。这比看上去更要紧:用拉丁字母识别器去读日文或韩文页面,得到的不是稍差一些的文字,而是完全无法使用的文字。
识别针对以下语言做了优化:
| 语言 | |
|---|---|
| 英语、法语、西班牙语、德语、葡萄牙语 | 共用拉丁字母识别器 |
| 日语、简体中文 | |
| 韩语 | |
| 越南语 |
其他语言仍会尽力处理,但不保证准确度。
超长文档:“Partial OCR” 徽标
识别每一页都要消耗你机器的实际算力,因此索引上限为每份文档 200 页。若扫描件超出该上限,Rephlo 会索引这个文件原本已有的文字,并在 Space 中标记 Partial OCR 徽标。
这个徽标的存在是为了不让你被误导。看到它,就说明该文档有部分页面不在搜索结果里——你看到的是其中一部分,而不是在毫不知情中漏掉其余内容。对于很长的扫描件,实用的做法是把它拆成更小的文件。
图片
图片与文档不同,因为一张图可以承载任何文字提取都无法捕捉的含义——图表的形状、示意图的布局、照片的主体。
如果你的模型能看见
具备视觉能力的模型会拿到图片本身。 Rephlo 不会对它做 OCR,也不会用文字替换它。这是刻意为之:文字提取会恰好丢掉你之所以附上这张图的视觉理解。
如果你的模型看不见
并非所有模型都能处理图像——本机模型不能,许多纯文本的云端模型也不能。以前,把图片附给这类模型意味着图片被悄悄丢弃,而你会从一个从未看过你图片的模型那里得到一个信心十足的回答。
现在,当模型看不见时,Rephlo 会在你的设备上读出图片中的文字,并转而把这些文字传过去。如果图片里根本没有可读的文字——比如一张人物照片——你会看到一条明确的提示,而不是沉默,这样模型就能告诉你它看不到这张图,而不是凭空编造。
这是一种兜底,而非升级。从图表中识别出的文字,不等于理解了那张图表。如果视觉细节很重要,请使用具备视觉能力的模型。
图片与脱敏
如果你开启了 Remove personal info before cloud requests,图片同样在覆盖范围内。
在附加的图片发往云端模型之前,Rephlo 会用设备上的 OCR 扫描它。如果发现个人信息,图片会被替换为脱敏后的文字;如果没有需要脱敏的内容,图片将原样发送。
请清楚它的边界。OCR 读取的是文字,无法识别人脸、签名或它读不出的手写内容。对于无法承受这种风险的图片,请开启 Block send if redaction uncertain——Rephlo 会扣下它读不出的图片,而不是把它发出去。
完整的脱敏设置参见隐私与数据。
快速解答
| 问题 | 解答 |
|---|---|
| 我加了一份扫描版 PDF,但搜索不到内容 | 检查 Settings ▸ Privacy——“Read scanned documents on this device” 开着吗?那次一次性的模型下载完成了吗? |