跳到主要内容

本机模型 (On-Device Models)

Rephlo 可以直接在您的电脑上运行 AI 模型——无需联网,无需按消息计费的 credit,并且您的文本永远不会离开您的设备。On-Device Models 界面让您可以浏览精选的本地模型目录、下载您需要的模型,并控制它们对设备内存的使用方式。

该界面位于 Settings 的 LLM Providers 区域内。本机推理使用 GGUF 模型格式,并通过 Rephlo 内置的本地引擎运行。

没有内置的网络搜索。 由于本机模型完全离线运行,它们无法自行搜索或获取实时信息。目前正在开发一个网络搜索连接器(MCP),一旦推出,将允许本机模型获取最新数据。如果您现在就需要网络搜索,请使用支持该功能的云端 Provider(参见 Chat & Conversations)。

读取附件。 自 v1.4.1 起,本机模型可以在对话中读取附加的 PDF、文本文件和 Office 文档——文本会在本地提取并纳入提示中。它们不支持图片或视觉类附件。

谁可以使用本机模型?

本机模型需要 Pro、Enterprise 套餐或永久许可证——FreeStarter 套餐不包含此功能。

如果您的套餐不包含该功能,目录上方会出现一条升级横幅:"On-device models require Pro, Enterprise, or a perpetual license."(本机模型需要 Pro、Enterprise 套餐或永久许可证。)目录仍然可见——下载和激活模型会被禁用,但您仍可以删除已下载的模型以释放磁盘空间。该横幅显示一个按钮:

您的情况按钮
您有资格享受免费试用Start free trial or view plans
您已经使用过试用(或不具备试用资格)View plans

点击该按钮会打开升级提示,您可以在其中开始试用或比较套餐。一旦您的套餐解锁该功能,横幅会立即消失,下载随即可用——无需重启。

参见 License & Trial 以开始试用,或在定价页面比较各套餐选项。

Check my machine(检测我的设备,预检)

在下载任何内容之前,可以使用**预检硬件检测(pre-flight hardware check)**查看您的电脑能够顺畅运行哪些模型。Rephlo 会读取您的硬件信息,并显示一段简短摘要,例如:

16 GB RAM · 8 cores · Apple Silicon (unified memory)

随后它会对目录中的模型进行排序,并突出显示最合适的那一个,直接将其名称标注在下载按钮上(例如 Download Phi-4 Mini 3.8B)。点击一次即可下载该推荐模型。

该检测仅供参考,并非强制门槛:

  • 如果推荐的模型适合您的设备,您会看到一个明确的推荐结果。
  • 如果某个模型所需的内存超过您的设备配置,Rephlo 会显示一个温和的警告("This model may be slow or may not load",即"该模型可能运行缓慢或无法加载"),并允许您Download anyway(仍然下载)——它不会强制阻止您下载。
  • 如果硬件检测因任何原因失败,您仍然可以在下方手动浏览并下载模型。

下载与管理模型

目录中的每个模型都会显示其下载大小、简短描述,以及速度准确度评级(以一行圆点表示,圆点越多越好)。在模型行中您可以进行以下操作:

  • Download(下载) — 下载模型文件,并显示实时进度条。如果下载失败,该行会显示错误信息,方便您重试。
  • Use(Activate)(使用/激活) — 将已下载的模型标记为当前用于对话和命令的激活本机模型。激活某个模型会使其他模型停用;当前激活的模型会显示在界面顶部。
  • Delete(删除) — 删除模型文件以释放磁盘空间。(即使您的套餐后来已锁定该功能,您仍可以删除模型,以便随时回收存储空间。)

模型生命周期

存储

已下载的模型按平台存储在您的应用数据文件夹中:

平台位置
macOS~/Library/Application Support/Rephlo/models/llm
Windows%LOCALAPPDATA%\Rephlo\models\llm

该界面会显示您所有已下载模型的总磁盘占用,每行也会显示该模型各自的大小。模型文件通常较大(往往每个数 GB),请留意可用空间——下载前请确保有足够的存储空间。

内存:保持模型加载或将其卸载

将模型加载到内存需要一定时间,并且在激活期间会占用 RAM。您可以通过**内存策略(memory strategy)**选择 Rephlo 如何管理这一过程:

策略作用最适合
Always Loaded(始终加载)让激活的模型始终保持在内存中,以获得即时响应。性能强劲、且持续使用本机 AI 的设备。
Auto Unload (Recommended)(自动卸载,推荐)在您使用期间保持模型加载,空闲一段时间后(默认 10 分钟)自动释放内存。大多数人——使用时速度快,空闲时资源占用低。
Manual(手动)按需加载,只有您手动选择时才卸载。希望完全掌控的高级用户。

使用 Auto Unload 时,您可以调整空闲超时时间(以分钟为单位)。经过这段时间未使用后,模型会自行卸载,将内存让给其他应用。下一次请求会自动重新加载模型。

同一个 Model Memory 卡片中还有一个 Context Window(上下文窗口) 控件——即本机模型每次请求可考虑的最大 token 数。默认值为 32,768 token(约 32K),可设置范围为 2,048 至 262,144。这里没有 Auto(自动) 选项——与 BYOK/云端及 Ollama 类 Provider 模型的 Context Length 字段不同,本机模型始终使用这个显式设置的数值。提高 Context Window 会占用更多 RAM/VRAM,并会重新加载当前激活的模型。

遇到超出上下文的错误? 如果某个请求无法装入内存,Rephlo 会显示一条可操作的错误提示(有时会提及 NoKvSlot)。提高上方的 Context Window 即可解决。

Settings → LLM Providers → On-Device — storage used, Check my machine, Model Memory, and the on-device model catalog with Activate/Delete

On-Device Models 界面:顶部是预检的"Check my machine"面板,接着是内存策略选择器、总存储占用情况,以及可滚动的模型目录(每行都有下载/使用/删除操作)。

相关页面