模型与推理
**服务商(provider)**是指由谁来运行 AI(OpenAI、Anthropic、您自己的电脑,或 Rephlo)。**模型(model)**则是真正生成文本的引擎。一个服务商通常会提供多个模型,您可以为每个命令或对话选择使用哪一个。
正确理解这一区别,是掌控速度、质量、隐私和成本的关键。
Rephlo 运行 AI 的三种方式
Rephlo 可以用三种不同方式之一来处理请求,您可以选择最适合自己需求的一种。
| 运行方式 | 运行位置 | 由谁付费 | 所需套餐 | 最适合 |
|---|---|---|---|---|
| Cloud(云端,使用您自己的密钥) | 服务商的服务器(OpenAI、Anthropic、Google 等) | 您本人——由服务商根据您自己的 API 密钥计费 | Pro 套餐或永久许可证(perpetual license) | 顶级模型,完全掌控 |
| On-device(本地设备) | 您自己的电脑,完全离线 | 无人付费——不消耗 credit,也没有服务商账单 | Pro 套餐或永久许可证(perpetual license) | 隐私保护、无需联网、无使用成本 |
| Rephlo-hosted(Rephlo 托管) | Rephlo 的推理服务 | 从您的套餐中消耗 Rephlo credit | 已包含在付费套餐中 | 便捷,无需管理密钥 |
套餐限制(Plan gating): Bring-your-own-key(自带密钥)服务商(云端以及 Ollama)和 on-device 模型均属于 Pro 级功能——需要有效的 Pro 套餐(或更高)或永久许可证才能使用。对于 on-device 模型,该限制同时覆盖下载与运行两个环节;一旦解锁,运行时不产生使用成本,且完全离线。Rephlo-hosted 的 Dedicated API 已包含在付费套餐中,会消耗 credit。
1. Cloud 服务商(自带密钥)
您只需粘贴一个已拥有账户的服务商的 API 密钥。Rephlo 支持八种 BYOK 服务商类型——七个云端厂商(OpenAI、Anthropic、Google、Groq、xAI(Grok)、OpenRouter,以及任何兼容 OpenAI 的端点,包括 Azure OpenAI),再加上运行在您自己电脑上的本地 Ollama(地址为 localhost:11434)。每个服务商都会展示自己的模型列表——您可以从该服务商当前提供的任何模型中进行选择(最新的 GPT、Claude、Gemini 及其他模型)。
使用量由该服务商根据您的密钥计费——Rephlo 不会为这些调用收取任何 credit。可在服务商(Providers)中进行设置。
2. On-device 模型(隐私、免费、离线)
Rephlo 可以通过内置引擎,使用 GGUF 模型文件,完全在您自己的电脑上运行开源模型。模型下载完成后:
- 运行时完全不需要联网——不会向任何服务器发送任何数据。
- 运行不消耗 credit,也不产生任何费用。
- 一切都完全私密地保留在您自己的电脑上。
使用 on-device 模型——无论是下载还是运行——都需要有效的 Pro 套餐(或更高)或永久许可证,这与 BYOK 云端及 Ollama 服务商的要求相同。一旦解锁,它们会不消耗 credit,并完全离线运行。
每个 on-device 模型都带有元数据,帮助您选择合适的模型:下载大小、速度评分(speed rating)与准确度评分(accuracy rating)(1–10 分),以及所需的 RAM(最低要求与建议值)。如果您的电脑内存有限,可以选择更小、更快的模型;如果 RAM 富余,则可以选择更大、更精准的模型。
部分 on-device 模型支持思考模式(thinking mode)(在给出最终答案之前展示可见的推理过程)。像 Qwen 和 Gemma 这类具备推理能力的模型会将其思考过程放在特殊的区块中;Rephlo 会自动识别这一点,从而正确处理这些推理内容。
您可以在 On-Device Models(本地设备模型)中浏览、下载和管理这些模型。
3. Rephlo-hosted 推理(消耗 credit)
如果您不想管理任何密钥,Rephlo 可以在其自有的托管服务上为您运行推理。这些请求会从您的 Rephlo 套餐中消耗 credit。响应会实时流式返回,让您在生成的同时就能看到输出内容。
credit、余额,以及各套餐所包含的内容均在网页端管理——参见 Credits & Usage(Credit 与用量)以及 Plans & Pricing(套餐与定价)。
模型如何被选定
Rephlo 会根据明确的优先级顺序来决定使用哪个模型:
- 命令自身的模型覆盖设置(model override)——如果该命令指定了模型。
- 当前对话所选的模型(在 chat 中),按对话逐一记忆。
- 当前活动服务商的默认模型,作为兜底方案——例如,快捷右键菜单(context-menu / overlay)操作会运行在当前活动服务商的默认模型上,除非命令覆盖了这一设置。
全新开始: 一个全新的对话——或者在尚未为该特定对话设置模型之前从侧边栏打开 Chat——会恢复您在 Rephlo 中任意位置最近使用过的模型。这种全局的"最近使用模型"记忆与按对话的记忆是相互独立的:一旦您在某个对话内切换了模型,该对话会独立记住自己的选择。