跳到主要内容

模型与推理

**服务商(provider)**是指由谁来运行 AI(OpenAI、Anthropic、您自己的电脑,或 Rephlo)。**模型(model)**则是真正生成文本的引擎。一个服务商通常会提供多个模型,您可以为每个命令或对话选择使用哪一个。

正确理解这一区别,是掌控速度、质量、隐私和成本的关键。

Rephlo 运行 AI 的三种方式

Rephlo 可以用三种不同方式之一来处理请求,您可以选择最适合自己需求的一种。

运行方式运行位置由谁付费所需套餐最适合
Cloud(云端,使用您自己的密钥)服务商的服务器(OpenAI、Anthropic、Google 等)您本人——由服务商根据您自己的 API 密钥计费Pro 套餐或永久许可证(perpetual license)顶级模型,完全掌控
On-device(本地设备)您自己的电脑,完全离线无人付费——不消耗 credit,也没有服务商账单Pro 套餐或永久许可证(perpetual license)隐私保护、无需联网、无使用成本
Rephlo-hosted(Rephlo 托管)Rephlo 的推理服务从您的套餐中消耗 Rephlo credit已包含在付费套餐中便捷,无需管理密钥

套餐限制(Plan gating): Bring-your-own-key(自带密钥)服务商(云端以及 Ollama)和 on-device 模型均属于 Pro 级功能——需要有效的 Pro 套餐(或更高)或永久许可证才能使用。对于 on-device 模型,该限制同时覆盖下载与运行两个环节;一旦解锁,运行时不产生使用成本,且完全离线Rephlo-hosted 的 Dedicated API 已包含在付费套餐中,会消耗 credit

1. Cloud 服务商(自带密钥)

您只需粘贴一个已拥有账户的服务商的 API 密钥。Rephlo 支持八种 BYOK 服务商类型——七个云端厂商(OpenAI、Anthropic、Google、Groq、xAI(Grok)、OpenRouter,以及任何兼容 OpenAI 的端点,包括 Azure OpenAI),再加上运行在您自己电脑上的本地 Ollama(地址为 localhost:11434)。每个服务商都会展示自己的模型列表——您可以从该服务商当前提供的任何模型中进行选择(最新的 GPT、Claude、Gemini 及其他模型)。

使用量由该服务商根据您的密钥计费——Rephlo 不会为这些调用收取任何 credit。可在服务商(Providers)中进行设置。

2. On-device 模型(隐私、免费、离线)

Rephlo 可以通过内置引擎,使用 GGUF 模型文件,完全在您自己的电脑上运行开源模型。模型下载完成后:

  • 运行时完全不需要联网——不会向任何服务器发送任何数据。
  • 运行不消耗 credit,也不产生任何费用
  • 一切都完全私密地保留在您自己的电脑上。

使用 on-device 模型——无论是下载还是运行——都需要有效的 Pro 套餐(或更高)或永久许可证,这与 BYOK 云端及 Ollama 服务商的要求相同。一旦解锁,它们会不消耗 credit,并完全离线运行。

每个 on-device 模型都带有元数据,帮助您选择合适的模型:下载大小、速度评分(speed rating)准确度评分(accuracy rating)(1–10 分),以及所需的 RAM(最低要求与建议值)。如果您的电脑内存有限,可以选择更小、更快的模型;如果 RAM 富余,则可以选择更大、更精准的模型。

部分 on-device 模型支持思考模式(thinking mode)(在给出最终答案之前展示可见的推理过程)。像 Qwen 和 Gemma 这类具备推理能力的模型会将其思考过程放在特殊的区块中;Rephlo 会自动识别这一点,从而正确处理这些推理内容。

您可以在 On-Device Models(本地设备模型)中浏览、下载和管理这些模型。

3. Rephlo-hosted 推理(消耗 credit)

如果您不想管理任何密钥,Rephlo 可以在其自有的托管服务上为您运行推理。这些请求会从您的 Rephlo 套餐中消耗 credit。响应会实时流式返回,让您在生成的同时就能看到输出内容。

credit、余额,以及各套餐所包含的内容均在网页端管理——参见 Credits & Usage(Credit 与用量)以及 Plans & Pricing(套餐与定价)

模型如何被选定

Rephlo 会根据明确的优先级顺序来决定使用哪个模型:

  1. 命令自身的模型覆盖设置(model override)——如果该命令指定了模型。
  2. 当前对话所选的模型(在 chat 中),按对话逐一记忆。
  3. 当前活动服务商的默认模型,作为兜底方案——例如,快捷右键菜单(context-menu / overlay)操作会运行在当前活动服务商的默认模型上,除非命令覆盖了这一设置。

全新开始: 一个全新的对话——或者在尚未为该特定对话设置模型之前从侧边栏打开 Chat——会恢复您在 Rephlo 中任意位置最近使用过的模型。这种全局的"最近使用模型"记忆与按对话的记忆是相互独立的:一旦您在某个对话内切换了模型,该对话会独立记住自己的选择。

即时切换模型

在 chat 中,工具栏上的统一模型选择器(model selector)可让您更改当前对话所使用的模型。您的选择会被该对话记住,因此重新打开时仍会保持同一模型。详情参见 Chat & Conversations(对话与会话)

该选择器还会显示您的套餐包含哪些模型:已锁定或无法访问的 Dedicated API 模型会显示一个套餐层级徽章(tier badge,例如 PROENTERPRISE)以及一个锁形图标,让您一眼就能看清自己套餐中可用的内容。

Rephlo 绝不会让您在毫无察觉的情况下继续使用一个您的套餐已不再包含的模型——如果您当前使用的模型变为不可访问(例如套餐降级后),系统会自动为您切换到一个可访问的模型。

模型参数

除了选择使用哪个模型之外,您还可以通过 temperature(随机性)、max tokens(回复长度)、top-ptop-k 等参数来调整模型的行为。并非所有模型都支持全部参数,有些还会施加限制——Rephlo 会校验并调整您的设置,使其符合每个模型的约束条件,您无需自己记住这些规则。您可以在模型参数编辑器以及高级配置(Advanced Configuration)中找到这些参数。

用 prompt caching 降低成本

当您在多次请求中使用 Anthropic(Claude) 并携带重复的上下文——例如相同的长指令或文档——时,Rephlo 可以复用该上下文的缓存副本,而不必每次都重新发送。此功能默认开启,能大幅降低重复性工作的成本。其他一些云端服务商会在自己的一侧自动缓存重复的上下文,而 on-device 模型则完全不进行缓存。详情参见 Prompt Caching

选择合适的方式

  • 希望获得最佳质量,并且已经拥有 API 密钥? 使用 Cloud 服务商(BYOK——Pro 级功能)。
  • 最看重隐私,或需要离线工作? 使用 on-device 模型——运行免费且完全本地(访问权限属于 Pro 级功能)。
  • 完全不想管理任何密钥? 使用 Rephlo-hosted 推理(已包含在付费套餐中;会消耗 credit)。

相关页面