跳到主要内容

高级配置

面向高级用户,Rephlo 提供了对性能、AI 行为和提示词缓存的更精细控制。与基础设置不同,这些设置分散在几个不同的位置——有些按 Space 配置,有些按提供商或按命令配置,还有一些是应用全局设置。本页将说明每一项设置位于何处、作用是什么。

General 标签页的 Performance 部分——Default Space Token Budget 与聊天浏览窗口设置

Token 预算

Default Space Token Budget(默认 Space Token 预算)位于 Settings → General → Performance 中。它设置了每个新建 Space 的起始 token 上限——即在触发数据模式与压缩之前,该 Space 能容纳多少文档内容。

  • 滑块范围:5,000 到 1,000,000 tokens(输入框最低可设为 1,000)。
  • 默认值:100,000 tokens。
  • 仅适用于新建的 Space。之后每个 Space 都可以单独重新设置预算,更改此默认值不会影响已有的 Space。

同一部分中还有一个独立的聊天浏览窗口大小设置,用于控制一次加载到聊天侧边栏中的近期对话数量(10–5,000;更早的对话仍可通过搜索访问)。这是一个性能调节旋钮,而非数据上限。

压缩策略

压缩(Compaction)通过总结 Space 中的文档来保持其 token 占用较低。当某个 Space 设为 🗜️ Compact 数据模式时(通过 Space 专属的数据模式选择器选定——没有单独的全局开关),压缩会生效:

  • 将某个 Space 切换为 Compact 时,系统会提示总结其当前文件,而新添加的文件也可以在 Space 视图中进行压缩。生成摘要会消耗 credit,因此 Rephlo 始终会先请您确认所需的 credit 花费——压缩操作绝不会静默执行。
  • Credit 保护机制:对于大型 Space(原始总量约 128,000 tokens 或以上),Compact 会被禁用,压缩操作将被阻止,系统会引导您改用免费的 Smart Search。压缩单个大文件(约 50,000 tokens 或以上)会触发额外的确认提示。
  • 进行压缩时,Rephlo 会请您选择一种策略,以及由哪个模型来执行摘要生成。所选模型会在本次会话的其余时间内被记住。

三种策略在保真度与节省 token 之间做出不同权衡:

策略作用最适合场景
Conservative(保守)保留最多细节;token 削减幅度最小。准确性比节省 token 更重要时。
Balanced(平衡)总结较旧的文档——推荐的折中方案(默认)。大多数项目。
Aggressive(激进)只保留最近的关键要点;节省幅度最大,细节损失也更多。将非常长的内容压缩进较小的上下文窗口时。

无论某个 Space 使用哪种模式,Rephlo 都会分别追踪该 Space 的原始 token 总量和压缩后 token 总量,方便您查看压缩效果的具体差异。若想全面了解 Smart Search 与 Compact 数据模式的区别,以及压缩与设备端检索(RAG)之间的交互方式,请参见数据模式与压缩

提供商与模型调优

温度(Temperature)、最大回复长度和上下文窗口都是按提供商和按模型分别设置的(并可选择按命令进行覆盖)——它们并非单一的全局控制项。请在 LLM Providers 标签页中进行配置;参见提供商管理提供商

温度(Temperature)

控制回复的确定性与创造性程度。默认值为 0.7(平衡)。

  • 0.0 – 0.3 —— 精确且可重复。适合代码和事实类内容。
  • 约 0.7 —— 平衡。适合一般性写作。
  • 1.0 及以上 —— 更具创造性和多样性。适合头脑风暴。

最大回复 Token 数

限制 AI 回复的长度,避免在您只想要一句话时得到一整篇文章。典型默认值约为 2,000

上下文窗口限制

对于 BYOK/云端及 Ollama 类型的提供商模型,该设置对应"添加/编辑模型"对话框中的 Context Length(上下文长度)字段。它限制了发送给模型的文本量。保持 Auto(自动)即可使用提供商的默认值,或手动设置一个上限,以便在付费 API 上控制成本。

设备端模型(On-device models)不使用此字段——精选的设备端模型目录会忽略它。取而代之的是,其上下文窗口由专门的 Context Window 设置控制(Settings → LLM Providers → On-Device,位于 Model Memory 卡片中):范围为 2,048–262,144 tokens,默认约为 32,768。调高该值会占用更多 RAM/VRAM,并会重新加载当前使用的模型。

按命令覆盖设置

单个命令可以覆盖全局的提供商、模型、温度和最大 token 数设置。命令运行时,其自身的设置会优先于全局提供商默认值生效。参见执行工作流

提示词缓存

在支持该功能的提供商上,Rephlo 可以复用提示词中已缓存的前缀部分,以降低成本和延迟。缓存相关设置位于提供商配置中:

  • Enable prompt caching(启用提示词缓存)—— 为支持的请求开启缓存(默认开启)。
  • Cache TTL(缓存存活时间)—— 缓存条目的存活时长:
    • Ephemeral(临时) —— 约 5 分钟。
    • Extended(延长) —— 约 1 小时。
  • Cache logging(缓存日志)—— 记录详细的缓存性能信息。

缓存读取的费用会大幅折扣,History详情视图会显示每个请求的缓存创建与缓存读取 token 数,方便您查看节省的成本。只有当请求包含可缓存的前缀时(例如附带了 Space 的聊天),缓存才会生效。完整行为说明请参见提示词缓存

开发者工具

以下是用于排查问题的辅助工具,而非日常设置:

  • Debug Mode(调试模式)—— 启用向应用日志文件写入详细日志。诊断提供商连接问题时很有用。
  • Prompt Inspection(提示词检查)—— 显示发送给提供商的确切 JSON 请求体,可在 History 详情中查看。

环境切换(Production / Staging / Local API 端点)仅在调试版本中可用,不属于常规用户体验的一部分。


相关链接: 数据模式与压缩 · 提供商 · 提示词缓存 · 历史记录与审计