Configuração Avançada
Para usuários avançados, o Rephlo expõe um controle mais refinado sobre desempenho, comportamento de IA e cache de prompts. Diferente das configurações básicas, essas opções estão espalhadas por alguns lugares — algumas são por Space, algumas são por provedor ou por comando, e algumas são globais no aplicativo. Esta página mapeia onde cada uma fica e o que ela faz.

Orçamentos de Tokens
O Default Space Token Budget fica em Settings → General → Performance. Ele define o limite inicial de tokens para cada novo Space — quanto conteúdo de documentos o Space pode conter antes que os modos de dados e a compactação se tornem relevantes.
- Faixa do slider: 5.000 a 1.000.000 de tokens (o campo de entrada permite até 1.000).
- Padrão: 100.000 tokens.
- Aplica-se apenas a Spaces novos. Cada Space pode ter seu orçamento reajustado individualmente depois, e alterar esse padrão nunca reescreve Spaces existentes.
Um tamanho da janela de navegação do chat separado, na mesma seção, controla quantas conversas recentes são carregadas na barra lateral do chat de uma só vez (10–5.000; conversas mais antigas continuam acessíveis pela busca). É um ajuste de desempenho, não um limite de dados.
Estratégia de Compactação
A Compactação mantém um Space leve em tokens ao resumir seus documentos. Ela se aplica quando um Space está definido para o modo de dados 🗜️ Compact (escolhido no seletor de modo de dados por Space — não há uma alternância global separada):
- Alternar um Space para Compact oferece resumir seus arquivos atuais, e arquivos recém-adicionados podem ser compactados a partir da visualização do Space. Criar resumos consome créditos, então o Rephlo sempre pede para você confirmar o custo em créditos primeiro — a compactação nunca é silenciosa.
- Proteção de créditos: para um Space grande (total bruto ≈ 128.000 tokens ou mais), o Compact é desativado e a compactação é bloqueada, direcionando você para o Smart Search gratuito. Compactar um único arquivo grande (≈ 50.000 tokens ou mais) solicita uma confirmação extra.
- Ao compactar, o Rephlo pede que você escolha uma estratégia e qual modelo deve fazer o resumo. A escolha do modelo é lembrada pelo restante da sua sessão.
As três estratégias trocam fidelidade por economia de tokens:
| Estratégia | O que faz | Melhor para |
|---|---|---|
| Conservative | Mantém o máximo de detalhes; menor redução de tokens. | Quando a precisão importa mais do que economizar tokens. |
| Balanced | Resume documentos mais antigos — o meio-termo recomendado (padrão). | A maioria dos projetos. |
| Aggressive | Mantém apenas os pontos-chave mais recentes; economia máxima, mais perda de detalhes. | Encaixar material muito longo em uma janela de contexto pequena. |
Seja qual for o modo que um Space usa, o Rephlo rastreia tanto um total bruto de tokens quanto um total compacto de tokens por Space, para que você veja o efeito da compactação. Para o panorama completo de Smart Search vs. dados Compact e como a compactação interage com a recuperação no dispositivo (RAG), veja Modos de Dados e Compactação.
Ajuste de Provedor e Modelo
Temperatura, tamanho máximo da resposta e janela de contexto são configurações por provedor e por modelo (com substituições opcionais por comando) — não é um único controle global. Configure-as na aba LLM Providers; veja Providers e Gerenciando Provedores.
Temperatura
Controla o quão determinísticas ou criativas são as respostas. O padrão é 0.7 (equilibrado).
- 0.0 – 0.3 — preciso e repetível. Bom para código e fatos.
- ~0.7 — equilibrado. Bom para escrita geral.
- 1.0+ — mais criativo e variado. Bom para brainstorming.
Máximo de Tokens da Resposta
Limita o comprimento da resposta da IA para que ela não escreva um ensaio quando você queria uma frase. Um valor em torno de 2.000 é um padrão típico.
Limite da Janela de Contexto
Para modelos de provedores BYOK/nuvem e estilo Ollama, este é o campo Context Length na caixa de diálogo Add/Edit Model. Ele limita quanto texto é enviado ao modelo. Deixe em Auto para usar o padrão do provedor, ou defina um limite manual para controlar o custo em APIs pagas.
Os modelos no dispositivo não usam esse campo — o catálogo selecionado de modelos no dispositivo o ignora. Em vez disso, sua janela de contexto é uma configuração dedicada de Context Window (Settings → LLM Providers → On-Device, no card Model Memory): uma faixa de 2.048–262.144 tokens, padrão de ~32.768. Aumentá-la usa mais RAM/VRAM e recarrega o modelo ativo.
Substituições por Comando
Comandos individuais podem substituir o provedor, modelo, temperatura e máximo de tokens globais. As próprias configurações de um comando têm precedência sobre os padrões globais do provedor quando ele é executado. Veja Fluxos de Execução.
Cache de Prompts
O Rephlo pode reutilizar um prefixo em cache do seu prompt para reduzir custo e latência em provedores compatíveis. As configurações de cache ficam junto com a configuração do provedor:
- Enable prompt caching — ativa o cache para solicitações compatíveis (ativado por padrão).
- Cache TTL — quanto tempo uma entrada de cache dura:
- Ephemeral — cerca de 5 minutos.
- Extended — cerca de 1 hora.
- Cache logging — registra informações detalhadas de desempenho do cache.
Leituras de cache têm desconto significativo, e a visualização de detalhes do History mostra os tokens de criação e leitura de cache por solicitação, para que você veja a economia. O cache só entra em ação quando a solicitação tem um prefixo cacheável (por exemplo, um chat com um Space anexado). Para o comportamento completo, veja Prompt Caching.
Ferramentas de Desenvolvedor
Estas são ajudas para solução de problemas, não configurações do dia a dia:
- Debug Mode — ativa registro detalhado no arquivo de log do aplicativo. Útil para diagnosticar problemas de conexão com o provedor.
- Prompt Inspection — exibe o payload JSON exato enviado ao provedor, visível nos detalhes do History.
A troca de ambiente (endpoints de API Production / Staging / Local) está disponível apenas em builds de depuração e não faz parte da experiência regular do usuário.
Relacionado: Modos de Dados e Compactação · Providers · Prompt Caching · History & Audit