Modelos On-Device
O Rephlo pode executar modelos de IA diretamente no seu computador — sem conexão com a internet, sem créditos por mensagem, e seu texto nunca sai do seu dispositivo. A tela On-Device Models permite navegar por um catálogo selecionado de modelos locais, baixar os que você quiser e controlar como eles usam a memória da sua máquina.
Essa tela fica dentro da área LLM Providers das Settings. A inferência on-device usa o formato de modelo GGUF e roda através do mecanismo local integrado do Rephlo.
Sem busca web integrada. Como os modelos on-device rodam totalmente offline, eles não conseguem buscar ou obter informações em tempo real por conta própria. Um conector de busca web (MCP) está em desenvolvimento e permitirá que os modelos on-device recuperem dados atualizados assim que estiver disponível. Para busca web hoje, use um provedor na nuvem que a suporte (veja Chat & Conversations).
Leitura de anexos. Desde a v1.4.1, os modelos on-device conseguem ler PDFs, arquivos de texto e documentos do Office anexados no chat — o texto é extraído localmente e incluído no prompt. Eles não suportam anexos de imagem ou visão.
Quem pode usar modelos on-device?
Os modelos on-device exigem Pro, Enterprise ou uma licença perpétua — os planos Free e Starter não os incluem.
Se o seu plano não os incluir, um banner de upgrade aparece acima do catálogo: "On-device models require Pro, Enterprise, or a perpetual license." O catálogo continua visível — baixar e ativar modelos fica desabilitado, mas você ainda pode excluir modelos já baixados para liberar espaço em disco. O banner mostra um único botão:
| Sua situação | Botão |
|---|---|
| Você é elegível para o teste gratuito | Start free trial or view plans |
| Você j á usou seu teste gratuito (ou não é elegível) | View plans |
Ao selecioná-lo, abre-se o prompt de upgrade, onde você pode iniciar seu teste gratuito ou comparar planos. No momento em que seu plano desbloquear o recurso, o banner desaparece e o download fica disponível — sem necessidade de reiniciar.
Veja License & Trial para iniciar um teste gratuito, ou compare as opções na página de preços.
Check my machine (verificação prévia)
Antes de baixar qualquer coisa, use a verificação prévia de hardware para ver o que seu computador consegue rodar com folga. O Rephlo lê o seu hardware e mostra um resumo curto como:
16 GB RAM · 8 cores · Apple Silicon (memória unificada)
Em seguida, ele classifica o catálogo e destaca a melhor opção, nomeando-a diretamente no botão de download (por exemplo, Download Phi-4 Mini 3.8B). Um clique baixa esse modelo recomendado.
A verificação é apenas consultiva, não um bloqueio:
- Se o modelo recomendado couber, você recebe uma recomendação limpa.
- Se um modelo precisar de mais memória do que você tem, o Rephlo mostra um aviso leve ("This model may be slow or may not load") e permite que você clique em Download anyway — ele nunca bloqueia totalmente.
- Se a sondagem de hardware falhar por qualquer motivo, você ainda pode navegar e baixar modelos manualmente abaixo.
Baixando e gerenciando modelos
Cada modelo no catálogo mostra seu tamanho de download, uma breve descrição e classificações de velocidade e precisão (exibidas como uma linha de pontos, quanto mais alto, melhor). A partir de uma linha de modelo, você pode:
- Download — baixa o arquivo do modelo com uma barra de progresso em tempo real. Se um download falhar, a linha exibe o erro para que você possa tentar novamente.
- Use (Activate) — marca um modelo baixado como o modelo on-device ativo para chat e comandos. Ativar um modelo desativa os outros; o modelo ativo é exibido no topo da tela.
- Delete — remove o arquivo do modelo para liberar espaço em disco. (Você pode excluir mesmo em um plano que teve o recurso bloqueado depois, então sempre pode recuperar espaço de armazenamento.)
Ciclo de vida do modelo
Armazenamento
Os modelos baixados são armazenados na pasta de dados do aplicativo, por plataforma:
| Plataforma | Local |
|---|---|
| macOS | ~/Library/Application Support/Rephlo/models/llm |
| Windows | %LOCALAPPDATA%\Rephlo\models\llm |
A tela mostra o uso total de disco entre todos os modelos baixados, e cada linha mostra o tamanho individual daquele modelo. Os arquivos de modelo são grandes (frequentemente vários gigabytes cada), então fique atento ao espaço livre — certifique-se de ter espaço antes de baixar.
Memória: mantendo modelos carregados ou descarregando-os
Carregar um modelo na memória leva um momento e usa RAM enquanto estiver ativo. Você escolhe como o Rephlo gerencia isso com uma estratégia de memória:
| Estratégia | O que faz | Ideal para |
|---|---|---|
| Always Loaded | Mantém o modelo ativo na memória o tempo todo, para respostas instantâneas. | Máquinas potentes onde você usa a IA on-device o tempo todo. |
| Auto Unload (Recommended) | Mantém o modelo carregado enquanto você o usa e, em seguida, libera a memória automaticamente após um período ocioso (padrão de 10 minutos). | A maioria das pessoas — rápido quando em uso, leve nos recursos quando ocioso. |
| Manual | Carrega sob demanda e só descarrega quando você escolher. | Usuários avançados que querem controle total. |
Com Auto Unload, você pode ajustar o tempo limite de inatividade (em minutos). Depois desse tempo sem uso, o modelo se descarrega sozinho para devolver a memória a outros aplicativos. A próxima solicitação o recarrega automaticamente.
O mesmo cartão de Model Memory também tem um controle de Context Window — o número máximo de tokens que o modelo on-device pode considerar por solicitação. O padrão é 32.768 tokens (~32K) e pode ser definido entre 2.048 e 262.144. Não há opção Auto aqui — diferentemente do campo Context Length dos modelos de provedores BYOK/nuvem e no estilo Ollama, os modelos on-device sempre usam essa configuração explícita. Aumentar o Context Window usa mais RAM/VRAM e recarrega o modelo ativo.
Recebendo um erro de contexto esgotado? Se uma solicitação não couber na memória, o Rephlo mostra um erro acionável (às vezes referenciando
NoKvSlot). Aumente o Context Window acima para corrigir isso.

A tela de Modelos On-Device: painel de verificação prévia "Check my machine" no topo, um seletor de estratégia de memória, uso total de armazenamento e o catálogo de modelos rolável com ações de download/uso/exclusão por linha.
Páginas relacionadas
- Models & Inference — como o Rephlo escolhe entre modelos na nuvem e on-device
- LLM Providers — configure provedores na nuvem e chaves de API
- License & Trial — inicie um teste gratuito para desbloquear os modelos on-device
- Privacy & Data — por que os modelos locais mantêm seu texto no dispositivo