Modelos e Inferência
Um provedor é quem executa a IA (OpenAI, Anthropic, sua própria máquina ou o Rephlo). Um modelo é o motor real que produz texto. Um provedor geralmente oferece vários modelos, e você escolhe qual deles executa cada comando ou chat.
Acertar essa distinção é a chave para controlar velocidade, qualidade, privacidade e custo.
As três formas como o Rephlo executa a IA
O Rephlo pode executar uma requisição de três formas diferentes. Você escolhe a que melhor se encaixa nas suas necessidades.
| Forma de executar a IA | Onde roda | Quem paga | Plano necessário | Ideal para |
|---|---|---|---|---|
| Nuvem (sua própria chave) | Os servidores do provedor (OpenAI, Anthropic, Google, etc.) | Você — cobrado pelo provedor na sua própria chave de API | Plano Pro ou licença perpétua | Modelos de ponta, controle total |
| No dispositivo (on-device) | Seu próprio computador, totalmente offline | Ninguém — sem credits, sem cobrança do provedor | Plano Pro ou licença perpétua | Privacidade, sem internet, sem custo de uso |
| Hospedado pelo Rephlo | Serviço de inferência do Rephlo | Credits do Rephlo, do seu plano | Incluído nos planos pagos | Conveniência, sem chaves para gerenciar |
Restrição por plano: Provedores bring-your-own-key (nuvem e Ollama) e modelos no dispositivo são recursos de nível Pro — exigem um plano Pro ativo (ou superior) ou uma licença perpétua para uso. Para modelos no dispositivo, essa restrição cobre tanto o download quanto a execução; uma vez desbloqueados, eles rodam sem custo de uso e totalmente offline. A Dedicated API hospedada pelo Rephlo está incluída nos planos pagos e consome credits.
1. Provedores em nuvem (traga sua própria chave)
Você cola uma chave de API de um provedor com o qual já tem conta. O Rephlo suporta oito tipos de provedores BYOK — sete fornecedores em nuvem (OpenAI, Anthropic, Google, Groq, xAI (Grok), OpenRouter e qualquer endpoint compatível com OpenAI — incluindo Azure OpenAI) mais o Ollama local, que roda na sua própria máquina em localhost:11434. Cada um expõe sua própria lista de modelos — você escolhe entre o que aquele provedor oferece atualmente (o GPT, Claude, Gemini e outros modelos mais recentes).
O uso é cobrado pelo provedor, na sua chave — o Rephlo nunca cobra credits por essas chamadas. Configure isso em Provedores.
2. Modelos no dispositivo (privados, gratuitos, offline)
O Rephlo pode executar modelos abertos inteiramente no seu próprio computador usando arquivos de modelo GGUF por meio de um motor integrado. Uma vez baixado um modelo:
- Ele roda com zero internet — nada é enviado a nenhum servidor.
- Ele usa nenhum credit e não custa nada para rodar.
- Tudo permanece completamente privado na sua máquina.
Usar modelos no dispositivo — tanto baixá-los quanto executá-los — exige um plano Pro ativo (ou superior) ou uma licença perpétua, o mesmo que os provedores BYOK em nuvem e o Ollama. Uma vez desbloqueados, eles rodam sem consumir credits e totalmente offline.
Cada modelo no dispositivo carrega metadados para ajudar você a escolher o certo: um tamanho de download, uma classificação de velocidade e uma classificação de precisão (1–10), e a RAM necessária (uma quantidade mínima e uma recomendada). Escolha um modelo menor e mais rápido se sua máquina tiver memória limitada, ou um maior e mais preciso se você tiver RAM sobrando.
Alguns modelos no dispositivo suportam um modo de raciocínio (thinking mode) (raciocínio visível antes da resposta final). Modelos com capacidade de raciocínio, como Qwen e Gemma, produzem seus pensamentos em blocos especiais; o Rephlo detecta isso automaticamente para que o raciocínio seja tratado corretamente.
Explore, baixe e gerencie esses modelos em Modelos no Dispositivo.
3. Inferência hospedada pelo Rephlo (usa credits)
Se você não quiser gerenciar nenhuma chave, o Rephlo pode executar a inferência para você em seu próprio serviço hospedado. Essas requisições consomem credits do seu plano Rephlo. As respostas são transmitidas em tempo real, para que você veja o resultado sendo gerado.
Credits, saldos e o que cada plano inclui estão descritos na web — veja Credits e Uso e Planos e Preços.
Como um modelo é escolhido
O Rephlo decide qual modelo usar com base em uma ordem de precedência clara:
- A substituição de modelo própria do comando, se o comando especificar uma.
- O modelo escolhido para a conversa atual (no chat), que é lembrado por conversa.
- O modelo padrão do provedor ativo, usado como alternativa — por exemplo, ações rápidas de menu de contexto (overlay) rodam no modelo padrão do provedor ativo, a menos que o comando o substitua.
Começando do zero: Um chat totalmente novo — ou abrir o Chat pela barra lateral antes de um modelo ter sido definido para aquela conversa específica — retoma o modelo que você usou por último em qualquer lugar do Rephlo. Essa memória global de último modelo usado é separada da memória por conversa: uma vez que você troca de modelo dentro de uma conversa específica, ela passa a lembrar sua própria escolha de forma independente.
Trocando de modelo durante o uso
No chat, um seletor de modelo unificado na barra de ferramentas permite mudar o modelo da conversa atual. Sua escolha é lembrada para aquela conversa, então reabri-la mantém o mesmo modelo. Veja Chat e Conversas para detalhes.
O seletor também mostra quais modelos seu plano inclui: modelos Dedicated API bloqueados ou inacessíveis exibem um selo de nível (como PRO ou ENTERPRISE) e um ícone de cadeado, para que você veja rapidamente o que está disponível no seu plano.
O Rephlo nunca deixa você silenciosamente em um modelo que seu plano não inclui mais — se seu modelo ativo se tornar inacessível (por exemplo, após um downgrade de plano), ele automaticamente troca você para um modelo acessível.
Parâmetros do modelo
Além de qual modelo você usa, é possível ajustar seu comportamento com parâmetros como temperature (aleatoriedade), max tokens (tamanho da resposta), top-p e top-k. Nem todo modelo suporta todos os parâmetros, e alguns impõem limites — o Rephlo valida e ajusta suas configurações para respeitar as restrições de cada modelo, para que você não precise memorizar as regras. Você encontra esses controles no editor de parâmetros do modelo e em Configuração Avançada.
Reduzindo custos com cache de prompt
Ao usar Anthropic (Claude) com contexto repetido — as mesmas instruções ou documentos longos em várias requisições — o Rephlo pode reutilizar uma cópia em cache desse contexto em vez de reenviá-lo a cada vez. Isso vem ativado por padrão e pode reduzir drasticamente o custo de trabalhos repetitivos. Alguns outros provedores em nuvem fazem cache de contexto repetido automaticamente do seu próprio lado, e os modelos no dispositivo não fazem cache algum. Saiba mais em Cache de Prompt.
Escolhendo a abordagem certa
- Quer a melhor qualidade e já tem uma chave de API? Use um provedor em nuvem (BYOK — um recurso de nível Pro).
- Se importa mais com privacidade, ou trabalha offline? Use um modelo no dispositivo — gratuito e local para executar (o acesso é um recurso de nível Pro).
- Não quer gerenciar chaves de forma alguma? Use a inferência hospedada pelo Rephlo (incluída nos planos pagos; consome credits).