Provedores de LLM
A aba LLM Providers em Settings é onde você conecta o Rephlo aos modelos de IA que alimentam seus comandos e chats. Você pode conectar suas próprias contas nos principais fornecedores de IA, rodar modelos localmente para privacidade completa, ou deixar o Rephlo gerenciar tudo para você sem nenhuma chave.
Abra em Settings → LLM Providers.

Duas formas de usar provedores
| Modo | Como funciona | Ideal para |
|---|---|---|
| Login (Dedicated API) | O Rephlo executa a inferência para você. Nenhuma chave de API para gerenciar — o uso consome os credits do seu plano. | Quem quer configuração zero. |
| BYOK (Bring Your Own Key) | Você adiciona sua própria chave de API de um provedor (OpenAI, Anthropic, etc.). Você paga esse fornecedor diretamente e usa os modelos mais recentes deles. | Usuários avançados que já têm contas em provedores. |
Você pode combinar os dois: permanecer conectado para o uso do dia a dia e adicionar um provedor BYOK para um modelo específico. Para entender como funcionam a cobrança e os credits, veja Credits e Uso e Planos e Preços.
Provedores suportados
O Rephlo suporta oito tipos de provedores BYOK — sete fornecedores em nuvem mais o Ollama local (que roda na sua própria máquina em localhost:11434) — além de opções no dispositivo e gerenciadas:
| Provedor | O que você fornece |
|---|---|
| OpenAI | Chave de API (endpoint personalizado opcional) |
| Anthropic | Chave de API (URL base opcional); suporta cache de prompt |
| Chave de API (URL base opcional) | |
| Groq | Chave de API |
| xAI (Grok) | Chave de API (Live Search opcional) |
| OpenRouter | Chave de API (URL/nome do site opcionais para o painel do OpenRouter) |
| OpenAI-Compatible | URL base + chave de API + nome do modelo (Azure OpenAI, vLLM, LocalAI, LiteLLM e similares) |
| Ollama | URL base (padrão http://localhost:11434); chave opcional para busca na web |
| On-Device | Nada — os modelos rodam localmente. Veja Modelos no Dispositivo. |
| Dedicated API | Nada — gerenciado pelo Rephlo quando você entra na sua conta. |
O Azure OpenAI é conectado por meio do tipo OpenAI-Compatible — aponte a URL base para o endpoint de implantação do seu Azure — e não como um item separado na lista de adicionar provedor.
Para uma visão conceitual de como provedores e modelos se relacionam, veja Provedores e Modelos e Inferência.
Adicionando um provedor
- Clique em Add Provider.
- Escolha o tipo de provedor. O formulário se adapta para mostrar apenas os campos que aquele provedor precisa.
- Insira suas credenciais (por exemplo, uma chave de API, ou um endpoint do Azure + nome de implantação).
- Opcionalmente, defina um nome personalizado para que o provedor seja fácil de reconhecer nas listas.
- Clique em Test Connection para confirmar que a chave funciona antes de salvar.
- Clique em Save.
Suas chaves são criptografadas
Chaves de API e tokens são criptografados antes de serem armazenados na sua máquina. Eles nunca são gravados em logs e são excluídos das exportações de dados. Trate suas chaves como senhas — o Rephlo as mantém locais e protegidas.
Modelos
Cada provedor expõe um ou mais modelos (por exemplo, um provedor OpenAI pode oferecer vários modelos GPT). Você pode adicionar vários modelos a um único provedor e marcar um como padrão. Ao executar um comando ou chat, o Rephlo usa o modelo padrão do provedor ativo, a menos que o comando ou a conversa especifique outro.
No seletor de modelos, modelos Dedicated (Gateway) bloqueados que seu plano não inclui exibem um selo de nível (por exemplo, PRO ou ENTERPRISE) e um ícone de cadeado, para que você veja rapidamente quais modelos seu plano cobre. Iniciar um chat totalmente novo, ou abrir o Chat sem nenhum modelo já definido para aquela conversa, retoma o modelo que você usou por último globalmente — uma memória separada da escolha de modelo por conversa.
Para entender como funcionam as substituições de modelo por comando e por conversa — e essa memória global de "último usado" — veja Modelos e Inferência.
Ocultar modelos online do Rephlo Gateway
As sub-abas On-Device e BYOK Providers incluem um alternador Hide online models from Rephlo Gateway (dica: "When enabled, hides online models from Rephlo Gateway"). Ativá-lo oculta os modelos Dedicated (Gateway) de toda superfície de seleção de modelo — a barra de status, o chat e o overlay.
Desde a v1.4.1, se seu modelo ativo for um modelo Gateway quando você ativar esse alternador, o Rephlo automaticamente troca você para um modelo on-device ou BYOK acessível, em vez de deixá-lo silenciosamente no modelo agora oculto — ou desativa o modelo se nenhum estiver disponível.
Capacidades
Cada configuração de provedor carrega um conjunto de flags de capacidade que informam ao Rephlo o que o modelo pode fazer:
- Geração de texto — sempre ativa.
- Visão (Vision) — analisar imagens (apenas para modelos com capacidade de visão, como GPT-4o, Claude, Gemini).
- Chamada de função / ferramentas — uso estruturado de ferramentas, necessário para conectores MCP.
- Contexto longo (Long context) — lidar com entradas muito grandes (>100 mil tokens).
- Streaming — mostrar respostas token por token (ativado por padrão).
- Busca na web (Web search) e Raciocínio (Thinking) — quando o modelo os suporta.
As capacidades são validadas em relação às habilidades reais do modelo em tempo de execução, então ativar uma flag que um modelo não suporta não quebra nada — o Rephlo simplesmente não tentará essa operação.
Parâmetros do modelo
Você pode ajustar o comportamento de geração por modelo:
- Temperature — valores mais baixos são mais precisos e repetíveis; valores mais altos são mais criativos.
- Max tokens — limita o tamanho de cada resposta.
- Top-p / top-k — controles de amostragem adicionais para usuários avançados.
Um comando pode substituir esses valores para suas próprias execuções, permitindo manter um padrão calmo, de baixa temperature, enquanto deixa um comando de brainstorming ser mais ousado.
Cache de prompt da Anthropic
Provedores Anthropic suportam cache de prompt, o que pode reduzir substancialmente o custo de contexto repetido. Ele vem ativado por padrão com um cache "ephemeral" (cerca de 5 minutos). Uma opção "extended" (cerca de 1 hora) também está disponível. O cache só entra em ação quando uma requisição realmente carrega contexto passível de cache — veja Cache de Prompt para a história completa.
Ollama e modelos locais
Para o Ollama, defina a URL base (padrão http://localhost:11434). Em m áquinas com recursos limitados, fique atento à janela de contexto para não ficar sem memória. Se preferir que o Rephlo baixe e gerencie modelos locais para você, use em vez disso o catálogo integrado Modelos no Dispositivo.
Editando, testando e removendo
- Edit qualquer provedor para atualizar sua chave, adicionar modelos ou alterar parâmetros.
- Test Connection revalida um provedor após uma rotação de chave.
- Remove um provedor que você não usa mais. Remover um provedor não exclui seus comandos — eles voltam a usar seu provedor ativo.
Configurações comuns
Todo provedor também tem opções compartilhadas:
- Request timeout (padrão de 60 segundos)
- Max retries para falhas transitórias (padrão de 3)
- Streaming ligado/desligado