Modelos e inferencia
Un proveedor (provider) es quién ejecuta la IA (OpenAI, Anthropic, tu propia máquina o Rephlo). Un modelo (model) es el motor real que genera el texto. Un proveedor suele ofrecer varios modelos, y tú eliges cuál ejecuta cada comando o chat.
Entender bien esta distinción es la clave para controlar la velocidad, la calidad, la privacidad y el costo.
Las tres formas en que Rephlo ejecuta la IA
Rephlo puede ejecutar una solicitud de una de tres formas distintas. Tú eliges la que mejor se ajuste a tus necesidades.
| Forma de ejecutar la IA | Dónde se ejecuta | Quién paga | Plan requerido | Ideal para |
|---|---|---|---|---|
| Cloud (tu propia clave) | Los servidores del proveedor (OpenAI, Anthropic, Google, etc.) | Tú — facturado por el proveedor con tu propia clave de API | Plan Pro o licencia perpetua (perpetual license) | Modelos de primer nivel, control total |
| On-device | Tu propio equipo, totalmente sin conexión | Nadie — sin credits, sin factura del proveedor | Plan Pro o licencia perpetua (perpetual license) | Privacidad, sin internet, sin costo de uso |
| Rephlo-hosted | El servicio de inferencia de Rephlo | Credits de Rephlo de tu plan | Incluido con los planes de pago | Comodidad, sin claves que gestionar |
Restricción por plan (plan gating): Los proveedores bring-your-own-key (cloud y Ollama) y los modelos on-device son funciones del nivel Pro — requieren un plan Pro activo (o superior) o una licencia perpetua para usarse. En el caso de los modelos on-device, esa restricción cubre tanto la descarga como la ejecución; una vez desbloqueados, funcionan sin costo de uso y totalmente sin conexión. El Dedicated API alojado por Rephlo (Rephlo-hosted) está incluido con los planes de pago y consume credits.
1. Proveedores cloud (trae tu propia clave)
Pegas una clave de API de un proveedor con el que ya tienes una cuenta. Rephlo admite ocho tipos de proveedores BYOK — siete proveedores cloud (OpenAI, Anthropic, Google, Groq, xAI (Grok), OpenRouter, y cualquier endpoint compatible con OpenAI — incluyendo Azure OpenAI) más Ollama local, que se ejecuta en tu propia máquina en localhost:11434. Cada uno expone su propia lista de modelos — eliges entre lo que ese proveedor ofrezca actualmente (los últimos modelos GPT, Claude, Gemini y otros).
El uso lo factura el proveedor, con tu clave — Rephlo nunca cobra credits por estas llamadas. Configúralos en Proveedores.
2. Modelos on-device (privados, gratuitos, sin conexión)
Rephlo puede ejecutar modelos abiertos completamente en tu propio equipo usando archivos de modelo GGUF a través de un motor integrado. Una vez descargado un modelo:
- Se ejecuta con cero internet — no se envía nada a ningún servidor.
- No usa credits y no cuesta nada ejecutarlo.
- Todo permanece totalmente privado en tu máquina.
Usar modelos on-device — tanto descargarlos como ejecutarlos — requiere un plan Pro activo (o superior) o una licencia perpetua, igual que los proveedores BYOK cloud y Ollama. Una vez desbloqueados, funcionan sin consumir credits y totalmente sin conexión.
Cada modelo on-device incluye metadatos para que puedas elegir el adecuado: un tamaño de descarga, una puntuación de velocidad (speed rating) y una puntuación de precisión (accuracy rating) (1–10), y la RAM que necesita (una cantidad mínima y una recomendada). Elige un modelo más pequeño y rápido si tu equipo tiene memoria limitada, o uno más grande y preciso si te sobra RAM.
Algunos modelos on-device admiten un thinking mode (modo de pensamiento, con razonamiento visible antes de la respuesta final). Los modelos con capacidad de razonamiento, como Qwen y Gemma, generan sus pensamientos en bloques especiales; Rephlo lo detecta automáticamente para procesar el razonamiento correctamente.
Explora, descarga y gestiona estos modelos en Modelos on-device (On-Device Models).
3. Inferencia alojada por Rephlo (Rephlo-hosted, consume credits)
Si no quieres gestionar ninguna clave, Rephlo puede ejecutar la inferencia por ti en su propio servicio alojado. Estas solicitudes consumen credits de tu plan de Rephlo. Las respuestas se transmiten en tiempo real para que veas el resultado a medida que se genera.
Los credits, los saldos y lo que incluye cada plan se gestionan en la web — consulta Credits y uso y Planes y precios.
Cómo se elige un modelo
Rephlo decide qué modelo usar según un orden de precedencia claro:
- El model override propio del comando, si el comando especifica uno.
- El modelo elegido para la conversación actual (en el chat), que se recuerda por conversación.
- El modelo predeterminado del proveedor activo, usado como respaldo — por ejemplo, las acciones rápidas del menú contextual (overlay) se ejecutan con el modelo predeterminado del proveedor activo, a menos que el comando lo anule.
Empezar de cero: Un chat completamente nuevo — o abrir Chat desde la barra lateral antes de que se haya definido un modelo para esa conversación en concreto — retoma el modelo que usaste por última vez en cualquier parte de Rephlo. Esta memoria global del último modelo usado es independiente de la memoria por conversación: una vez que cambias de modelo dentro de una conversación determinada, esa conversación recuerda su propia elección de forma independiente.
Cambiar de modelo sobre la marcha
En el chat, un selector de modelo unificado en la barra de herramientas te permite cambiar el modelo de la conversación actual. Tu elección se recuerda para esa conversación, así que al volver a abrirla se mantiene el mismo modelo. Consulta Chat y conversaciones para más detalles.
El selector también muestra qué modelos incluye tu plan: los modelos de Dedicated API bloqueados o inaccesibles muestran una insignia de nivel (tier badge) (como PRO o ENTERPRISE) y un ícono de candado, para que veas de un vistazo qué está disponible en tu plan.
Rephlo nunca te deja atrapado en silencio en un modelo que tu plan ya no incluye — si tu modelo activo queda inaccesible (por ejemplo, tras un downgrade de plan), te cambia automáticamente a un modelo accesible.
Parámetros del modelo
Más allá de qué modelo uses, puedes ajustar su comportamiento con parámetros como temperature (aleatoriedad), max tokens (longitud de la respuesta), top-p y top-k. No todos los modelos admiten todos los parámetros, y algunos imponen límites — Rephlo valida y ajusta tus configuraciones para que coincidan con las restricciones de cada modelo, así no tienes que memorizar las reglas. Los encontrarás en el editor de parámetros del modelo y en Configuración avanzada.
Reducir el costo con prompt caching
Cuando usas Anthropic (Claude) con contexto repetido — las mismas instrucciones largas o documentos en muchas solicitudes — Rephlo puede reutilizar una copia en caché de ese contexto en lugar de reenviarlo cada vez. Esto está activado por defecto y puede reducir drásticamente el costo en trabajos repetitivos. Algunos otros proveedores cloud cachean el contexto repetido automáticamente por su cuenta, y los modelos on-device no cachean en absoluto. Descubre más en Prompt Caching.
Elegir el enfoque adecuado
- ¿Quieres la mejor calidad y ya tienes una clave de API? Usa un proveedor cloud (BYOK — una función del nivel Pro).
- ¿Lo que más te importa es la privacidad, o trabajar sin conexión? Usa un modelo on-device — gratuito y local para ejecutar (el acceso es una función del nivel Pro).
- ¿No quieres gestionar claves en absoluto? Usa la inferencia Rephlo-hosted (incluida con los planes de pago; consume credits).