Modelos on-device
Rephlo puede ejecutar modelos de IA directamente en tu equipo — sin conexión a internet, sin credits por mensaje, y tu texto nunca sale de tu dispositivo. La pantalla On-Device Models te permite explorar un catálogo curado de modelos locales, descargar los que quieras y controlar cómo usan la memoria de tu equipo.
Esta pantalla se encuentra dentro del área LLM Providers de Settings. La inferencia on-device usa el formato de modelo GGUF y se ejecuta mediante el motor local integrado de Rephlo.
Sin búsqueda web integrada. Como los modelos on-device se ejecutan totalmente sin conexión, no pueden buscar ni obtener información en tiempo real por sí mismos. Hay un conector de búsqueda web (MCP) en desarrollo que permitirá a los modelos on-device recuperar datos actualizados en cuanto esté disponible. Para buscar en la web hoy, usa un proveedor en la nube que lo admita (consulta Chat & Conversations).
Lectura de archivos adjuntos. Desde la v1.4.1, los modelos on-device pueden leer PDF, archivos de texto y documentos de Office adjuntos en el chat — el texto se extrae localmente y se incluye en el prompt. No admiten adjuntos de imagen ni de visión.
¿Quién puede usar los modelos on-device?
Los modelos on-device requieren Pro, Enterprise o una licencia perpetua — los planes Free y Starter no los incluyen.
Si tu plan no los incluye, aparece un banner de actualización encima del catálogo: "On-device models require Pro, Enterprise, or a perpetual license." El catálogo se mantiene visible — la descarga y activación de modelos está deshabilitada, pero aún puedes eliminar los modelos ya descargados para liberar espacio en disco. El banner muestra un único botón:
| Tu situación | Botón |
|---|---|
| Eres elegible para la prueba gratuita | Start free trial or view plans |
| Ya usaste tu prueba (o no eres elegible) | View plans |
Al seleccionarlo se abre el aviso de actualización, donde puedes iniciar tu prueba o comparar planes. En cuanto tu plan desbloquea la función, el banner desaparece y la descarga queda disponible — sin necesidad de reiniciar.
Consulta License & Trial para iniciar una prueba, o compara opciones en la página de precios.
Check my machine (verificación previa)
Antes de descargar nada, usa la verificación previa de hardware para ver qué puede ejecutar tu equipo sin problemas. Rephlo lee tu hardware y muestra un breve resumen como:
16 GB RAM · 8 núcleos · Apple Silicon (memoria unificada)
Luego clasifica el catálogo y destaca la mejor opción, nombrándola directamente en el botón de descarga (por ejemplo, Download Phi-4 Mini 3.8B). Con un clic descargas ese modelo recomendado.
La verificación es orientativa, no una barrera:
- Si el modelo recomendado encaja, obtendrás una recomendación clara.
- Si un modelo necesita más memoria de la que tienes, Rephlo muestra una advertencia leve ("This model may be slow or may not load") y te permite Download anyway — nunca te bloquea por completo.
- Si la detección de hardware falla por cualquier motivo, aún puedes explorar y descargar modelos manualmente más abajo.
Descargar y gestionar modelos
Cada modelo del catálogo muestra su tamaño de descarga, una breve descripción y valoraciones de speed y accuracy (mostradas como una fila de puntos, más puntos es mejor). Desde la fila de un modelo puedes:
- Download — obtiene el archivo del modelo con una barra de progreso en vivo. Si una descarga falla, la fila muestra el error para que puedas reintentarlo.
- Use (Activate) — marca un modelo descargado como el modelo on-device activo para chat y comandos. Activar un modelo desactiva los demás; el modelo activo se muestra en la parte superior de la pantalla.
- Delete — elimina el archivo del modelo para liberar espacio en disco. (Puedes eliminarlo incluso en un plan que ya bloqueó la función, así siempre puedes recuperar almacenamiento.)
Ciclo de vida del modelo
Almacenamiento
Los modelos descargados se guardan en la carpeta de datos de la aplicación, según la plataforma:
| Platform | Ubicación |
|---|---|
| macOS | ~/Library/Application Support/Rephlo/models/llm |
| Windows | %LOCALAPPDATA%\Rephlo\models\llm |
La pantalla muestra tu uso total de disco en todos los modelos descargados, y cada fila muestra el tamaño individual de ese modelo. Los archivos de los modelos son grandes (a menudo varios gigabytes cada uno), así que vigila el espacio libre — asegúrate de tener espacio suficiente antes de descargar.
Memoria: mantener los modelos cargados o descargarlos
Cargar un modelo en memoria toma un momento y usa RAM mientras está activo. Tú eliges cómo gestiona esto Rephlo mediante una estrategia de memoria:
| Strategy | Qué hace | Ideal para |
|---|---|---|
| Always Loaded | Mantiene el modelo activo en memoria en todo momento para respuestas instantáneas. | Equipos potentes donde usas IA on-device constantemente. |
| Auto Unload (Recommended) | Mantiene el modelo cargado mientras lo usas y luego libera la memoria automáticamente tras un periodo de inactividad (predeterminado 10 minutos). | La mayoría de las personas — rápido cuando está activo, ligero en recursos cuando está inactivo. |
| Manual | Carga bajo demanda y solo se descarga cuando tú lo decides. | Usuarios avanzados que quieren control total. |
Con Auto Unload, puedes ajustar el idle timeout (en minutos). Después de ese tiempo sin uso, el modelo se descarga por sí solo para devolver la memoria a otras aplicaciones. La siguiente solicitud lo vuelve a cargar automáticamente.
Esa misma tarjeta Model Memory también tiene un control de Context Window — el número máximo de tokens que el modelo on-device puede considerar por solicitud. Por defecto es 32.768 tokens (~32K) y se puede configurar entre 2.048 y 262.144. Aquí no hay opción Auto — a diferencia del campo Context Length de los modelos BYOK/en la nube y de tipo Ollama, los modelos on-device siempre usan este ajuste explícito. Aumentar el Context Window usa más RAM/VRAM y recarga el modelo activo.
¿Obtienes un error de contexto excedido? Si una solicitud no cabe en memoria, Rephlo muestra un error accionable (a veces referenciando
NoKvSlot). Aumenta el Context Window de arriba para solucionarlo.

La pantalla On-Device Models: el panel de verificación previa "Check my machine" en la parte superior, un selector de estrategia de memoria, el uso total de almacenamiento y el catálogo de modelos con desplazamiento, con acciones de descarga/uso/eliminación por fila.
Páginas relacionadas
- Models & Inference — cómo elige Rephlo entre modelos en la nube y on-device
- LLM Providers — configura proveedores en la nube y claves de API
- License & Trial — inicia una prueba para desbloquear los modelos on-device
- Privacy & Data — por qué los modelos locales mantienen tu texto on-device