Saltar al contenido principal

Cómo lee Rephlo tus archivos

Puedes darle un archivo a Rephlo de varias maneras: adjuntándolo a un mensaje del chat, añadiéndolo a un Knowledge Space o pegando una captura de pantalla. Lo que ocurre después depende de qué tipo de archivo es y de dónde lo colocas, y esas dos preguntas se confunden con facilidad.

Esta página responde a una sola cosa: le di un archivo a Rephlo, ¿qué hizo realmente con él?

La versión corta

Todo archivo que le entregas a Rephlo recorre uno de tres caminos:

CaminoCuándo se tomaQué hace Rephlo
TextoEl archivo ya contiene texto: un PDF normal, un documento de Word, Markdown, CSV, códigoLee el texto directamente del archivo
OCREl archivo es una imagen de texto: un PDF escaneado, la foto de una página, un faxReconoce el texto en tu ordenador y luego lo trata como el camino Texto
VisiónEl archivo es una imagen de verdad: un gráfico, una captura, una fotoEnvía la imagen misma a un modelo capaz de verla

La diferencia entre los dos primeros importa más de lo que parece. Un PDF salido de un escáner se ve idéntico a un PDF generado por Word cuando lo abres, pero para el software uno es texto y el otro es una fotografía de texto. Antes de que Rephlo hiciera OCR, un PDF escaneado era sencillamente una imagen ilegible: no había nada que buscar ni nada que citar.

La segunda pregunta: ¿adjunto o Space?

El camino decide cómo se lee el archivo. Dónde lo colocas decide cuánto dura y cómo se utiliza.

Adjuntar a un mensajeAñadir a un Knowledge Space
DuraciónSolo esta conversaciónGuardado hasta que lo elimines
ReutilizaciónHay que adjuntarlo cada vezDisponible para cada chat y comando que use ese Space
Cómo se usaSe inserta en el prompt de ese mensajeSe divide en fragmentos y se indexa, para que Rephlo recupere solo lo relevante
Bueno paraUna pregunta puntual sobre un documentoMaterial de referencia al que vuelves: un manual, un conjunto de contratos, notas de investigación

Ambos recorren los mismos tres caminos. Un PDF escaneado pasa por OCR tanto si lo adjuntas como si lo añades a un Space; la diferencia está en qué ocurre después con el texto.

Por qué los Spaces no envían el documento entero. Un documento grande no cabe en la ventana de contexto de un modelo, y meterlo a la fuerza sería lento y caro. Los Spaces indexan el texto para que Rephlo pueda extraer solo los pocos pasajes que de verdad responden a tu pregunta. Consulta Recuperación RAG y ajustes.

Juntando ambas preguntas

Qué le das a RephloDónde lo ponesQué ocurre
PDF con capa de texto, Word, Markdown, CSV, códigoAdjunto a un mensajeSe lee el texto y se incluye en ese mensaje
El mismo archivoAñadido a un SpaceSe lee el texto, se fragmenta y se indexa para su recuperación
PDF escaneado (sin capa de texto)Adjunto a un mensajeEl texto se reconoce en tu dispositivo y luego se incluye
PDF escaneadoAñadido a un SpaceEl texto se reconoce en tu dispositivo, luego se fragmenta y se indexa
Captura, gráfico, fotoAdjunto a un mensajeLa imagen va a un modelo con capacidad de visión
Captura, gráfico, fotoAñadido a un SpaceEl texto que se encuentre se indexa; la imagen en sí no es recuperable

Leer documentos escaneados (OCR)

OCR —reconocimiento óptico de caracteres— es la tecnología que convierte una imagen de texto de nuevo en texto. Rephlo lo hace por completo en tu propio ordenador. El documento nunca se sube a ningún sitio para reconocerlo.

Activarlo y desactivarlo

Ve a Settings ▸ Privacy ▸ Read scanned documents on this device.

Viene activado de forma predeterminada. Con la opción desactivada, Rephlo se salta el reconocimiento y envía el archivo directamente al modelo de IA, algo razonable si usas un modelo que lee documentos bien por su cuenta y prefieres no gastar el tiempo de procesamiento local.

La descarga única

La primera vez que se ejecuta el OCR, Rephlo descarga un pequeño modelo de reconocimiento de texto —unos 15 MB— y te avisa cuando está listo. Ocurre una sola vez, en segundo plano. Si la descarga falla (normalmente por la conexión), Rephlo te lo dice; los documentos escaneados no se leerán hasta que se complete.

Elegir el idioma del documento

Bajo el mismo ajuste está Scanned document language. Por defecto está en Auto, que sigue el idioma de la aplicación, así que la mayoría no necesita tocarlo nunca.

Cámbialo cuando los documentos que escaneas estén escritos en un idioma distinto al de la interfaz. Esto importa más de lo que parece: reconocer páginas en japonés o coreano con un reconocedor de alfabeto latino produce texto inservible, no un texto algo peor.

El reconocimiento está ajustado para estos idiomas:

Idiomas
Inglés, francés, español, alemán, portuguésReconocedor latino compartido
Japonés, chino (simplificado)
Coreano
Vietnamita

Otros idiomas siguen funcionando en la medida de lo posible, pero para ellos no se garantiza la precisión.

Documentos muy largos: la etiqueta «Partial OCR»

Reconocer una página exige trabajo real de tu máquina, así que la indexación está limitada a 200 páginas por documento. Si un documento escaneado supera ese límite, Rephlo indexa el texto que el archivo ya tenía y lo marca en el Space con la etiqueta Partial OCR.

La etiqueta existe para que nunca te lleves una impresión equivocada. Si la ves, faltan páginas de ese documento en los resultados de búsqueda: estás viendo una parte, en lugar de perderte el resto sin enterarte. Para un documento escaneado muy largo, la solución práctica es dividirlo en archivos más pequeños.

Imágenes

Las imágenes funcionan de forma distinta a los documentos, porque una imagen puede transmitir un significado que ninguna extracción de texto captura: la forma de un gráfico, la disposición de un diagrama, el sujeto de una fotografía.

Si tu modelo puede ver

Los modelos con capacidad de visión reciben la imagen misma. Rephlo no le aplica OCR ni la sustituye por texto. Es deliberado: extraer el texto tiraría por la borda justo la comprensión visual por la que adjuntaste la imagen.

Si tu modelo no puede ver

No todos los modelos procesan imágenes: los modelos en el propio dispositivo no pueden, y muchos modelos en la nube solo de texto tampoco. Antes, adjuntar una imagen a uno de ellos significaba que la imagen se descartaba en silencio y recibías una respuesta segura de sí misma de un modelo que nunca vio tu imagen.

Ahora, cuando el modelo no puede ver, Rephlo lee en tu dispositivo el texto que contenga la imagen y transmite eso en su lugar. Si la imagen no tiene ningún texto legible —la foto de una persona, por ejemplo— recibes un aviso visible en vez de silencio, de modo que el modelo pueda decirte que no pudo ver la imagen en lugar de inventarse una.

Esto es un recurso de respaldo, no una mejora. El texto reconocido de un gráfico no equivale a entender el gráfico. Si el detalle visual importa, usa un modelo con capacidad de visión.

Imágenes y ocultación de datos

Si has activado Remove personal info before cloud requests, las imágenes también están cubiertas.

Rephlo analiza una imagen adjunta con OCR en el dispositivo antes de que llegue a un modelo en la nube. Si encuentra información personal, la imagen se sustituye por su texto ocultado. Si no hay nada que ocultar, la imagen se envía tal cual.

Ten claros los límites de esto. El OCR lee texto; no puede captar caras, firmas ni escritura a mano que no consiga leer. Para imágenes en las que ese riesgo no sea aceptable, activa Block send if redaction uncertain: Rephlo retendrá las imágenes que no pueda leer en lugar de enviarlas.

Consulta Privacidad y datos para ver todos los ajustes de ocultación.

Respuestas rápidas

PreguntaRespuesta
Añadí un PDF escaneado y la búsqueda no encuentra nadaRevisa Settings ▸ Privacy: ¿está activado «Read scanned documents on this device» y terminó la descarga única del modelo?
El texto reconocido es ilegibleProbablemente el idioma del documento no coincide. Fija Scanned document language de forma explícita.
Mi documento muestra la etiqueta «Partial OCR»Supera el límite de indexación de 200 páginas. Divídelo en archivos más pequeños.
Adjunté una imagen y el modelo la ignoróEs probable que el modelo no vea imágenes. Rephlo ahora transmite el texto que encuentre; para comprensión visual, cambia a un modelo con visión.
¿Se sube mi documento escaneado para el OCR?No. El reconocimiento ocurre en tu ordenador.
¿Puedo usar OCR con un modelo en el propio dispositivo?Sí. El OCR es independiente del modelo que uses: se ejecuta localmente en cualquier caso.

Páginas relacionadas