Como o Rephlo lê seus arquivos
Você pode entregar um arquivo ao Rephlo de várias formas — anexando a uma mensagem do chat, adicionando a um Knowledge Space ou colando uma captura de tela. O que acontece depois depende de que tipo de arquivo é e de onde você o colocou, e essas duas perguntas são fáceis de confundir.
Esta página responde a uma coisa só: entreguei um arquivo ao Rephlo — o que ele de fato fez com ele?
Em resumo
Todo arquivo que você entrega ao Rephlo segue um de três caminhos:
| Caminho | Quando é usado | O que o Rephlo faz |
|---|---|---|
| Texto | O arquivo já contém texto — um PDF comum, documento do Word, Markdown, CSV, código | Lê o texto direto do arquivo |
| OCR | O arquivo é uma imagem de texto — um PDF digitalizado, a foto de uma página, um fax | Reconhece o texto no seu computador e depois trata como o caminho Texto |
| Visão | O arquivo é uma imagem de verdade — um gráfico, uma captura de tela, uma foto | Envia a própria imagem para um modelo que consegue enxergar |
A diferença entre os dois primeiros importa mais do que parece. Um PDF vindo de um scanner parece idêntico a um PDF gerado pelo Word quando você abre, mas para o software um é texto e o outro é uma fotografia de texto. Antes de o Rephlo fazer OCR, um PDF digitalizado era simplesmente uma imagem ilegível — não havia nada para pesquisar nem para citar.
A segunda pergunta: anexo ou Space?
O caminho decide como o arquivo é lido. Onde você o coloca decide quanto tempo ele dura e como é usado.
| Anexar a uma mensagem | Adicionar a um Knowledge Space | |
|---|---|---|
| Duração | Só nesta conversa | Guardado até você excluir |
| Reúso | Anexar de novo a cada vez | Disponível para todo chat e comando que use o Space |
| Como é usado | Inserido no prompt daquela mensagem | Dividido em trechos e indexado, para o Rephlo trazer só as partes relevantes |
| Bom para | Uma pergunta pontual sobre um documento | Material de referência ao qual você volta — um manual, um conjunto de contratos, notas de pesquisa |
Os dois seguem os mesmos três caminhos. Um PDF digitalizado passa por OCR quer você o anexe, quer o adicione a um Space; a diferença é o que acontece com o texto depois.
Por que os Spaces não enviam o documento inteiro. Um documento grande não cabe na janela de contexto de um modelo, e enfiá-lo lá seria lento e caro. Os Spaces indexam o texto para que o Rephlo possa extrair apenas os poucos trechos que realmente respondem à sua pergunta. Veja Recuperação RAG e ajustes.
Juntando as duas perguntas
| O que você dá ao Rephlo | Onde você coloca | O que acontece |
|---|---|---|
| PDF com camada de texto, Word, Markdown, CSV, código | Anexado a uma mensagem | O texto é lido e incluído naquela mensagem |
| O mesmo arquivo | Adicionado a um Space | O texto é lido, dividido em trechos e indexado para recuperação |
| PDF digitalizado (sem camada de texto) | Anexado a uma mensagem | O texto é reconhecido no seu dispositivo e então incluído |
| PDF digitalizado | Adicionado a um Space | O texto é reconhecido no seu dispositivo, depois dividido e indexado |
| Captura de tela, gráfico, foto | Anexado a uma mensagem | A imagem vai para um modelo com capacidade de visão |
| Captura de tela, gráfico, foto | Adicionado a um Space | Qualquer texto encontrado é indexado; a imagem em si não é recuperável |
Ler documentos digitalizados (OCR)
OCR — reconhecimento óptico de caracteres — é a tecnologia que transforma uma imagem de texto de volta em texto. O Rephlo faz isso inteiramente no seu próprio computador. O documento nunca é enviado a lugar nenhum para ser reconhecido.
Ligar e desligar
Vá em Settings ▸ Privacy ▸ Read scanned documents on this device.
Vem ativado por padrão. Com a opção desligada, o Rephlo pula o reconhecimento e envia o arquivo direto ao modelo de IA — uma escolha razoável se você usa um modelo que lê documentos bem por conta própria e prefere não gastar o tempo de processamento local.
O download único
Na primeira vez que o OCR roda, o Rephlo baixa um pequeno modelo de reconhecimento de texto — cerca de 15 MB — e avisa quando está pronto. Isso acontece uma única vez, em segundo plano. Se o download falhar (normalmente um problema de conexão), o Rephlo informa; documentos digitalizados não serão lidos até que dê certo.
Escolher o idioma do documento
Sob a mesma configuração está Scanned document language. O padrão é Auto, que segue o idioma do aplicativo, então a maioria das pessoas nunca precisa mexer nisso.
Altere quando os documentos que você digitaliza estiverem escritos em um idioma diferente do da interface. Isso importa mais do que parece: reconhecer páginas em japonês ou coreano com um reconhecedor de alfabeto latino produz texto inutilizável, não apenas um pouco pior.
O reconhecimento é ajustado para estes idiomas:
| Idiomas | |
|---|---|
| Inglês, francês, espanhol, alemão, português | Reconhecedor latino compartilhado |
| Japonês, chinês (simplificado) | |
| Coreano | |
| Vietnamita |
Outros idiomas continuam funcionando da melhor forma possível, mas para eles a precisão não é garantida.
Documentos muito longos: o rótulo “Partial OCR”
Reconhecer uma página exige trabalho real da sua máquina, então a indexação é limitada a 200 páginas por documento. Se um documento digitalizado passar desse limite, o Rephlo indexa o texto que o arquivo já trazia e o marca no Space com o rótulo Partial OCR.
O rótulo existe para que você nunca seja induzido ao erro. Se você o vê, algumas páginas estão fora dos resultados de busca daquele documento — você está vendo parte dele, em vez de perder o resto silenciosamente. Para um documento digitalizado muito longo, a solução prática é dividi-lo em arquivos menores.
Imagens
Imagens funcionam de forma diferente de documentos, porque uma imagem pode carregar sentido que nenhuma extração de texto captura — a forma de um gráfico, o layout de um diagrama, o assunto de uma fotografia.
Se o seu modelo enxerga
Modelos com capacidade de visão recebem a própria imagem. O Rephlo não faz OCR nela nem a substitui por texto. Isso é proposital: a extração de texto jogaria fora exatamente a compreensão visual pela qual você anexou a imagem.
Se o seu modelo não enxerga
Nem todo modelo processa imagens — modelos on-device não processam, e muitos modelos de nuvem só de texto também não. Antes, anexar uma imagem a um desses significava que a imagem era descartada em silêncio e você recebia uma resposta confiante de um modelo que nunca viu a sua foto.
Agora, quando o modelo não enxerga, o Rephlo lê no seu dispositivo qualquer texto contido na imagem e repassa isso no lugar dela. Se a imagem não tiver nenhum texto legível — a foto de uma pessoa, por exemplo — você recebe um aviso visível em vez de silêncio, para que o modelo possa dizer que não conseguiu ver a imagem em vez de inventar uma.
Isso é um plano B, não uma melhoria. Texto reconhecido de um gráfico não é o mesmo que entender o gráfico. Se o detalhe visual importa, use um modelo com capacidade de visão.
Imagens e supressão de dados
Se você ativou Remove personal info before cloud requests, as imagens também estão cobertas.
O Rephlo analisa uma imagem anexada com OCR no dispositivo antes de ela ir para um modelo na nuvem. Se encontrar informações pessoais, a imagem é substituída pelo seu texto suprimido. Se não houver nada a suprimir, a imagem é enviada como está.
Tenha clareza sobre os limites disso. O OCR lê texto; ele não consegue captar rostos, assinaturas ou escrita à mão que não consiga ler. Para imagens em que esse risco não seja aceitável, ative Block send if redaction uncertain — o Rephlo reterá as imagens que não conseguir ler em vez de enviá-las.
Veja Privacidade e dados para todas as configurações de supressão.
Respostas rápidas
| Pergunta | Resposta |
|---|---|
| Adicionei um PDF digitalizado e a busca não acha nada | Confira Settings ▸ Privacy — “Read scanned documents on this device” está ligado, e o download único do modelo terminou? |
| O texto reconhecido está ilegível | Provavelmente o idioma do documento não corresponde. Defina Scanned document language explicitamente. |
| Meu documento mostra o rótulo “Partial OCR” | Ele passa do limite de indexação de 200 páginas. Divida-o em arquivos menores. |
| Anexei uma imagem e o modelo a ignorou | O modelo provavelmente não enxerga imagens. O Rephlo agora repassa qualquer texto encontrado; para compreensão visual, troque para um modelo com visão. |
| Meu documento digitalizado é enviado para o OCR? | Não. O reconhecimento acontece no seu computador. |
| Posso usar OCR com um modelo on-device? | Sim. O OCR independe do modelo que você usa — ele roda localmente de qualquer forma. |
Páginas relacionadas
- Spaces — o que é um Knowledge Space e como ele guarda documentos
- Gerenciar Spaces — adicionar e remover documentos
- Recuperação RAG e ajustes — como o Rephlo escolhe quais trechos usar
- Privacidade e dados — supressão, processamento local e o que fica no seu dispositivo
- Modelos no dispositivo x na nuvem — qual modelo usar, e por quê