Pular para o conteúdo principal

Como o Rephlo lê seus arquivos

Você pode entregar um arquivo ao Rephlo de várias formas — anexando a uma mensagem do chat, adicionando a um Knowledge Space ou colando uma captura de tela. O que acontece depois depende de que tipo de arquivo é e de onde você o colocou, e essas duas perguntas são fáceis de confundir.

Esta página responde a uma coisa só: entreguei um arquivo ao Rephlo — o que ele de fato fez com ele?

Em resumo

Todo arquivo que você entrega ao Rephlo segue um de três caminhos:

CaminhoQuando é usadoO que o Rephlo faz
TextoO arquivo já contém texto — um PDF comum, documento do Word, Markdown, CSV, códigoLê o texto direto do arquivo
OCRO arquivo é uma imagem de texto — um PDF digitalizado, a foto de uma página, um faxReconhece o texto no seu computador e depois trata como o caminho Texto
VisãoO arquivo é uma imagem de verdade — um gráfico, uma captura de tela, uma fotoEnvia a própria imagem para um modelo que consegue enxergar

A diferença entre os dois primeiros importa mais do que parece. Um PDF vindo de um scanner parece idêntico a um PDF gerado pelo Word quando você abre, mas para o software um é texto e o outro é uma fotografia de texto. Antes de o Rephlo fazer OCR, um PDF digitalizado era simplesmente uma imagem ilegível — não havia nada para pesquisar nem para citar.

A segunda pergunta: anexo ou Space?

O caminho decide como o arquivo é lido. Onde você o coloca decide quanto tempo ele dura e como é usado.

Anexar a uma mensagemAdicionar a um Knowledge Space
DuraçãoSó nesta conversaGuardado até você excluir
ReúsoAnexar de novo a cada vezDisponível para todo chat e comando que use o Space
Como é usadoInserido no prompt daquela mensagemDividido em trechos e indexado, para o Rephlo trazer só as partes relevantes
Bom paraUma pergunta pontual sobre um documentoMaterial de referência ao qual você volta — um manual, um conjunto de contratos, notas de pesquisa

Os dois seguem os mesmos três caminhos. Um PDF digitalizado passa por OCR quer você o anexe, quer o adicione a um Space; a diferença é o que acontece com o texto depois.

Por que os Spaces não enviam o documento inteiro. Um documento grande não cabe na janela de contexto de um modelo, e enfiá-lo lá seria lento e caro. Os Spaces indexam o texto para que o Rephlo possa extrair apenas os poucos trechos que realmente respondem à sua pergunta. Veja Recuperação RAG e ajustes.

Juntando as duas perguntas

O que você dá ao RephloOnde você colocaO que acontece
PDF com camada de texto, Word, Markdown, CSV, códigoAnexado a uma mensagemO texto é lido e incluído naquela mensagem
O mesmo arquivoAdicionado a um SpaceO texto é lido, dividido em trechos e indexado para recuperação
PDF digitalizado (sem camada de texto)Anexado a uma mensagemO texto é reconhecido no seu dispositivo e então incluído
PDF digitalizadoAdicionado a um SpaceO texto é reconhecido no seu dispositivo, depois dividido e indexado
Captura de tela, gráfico, fotoAnexado a uma mensagemA imagem vai para um modelo com capacidade de visão
Captura de tela, gráfico, fotoAdicionado a um SpaceQualquer texto encontrado é indexado; a imagem em si não é recuperável

Ler documentos digitalizados (OCR)

OCR — reconhecimento óptico de caracteres — é a tecnologia que transforma uma imagem de texto de volta em texto. O Rephlo faz isso inteiramente no seu próprio computador. O documento nunca é enviado a lugar nenhum para ser reconhecido.

Ligar e desligar

Vá em Settings ▸ Privacy ▸ Read scanned documents on this device.

Vem ativado por padrão. Com a opção desligada, o Rephlo pula o reconhecimento e envia o arquivo direto ao modelo de IA — uma escolha razoável se você usa um modelo que lê documentos bem por conta própria e prefere não gastar o tempo de processamento local.

O download único

Na primeira vez que o OCR roda, o Rephlo baixa um pequeno modelo de reconhecimento de texto — cerca de 15 MB — e avisa quando está pronto. Isso acontece uma única vez, em segundo plano. Se o download falhar (normalmente um problema de conexão), o Rephlo informa; documentos digitalizados não serão lidos até que dê certo.

Escolher o idioma do documento

Sob a mesma configuração está Scanned document language. O padrão é Auto, que segue o idioma do aplicativo, então a maioria das pessoas nunca precisa mexer nisso.

Altere quando os documentos que você digitaliza estiverem escritos em um idioma diferente do da interface. Isso importa mais do que parece: reconhecer páginas em japonês ou coreano com um reconhecedor de alfabeto latino produz texto inutilizável, não apenas um pouco pior.

O reconhecimento é ajustado para estes idiomas:

Idiomas
Inglês, francês, espanhol, alemão, portuguêsReconhecedor latino compartilhado
Japonês, chinês (simplificado)
Coreano
Vietnamita

Outros idiomas continuam funcionando da melhor forma possível, mas para eles a precisão não é garantida.

Documentos muito longos: o rótulo “Partial OCR”

Reconhecer uma página exige trabalho real da sua máquina, então a indexação é limitada a 200 páginas por documento. Se um documento digitalizado passar desse limite, o Rephlo indexa o texto que o arquivo já trazia e o marca no Space com o rótulo Partial OCR.

O rótulo existe para que você nunca seja induzido ao erro. Se você o vê, algumas páginas estão fora dos resultados de busca daquele documento — você está vendo parte dele, em vez de perder o resto silenciosamente. Para um documento digitalizado muito longo, a solução prática é dividi-lo em arquivos menores.

Imagens

Imagens funcionam de forma diferente de documentos, porque uma imagem pode carregar sentido que nenhuma extração de texto captura — a forma de um gráfico, o layout de um diagrama, o assunto de uma fotografia.

Se o seu modelo enxerga

Modelos com capacidade de visão recebem a própria imagem. O Rephlo não faz OCR nela nem a substitui por texto. Isso é proposital: a extração de texto jogaria fora exatamente a compreensão visual pela qual você anexou a imagem.

Se o seu modelo não enxerga

Nem todo modelo processa imagens — modelos on-device não processam, e muitos modelos de nuvem só de texto também não. Antes, anexar uma imagem a um desses significava que a imagem era descartada em silêncio e você recebia uma resposta confiante de um modelo que nunca viu a sua foto.

Agora, quando o modelo não enxerga, o Rephlo lê no seu dispositivo qualquer texto contido na imagem e repassa isso no lugar dela. Se a imagem não tiver nenhum texto legível — a foto de uma pessoa, por exemplo — você recebe um aviso visível em vez de silêncio, para que o modelo possa dizer que não conseguiu ver a imagem em vez de inventar uma.

Isso é um plano B, não uma melhoria. Texto reconhecido de um gráfico não é o mesmo que entender o gráfico. Se o detalhe visual importa, use um modelo com capacidade de visão.

Imagens e supressão de dados

Se você ativou Remove personal info before cloud requests, as imagens também estão cobertas.

O Rephlo analisa uma imagem anexada com OCR no dispositivo antes de ela ir para um modelo na nuvem. Se encontrar informações pessoais, a imagem é substituída pelo seu texto suprimido. Se não houver nada a suprimir, a imagem é enviada como está.

Tenha clareza sobre os limites disso. O OCR lê texto; ele não consegue captar rostos, assinaturas ou escrita à mão que não consiga ler. Para imagens em que esse risco não seja aceitável, ative Block send if redaction uncertain — o Rephlo reterá as imagens que não conseguir ler em vez de enviá-las.

Veja Privacidade e dados para todas as configurações de supressão.

Respostas rápidas

PerguntaResposta
Adicionei um PDF digitalizado e a busca não acha nadaConfira Settings ▸ Privacy — “Read scanned documents on this device” está ligado, e o download único do modelo terminou?
O texto reconhecido está ilegívelProvavelmente o idioma do documento não corresponde. Defina Scanned document language explicitamente.
Meu documento mostra o rótulo “Partial OCR”Ele passa do limite de indexação de 200 páginas. Divida-o em arquivos menores.
Anexei uma imagem e o modelo a ignorouO modelo provavelmente não enxerga imagens. O Rephlo agora repassa qualquer texto encontrado; para compreensão visual, troque para um modelo com visão.
Meu documento digitalizado é enviado para o OCR?Não. O reconhecimento acontece no seu computador.
Posso usar OCR com um modelo on-device?Sim. O OCR independe do modelo que você usa — ele roda localmente de qualquer forma.

Páginas relacionadas