본문으로 건너뛰기

Rephlo가 파일을 읽는 방식

Rephlo에 파일을 건네는 방법은 여러 가지입니다 — 채팅 메시지에 첨부하거나, Knowledge Space에 추가하거나, 스크린샷을 붙여넣거나. 그다음에 무슨 일이 일어나는지는 그 파일이 어떤 종류인지어디에 두었는지에 달려 있는데, 이 둘은 헷갈리기 쉽습니다.

이 페이지는 딱 한 가지에 답합니다: Rephlo에 파일을 줬는데, 실제로 무슨 처리를 한 걸까?

짧게 말하면

Rephlo에 건넨 모든 파일은 세 갈래 길 중 하나를 지납니다.

경로언제 해당되나Rephlo가 하는 일
텍스트파일에 이미 텍스트가 들어 있음 — 일반 PDF, Word 문서, Markdown, CSV, 코드파일에서 텍스트를 바로 읽음
OCR파일이 텍스트를 찍은 그림 임 — 스캔한 PDF, 지면 사진, 팩스사용자의 컴퓨터에서 텍스트를 인식한 뒤, 텍스트 경로와 똑같이 처리
비전파일이 진짜 이미지임 — 차트, 스크린샷, 사진그림 자체를 볼 수 있는 모델로 전송

앞의 두 경로 차이는 들리는 것보다 훨씬 중요합니다. 스캐너에서 나온 PDF는 열어 보면 Word에서 만든 PDF와 똑같아 보이지만, 소프트웨어에게 하나는 텍스트이고 다른 하나는 텍스트를 찍은 사진입니다. Rephlo가 OCR을 하기 전에는 스캔한 PDF는 그저 읽을 수 없는 그림이었습니다 — 검색할 것도, 인용할 것도 없었죠.

두 번째 질문: 첨부인가 Space인가

경로는 파일을 어떻게 읽을지 를 결정합니다. 어디에 두는지는 얼마나 오래 남고 어떻게 쓰이는지 를 결정합니다.

메시지에 첨부Knowledge Space에 추가
유지 기간이 대화에서만삭제할 때까지 저장
재사용매번 다시 첨부해야 함해당 Space를 쓰는 모든 채팅과 명령에서 사용 가능
사용 방식그 메시지의 프롬프트에 삽입청크로 나눠 색인해, 관련된 부분만 가져옴
알맞은 용도문서 하나에 대한 일회성 질문계속 돌아와서 보는 참고 자료 — 안내서, 계약서 묶음, 연구 노트

둘 다 같은 세 경로를 지납니다. 스캔한 PDF는 첨부하든 Space에 넣든 OCR을 거치며, 차이는 그 뒤 텍스트가 어떻게 되느냐입니다.

Space가 문서 전체를 그냥 보내지 않는 이유. 큰 문서는 모델의 컨텍스트 창에 들어가지 않고, 억지로 밀어 넣으면 느리고 비쌉니다. Space는 텍스트를 색인해서, 질문에 실제로 답이 되는 몇 개 대목만 Rephlo가 꺼내 오도록 합니다. RAG 검색 및 튜닝을 참고하세요.

두 질문을 함께 놓고 보면

Rephlo에 주는 것어디에 두는가무슨 일이 일어나는가
텍스트 레이어가 있는 PDF, Word, Markdown, CSV, 코드메시지에 첨부텍스트를 읽어 그 메시지에 포함
같은 파일Space에 추가텍스트를 읽고, 청크로 나눠 검색용으로 색인
스캔한 PDF (텍스트 레이어 없음)메시지에 첨부기기에서 텍스트를 인식한 뒤 포함
스캔한 PDFSpace에 추가기기에서 텍스트를 인식한 뒤 청크로 나눠 색인
스크린샷, 차트, 사진메시지에 첨부그림이 비전 지원 모델로 전달
스크린샷, 차트, 사진Space에 추가그 안에서 찾은 텍스트를 색인. 그림 자체는 검색되지 않음

스캔 문서 읽기 (OCR)

OCR — 광학 문자 인식 — 은 텍스트의 그림을 다시 텍스트로 되돌리는 기술입니다. Rephlo는 이 작업을 전적으로 사용자의 컴퓨터에서 수행합니다. 문서가 인식을 위해 어딘가로 업로드되는 일은 없습니다.

켜고 끄기

Settings ▸ Privacy ▸ Read scanned documents on this device 로 이동하세요.

기본으로 켜져 있습니다. 끄면 Rephlo는 인식을 건너뛰고 파일을 그대로 AI 모델로 보냅니다 — 문서를 스스로 잘 읽는 모델을 쓰고 있고 로컬 처리 시간을 들이고 싶지 않다면 합리적인 선택입니다.

한 번뿐인 다운로드

OCR을 처음 실행할 때 Rephlo는 약 15 MB 의 작은 텍스트 인식 모델을 내려받고 준비되면 알려 줍니다. 이 과정은 백그라운드에서 한 번만 일어납니다. 다운로드가 실패하면(대개 연결 문제) Rephlo가 알려 주며, 성공할 때까지 스캔 문서는 읽히지 않습니다.

문서 언어 선택

같은 설정 아래에 Scanned document language 가 있습니다. 기본값은 Auto 로 앱 언어를 따르므로, 대부분은 손댈 일이 없습니다.

스캔하는 문서가 앱 인터페이스와 다른 언어 로 쓰였을 때 바꾸세요. 이건 보기보다 중요합니다. 일본어나 한국어 지면을 라틴 문자용 인식기로 읽으면 조금 나빠지는 정도가 아니라 아예 쓸 수 없는 텍스트가 나옵니다.

인식은 다음 언어에 맞춰 조정되어 있습니다.

언어
영어, 프랑스어, 스페인어, 독일어, 포르투갈어공용 라틴 문자 인식기
일본어, 중국어(간체)
한국어
베트남어

다른 언어도 최선을 다해 동작하지만 정확도는 보장되지 않습니다.

아주 긴 문서: ‘Partial OCR’ 배지

한 페이지를 인식하는 데는 실제 연산이 들기 때문에, 색인은 문서당 200페이지 로 제한됩니다. 스캔 문서가 이 한도를 넘으면 Rephlo는 파일이 원래 갖고 있던 텍스트를 색인하고 Space에서 Partial OCR 배지를 붙입니다.

이 배지는 사용자가 오해하지 않도록 존재합니다. 배지가 보인다면 그 문서의 일부 페이지가 검색 결과에서 빠져 있다는 뜻입니다 — 나머지를 조용히 놓치는 게 아니라, 일부를 보고 있는 것입니다. 아주 긴 스캔 문서라면 더 작은 파일로 나누는 것이 현실적인 해법입니다.

이미지

이미지는 문서와 다르게 동작합니다. 아무리 텍스트를 뽑아내도 담기지 않는 의미 — 차트의 형태, 도해의 배치, 사진의 피사체 — 를 담을 수 있기 때문입니다.

모델이 볼 수 있다면

비전 지원 모델은 그림 자체를 받습니다. Rephlo는 OCR을 돌리지 않고, 텍스트로 대체하지도 않습니다. 의도된 동작입니다. 텍스트 추출은 애초에 이미지를 첨부한 이유인 시각적 이해를 그대로 버리는 일이니까요.

모델이 볼 수 없다면

모든 모델이 이미지를 처리할 수 있는 건 아닙니다 — 온디바이스 모델은 못 하고, 텍스트 전용 클라우드 모델도 상당수 그렇습니다. 예전에는 그런 모델에 이미지를 첨부하면 이미지가 조용히 버려졌고, 사용자는 자기 그림을 한 번도 못 본 모델에게서 자신만만한 답변을 받았습니다.

이제는 모델이 볼 수 없을 때 Rephlo가 기기에서 이미지 속 텍스트를 읽어 그것을 대신 전달합니다. 읽을 수 있는 텍스트가 전혀 없는 이미지라면 — 예컨대 인물 사진 — 침묵 대신 눈에 보이는 안내가 표시되어, 모델이 보지도 못한 이미지를 지어내는 대신 볼 수 없었다고 말할 수 있습니다.

이는 개선이 아니라 대체 수단입니다. 차트에서 인식한 텍스트는 그 차트를 이해하는 것과 다릅니다. 시각적 세부가 중요하다면 비전 지원 모델을 쓰세요.

이미지와 마스킹

Remove personal info before cloud requests 를 켜 두었다면 이미지도 대상에 포함됩니다.

Rephlo는 첨부한 이미지가 클라우드 모델로 가기 전에 기기 내 OCR로 읽습니다. 개인 정보가 발견되면 이미지는 마스킹된 텍스트로 대체됩니다. 마스킹할 것이 없으면 이미지는 그대로 전송됩니다.

이 방식의 한계는 분명히 알아 두세요. OCR은 텍스트를 읽으므로 얼굴, 서명, 읽어내지 못한 손글씨는 잡아낼 수 없습니다. 그 위험을 받아들일 수 없는 이미지라면 Block send if redaction uncertain 을 켜세요. Rephlo가 읽지 못한 이미지를 보내지 않고 보류합니다.

마스킹 설정 전체는 개인정보 보호 및 데이터에서 확인하세요.

빠른 답변

질문답변
스캔 PDF를 추가했는데 검색에 안 나옵니다Settings ▸ Privacy 를 확인하세요. ‘Read scanned documents on this device’ 가 켜져 있나요? 한 번뿐인 모델 다운로드가 끝났나요?
인식된 텍스트가 깨져 나옵니다문서 언어가 맞지 않을 가능성이 큽니다. Scanned document language 를 직접 지정하세요.
문서에 ‘Partial OCR’ 배지가 있습니다200페이지 색인 한도를 넘었습니다. 더 작은 파일로 나누세요.
이미지를 첨부했는데 모델이 무시합니다그 모델은 이미지를 못 보는 것 같습니다. Rephlo가 찾은 텍스트는 전달하지만, 시각적 이해가 필요하면 비전 지원 모델로 바꾸세요.
스캔 문서가 OCR을 위해 업로드되나요?아니요. 인식은 사용자의 컴퓨터에서 이루어집니다.
온디바이스 모델로 OCR을 쓸 수 있나요?네. OCR은 어떤 모델을 쓰든 무관하게 로컬에서 실행됩니다.

관련 페이지