Rephlo가 파일을 읽는 방식
Rephlo에 파일을 건네는 방법은 여러 가지입니다 — 채팅 메시지에 첨부하거나, Knowledge Space에 추가하거나, 스크린샷을 붙여넣거나. 그다음에 무슨 일이 일어나는지는 그 파일이 어떤 종류인지와 어디에 두었는지에 달려 있는데, 이 둘은 헷갈리기 쉽습니다.
이 페이지는 딱 한 가지에 답합니다: Rephlo에 파일을 줬는데, 실제로 무슨 처리를 한 걸까?
짧게 말하면
Rephlo에 건넨 모든 파일은 세 갈래 길 중 하나를 지납니다.
| 경로 | 언제 해당되나 | Rephlo가 하는 일 |
|---|---|---|
| 텍스트 | 파일에 이미 텍스트가 들어 있음 — 일반 PDF, Word 문서, Markdown, CSV, 코드 | 파일에서 텍스트를 바로 읽음 |
| OCR | 파일이 텍스트를 찍은 그림 임 — 스캔한 PDF, 지면 사진, 팩스 | 사용자의 컴퓨터에서 텍스트를 인식한 뒤, 텍스트 경로와 똑같이 처리 |
| 비전 | 파일이 진짜 이미지 임 — 차트, 스크린샷, 사진 | 그림 자체를 볼 수 있는 모델로 전송 |
앞의 두 경로 차이는 들리는 것보다 훨씬 중요합니다. 스캐너에서 나온 PDF는 열어 보면 Word에서 만든 PDF와 똑같아 보이지만, 소프트웨어에게 하나는 텍스트이고 다른 하나는 텍스트를 찍은 사진입니다. Rephlo가 OCR을 하기 전에는 스캔한 PDF는 그저 읽을 수 없는 그림이었습니다 — 검색할 것도, 인용할 것도 없었죠.
두 번째 질문: 첨부인가 Space인가
경로는 파일을 어떻게 읽을지 를 결정합니다. 어디에 두는지는 얼마나 오래 남고 어떻게 쓰이는지 를 결정합니다.
| 메시지에 첨부 | Knowledge Space에 추가 | |
|---|---|---|
| 유지 기간 | 이 대화에서만 | 삭제할 때까지 저장 |
| 재사용 | 매번 다시 첨부해야 함 | 해당 Space를 쓰는 모든 채팅과 명령에서 사용 가능 |
| 사용 방식 | 그 메시지의 프롬프트에 삽입 | 청크로 나눠 색인해, 관련된 부분만 가져옴 |
| 알맞은 용도 | 문서 하나에 대한 일회성 질문 | 계속 돌아와서 보는 참고 자료 — 안내서, 계약서 묶음, 연구 노트 |
둘 다 같은 세 경로를 지납니다. 스캔한 PDF는 첨부하든 Space에 넣든 OCR을 거치며, 차이는 그 뒤 텍스트가 어떻게 되느냐입니다.
Space가 문서 전체를 그냥 보내지 않는 이유. 큰 문서는 모델의 컨텍스트 창에 들어가지 않고, 억지로 밀어 넣으면 느리고 비쌉니다. Space는 텍스트를 색인해서, 질문에 실제로 답이 되는 몇 개 대목만 Rephlo가 꺼내 오도록 합니다. RAG 검색 및 튜닝을 참고하세요.
두 질문을 함께 놓고 보면
| Rephlo에 주는 것 | 어디에 두는가 | 무슨 일이 일어나는가 |
|---|---|---|
| 텍스트 레이어가 있는 PDF, Word, Markdown, CSV, 코드 | 메시지에 첨부 | 텍스트를 읽어 그 메시지에 포함 |
| 같은 파일 | Space에 추가 | 텍스트를 읽고, 청크로 나눠 검색용으로 색인 |
| 스캔한 PDF (텍스트 레이어 없음) | 메시지에 첨부 | 기기에서 텍스트를 인식한 뒤 포함 |
| 스캔한 PDF | Space에 추가 | 기기에서 텍스트를 인식한 뒤 청크로 나눠 색인 |
| 스크린샷, 차트, 사진 | 메시지에 첨부 | 그림이 비전 지원 모델로 전달 |
| 스크린샷, 차트, 사진 | Space에 추가 | 그 안에서 찾은 텍스트를 색인. 그림 자체는 검색되지 않음 |
스캔 문서 읽기 (OCR)
OCR — 광학 문자 인식 — 은 텍스트의 그림을 다시 텍스트로 되돌리는 기술입니다. Rephlo는 이 작업을 전적으로 사용자의 컴퓨터에서 수행합니다. 문서가 인식을 위해 어딘가로 업로드되는 일은 없습니다.
켜고 끄기
Settings ▸ Privacy ▸ Read scanned documents on this device 로 이동하세요.
기본으로 켜져 있습니다. 끄면 Rephlo는 인식을 건너뛰고 파일을 그대로 AI 모델로 보냅니다 — 문서를 스스로 잘 읽는 모델을 쓰고 있고 로컬 처리 시간을 들이고 싶지 않다면 합리적인 선택입니다.
한 번뿐인 다운로드
OCR을 처음 실행할 때 Rephlo는 약 15 MB 의 작은 텍스트 인식 모델을 내려받고 준비되면 알려 줍니다. 이 과정은 백그라운드에서 한 번만 일어납니다. 다운로드가 실패하면(대개 연결 문제) Rephlo가 알려 주며, 성공할 때까지 스캔 문서는 읽히지 않습니다.
문서 언어 선택
같은 설정 아래에 Scanned document language 가 있습니다. 기본값은 Auto 로 앱 언어를 따르므로, 대부분은 손댈 일이 없습니다.
스캔하는 문서가 앱 인터페이스와 다른 언어 로 쓰였을 때 바꾸세요. 이건 보기보다 중요합니다. 일본어나 한국어 지면을 라틴 문자용 인식기로 읽으면 조금 나빠지는 정도가 아니라 아예 쓸 수 없는 텍스트가 나옵니다.
인식은 다음 언어에 맞춰 조정되어 있습니다.
| 언어 | |
|---|---|
| 영어, 프랑스어, 스페인어, 독일어, 포르투갈어 | 공용 라틴 문자 인식기 |
| 일본어, 중국어(간체) | |
| 한국어 | |
| 베트남어 |
다른 언어도 최선을 다해 동작하지만 정확도는 보장되지 않습니다.
아주 긴 문서: ‘Partial OCR’ 배지
한 페이지를 인식하는 데는 실제 연산이 들기 때문에, 색인은 문서당 200페이지 로 제한됩니다. 스캔 문서가 이 한도를 넘으면 Rephlo는 파일이 원래 갖고 있던 텍스트를 색인하고 Space에서 Partial OCR 배지를 붙입니다.
이 배지는 사용자가 오해하지 않도록 존재합니다. 배지가 보인다면 그 문서의 일부 페이지가 검색 결과에서 빠져 있다는 뜻입니다 — 나머지를 조용히 놓치는 게 아니라, 일부를 보고 있는 것입니다. 아주 긴 스캔 문서라면 더 작은 파일로 나누는 것이 현실적인 해법입니다.
이미지
이미지는 문서와 다르게 동작합니다. 아무리 텍스트를 뽑아내도 담기지 않는 의미 — 차트의 형태, 도해의 배치, 사진의 피사체 — 를 담을 수 있기 때문입니다.
모델이 볼 수 있다면
비전 지원 모델은 그림 자체를 받습니다. Rephlo는 OCR을 돌리지 않고, 텍스트로 대체하지도 않습니다. 의도된 동작입니다. 텍스트 추출은 애초에 이미지를 첨부한 이유인 시각적 이해를 그대로 버리는 일이니까요.
모델이 볼 수 없다면
모든 모델이 이미지를 처리할 수 있는 건 아닙니다 — 온디바이스 모델은 못 하고, 텍스트 전용 클라우드 모델도 상당수 그렇습니다. 예전에는 그런 모델에 이미지를 첨부하면 이미지가 조용히 버려졌고, 사용자는 자기 그림을 한 번도 못 본 모델에게서 자신만만한 답변을 받았습니다.
이제는 모델이 볼 수 없을 때 Rephlo가 기기에서 이미지 속 텍스트를 읽어 그것을 대신 전달합니다. 읽을 수 있는 텍스트가 전혀 없는 이미지라면 — 예컨대 인물 사진 — 침묵 대신 눈에 보이는 안내가 표시되어, 모델이 보지도 못한 이미지를 지어내는 대신 볼 수 없었다고 말할 수 있습니다.
이는 개선이 아니라 대체 수단입니다. 차트에서 인식한 텍스트는 그 차트를 이해하는 것과 다릅니다. 시각적 세부가 중요하다면 비전 지원 모델을 쓰세요.
이미지와 마스킹
Remove personal info before cloud requests 를 켜 두었다면 이미지도 대상에 포함됩니다.
Rephlo는 첨부한 이미지가 클라우드 모델로 가기 전에 기기 내 OCR로 읽습니다. 개인 정보가 발견되면 이미지는 마스킹된 텍스트로 대체됩니다. 마스킹할 것이 없으면 이미지는 그대로 전송됩니다.
이 방식의 한계는 분명히 알아 두세요. OCR은 텍스트를 읽으므로 얼굴, 서명, 읽어내지 못한 손글씨는 잡아낼 수 없습니다. 그 위험을 받아들일 수 없는 이미지라면 Block send if redaction uncertain 을 켜세요. Rephlo가 읽지 못한 이미지를 보내지 않고 보류합니다.
마스킹 설정 전체는 개인정보 보호 및 데이터에서 확인하세요.
빠른 답변
| 질문 | 답변 |
|---|---|
| 스캔 PDF를 추가했는데 검색에 안 나옵니다 | Settings ▸ Privacy 를 확인하세요. ‘Read scanned documents on this device’ 가 켜져 있나요? 한 번뿐인 모델 다운로드가 끝났나요? |
| 인식된 텍스트가 깨져 나옵니다 | 문서 언어가 맞지 않을 가능성이 큽니다. Scanned document language 를 직접 지정하세요. |
| 문서에 ‘Partial OCR’ 배지가 있습니다 | 200페이지 색인 한도를 넘었습니다. 더 작은 파일로 나누세요. |
| 이미지를 첨부했는데 모델이 무시합니다 | 그 모델은 이미지를 못 보는 것 같습니다. Rephlo가 찾은 텍스트는 전달하지만, 시각적 이해가 필요하면 비전 지원 모델로 바꾸세요. |
| 스캔 문서가 OCR을 위해 업로드되나요? | 아니요. 인식은 사용자의 컴퓨터에서 이루어집니다. |
| 온디바이스 모델로 OCR을 쓸 수 있나요? | 네. OCR은 어떤 모델을 쓰든 무관하게 로컬에서 실행됩니다. |
관련 페이지
- Spaces — Knowledge Space란 무엇이고 문서를 어떻게 저장하는가
- Space 관리 — 문서 추가와 삭제
- RAG 검색 및 튜닝 — Rephlo가 어떤 대목을 쓸지 고르는 방식
- 개인정보 보호 및 데이터 — 마스킹, 로컬 처리, 기기에 남는 것
- 온디바이스 모델과 클라우드 모델 — 어떤 모델을 쓸지, 그리고 그 이유