본문으로 건너뛰기

고급 설정

파워 유저를 위해 Rephlo는 성능, AI 동작, 프롬프트 캐싱에 대한 더 세밀한 제어를 제공합니다. 기본 설정과 달리 이 설정들은 여러 위치에 흩어져 있습니다 — 일부는 Space별로, 일부는 제공자별 또는 Command별로, 일부는 앱 전체에 적용됩니다. 이 페이지에서는 각 설정이 어디에 있고 무엇을 하는지 정리합니다.

General 탭의 Performance 섹션 — Default Space Token Budget 및 채팅 브라우즈 윈도우 설정

토큰 예산

Default Space Token BudgetSettings → General → Performance에 있습니다. 이는 각 새로운 Space의 시작 토큰 한도를 설정합니다 — Space가 데이터 모드와 압축(compaction)이 관련되기 전까지 담을 수 있는 문서 콘텐츠의 양입니다.

  • 슬라이더 범위: 5,000~1,000,000 토큰(입력란에서는 1,000까지 낮출 수 있습니다).
  • 기본값: 100,000 토큰.
  • Space에만 적용됩니다. 각 Space는 이후 개별적으로 예산을 재조정할 수 있으며, 이 기본값을 변경해도 기존 Space는 절대 다시 작성되지 않습니다.

같은 섹션의 별도 채팅 브라우즈 윈도우 크기 설정은 채팅 사이드바에 한 번에 로드되는 최근 대화 수를 제어합니다(10~5,000개이며, 이전 채팅은 검색을 통해 계속 접근할 수 있습니다). 이는 데이터 한도가 아니라 성능 튜닝 항목입니다.

압축 전략

압축(Compaction)은 Space의 문서를 요약하여 토큰 사용량을 가볍게 유지합니다. 이는 Space가 (전역 토글이 아니라 Space별 데이터 모드 선택기로 지정하는) 🗜️ Compact 데이터 모드로 설정된 경우에 적용됩니다:

  • Space를 Compact로 전환하면 현재 파일을 요약할지 물어보며, 새로 추가된 파일은 Space 화면에서 압축할 수 있습니다. 요약 생성에는 credit이 사용되므로, Rephlo는 항상 먼저 credit 비용을 확인하도록 요청합니다 — 압축은 절대 조용히 진행되지 않습니다.
  • Credit 가드: 대형 Space(원본 총량 약 128,000토큰 이상)의 경우 Compact가 비활성화되고 압축이 차단되어 무료 Smart Search를 사용하도록 안내합니다. 단일 대형 파일(약 50,000토큰 이상)을 압축할 때는 추가 확인이 요청됩니다.
  • 압축할 때 Rephlo는 전략과 요약을 수행할 모델을 선택하도록 요청합니다. 모델 선택은 세션이 끝날 때까지 기억됩니다.

세 가지 전략은 정확도와 토큰 절감 사이에서 트레이드오프를 제공합니다:

전략하는 일적합한 경우
Conservative가장 많은 세부 정보를 유지하며 토큰 감소 폭이 가장 작습니다.토큰 절약보다 정확도가 더 중요할 때.
Balanced오래된 문서를 요약합니다 — 권장되는 중간 지점(기본값)입니다.대부분의 프로젝트.
Aggressive가장 최근의 핵심 내용만 유지하며, 토큰 절감이 최대이지만 세부 정보 손실이 더 큽니다.매우 긴 자료를 작은 컨텍스트 윈도우에 맞출 때.

Space가 어떤 모드를 사용하든, Rephlo는 Space별로 원본 토큰 총량과 압축 토큰 총량을 모두 추적하므로 압축의 효과를 확인할 수 있습니다. Smart Search와 Compact 데이터의 전체적인 비교, 그리고 압축이 온디바이스 검색(RAG)과 어떻게 상호작용하는지에 대한 자세한 내용은 데이터 모드와 압축을 참고하세요.

제공자 및 모델 튜닝

Temperature, 최대 응답 길이, 컨텍스트 윈도우는 (선택적으로 Command별 재정의가 가능한) 제공자별 및 모델별 설정이며, 단일 전역 컨트롤이 아닙니다. LLM Providers 탭에서 구성하세요. Providers제공자 관리를 참고하세요.

Temperature

응답이 얼마나 결정적인지 또는 창의적인지를 제어합니다. 기본값은 0.7(균형)입니다.

  • 0.0 – 0.3 — 정확하고 반복 가능함. 코드와 사실 확인에 적합.
  • ~0.7 — 균형 잡힘. 일반적인 글쓰기에 적합.
  • 1.0 이상 — 더 창의적이고 다양함. 브레인스토밍에 적합.

최대 응답 토큰(Max Response Tokens)

한 문장을 원했는데 에세이가 나오지 않도록 AI 응답의 길이를 제한합니다. 일반적인 기본값은 약 2,000입니다.

컨텍스트 윈도우 한도

BYOK/클라우드 및 Ollama 유형 제공자 모델의 경우, 이는 Add/Edit Model 대화 상자의 Context Length 필드입니다. 모델로 전송되는 텍스트 양을 제한합니다. 제공자의 기본값을 사용하려면 Auto로 두고, 유료 API에서 비용을 통제하려면 수동 한도를 설정하세요.

온디바이스 모델은 이 필드를 사용하지 않습니다 — 큐레이션된 온디바이스 카탈로그는 이를 무시합니다. 대신 컨텍스트 윈도우는 전용 Context Window 설정(Settings → LLM Providers → On-Device의 Model Memory 카드)이며, 범위는 2,048~262,144토큰, 기본값은 약 32,768입니다. 값을 높이면 RAM/VRAM을 더 많이 사용하고 활성 모델을 다시 로드합니다.

Command별 재정의

개별 Command는 전역 제공자, 모델, temperature, 최대 토큰을 재정의할 수 있습니다. Command 실행 시 Command 자체의 설정이 전역 제공자 기본값보다 우선합니다. 실행 워크플로를 참고하세요.

프롬프트 캐싱

Rephlo는 지원되는 제공자에서 프롬프트의 캐시된 접두사(prefix)를 재사용하여 비용과 지연 시간을 줄일 수 있습니다. 캐싱 설정은 제공자 구성과 함께 있습니다:

  • 프롬프트 캐싱 사용 — 지원되는 요청에 대해 캐싱을 켭니다(기본적으로 켜져 있음).
  • Cache TTL — 캐시 항목이 유지되는 시간:
    • Ephemeral — 약 5분.
    • Extended — 약 1시간.
  • 캐시 로깅 — 상세한 캐시 성능 정보를 기록합니다.

캐시 읽기는 큰 폭으로 할인되며, History 상세 보기에서는 요청별 캐시 생성 및 캐시 읽기 토큰을 표시하여 절감 효과를 확인할 수 있습니다. 캐싱은 요청에 캐시 가능한 접두사가 있을 때만 작동합니다(예: Space가 연결된 채팅). 전체 동작 방식은 프롬프트 캐싱을 참고하세요.

개발자 도구

이는 일상적인 설정이 아니라 문제 해결을 위한 보조 도구입니다:

  • 디버그 모드 — 앱의 로그 파일에 상세 로깅을 활성화합니다. 제공자 연결 문제를 진단할 때 유용합니다.
  • 프롬프트 검사(Prompt Inspection) — 제공자로 전송되는 정확한 JSON 페이로드를 History 상세 정보에서 확인할 수 있게 합니다.

환경 전환(Production / Staging / Local API 엔드포인트)은 디버그 빌드에서만 사용할 수 있으며 일반 사용자 경험의 일부가 아닙니다.


관련 문서: 데이터 모드와 압축 · Providers · 프롬프트 캐싱 · History & Audit