모델 및 추론
**제공업체(provider)**는 AI를 누가 실행하는지를 의미합니다(OpenAI, Anthropic, 여러분 자신의 컴퓨터, 또는 Rephlo). **모델(model)**은 텍스트를 생성하는 실제 엔진입니다. 하나의 제공업체는 보통 여러 모델을 제공하며, 각 명령어나 채팅을 실행할 모델을 여러분이 직접 선택합니다.
이 차이를 정확히 이해하는 것이 속도, 품질, 개인정보 보호, 비용을 조절하는 핵심입니다.
Rephlo가 AI를 실행하는 세 가지 방법
Rephlo는 세 가지 서로 다른 방식 중 하나로 요청을 처리할 수 있습니다. 여러분의 필요에 맞는 방식을 선택하면 됩니다.
| 실행 방식 | 실행 위치 | 비용 부담 | 필요한 플랜 | 적합한 경우 |
|---|---|---|---|---|
| Cloud(자신의 키 사용) | 제공업체의 서버(OpenAI, Anthropic, Google 등) | 사용자 본인 — 자신의 API 키로 제공업체가 직접 청구 | Pro 플랜 또는 perpetual license(영구 라이선스) | 최상위 모델, 완전한 제어권 |
| On-device(온디바이스) | 완전히 오프라인 상태인 사용자 본인 컴퓨터 | 아무도 없음 — credit도, 제공업체 청 구도 없음 | Pro 플랜 또는 perpetual license(영구 라이선스) | 개인정보 보호, 인터넷 불필요, 사용 비용 없음 |
| Rephlo-hosted(Rephlo 호스팅) | Rephlo의 추론 서비스 | 플랜에 포함된 Rephlo credit | 유료 플랜에 포함 | 편의성, 키 관리 불필요 |
플랜 제한(Plan gating): BYOK 제공업체(cloud 및 Ollama)와 온디바이스 모델은 모두 Pro 등급 기능입니다 — 사용하려면 활성 상태의 Pro 플랜(또는 그 이상) 또는 perpetual license가 필요합니다. 온디바이스 모델의 경우 이 제한은 다운로드와 실행 모두에 적용됩니다. 일단 잠금이 해제되면 사용 비용 없이 완전히 오프라인으로 실행됩니다. 유료 플랜에 포함된 Rephlo-hosted Dedicated API는 credit을 사용합니다.
1. Cloud 제공업체(자신의 키 사용)
이미 계정을 갖고 있는 제공업체의 API 키를 붙여넣습니다. Rephlo는 여덟 가지 BYOK 제공업체 유형을 지원합니다 — 일곱 개의 cloud 제공업체(OpenAI, Anthropic, Google, Groq, xAI(Grok), OpenRouter, 그리고 Azure OpenAI를 포함한 모든 OpenAI 호환 엔드포인트) 그리고 localhost:11434에서 여러분 자신의 컴퓨터에서 실행되는 로컬 Ollama입니다. 각 제공업체는 자체 모델 목록을 제공하며, 해당 제공업체가 현재 제공하는 모델(최신 GPT, Claude, Gemini 및 기타 모델) 중에서 선택할 수 있습니다.
사용량은 여러분의 키를 기준으로 제공업체가 청구합니다 — Rephlo는 이러한 호출에 대해 credit을 부과하지 않습니다. 제공업체 (Providers)에서 설정할 수 있습니다.
2. 온디바이스 모델(비공개, 무료, 오프라인)
Rephlo는 내장된 엔진을 통해 GGUF 모델 파일을 사용하여 오픈 모델을 여러분 자신의 컴퓨터에서 완전히 실행할 수 있습니다. 모델을 다운로드하면 다음과 같습니다.
- 인터넷 연결이 전혀 필요 없이 실행됩니다 — 어떤 서버로도 아무것도 전송되지 않습니다.
- credit이 들지 않고 실행 비용이 전혀 없습니다.
- 모든 것이 여러분의 컴퓨터에 완전히 비공개로 유지됩니다.
온디바이스 모델을 사용하려면 — 다운로드와 실행 모두 — BYOK cloud 및 Ollama 제공업체와 마찬가지로 활성 상태의 Pro 플랜(또는 그 이상) 또는 perpetual license가 필요합니다. 일단 잠금이 해제되면 credit 없이 완전히 오프라인으로 실행됩니다.
각 온디바이스 모델에는 알맞은 모델을 고를 수 있도록 메타데이터가 함께 제공됩니다: 다운로드 용량, **속도 등급(speed rating)**과 정확도 등급(accuracy rating)(1–10), 그리고 필요한 RAM(최소 및 권장 용량)입니다. 메모리가 제한적인 컴퓨터라면 더 작고 빠른 모델을, RAM에 여유가 있다면 더 크고 정확한 모델을 선택하세요.
일부 온디바이스 모델은 사고 모드(thinking mode)(최종 답변 전에 드러나는 추론 과정)를 지원합니다. Qwen이나 Gemma 같은 추론 지원 모델은 특수한 블록 안에 자신의 사고 과정을 생성하며, Rephlo는 이를 자동으로 감지하여 추론 과정을 올바르게 처리합니다.
온디바이스 모델 (On-Device Models)에서 이러한 모델을 탐색, 다운로드, 관리할 수 있습니다.
3. Rephlo 호스팅 추론(credit 사용)
키를 직접 관리하고 싶지 않다면, Rephlo는 자체 호스팅 서비스에서 여러분을 대신해 추론을 실행할 수 있습니다. 이러한 요청은 Rephlo 플랜의 credit을 소모합니다. 응답은 실시간으로 스트리밍되어 생성되는 즉시 출력을 확인할 수 있습니다.
credit, 잔액, 각 플랜에 포함된 내용은 웹에서 확인할 수 있습니다 — credit 및 사용량 (Credits & Usage)와 플랜 및 가격 (Plans & Pricing)을 참고하세요.