モデルと推論
プロバイダーとは、AIを実行する主体(OpenAI、Anthropic、あなた自身のマシン、またはRephlo)です。モデルとは、実際にテキストを生成するエンジンです。1つのプロバイダーは通常複数のモデルを提供しており、コマンドやチャットごとにどのモデルを使うかを選択できます。
この違いを正しく理解することが、速度・品質・プライバシー・コストをコントロールするための鍵です。
RephloがAIを実行する3つの方法
Rephloは3つの異なる方法のいずれかでリクエストを実行できます。ニーズに合った方法を選択してください。
| AIの実行方法 | 実行場所 | 支払い者 | 必要なプラン | 最適な用途 |
|---|---|---|---|---|
| クラウド(自分のキーを使用) | プロバイダーのサーバー(OpenAI、Anthropic、Googleなど) | あなた——自分のAPIキーでプロバイダーから直接請求 | Proプランまたはパーペチュアルライ センス | トップクラスのモデル、完全なコントロール |
| オンデバイス | あなた自身のコンピュータ、完全オフライン | 誰も支払わない——creditもプロバイダー請求もなし | Proプランまたはパーペチュアルライセンス | プライバシー、インターネット不要、使用コストなし |
| Rephloホスト | Rephloの推論サービス | プランのRephlocredit | 有料プランに含まれる | 利便性、キー管理不要 |
プランによる制限: BYOK(自分のキーを持ち込む)プロバイダー(クラウドおよびOllama)とオンデバイスモデルはProティア機能です——利用にはアクティブなProプラン(またはそれ以上)、あるいはパーペチュアルライセンスが必要です。オンデバイスモデルの場合、この制限はダウンロードと実行の両方に適用されます。解除されれば、使用コストなし・完全オフラインで実行できます。RephloホストのDedicated APIは有料プランに含まれ、creditを消費します。
1. クラウドプロバイダー(自分のキーを持ち込む)
すでにアカウントを持っているプロバイダーのAPIキーを貼り付けま す。Rephloは8種類のBYOKプロバイダータイプに対応しています——7つのクラウドベンダー(OpenAI、Anthropic、Google、Groq、xAI(Grok)、OpenRouter、および任意のOpenAI互換エンドポイント——Azure OpenAIを含む)に加え、自分のマシン上の localhost:11434 で動作するローカルのOllamaです。それぞれ独自のモデル一覧を提供しており、そのプロバイダーが現在提供しているモデル(最新のGPT、Claude、Gemini、その他のモデル)から選択できます。
使用料はプロバイダーがあなたのキーに対して請求します——Rephloはこれらの呼び出しに対してcreditを請求することはありません。設定はProvidersから行います。
2. オンデバイスモデル(プライベート・無料・オフライン)
Rephloは、組み込みのエンジンを介してGGUFモデルファイルを使用し、完全にあなた自身のコンピュータ上でオープンモデルを実行できます。モデルをダウンロードすると、次のようになります。
- インターネット接続ゼロで動作します——どのサーバーにも何も送信されません。
- 実行にcreditを使わず、コストもかかりません。
- すべてがあなたのマシン上で完全 にプライベートなまま保たれます。
オンデバイスモデルの利用——ダウンロードと実行の両方——には、BYOKのクラウドおよびOllamaプロバイダーと同様に、アクティブなProプラン(またはそれ以上)、あるいはパーペチュアルライセンスが必要です。解除後はcredit不要・完全オフラインで実行されます。
各オンデバイスモデルには、適切なモデルを選べるようメタデータが付随しています。ダウンロードサイズ、速度評価と精度評価(1〜10)、そして必要なRAM(最小値と推奨値)です。マシンのメモリに余裕がない場合は小さく高速なモデルを、RAMに余裕がある場合はより大きく高精度なモデルを選んでください。
一部のオンデバイスモデルは思考モード(最終回答の前に推論過程が見える機能)に対応しています。QwenやGemmaなどの推論対応モデルは、思考内容を専用のブロックとして出力します。Rephloはこれを自動的に検出し、推論内容が正しく処理されるようにします。
これらの参照・ダウンロード・管理はOn-Device Modelsから行えます。
3. Rephloホスト推論(creditを使用)
キーを一切管理したくない場合、Rephloは自社のホスト型サービス上で推論を実行できます。これらのリクエストはあなたのRephloプランからcreditを消費します。応答はリアルタイムでストリーム配信されるため、生成される様子をそのまま確認できます。
credit、残高、各プランに含まれる内容についてはウェブサイトをご覧ください——Credits & UsageとPlans & Pricingを参照してください。
モデルの選択方法
Rephloは明確な優先順位に基づいて使用するモデルを決定します。
- コマンド自体のモデルオーバーライド(コマンドが指定している場合)。
- 現在の会話に選択されているモデル(チャットの場合)。これは会話ごとに記憶されます。
- アクティブなプロバイダーのデフォルトモデル——フォールバックとして使用されます。たとえば、クイックコンテキストメニュー(オーバーレイ)のアクションは、コマンドがオーバーライドしない限り、アクティブなプロバイダーのデフォルトモデルで実行されます。
新規開始時: 全く新しいチャット——または、その会話にまだモデルが設定されていない状態でサイドバーからChatを開いた場合——は、Rephlo全体で最後に使用したモデルを再開します。このグローバルな直近使用モデルの記憶は、会話ごとの記憶とは別のものです。ある会話の中でモデル を切り替えると、その会話は自分自身の選択を独立して記憶します。
モデルをその場で切り替える
チャットでは、ツールバーの統合モデルセレクタから現在の会話のモデルを変更できます。選択内容はその会話について記憶されるため、再度開いても同じモデルが維持されます。詳細はChat & Conversationsを参照してください。
セレクタには、あなたのプランに含まれるモデルも表示されます。ロックされている、またはアクセスできないDedicated APIモデルには、ティアバッジ(PROやENTERPRISEなど)とロックアイコンが表示されるため、プランで利用可能なものが一目でわかります。
Rephloは、あなたのプランがもはや含んでいないモデルに気付かないまま留まらせることはありません——アクティブなモデルがアクセス不可になった場合(たとえばプランのダウングレード後など)、自動的にアクセス可能なモデルに切り替えます。
モデルパラメータ
使用するモデルに加えて、temperature(ランダム性)、max tokens(応答の長さ)、top-p、top-kとい ったパラメータでその挙動を調整できます。すべてのモデルがすべてのパラメータに対応しているわけではなく、制限を課しているモデルもあります——Rephloは各モデルの制約に合わせて設定を検証・調整するため、ルールを覚えておく必要はありません。これらはモデルパラメータエディタとAdvanced Configurationで確認できます。
プロンプトキャッシングでコストを下げる
**Anthropic(Claude)**を、多数のリクエストにわたって同じ長い指示や文書といった繰り返しのコンテキストで使用する場合、Rephloはそのコンテキストを毎回再送信する代わりに、キャッシュしたコピーを再利用できます。これはデフォルトで有効になっており、繰り返し行う作業のコストを大幅に削減できます。他の一部のクラウドプロバイダーは、繰り返しのコンテキストを自社側で自動的にキャッシュしており、オンデバイスモデルはキャッシュを一切行いません。詳細はPrompt Cachingをご覧ください。
適切な方法を選ぶ
- 最高品質を求めており、すでにAPIキーを 持っている場合は? クラウドプロバイダー(BYOK——Proティア機能)を使用してください。
- プライバシーやオフライン作業を最も重視する場合は? オンデバイスモデルを使用してください——実行は無料・ローカルです(利用にはProティア機能が必要です)。
- キーの管理を一切したくない場合は? Rephloホスト推論を使用してください(有料プランに含まれ、creditを使用します)。