Chuyển tới nội dung chính

LLM Providers

Tab LLM Providers trong Settings là nơi bạn kết nối Rephlo với các mô hình AI cung cấp sức mạnh cho lệnh và cuộc trò chuyện của bạn. Bạn có thể dùng tài khoản riêng của mình tại các nhà cung cấp AI lớn, chạy mô hình cục bộ để đảm bảo quyền riêng tư trọn vẹn, hoặc để Rephlo quản lý mọi thứ giúp bạn mà không cần bất kỳ khóa nào.

Mở nó từ Settings → LLM Providers.

Tab LLM Providers trong Settings, hiển thị các tab con On-Device và BYOK Providers

Hai cách dùng nhà cung cấp

Chế độCách hoạt độngPhù hợp cho
Login (Dedicated API)Rephlo chạy suy luận thay bạn. Không cần quản lý khóa API — mức dùng được trừ từ credit trong gói của bạn.Bất kỳ ai muốn không cần thiết lập gì.
BYOK (Bring Your Own Key)Bạn thêm khóa API của riêng mình từ một nhà cung cấp (OpenAI, Anthropic, v.v.). Bạn trả tiền trực tiếp cho nhà cung cấp đó và dùng các mô hình mới nhất của họ.Người dùng nâng cao đã có sẵn tài khoản nhà cung cấp.

Bạn có thể kết hợp cả hai: giữ trạng thái đăng nhập cho việc dùng hằng ngày và thêm một nhà cung cấp BYOK cho một mô hình cụ thể. Để hiểu cách tính phí và credit hoạt động, xem Credit & Mức sử dụngGói & Giá.

Các nhà cung cấp được hỗ trợ

Rephlo hỗ trợ tám loại nhà cung cấp BYOK — bảy nhà cung cấp đám mây cộng với Ollama chạy cục bộ (hoạt động ngay trên máy của bạn tại localhost:11434) — cùng với các tùy chọn on-device và được quản lý:

Nhà cung cấpBạn cần cung cấp
OpenAIKhóa API (tùy chọn endpoint tùy chỉnh)
AnthropicKhóa API (tùy chọn base URL); hỗ trợ prompt caching
GoogleKhóa API (tùy chọn base URL)
GroqKhóa API
xAI (Grok)Khóa API (tùy chọn Live Search)
OpenRouterKhóa API (tùy chọn site URL/tên hiển thị trên dashboard OpenRouter)
OpenAI-CompatibleBase URL + khóa API + tên mô hình (Azure OpenAI, vLLM, LocalAI, LiteLLM, và tương tự)
OllamaBase URL (mặc định http://localhost:11434); khóa tùy chọn cho tìm kiếm web
On-DeviceKhông cần gì — mô hình chạy cục bộ. Xem Mô hình On-Device.
Dedicated APIKhông cần gì — được Rephlo quản lý khi bạn đăng nhập.

Azure OpenAI được kết nối thông qua loại OpenAI-Compatible — trỏ Base URL đến endpoint triển khai Azure của bạn — chứ không phải một mục riêng trong danh sách thêm nhà cung cấp.

Để có cái nhìn tổng quan về mối quan hệ giữa nhà cung cấp và mô hình, xem Nhà cung cấp (Providers)Mô hình & Suy luận (Models & Inference).

Thêm một nhà cung cấp

  1. Nhấp Add Provider.
  2. Chọn loại nhà cung cấp. Biểu mẫu sẽ tự điều chỉnh để chỉ hiện các trường mà nhà cung cấp đó cần.
  3. Nhập thông tin xác thực của bạn (ví dụ: khóa API, hoặc endpoint Azure + tên deployment).
  4. Tùy chọn: đặt một tên tùy chỉnh để dễ nhận diện nhà cung cấp trong danh sách.
  5. Nhấp Test Connection để xác nhận khóa hoạt động trước khi lưu.
  6. Nhấp Save.

Khóa của bạn được mã hóa

Khóa API và token được mã hóa trước khi lưu trữ trên máy của bạn. Chúng không bao giờ được ghi vào log và bị loại trừ khỏi các bản xuất dữ liệu. Hãy đối xử với khóa của bạn như mật khẩu — Rephlo giữ chúng cục bộ và được bảo vệ.

Mô hình

Mỗi nhà cung cấp cung cấp một hoặc nhiều mô hình (ví dụ: một nhà cung cấp OpenAI có thể cung cấp nhiều mô hình GPT). Bạn có thể thêm nhiều mô hình vào một nhà cung cấp duy nhất và đánh dấu một mô hình làm mặc định. Khi bạn chạy một lệnh hoặc trò chuyện, Rephlo sẽ dùng mô hình mặc định của nhà cung cấp đang hoạt động, trừ khi lệnh hoặc cuộc trò chuyện chỉ định một mô hình khác.

Trong bộ chọn mô hình, các mô hình Dedicated (Gateway) bị khóa mà gói của bạn không bao gồm sẽ hiển thị huy hiệu bậc (ví dụ PRO hoặc ENTERPRISE) cùng biểu tượng ổ khóa, để bạn dễ dàng nhận biết mô hình nào nằm trong phạm vi gói của mình. Khi bắt đầu một cuộc trò chuyện hoàn toàn mới, hoặc mở Chat mà chưa có mô hình nào được đặt cho cuộc trò chuyện đó, Rephlo sẽ tiếp tục dùng mô hình bạn đã dùng gần nhất trên toàn hệ thống — một bộ nhớ riêng biệt với lựa chọn mô hình theo từng cuộc trò chuyện.

Để tìm hiểu cách các tùy chỉnh mô hình theo từng lệnh và từng cuộc trò chuyện — cùng bộ nhớ "dùng gần nhất" toàn hệ thống này — hoạt động, xem Mô hình & Suy luận (Models & Inference).

Ẩn mô hình trực tuyến khỏi Rephlo Gateway

Cả hai tab con On-DeviceBYOK Providers đều có công tắc Hide online models from Rephlo Gateway (chú thích: "When enabled, hides online models from Rephlo Gateway"). Bật công tắc này sẽ ẩn các mô hình Dedicated (Gateway) khỏi mọi giao diện bộ chọn mô hình — thanh trạng thái, chat, và lớp phủ.

Kể từ v1.4.1, nếu mô hình đang hoạt động của bạn là một mô hình Gateway khi bạn bật công tắc này, Rephlo sẽ tự động chuyển bạn sang một mô hình on-device hoặc BYOK khả dụng thay vì âm thầm để bạn kẹt lại với mô hình vừa bị ẩn — hoặc vô hiệu hóa mô hình nếu không có lựa chọn nào khả dụng.

Năng lực

Mỗi cấu hình nhà cung cấp mang theo một tập hợp cờ năng lực cho Rephlo biết mô hình có thể làm gì:

  • Text generation — luôn bật.
  • Vision — phân tích hình ảnh (chỉ dành cho các mô hình có khả năng thị giác như GPT-4o, Claude, Gemini).
  • Function calling / tools — sử dụng công cụ có cấu trúc, bắt buộc để dùng connector MCP.
  • Long context — xử lý đầu vào rất lớn (>100K token).
  • Streaming — hiển thị phản hồi từng token một (mặc định bật).
  • Web searchThinking — khi mô hình hỗ trợ.

Các năng lực được xác thực dựa trên khả năng thực tế của mô hình tại thời điểm chạy, nên việc bật một cờ mà mô hình không hỗ trợ sẽ không làm hỏng gì cả — Rephlo đơn giản sẽ không thực hiện thao tác đó.

Tham số mô hình

Bạn có thể tinh chỉnh hành vi sinh nội dung theo từng mô hình:

  • Temperature — giá trị thấp cho kết quả chính xác và ổn định hơn; giá trị cao cho kết quả sáng tạo hơn.
  • Max tokens — giới hạn độ dài của mỗi phản hồi.
  • Top-p / top-k — các tùy chỉnh lấy mẫu bổ sung dành cho người dùng nâng cao.

Một lệnh có thể ghi đè các thiết lập này cho riêng lần chạy của nó, nhờ vậy bạn có thể giữ mặc định điềm tĩnh, temperature thấp trong khi để một lệnh động não nào đó phóng khoáng hơn.

Prompt caching của Anthropic

Các nhà cung cấp Anthropic hỗ trợ prompt caching, giúp giảm đáng kể chi phí cho ngữ cảnh lặp lại. Tính năng này được bật mặc định với cache "ephemeral" (khoảng 5 phút). Tùy chọn "extended" (khoảng 1 giờ) cũng có sẵn. Caching chỉ được kích hoạt khi một yêu cầu thực sự mang ngữ cảnh có thể cache — xem Prompt Caching để biết toàn bộ chi tiết.

Ollama và mô hình cục bộ

Với Ollama, hãy đặt base URL (mặc định http://localhost:11434). Trên các máy có cấu hình hạn chế, hãy chú ý cửa sổ ngữ cảnh để tránh hết bộ nhớ. Nếu bạn muốn để Rephlo tải và quản lý mô hình cục bộ thay bạn, hãy dùng danh mục Mô hình On-Device tích hợp sẵn thay thế.

Chỉnh sửa, kiểm tra và xóa bỏ

  • Edit bất kỳ nhà cung cấp nào để cập nhật khóa, thêm mô hình, hoặc thay đổi tham số.
  • Test Connection xác thực lại một nhà cung cấp sau khi xoay vòng khóa.
  • Remove một nhà cung cấp bạn không còn dùng nữa. Xóa một nhà cung cấp không xóa các lệnh của bạn — chúng sẽ chuyển về dùng nhà cung cấp đang hoạt động của bạn.

Thiết lập chung

Mỗi nhà cung cấp cũng có các tùy chọn dùng chung:

  • Request timeout (mặc định 60 giây)
  • Max retries cho các lỗi tạm thời (mặc định 3)
  • Streaming bật/tắt

Trang liên quan