Cấu hình nâng cao
Dành cho người dùng nâng cao, Rephlo cung cấp khả năng kiểm soát chi tiết hơn đối với hiệu năng, hành vi AI, và bộ nhớ đệm prompt (prompt caching). Không giống các thiết lập cơ bản, các tùy chọn này nằm rải rác ở vài nơi — một số theo từng Space, một số theo từng nhà cung cấp hoặc từng lệnh, và một số áp dụng toàn ứng dụng. Trang này chỉ ra từng tùy chọn nằm ở đâu và có tác dụng gì.

Ngân sách token (Token Budgets)
Default Space Token Budget nằm trong Settings → General → Performance. Nó đặt giới hạn token khởi đầu cho mỗi Space mới — lượng nội dung tài liệu mà Space có thể chứa trước khi chế độ dữ liệu và nén thông minh trở nên liên quan.
- Phạm vi thanh trượt: 5.000 đến 1.000.000 token (ô nhập cho phép xuống tới 1.000).
- Mặc định: 100.000 token.
- Chỉ áp dụng cho các Space mới. Mỗi Space có thể được đặt lại ngân sách riêng sau đó, và việc thay đổi giá trị mặc định này không bao giờ ghi đè lên các Space đã có sẵn.
Một mục kích thước cửa sổ duyệt chat riêng biệt trong cùng phần này kiểm soát số lượng cuộc trò chuyện gần đây được tải vào thanh bên chat cùng lúc (10–5.000; các cuộc trò chuyện cũ hơn vẫn có thể truy cập qua tìm kiếm). Đây là một nút điều chỉnh hiệu năng, không phải giới hạn dữ liệu.
Chiến lược nén thông minh
Nén thông minh (Compaction) giữ cho một Space nhẹ về token bằng cách tóm tắt tài liệu của nó. Cơ chế này áp dụng khi một Space được đặt ở chế độ d ữ liệu 🗜️ Compact (chọn bằng bộ chọn chế độ dữ liệu theo từng Space — không có công tắc toàn cục riêng biệt nào):
- Chuyển một Space sang Compact sẽ đề nghị tóm tắt các tệp hiện có, và các tệp mới thêm vào có thể được nén ngay từ khung xem Space. Tạo bản tóm tắt sẽ tốn credit, vì vậy Rephlo luôn yêu cầu bạn xác nhận chi phí credit trước — nén thông minh không bao giờ diễn ra âm thầm.
- Rào chắn credit: đối với một Space lớn (tổng token thô ≈ 128.000 token trở lên), chế độ Compact bị vô hiệu hóa và việc nén bị chặn, hướng bạn đến Smart Search miễn phí. Nén một tệp đơn lẻ lớn (≈ 50.000 token trở lên) sẽ yêu cầu xác nhận bổ sung.
- Khi bạn nén, Rephlo yêu cầu bạn chọn một chiến lược và mô hình nào sẽ thực hiện việc tóm tắt. Lựa chọn mô hình sẽ được ghi nhớ cho phần còn lại của phiên làm việc.
Ba chiến lược đánh đổi giữa độ trung thực và mức tiết kiệm token:
| Chiến lược | Cơ chế hoạt động | Phù hợp nhất cho |
|---|---|---|
| Conservative | Giữ lại nhiều chi tiết nhất; mức giảm token nhỏ nhất. | Khi độ chính xác quan trọng hơn việc tiết kiệm token. |
| Balanced | Tóm tắt các tài liệu cũ hơn — mức cân bằng được khuyến nghị (mặc định). | Phần lớn các dự án. |
| Aggressive | Chỉ giữ lại những điểm chính gần đây nhất; tiết kiệm tối đa, mất chi tiết nhiều hơn. | Nhồi nhét tài liệu rất dài vào một cửa sổ ngữ cảnh nhỏ. |
Dù một Space đang dùng chế độ nào, Rephlo vẫn theo dõi cả tổng token thô lẫn tổng token đã nén cho từng Space, để bạn có thể thấy rõ tác dụng của việc nén. Để hiểu toàn cảnh về Smart Search so với dữ liệu Compact và cách việc nén tương tác với truy xuất trên thiết bị (RAG), xem Chế độ dữ liệu & Nén thông minh.
Tinh chỉnh nhà cung cấp & mô hình
Temperature, độ dài phản hồi tối đa, và cửa sổ ngữ cảnh là các thiết lập theo từng nhà cung cấp và từng mô hình (kèm tùy chọn ghi đè theo từng lệnh) — chúng không phải một điều khiển toàn cục duy nhất. Cấu hình các thiết lập này trong tab LLM Providers; xem Providers và Quản lý nhà cung cấp.
Temperature
Kiểm soát mức độ xác định (deterministic) so với sáng tạo của phản hồi. Mặc định là 0.7 (cân bằng).
- 0.0 – 0.3 — chính xác và lặp lại được. Phù hợp cho mã ngu ồn và dữ kiện.
- ~0.7 — cân bằng. Phù hợp cho viết lách nói chung.
- 1.0+ — sáng tạo và đa dạng hơn. Phù hợp cho động não (brainstorming).
Max Response Tokens
Giới hạn độ dài phản hồi của AI để nó không viết cả một bài luận khi bạn chỉ cần một câu. Giá trị khoảng 2.000 là mức mặc định điển hình.
Giới hạn cửa sổ ngữ cảnh (Context Window Limit)
Đối với các mô hình từ nhà cung cấp BYOK/đám mây và kiểu Ollama, đây là trường Context Length trong hộp thoại Add/Edit Model. Nó giới hạn lượng văn bản được gửi đến mô hình. Để ở Auto để dùng giá trị mặc định của nhà cung cấp, hoặc đặt một giới hạn thủ công để kiểm soát chi phí trên các API trả phí.
Mô hình trên thiết bị (on-device) không dùng trường này — danh mục on-device được tuyển chọn sẵn bỏ qua nó. Thay vào đó, cửa sổ ngữ cảnh của các mô hình này là một thiết lập Context Window riêng (Settings → LLM Providers → On-Device, trong thẻ Model Memory): phạm vi từ 2.048–262.144 token, mặc định ~32.768. Tăng giá trị này sẽ dùng nhiều RAM/VRAM hơn và tải lại mô hình đang hoạt động.
Ghi đè theo từng lệnh
Từng lệnh riêng lẻ có thể ghi đè nhà cung cấp, mô hình, temperature, và số token tối đa toàn cục. Thiết lập riêng của một lệnh sẽ được ưu tiên hơn giá trị mặc định của nhà cung cấp toàn cục khi lệnh đó chạy. Xem Quy trình thực thi.
Bộ nhớ đệm Prompt (Prompt Caching)
Rephlo có thể tái sử dụng một tiền tố (prefix) đã lưu trong bộ nhớ đệm của prompt để giảm chi phí và độ trễ trên các nhà cung cấp được hỗ trợ. Các thiết lập bộ nhớ đệm nằm cùng cấu hình nhà cung cấp:
- Enable prompt caching — bật bộ nhớ đệm cho các yêu cầu được hỗ trợ (mặc định bật).
- Cache TTL — thời gian một mục trong bộ nhớ đệm tồn tại:
- Ephemeral — khoảng 5 phút.
- Extended — khoảng 1 giờ.
- Cache logging — ghi lại thông tin chi tiết về hiệu năng bộ nhớ đệm.
Các lượt đọc từ bộ nhớ đệm được giảm giá đáng kể, và khung xem chi tiết trong History hiển thị số token tạo bộ nhớ đệm và đọc từ bộ nhớ đệm cho từng yêu cầu để bạn thấy rõ mức tiết kiệm. Bộ nhớ đệm chỉ kích hoạt khi yêu cầu có một tiền tố có thể lưu đệm (ví dụ: một cuộc chat có đính kèm một Space). Để biết đầy đủ cơ chế hoạt động, xem Bộ nhớ đệm Prompt.
Công cụ dành cho nhà phát triển
Đây là các công cụ hỗ trợ khắc phục sự cố, không phải thiết lập dùng hàng ngày:
- Debug Mode — bật ghi log chi tiết vào tệp log của ứng dụng. Hữu ích khi chẩn đoán sự cố kết nối nhà cung cấp.
- Prompt Inspection — hiển thị nguyên văn payload JSON được gửi đến nhà cung cấp, có thể xem trong phần chi tiết của History.
Chuyển đổi môi trường (điểm cuối API Production / Staging / Local) chỉ khả dụng trong các bản build debug và không phải một phần của trải nghiệm người dùng thông thường.
Liên quan: Chế độ dữ liệu & Nén thông minh · Providers · Bộ nhớ đệm Prompt · Lịch sử & Kiểm toán