Feat : Gitbook
This commit is contained in:
537
gitbook/content/zh-CN/features/combos.md
Normal file
537
gitbook/content/zh-CN/features/combos.md
Normal file
@@ -0,0 +1,537 @@
|
||||
# 组合(Combos)- 自定义回退链
|
||||
|
||||
创建自定义的模型组合并自动回退。组合让你根据成本、质量和可用性定义自己的路由策略。
|
||||
|
||||
---
|
||||
|
||||
## 什么是组合?
|
||||
|
||||
组合是你在仪表盘中创建的 **自定义回退链**。它不是单一模型,而是定义一组顺序模型,由 9Router 依次尝试。
|
||||
|
||||
**示例:**
|
||||
```
|
||||
组合名: premium-coding
|
||||
模型:
|
||||
1. cc/claude-opus-4-5-20251101 (首选)
|
||||
2. glm/glm-4.7 (#1 配额耗尽时)
|
||||
3. minimax/MiniMax-M2.1 (#2 配额耗尽时)
|
||||
```
|
||||
|
||||
**CLI 中使用:**
|
||||
```
|
||||
Model: premium-coding
|
||||
```
|
||||
|
||||
9Router 会按顺序自动尝试每个模型,直到成功为止。
|
||||
|
||||
---
|
||||
|
||||
## 为什么使用组合?
|
||||
|
||||
### 1. 最大化订阅价值
|
||||
```
|
||||
cc/claude-opus → glm/glm-4.7 → if/kimi-k2-thinking
|
||||
|
||||
→ 先用订阅,低价备用,免费应急
|
||||
→ 充分利用你已付费的订阅
|
||||
```
|
||||
|
||||
### 2. 最小化成本
|
||||
```
|
||||
glm/glm-4.7 → minimax/MiniMax-M2.1 → if/kimi-k2-thinking
|
||||
|
||||
→ 从最便宜的付费选项开始(每 1M $0.60)
|
||||
→ 回退到更便宜的(每 1M $0.20)
|
||||
→ 应急免费层
|
||||
→ 总成本: 约 $5-10/月,而 ChatGPT API 需要 $2000
|
||||
```
|
||||
|
||||
### 3. 保障 24/7 可用
|
||||
```
|
||||
cc/claude-opus → cx/gpt-5.2-codex → glm/glm-4.7 → if/kimi-k2-thinking
|
||||
|
||||
→ 末尾总是放免费层
|
||||
→ 永不耗尽配额
|
||||
→ 随时随地编码
|
||||
```
|
||||
|
||||
### 4. 质量优化
|
||||
```
|
||||
cc/claude-opus-4-5 → cx/gpt-5.2-codex → gc/gemini-3-pro
|
||||
|
||||
→ 优先最好的模型
|
||||
→ 回退到其他高端模型
|
||||
→ 整个回退链保持高质量
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 如何创建组合
|
||||
|
||||
### 步骤 1:打开仪表盘
|
||||
|
||||
```
|
||||
http://localhost:20128
|
||||
→ 用密码登录
|
||||
```
|
||||
|
||||
### 步骤 2:进入组合页面
|
||||
|
||||
```
|
||||
仪表盘 → 组合 → 新建组合
|
||||
```
|
||||
|
||||
### 步骤 3:配置组合
|
||||
|
||||
**组合名:**
|
||||
```
|
||||
premium-coding
|
||||
```
|
||||
|
||||
**描述(可选):**
|
||||
```
|
||||
订阅优先,低价备用,免费应急
|
||||
```
|
||||
|
||||
**选择模型:**
|
||||
```
|
||||
1. cc/claude-opus-4-5-20251101
|
||||
2. glm/glm-4.7
|
||||
3. minimax/MiniMax-M2.1
|
||||
```
|
||||
|
||||
**拖动排序** - 自上而下表示优先级。
|
||||
|
||||
### 步骤 4:保存
|
||||
|
||||
```
|
||||
点击 "Save Combo"
|
||||
→ 组合出现在模型列表中
|
||||
```
|
||||
|
||||
### 步骤 5:在 CLI 中使用
|
||||
|
||||
```
|
||||
Cursor/Cline/任意工具:
|
||||
Model: premium-coding
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 示例组合
|
||||
|
||||
### 示例 1:Premium Coding(订阅 → 低价 → 免费)
|
||||
|
||||
**目标**:最大化订阅价值,最小化额外成本。
|
||||
|
||||
```
|
||||
仪表盘 → 组合 → 新建
|
||||
|
||||
名称: premium-coding
|
||||
模型:
|
||||
1. cc/claude-opus-4-5-20251101
|
||||
2. glm/glm-4.7
|
||||
3. minimax/MiniMax-M2.1
|
||||
```
|
||||
|
||||
**用法:**
|
||||
```
|
||||
Cursor IDE:
|
||||
Model: premium-coding
|
||||
```
|
||||
|
||||
**行为:**
|
||||
```
|
||||
早上(全新配额):
|
||||
请求 → cc/claude-opus-4-5 ✅
|
||||
|
||||
下午(Claude 配额用完):
|
||||
请求 → glm/glm-4.7 ✅ (自动切换)
|
||||
|
||||
晚上(GLM 配额用完):
|
||||
请求 → minimax/MiniMax-M2.1 ✅ (自动切换)
|
||||
```
|
||||
|
||||
**月成本(100M tokens):**
|
||||
```
|
||||
80M 通过 Claude Code: $0(订阅)
|
||||
15M 通过 GLM: $9
|
||||
5M 通过 MiniMax: $1
|
||||
合计: $10 + 你的订阅
|
||||
```
|
||||
|
||||
**节省**:相比 ChatGPT API($2000)约 99%。
|
||||
|
||||
---
|
||||
|
||||
### 示例 2:Budget Combo(低价 → 免费)
|
||||
|
||||
**目标**:最小化成本,免费层作为备用。
|
||||
|
||||
```
|
||||
仪表盘 → 组合 → 新建
|
||||
|
||||
名称: budget-combo
|
||||
模型:
|
||||
1. glm/glm-4.7
|
||||
2. minimax/MiniMax-M2.1
|
||||
3. if/kimi-k2-thinking
|
||||
```
|
||||
|
||||
**用法:**
|
||||
```
|
||||
Cline:
|
||||
Provider: OpenAI Compatible
|
||||
Base URL: http://localhost:20128/v1
|
||||
Model: budget-combo
|
||||
```
|
||||
|
||||
**行为:**
|
||||
```
|
||||
请求 → glm/glm-4.7
|
||||
✅ 每日配额可用 → 使用 GLM(每 1M $0.60)
|
||||
❌ 配额耗尽 → 尝试 MiniMax(每 1M $0.20)
|
||||
❌ MiniMax 配额用完 → 使用 iFlow(免费)
|
||||
```
|
||||
|
||||
**月成本(100M tokens):**
|
||||
```
|
||||
70M 通过 GLM: $42
|
||||
20M 通过 MiniMax: $4
|
||||
10M 通过 iFlow: $0
|
||||
合计: $46,而 ChatGPT API 需 $2000
|
||||
```
|
||||
|
||||
**节省**:97%。
|
||||
|
||||
---
|
||||
|
||||
### 示例 3:Free Combo(零成本)
|
||||
|
||||
**目标**:100% 免费,永不付费。
|
||||
|
||||
```
|
||||
仪表盘 → 组合 → 新建
|
||||
|
||||
名称: free-combo
|
||||
模型:
|
||||
1. if/kimi-k2-thinking
|
||||
2. qw/qwen3-coder-plus
|
||||
3. kr/claude-sonnet-4.5
|
||||
```
|
||||
|
||||
**用法:**
|
||||
```
|
||||
Claude Desktop:
|
||||
Model: free-combo
|
||||
```
|
||||
|
||||
**行为:**
|
||||
```
|
||||
请求 → if/kimi-k2-thinking
|
||||
✅ 可用 → 使用 iFlow
|
||||
❌ 错误 → 尝试 Qwen
|
||||
❌ 错误 → 尝试 Kiro
|
||||
```
|
||||
|
||||
**月成本:**
|
||||
```
|
||||
100M tokens 通过免费提供商: $0
|
||||
合计: 永远 $0
|
||||
```
|
||||
|
||||
**适用场景**:个人项目、学习、试验。
|
||||
|
||||
---
|
||||
|
||||
### 示例 4:Quality First(仅高端模型)
|
||||
|
||||
**目标**:最高质量,无低价回退。
|
||||
|
||||
```
|
||||
仪表盘 → 组合 → 新建
|
||||
|
||||
名称: quality-first
|
||||
模型:
|
||||
1. cc/claude-opus-4-5-20251101
|
||||
2. cx/gpt-5.2-codex
|
||||
3. gc/gemini-3-pro-preview
|
||||
```
|
||||
|
||||
**用法:**
|
||||
```
|
||||
Codex CLI:
|
||||
export OPENAI_BASE_URL="http://localhost:20128"
|
||||
Model: quality-first
|
||||
```
|
||||
|
||||
**行为:**
|
||||
```
|
||||
请求 → cc/claude-opus-4-5
|
||||
❌ 配额用完 → cx/gpt-5.2-codex
|
||||
❌ 配额用完 → gc/gemini-3-pro-preview
|
||||
❌ 全部用完 → 返回错误(无低价回退)
|
||||
```
|
||||
|
||||
**适用场景**:关键生产代码、复杂重构。
|
||||
|
||||
---
|
||||
|
||||
### 示例 5:Multi-Subscription(用足所有订阅)
|
||||
|
||||
**目标**:在产生额外费用前用足所有订阅。
|
||||
|
||||
```
|
||||
仪表盘 → 组合 → 新建
|
||||
|
||||
名称: multi-sub
|
||||
模型:
|
||||
1. gc/gemini-3-flash-preview (每月免费 180K)
|
||||
2. cc/claude-opus-4-5-20251101 (Pro 订阅)
|
||||
3. cx/gpt-5.2-codex (Plus 订阅)
|
||||
4. gh/gpt-5 (Copilot 订阅)
|
||||
5. glm/glm-4.7 (低价备用)
|
||||
6. if/kimi-k2-thinking (免费应急)
|
||||
```
|
||||
|
||||
**月成本(200M tokens):**
|
||||
```
|
||||
50M 通过 Gemini CLI: $0(免费层)
|
||||
80M 通过 Claude Code: $0(订阅)
|
||||
40M 通过 Codex: $0(订阅)
|
||||
20M 通过 Copilot: $0(订阅)
|
||||
8M 通过 GLM: $4.80
|
||||
2M 通过 iFlow: $0
|
||||
合计: $4.80 + 你已有的订阅
|
||||
```
|
||||
|
||||
**结果**:190M tokens 来自订阅,只有 $4.80 额外费用。
|
||||
|
||||
---
|
||||
|
||||
### 示例 6:配额重置优化
|
||||
|
||||
**目标**:根据重置时间分配使用。
|
||||
|
||||
```
|
||||
仪表盘 → 组合 → 新建
|
||||
|
||||
名称: reset-optimized
|
||||
模型:
|
||||
1. cc/claude-opus-4-5 (5h 重置, 早上用)
|
||||
2. gc/gemini-3-flash (每日 1K, 下午用)
|
||||
3. glm/glm-4.7 (每日 10AM 重置, 晚上用)
|
||||
4. minimax/MiniMax-M2.1 (5h 滚动, 夜里用)
|
||||
5. if/kimi-k2-thinking (无限, 应急)
|
||||
```
|
||||
|
||||
**日常安排:**
|
||||
```
|
||||
08:00 - 13:00: Claude Code(全新 5h 配额)
|
||||
13:00 - 18:00: Gemini CLI(每日 1K 配额)
|
||||
18:00 - 22:00: GLM(次日 10AM 重置)
|
||||
22:00 - 08:00: MiniMax(5h 滚动)或 iFlow
|
||||
```
|
||||
|
||||
**结果**:24/7 编码,成本极低。
|
||||
|
||||
---
|
||||
|
||||
## 在 CLI 工具中使用组合
|
||||
|
||||
### Cursor IDE
|
||||
|
||||
```
|
||||
Settings → Models → Advanced:
|
||||
OpenAI API Base URL: http://localhost:20128/v1
|
||||
OpenAI API Key: [从仪表盘获取]
|
||||
Model: premium-coding
|
||||
```
|
||||
|
||||
### Claude Desktop
|
||||
|
||||
编辑 `~/.claude/config.json`:
|
||||
```json
|
||||
{
|
||||
"anthropic_api_base": "http://localhost:20128/v1",
|
||||
"anthropic_api_key": "your-9router-api-key",
|
||||
"model": "budget-combo"
|
||||
}
|
||||
```
|
||||
|
||||
### Codex CLI
|
||||
|
||||
```bash
|
||||
export OPENAI_BASE_URL="http://localhost:20128"
|
||||
export OPENAI_API_KEY="your-9router-api-key"
|
||||
|
||||
codex --model quality-first "your prompt"
|
||||
```
|
||||
|
||||
### Cline / Continue / RooCode
|
||||
|
||||
```
|
||||
Provider: OpenAI Compatible
|
||||
Base URL: http://localhost:20128/v1
|
||||
API Key: [从仪表盘获取]
|
||||
Model: free-combo
|
||||
```
|
||||
|
||||
### API 请求
|
||||
|
||||
```bash
|
||||
curl http://localhost:20128/v1/chat/completions \
|
||||
-H "Authorization: Bearer your-api-key" \
|
||||
-H "Content-Type: application/json" \
|
||||
-d '{
|
||||
"model": "premium-coding",
|
||||
"messages": [
|
||||
{"role": "user", "content": "Write a function to..."}
|
||||
],
|
||||
"stream": true
|
||||
}'
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 最佳实践
|
||||
|
||||
### 1. 总是包含免费层
|
||||
|
||||
```
|
||||
✅ 好:
|
||||
cc/claude-opus → glm/glm-4.7 → if/kimi-k2-thinking
|
||||
|
||||
❌ 不好:
|
||||
cc/claude-opus → glm/glm-4.7
|
||||
(无免费回退,可能耗尽配额)
|
||||
```
|
||||
|
||||
**原因**:确保 24/7 可用,绝不会被配额卡住。
|
||||
|
||||
### 2. 按成本排序(便宜 → 贵)
|
||||
|
||||
```
|
||||
✅ 好:
|
||||
glm/glm-4.7 → minimax/MiniMax-M2.1 → cc/claude-opus
|
||||
|
||||
❌ 不好:
|
||||
cc/claude-opus → glm/glm-4.7
|
||||
(在简单任务上浪费订阅配额)
|
||||
```
|
||||
|
||||
**例外**:如果想充分利用订阅价值,把订阅放在最前面。
|
||||
|
||||
### 3. 匹配质量要求
|
||||
|
||||
```
|
||||
生产代码:
|
||||
cc/claude-opus → cx/gpt-5.2-codex → glm/glm-4.7
|
||||
|
||||
简单任务:
|
||||
glm/glm-4.7 → if/kimi-k2-thinking
|
||||
|
||||
试验:
|
||||
if/kimi-k2-thinking → qw/qwen3-coder-plus
|
||||
```
|
||||
|
||||
### 4. 考虑配额重置时间
|
||||
|
||||
```
|
||||
早上组合(配额刚刷新):
|
||||
cc/claude-opus → cx/gpt-5.2-codex
|
||||
|
||||
晚上组合(配额大概率耗尽):
|
||||
glm/glm-4.7 → minimax/MiniMax-M2.1 → if/kimi-k2-thinking
|
||||
```
|
||||
|
||||
### 5. 为不同场景创建多个组合
|
||||
|
||||
```
|
||||
premium-coding: 复杂任务
|
||||
budget-combo: 简单任务
|
||||
free-combo: 试验
|
||||
quality-first: 生产代码
|
||||
```
|
||||
|
||||
**根据任务需求切换组合**。
|
||||
|
||||
### 6. 监控组合性能
|
||||
|
||||
```
|
||||
仪表盘 → 分析 → 组合使用:
|
||||
premium-coding:
|
||||
80% 通过 cc/claude-opus(良好,使用订阅)
|
||||
15% 通过 glm/glm-4.7(可接受备用)
|
||||
5% 通过 minimax(罕见回退)
|
||||
```
|
||||
|
||||
**优化**:回退使用过多时,提高主配额或重新排序模型。
|
||||
|
||||
---
|
||||
|
||||
## 高级配置
|
||||
|
||||
### 为组合设置预算上限
|
||||
|
||||
```
|
||||
仪表盘 → 组合 → 编辑 → 预算:
|
||||
每日上限: $5
|
||||
每月上限: $50
|
||||
```
|
||||
|
||||
达到上限时,9Router 跳过付费模型,仅使用免费层。
|
||||
|
||||
### 启用/禁用组合中的模型
|
||||
|
||||
```
|
||||
仪表盘 → 组合 → 编辑 → 模型:
|
||||
✅ cc/claude-opus-4-5(启用)
|
||||
❌ glm/glm-4.7(暂时禁用)
|
||||
✅ if/kimi-k2-thinking(启用)
|
||||
```
|
||||
|
||||
**用途**:暂时禁用昂贵模型而不删除组合。
|
||||
|
||||
### 克隆已有组合
|
||||
|
||||
```
|
||||
仪表盘 → 组合 → 克隆 "premium-coding"
|
||||
→ 生成带 "-copy" 后缀的副本
|
||||
→ 修改后另存为新组合
|
||||
```
|
||||
|
||||
**用途**:为不同场景创建变体。
|
||||
|
||||
---
|
||||
|
||||
## 故障排除
|
||||
|
||||
**问题:组合未出现在模型列表中**
|
||||
|
||||
**方案:**
|
||||
1. 刷新仪表盘
|
||||
2. 检查组合已保存(绿色对勾)
|
||||
3. 重启 CLI 工具以刷新模型列表
|
||||
|
||||
**问题:组合总是用最后一个模型(免费层)**
|
||||
|
||||
**方案:**
|
||||
1. 检查主模型的配额(仪表盘 → 配额)
|
||||
2. 确认 API keys 有效(仪表盘 → 提供商)
|
||||
3. 检查是否超出预算上限
|
||||
|
||||
**问题:组合成本超出预期**
|
||||
|
||||
**方案:**
|
||||
1. 仪表盘 → 分析 → 查看组合使用情况
|
||||
2. 检查主模型是否配额耗尽
|
||||
3. 重新排序模型(更便宜的放前面)
|
||||
4. 设置预算上限
|
||||
|
||||
---
|
||||
|
||||
## 相关
|
||||
|
||||
- [智能路由](./smart-routing.md) - 自动回退如何工作
|
||||
- [配额跟踪](./quota-tracking.md) - 监控使用与成本
|
||||
687
gitbook/content/zh-CN/features/quota-tracking.md
Normal file
687
gitbook/content/zh-CN/features/quota-tracking.md
Normal file
@@ -0,0 +1,687 @@
|
||||
# 配额跟踪 & 使用监控
|
||||
|
||||
实时跟踪 token 消耗、监控配额上限、估算成本,并在配额用尽前获得提醒。绝不浪费订阅配额,也不超出预算上限。
|
||||
|
||||
---
|
||||
|
||||
## 概览
|
||||
|
||||
9Router 为所有提供商提供完善的配额跟踪:
|
||||
|
||||
- **实时 token 消耗** - 查看每次请求使用的 tokens
|
||||
- **配额上限与剩余** - 跟踪使用 vs 上限
|
||||
- **重置倒计时** - 了解配额何时刷新
|
||||
- **成本估算** - 计算付费层支出
|
||||
- **月度报告** - 分析使用模式
|
||||
- **告警与通知** - 接近上限时收到警告
|
||||
|
||||
---
|
||||
|
||||
## 仪表盘总览
|
||||
|
||||
### 配额摘要
|
||||
|
||||
```
|
||||
仪表盘 → 主页 → 配额概览
|
||||
|
||||
┌─────────────────────────────────────────────┐
|
||||
│ Claude Code (cc/) │
|
||||
│ ████████████░░░░░░░░ 2.5h / 5h (50%) │
|
||||
│ 重置剩余: 2h 30m │
|
||||
│ 成本: $0(订阅) │
|
||||
└─────────────────────────────────────────────┘
|
||||
|
||||
┌─────────────────────────────────────────────┐
|
||||
│ Gemini CLI (gc/) │
|
||||
│ ████████░░░░░░░░░░░░ 450 / 1000 (45%) │
|
||||
│ 每日重置剩余: 18h 30m │
|
||||
│ 本月: 45K / 180K (25%) │
|
||||
│ 成本: $0(免费层) │
|
||||
└─────────────────────────────────────────────┘
|
||||
|
||||
┌─────────────────────────────────────────────┐
|
||||
│ GLM-4.7 (glm/) │
|
||||
│ ██████████████░░░░░░ 7M / 10M tokens (70%) │
|
||||
│ 重置: 每日 10:00 AM(5h 35m 后) │
|
||||
│ 今日成本: $4.20 │
|
||||
└─────────────────────────────────────────────┘
|
||||
|
||||
┌─────────────────────────────────────────────┐
|
||||
│ MiniMax M2.1 (minimax/) │
|
||||
│ ████████████████░░░░ 4M / 5M tokens (80%) │
|
||||
│ 5h 滚动窗口 │
|
||||
│ 成本(5h): $0.80 │
|
||||
└─────────────────────────────────────────────┘
|
||||
|
||||
┌─────────────────────────────────────────────┐
|
||||
│ iFlow (if/) │
|
||||
│ ████████████████████ 无限 │
|
||||
│ 成本: $0(永久免费) │
|
||||
└─────────────────────────────────────────────┘
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 实时 Token 消耗
|
||||
|
||||
### 按请求跟踪
|
||||
|
||||
每次请求都会显示详细的 token 使用情况:
|
||||
|
||||
```
|
||||
仪表盘 → 活动 → 最近请求
|
||||
|
||||
请求 #1234
|
||||
模型: cc/claude-opus-4-5-20251101
|
||||
时间戳: 2026-02-04 04:15:32
|
||||
|
||||
Tokens:
|
||||
输入: 1,250 tokens
|
||||
输出: 850 tokens
|
||||
合计: 2,100 tokens
|
||||
|
||||
成本: $0(订阅配额)
|
||||
耗时: 3.2s
|
||||
状态: ✅ 成功
|
||||
```
|
||||
|
||||
### 实时使用监控
|
||||
|
||||
```
|
||||
仪表盘 → 实时监控
|
||||
|
||||
当前请求:
|
||||
模型: glm/glm-4.7
|
||||
已流式输出 tokens: 450 / 预计 ~800
|
||||
当前成本: $0.0009
|
||||
耗时: 1.8s
|
||||
```
|
||||
|
||||
### 按模型分解 Token
|
||||
|
||||
```
|
||||
仪表盘 → 分析 → Token 使用
|
||||
|
||||
今日(2026-02-04):
|
||||
cc/claude-opus-4-5: 15M tokens($0,订阅)
|
||||
glm/glm-4.7: 8M tokens($4.80)
|
||||
if/kimi-k2-thinking: 3M tokens($0,免费)
|
||||
|
||||
合计: 26M tokens
|
||||
成本: $4.80
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 配额上限与重置时间
|
||||
|
||||
### 订阅型提供商
|
||||
|
||||
**Claude Code (Pro/Max)**
|
||||
```
|
||||
配额类型: 基于时间(5 小时滚动)
|
||||
上限: 5 小时使用时长
|
||||
重置: 5 小时滚动窗口 + 每周刷新
|
||||
跟踪: 每个模型的使用时间
|
||||
|
||||
仪表盘显示:
|
||||
Opus: 已用 2.5h / 5h
|
||||
Sonnet: 已用 1.2h / 5h
|
||||
Haiku: 已用 0.8h / 5h
|
||||
|
||||
每周重置: 每周一 00:00 UTC
|
||||
```
|
||||
|
||||
**OpenAI Codex (Plus/Pro)**
|
||||
```
|
||||
配额类型: 基于时间(5 小时滚动)
|
||||
上限: 5 小时(Plus)/ 10 小时(Pro)
|
||||
重置: 5 小时滚动窗口 + 每周刷新
|
||||
|
||||
仪表盘显示:
|
||||
GPT-5.2 Codex: 已用 3.5h / 5h
|
||||
重置剩余: 1h 30m
|
||||
```
|
||||
|
||||
**Gemini CLI(免费)**
|
||||
```
|
||||
配额类型: 请求次数 + 月度 tokens
|
||||
每日上限: 1,000 次请求
|
||||
月度上限: 180,000 次补全
|
||||
重置: 每日 00:00 UTC + 每月 1 日
|
||||
|
||||
仪表盘显示:
|
||||
今日: 450 / 1,000 次请求 (45%)
|
||||
本月: 45K / 180K 次补全 (25%)
|
||||
每日重置剩余: 18h 30m
|
||||
月度重置剩余: 26 天
|
||||
```
|
||||
|
||||
**GitHub Copilot**
|
||||
```
|
||||
配额类型: 月度使用量
|
||||
上限: 因套餐而异
|
||||
重置: 每月 1 日
|
||||
|
||||
仪表盘显示:
|
||||
使用: 月度配额 60%
|
||||
重置: 2026 年 3 月 1 日(25 天后)
|
||||
```
|
||||
|
||||
### 低价提供商
|
||||
|
||||
**GLM-4.7**
|
||||
```
|
||||
配额类型: 每日 token 上限
|
||||
上限: 10M tokens/天(Coding Plan)
|
||||
重置: 每日 10:00 AM 北京时间(UTC+8)
|
||||
|
||||
仪表盘显示:
|
||||
已用: 7M / 10M tokens (70%)
|
||||
剩余: 3M tokens
|
||||
重置剩余: 5h 35m
|
||||
今日成本: $4.20
|
||||
```
|
||||
|
||||
**MiniMax M2.1**
|
||||
```
|
||||
配额类型: 5 小时滚动窗口
|
||||
上限: 每 5 小时 5M tokens
|
||||
重置: 连续滚动窗口
|
||||
|
||||
仪表盘显示:
|
||||
已用(5h): 4M / 5M tokens (80%)
|
||||
最早一次使用过期: 45m
|
||||
成本(5h): $0.80
|
||||
```
|
||||
|
||||
**Kimi K2**
|
||||
```
|
||||
配额类型: 月度订阅
|
||||
上限: 10M tokens/月($9 固定)
|
||||
重置: 订阅日每月一次
|
||||
|
||||
仪表盘显示:
|
||||
已用: 6M / 10M tokens (60%)
|
||||
重置: 2026 年 2 月 15 日(11 天后)
|
||||
成本: $9/月(预付)
|
||||
```
|
||||
|
||||
### 免费提供商
|
||||
|
||||
**iFlow / Qwen / Kiro**
|
||||
```
|
||||
配额类型: 无限(限速)
|
||||
上限: 无硬上限
|
||||
重置: 不适用
|
||||
|
||||
仪表盘显示:
|
||||
今日已用: 5M tokens
|
||||
成本: $0(永久免费)
|
||||
状态: ✅ 可用
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 成本估算
|
||||
|
||||
### 实时成本跟踪
|
||||
|
||||
```
|
||||
仪表盘 → 成本 → 今日
|
||||
|
||||
订阅型提供商: $0
|
||||
Claude Code: 15M tokens($0,包含)
|
||||
Gemini CLI: 3M tokens($0,免费层)
|
||||
|
||||
付费提供商: $4.80
|
||||
GLM-4.7: 8M tokens($4.80)
|
||||
输入: 6M × $0.60/1M = $3.60
|
||||
输出: 2M × $2.20/1M = $4.40
|
||||
合计: $4.80
|
||||
|
||||
免费提供商: $0
|
||||
iFlow: 3M tokens($0)
|
||||
|
||||
今日合计: $4.80
|
||||
```
|
||||
|
||||
### 月度支出报告
|
||||
|
||||
```
|
||||
仪表盘 → 成本 → 本月(2026 年 2 月)
|
||||
|
||||
第 1 周(2 月 1-7 日):
|
||||
订阅: $0(80M tokens)
|
||||
付费: $15.20(25M tokens)
|
||||
免费: $0(10M tokens)
|
||||
合计: $15.20
|
||||
|
||||
第 2 周(2 月 8-14 日):
|
||||
订阅: $0(75M tokens)
|
||||
付费: $12.80(20M tokens)
|
||||
免费: $0(8M tokens)
|
||||
合计: $12.80
|
||||
|
||||
本月至今: $28.00
|
||||
预计(30 天): ~$120
|
||||
|
||||
按提供商分解:
|
||||
GLM-4.7: $22.00 (78%)
|
||||
MiniMax M2.1: $6.00 (22%)
|
||||
|
||||
每 1M tokens 平均成本: $0.62
|
||||
相比 ChatGPT API 节省: 97%($4,000 → $120)
|
||||
```
|
||||
|
||||
### 成本预测
|
||||
|
||||
```
|
||||
仪表盘 → 成本 → 预测
|
||||
|
||||
基于近 7 天使用:
|
||||
日均: 50M tokens
|
||||
日成本: $4.50
|
||||
|
||||
月度预测:
|
||||
Tokens: 1,500M (1.5B)
|
||||
成本: $135
|
||||
|
||||
分解:
|
||||
订阅: 900M tokens($0)
|
||||
GLM-4.7: 450M tokens($90)
|
||||
MiniMax: 120M tokens($24)
|
||||
免费: 30M tokens($0)
|
||||
|
||||
预算状态:
|
||||
每日上限: $5 → 今日已用 90%
|
||||
每月上限: $150 → 预计 90%
|
||||
⚠️ 警告: 可能超出每月预算
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 使用仪表盘
|
||||
|
||||
### 总览统计
|
||||
|
||||
```
|
||||
仪表盘 → 分析 → 总览
|
||||
|
||||
今日(2026-02-04):
|
||||
请求: 1,234
|
||||
Tokens: 26M
|
||||
成本: $4.80
|
||||
平均响应时间: 2.1s
|
||||
|
||||
本周:
|
||||
请求: 8,456
|
||||
Tokens: 180M
|
||||
成本: $28.00
|
||||
成功率: 99.2%
|
||||
|
||||
本月:
|
||||
请求: 15,234
|
||||
Tokens: 320M
|
||||
成本: $52.00
|
||||
Top 模型: cc/claude-opus-4-5 (45%)
|
||||
```
|
||||
|
||||
### 按模型使用
|
||||
|
||||
```
|
||||
仪表盘 → 分析 → 模型
|
||||
|
||||
Top 模型(本月):
|
||||
1. cc/claude-opus-4-5: 145M tokens (45%)
|
||||
2. glm/glm-4.7: 95M tokens (30%)
|
||||
3. if/kimi-k2-thinking: 50M tokens (16%)
|
||||
4. minimax/MiniMax-M2.1: 20M tokens (6%)
|
||||
5. gc/gemini-3-flash: 10M tokens (3%)
|
||||
|
||||
成本分解:
|
||||
cc/claude-opus: $0(订阅)
|
||||
glm/glm-4.7: $45.00
|
||||
if/kimi-k2-thinking: $0(免费)
|
||||
minimax/MiniMax-M2.1: $7.00
|
||||
gc/gemini-3-flash: $0(免费)
|
||||
```
|
||||
|
||||
### 按时间使用
|
||||
|
||||
```
|
||||
仪表盘 → 分析 → 时间线
|
||||
|
||||
按小时使用(今日):
|
||||
00:00 - 01:00: 0.5M tokens
|
||||
01:00 - 02:00: 0.2M tokens
|
||||
...
|
||||
08:00 - 09:00: 3.2M tokens(峰值)
|
||||
09:00 - 10:00: 2.8M tokens
|
||||
...
|
||||
23:00 - 00:00: 0.8M tokens
|
||||
|
||||
峰值时段: 08:00 - 12:00(早上编码)
|
||||
低谷时段: 00:00 - 06:00(夜间)
|
||||
```
|
||||
|
||||
### 按组合使用
|
||||
|
||||
```
|
||||
仪表盘 → 分析 → 组合
|
||||
|
||||
premium-coding:
|
||||
请求: 456
|
||||
Tokens: 12M
|
||||
成本: $2.40
|
||||
|
||||
分解:
|
||||
cc/claude-opus: 8M tokens (67%, $0)
|
||||
glm/glm-4.7: 3M tokens (25%, $1.80)
|
||||
minimax/MiniMax-M2.1: 1M tokens (8%, $0.20)
|
||||
|
||||
budget-combo:
|
||||
请求: 234
|
||||
Tokens: 6M
|
||||
成本: $1.20
|
||||
|
||||
分解:
|
||||
glm/glm-4.7: 4M tokens (67%, $2.40)
|
||||
if/kimi-k2-thinking: 2M tokens (33%, $0)
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 告警与通知
|
||||
|
||||
### 配额告警
|
||||
|
||||
```
|
||||
仪表盘 → 设置 → 告警
|
||||
|
||||
配额预警:
|
||||
✅ 配额使用 80% 时告警
|
||||
✅ 配额使用 90% 时告警
|
||||
✅ 配额耗尽时告警
|
||||
✅ 配额重置时通知
|
||||
|
||||
发送方式:
|
||||
✅ 仪表盘通知
|
||||
✅ 邮件(可选)
|
||||
✅ Webhook(可选)
|
||||
```
|
||||
|
||||
**通知示例:**
|
||||
```
|
||||
⚠️ Claude Code 配额已用 80%
|
||||
剩余 2.5h(1h 30m 后重置)
|
||||
|
||||
⚠️ GLM-4.7 配额已用 90%
|
||||
剩余 1M tokens(5h 后重置)
|
||||
|
||||
✅ Gemini CLI 配额已重置
|
||||
1,000 次请求可用(每日上限)
|
||||
```
|
||||
|
||||
### 预算告警
|
||||
|
||||
```
|
||||
仪表盘 → 设置 → 预算告警
|
||||
|
||||
每日预算: $5
|
||||
✅ 80%($4)告警
|
||||
✅ 100%($5)告警
|
||||
✅ 超额时自动切换到免费层
|
||||
|
||||
每月预算: $150
|
||||
✅ 50%($75)告警
|
||||
✅ 80%($120)告警
|
||||
✅ 100%($150)告警
|
||||
```
|
||||
|
||||
**通知示例:**
|
||||
```
|
||||
⚠️ 每日预算已用 80%
|
||||
今日花费 $4.00 / $5.00
|
||||
|
||||
⚠️ 每月预算达到 50%
|
||||
本月花费 $75 / $150
|
||||
预计: $135(预算内)
|
||||
|
||||
🚨 每日预算超额
|
||||
今日花费 $5.20 / $5.00
|
||||
已自动切换到免费层
|
||||
```
|
||||
|
||||
### 成本异常检测
|
||||
|
||||
```
|
||||
仪表盘 → 设置 → 异常检测
|
||||
|
||||
✅ 检测异常支出模式
|
||||
✅ 成本峰值告警(>2× 日均)
|
||||
✅ 配额耗尽模式警告
|
||||
|
||||
告警示例:
|
||||
⚠️ 检测到成本峰值
|
||||
今日: $12.50(2.5× 日均)
|
||||
原因: GLM-4.7 高用量(20M tokens)
|
||||
建议: 检查主模型是否配额耗尽
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 最佳实践
|
||||
|
||||
### 1. 每日监控配额
|
||||
|
||||
```
|
||||
日常:
|
||||
1. 查看仪表盘配额概览(30 秒)
|
||||
2. 检查重置时间
|
||||
3. 根据配额可用性规划使用
|
||||
```
|
||||
|
||||
**示例:**
|
||||
```
|
||||
早晨检查:
|
||||
✅ Claude Code: 5h 可用(刚重置)
|
||||
✅ Gemini CLI: 1K 请求可用
|
||||
⚠️ GLM-4.7: 剩 2M tokens(10AM 重置)
|
||||
|
||||
行动: 早上工作用 Claude Code
|
||||
```
|
||||
|
||||
### 2. 设置预算上限
|
||||
|
||||
```
|
||||
仪表盘 → 设置 → 预算:
|
||||
每日: $5(防止超支)
|
||||
每月: $150(与预算对齐)
|
||||
```
|
||||
|
||||
**结果**:达到上限时自动切换到免费层。
|
||||
|
||||
### 3. 优化组合使用
|
||||
|
||||
```
|
||||
仪表盘 → 分析 → 组合:
|
||||
查看哪些模型用得最多
|
||||
调整组合顺序以最小化成本
|
||||
```
|
||||
|
||||
**示例:**
|
||||
```
|
||||
当前: cc/claude-opus → glm/glm-4.7
|
||||
80% 通过 Claude(好)
|
||||
20% 通过 GLM($12/月)
|
||||
|
||||
优化后: gc/gemini-3-flash → cc/claude-opus → glm/glm-4.7
|
||||
50% 通过 Gemini(免费)
|
||||
40% 通过 Claude(订阅)
|
||||
10% 通过 GLM($6/月)
|
||||
|
||||
节省: $6/月
|
||||
```
|
||||
|
||||
### 4. 跟踪重置时间
|
||||
|
||||
```
|
||||
仪表盘 → 配额 → 重置日程:
|
||||
Claude Code: 5h 滚动 + 每周一
|
||||
Gemini CLI: 每日 00:00 UTC + 每月 1 日
|
||||
GLM-4.7: 每日 10:00 AM 北京时间
|
||||
MiniMax: 5h 滚动窗口
|
||||
```
|
||||
|
||||
**策略**:配额刚刷新时使用对应提供商。
|
||||
|
||||
### 5. 查看月度报告
|
||||
|
||||
```
|
||||
仪表盘 → 分析 → 月度报告:
|
||||
总 tokens: 1.5B
|
||||
总成本: $120
|
||||
节省: 相比 ChatGPT API 节省 97%
|
||||
|
||||
洞察:
|
||||
- 60% 用量来自订阅($0)
|
||||
- 30% 通过 GLM($90)
|
||||
- 10% 通过免费层($0)
|
||||
|
||||
优化:
|
||||
- 增加 Gemini CLI 用量(免费)
|
||||
- 减少 GLM 用量(更贵)
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## API 访问
|
||||
|
||||
### 获取配额状态
|
||||
|
||||
```bash
|
||||
GET http://localhost:20128/api/quota
|
||||
Authorization: Bearer your-api-key
|
||||
|
||||
Response:
|
||||
{
|
||||
"providers": [
|
||||
{
|
||||
"id": "cc",
|
||||
"name": "Claude Code",
|
||||
"quota": {
|
||||
"used": 2.5,
|
||||
"limit": 5,
|
||||
"unit": "hours",
|
||||
"percentage": 50
|
||||
},
|
||||
"reset": {
|
||||
"type": "rolling",
|
||||
"window": "5h",
|
||||
"nextReset": "2026-02-04T06:45:00Z"
|
||||
},
|
||||
"cost": {
|
||||
"today": 0,
|
||||
"month": 0,
|
||||
"currency": "USD"
|
||||
}
|
||||
},
|
||||
{
|
||||
"id": "glm",
|
||||
"name": "GLM-4.7",
|
||||
"quota": {
|
||||
"used": 7000000,
|
||||
"limit": 10000000,
|
||||
"unit": "tokens",
|
||||
"percentage": 70
|
||||
},
|
||||
"reset": {
|
||||
"type": "daily",
|
||||
"time": "10:00 AM UTC+8",
|
||||
"nextReset": "2026-02-04T10:00:00+08:00"
|
||||
},
|
||||
"cost": {
|
||||
"today": 4.20,
|
||||
"month": 52.00,
|
||||
"currency": "USD"
|
||||
}
|
||||
}
|
||||
]
|
||||
}
|
||||
```
|
||||
|
||||
### 获取使用统计
|
||||
|
||||
```bash
|
||||
GET http://localhost:20128/api/usage?period=today
|
||||
Authorization: Bearer your-api-key
|
||||
|
||||
Response:
|
||||
{
|
||||
"period": "today",
|
||||
"date": "2026-02-04",
|
||||
"summary": {
|
||||
"requests": 1234,
|
||||
"tokens": 26000000,
|
||||
"cost": 4.80
|
||||
},
|
||||
"byModel": [
|
||||
{
|
||||
"model": "cc/claude-opus-4-5",
|
||||
"requests": 456,
|
||||
"tokens": 15000000,
|
||||
"cost": 0
|
||||
},
|
||||
{
|
||||
"model": "glm/glm-4.7",
|
||||
"requests": 234,
|
||||
"tokens": 8000000,
|
||||
"cost": 4.80
|
||||
}
|
||||
]
|
||||
}
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 故障排除
|
||||
|
||||
**问题:配额显示 0% 但请求失败**
|
||||
|
||||
**方案:**
|
||||
1. 检查提供商连接(仪表盘 → 提供商)
|
||||
2. 确认 API keys 有效
|
||||
3. 检查提供商是否宕机(状态页)
|
||||
4. 尝试重新连接 OAuth 提供商
|
||||
|
||||
**问题:成本估算不正确**
|
||||
|
||||
**方案:**
|
||||
1. 仪表盘 → 设置 → 定价
|
||||
2. 确认每个提供商的定价与当前一致
|
||||
3. 若提供商调整费率,更新定价
|
||||
4. 若差异持续,联系支持
|
||||
|
||||
**问题:重置时间没有更新**
|
||||
|
||||
**方案:**
|
||||
1. 刷新仪表盘(F5)
|
||||
2. 检查系统时间是否正确
|
||||
3. 确认时区设置
|
||||
4. 若问题持续,重启 9Router
|
||||
|
||||
**问题:未收到告警**
|
||||
|
||||
**方案:**
|
||||
1. 仪表盘 → 设置 → 告警
|
||||
2. 确认邮箱地址正确
|
||||
3. 检查垃圾邮件夹
|
||||
4. 测试通知(Send Test 按钮)
|
||||
|
||||
---
|
||||
|
||||
## 相关
|
||||
|
||||
- [智能路由](./smart-routing.md) - 基于配额自动回退
|
||||
- [组合](./combos.md) - 创建自定义回退链
|
||||
407
gitbook/content/zh-CN/features/smart-routing.md
Normal file
407
gitbook/content/zh-CN/features/smart-routing.md
Normal file
@@ -0,0 +1,407 @@
|
||||
# 智能路由 & 自动回退
|
||||
|
||||
9Router 通过 3 层回退系统,自动将你的请求路由到最佳可用提供商。绝不再因配额限制或速率限制而中断编码。
|
||||
|
||||
---
|
||||
|
||||
## 工作原理
|
||||
|
||||
9Router 使用智能路由,最大化已有订阅价值、最小化成本,并保障 24/7 可用:
|
||||
|
||||
```
|
||||
请求 → 9Router → 检查第 1 层 (订阅)
|
||||
↓ 配额耗尽
|
||||
检查第 2 层 (低价)
|
||||
↓ 预算上限
|
||||
检查第 3 层 (免费)
|
||||
↓
|
||||
响应
|
||||
```
|
||||
|
||||
### 3 层回退系统
|
||||
|
||||
**第 1 层:订阅(主力)**
|
||||
- Claude Code(Pro/Max)
|
||||
- OpenAI Codex(Plus/Pro)
|
||||
- Gemini CLI(每月免费 180K)
|
||||
- GitHub Copilot
|
||||
- Antigravity(Google)
|
||||
|
||||
**目标**:充分挖掘你已付费订阅的价值。
|
||||
|
||||
**第 2 层:低价(备用)**
|
||||
- GLM-4.7(输入每 1M $0.60)
|
||||
- MiniMax M2.1(输入每 1M $0.20)
|
||||
- Kimi K2($9/月固定)
|
||||
|
||||
**目标**:订阅配额用完后的超低价备用(比 ChatGPT API 便宜 ~90%)。
|
||||
|
||||
**第 3 层:免费(应急)**
|
||||
- iFlow(8 个模型)
|
||||
- Qwen(3 个模型)
|
||||
- Kiro(Claude 免费)
|
||||
|
||||
**目标**:零成本回退,实现无限编码。
|
||||
|
||||
---
|
||||
|
||||
## 自动切换
|
||||
|
||||
9Router 实时监控配额,自动切换提供商:
|
||||
|
||||
### 场景 1:订阅配额耗尽
|
||||
|
||||
```
|
||||
用户请求 → cc/claude-opus-4-5
|
||||
↓ 配额耗尽(达到 5 小时限制)
|
||||
自动切换 → glm/glm-4.7
|
||||
↓ 每日配额耗尽
|
||||
自动切换 → minimax/MiniMax-M2.1
|
||||
↓ 5 小时配额耗尽
|
||||
自动切换 → if/kimi-k2-thinking (免费)
|
||||
↓
|
||||
响应已送达 ✅
|
||||
```
|
||||
|
||||
**结果**:零停机,无缝体验。
|
||||
|
||||
### 场景 2:速率限制
|
||||
|
||||
```
|
||||
用户请求 → cx/gpt-5.2-codex
|
||||
↓ 速率受限(请求过多)
|
||||
自动切换 → glm/glm-4.7
|
||||
↓
|
||||
响应已送达 ✅
|
||||
```
|
||||
|
||||
### 场景 3:提供商不可用
|
||||
|
||||
```
|
||||
用户请求 → cc/claude-opus-4-5
|
||||
↓ 提供商错误(503)
|
||||
自动切换 → 下一个可用模型
|
||||
↓
|
||||
响应已送达 ✅
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 模型选择逻辑
|
||||
|
||||
9Router 基于以下因素选择最佳模型:
|
||||
|
||||
1. **配额可用性** - 检查提供商是否仍有剩余配额
|
||||
2. **成本层级** - 优先订阅 → 低价 → 免费
|
||||
3. **重置时间** - 考虑配额何时重置
|
||||
4. **提供商健康度** - 跳过有错误的提供商
|
||||
|
||||
### 优先级示例
|
||||
|
||||
对 `cc/claude-opus-4-5` 的请求:
|
||||
|
||||
```
|
||||
1. 检查 Claude Code 配额
|
||||
✅ 可用 → 使用 cc/claude-opus-4-5
|
||||
❌ 耗尽 → 继续步骤 2
|
||||
|
||||
2. 检查回退层(若已配置)
|
||||
✅ GLM 配额可用 → 使用 glm/glm-4.7
|
||||
❌ 耗尽 → 继续步骤 3
|
||||
|
||||
3. 检查免费层
|
||||
✅ iFlow 可用 → 使用 if/kimi-k2-thinking
|
||||
❌ 全部耗尽 → 返回配额错误
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 配置选项
|
||||
|
||||
### 仪表盘设置
|
||||
|
||||
**1. 启用/禁用自动回退**
|
||||
|
||||
```
|
||||
仪表盘 → 设置 → 智能路由
|
||||
→ 切换 "Auto Fallback" ON/OFF
|
||||
```
|
||||
|
||||
- **ON**(默认):自动层级切换
|
||||
- **OFF**:严格模式,主模型不可用时返回错误
|
||||
|
||||
**2. 设置预算上限**
|
||||
|
||||
```
|
||||
仪表盘 → 设置 → 预算控制
|
||||
→ 每日上限: $5
|
||||
→ 每月上限: $50
|
||||
```
|
||||
|
||||
预算耗尽时,9Router 自动切换到免费层。
|
||||
|
||||
**3. 配置回退顺序**
|
||||
|
||||
```
|
||||
仪表盘 → 设置 → 回退优先级
|
||||
→ 拖动以重新排序每层内的提供商
|
||||
```
|
||||
|
||||
自定义顺序示例:
|
||||
```
|
||||
第 1 层: Gemini CLI → Claude Code → Codex
|
||||
第 2 层: MiniMax → GLM → Kimi
|
||||
第 3 层: iFlow → Kiro → Qwen
|
||||
```
|
||||
|
||||
**4. 配额重置通知**
|
||||
|
||||
```
|
||||
仪表盘 → 设置 → 通知
|
||||
→ 配额重置时邮件提醒
|
||||
→ 配额使用 80% 时告警
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 示例
|
||||
|
||||
### 示例 1:基础自动回退
|
||||
|
||||
**设置:**
|
||||
```
|
||||
Model: cc/claude-opus-4-5-20251101
|
||||
Fallback: 自动(默认 3 层)
|
||||
```
|
||||
|
||||
**行为:**
|
||||
```
|
||||
早上(全新配额):
|
||||
请求 → cc/claude-opus-4-5 ✅
|
||||
|
||||
下午(配额耗尽):
|
||||
请求 → glm/glm-4.7 ✅ (自动切换)
|
||||
|
||||
晚上(GLM 配额用完):
|
||||
请求 → minimax/MiniMax-M2.1 ✅ (自动切换)
|
||||
|
||||
深夜(付费配额全部耗尽):
|
||||
请求 → if/kimi-k2-thinking ✅ (免费层)
|
||||
```
|
||||
|
||||
**成本**:额外约 $5-10/月(大部分由订阅覆盖)。
|
||||
|
||||
### 示例 2:预算优先路由
|
||||
|
||||
**设置:**
|
||||
```
|
||||
仪表盘 → 设置:
|
||||
每日预算: $2
|
||||
每月预算: $20
|
||||
Fallback: 启用
|
||||
```
|
||||
|
||||
**行为:**
|
||||
```
|
||||
1-15 日(预算内):
|
||||
请求 → glm/glm-4.7 (低价层)
|
||||
成本: $1.50/天
|
||||
|
||||
第 16 日(达到预算):
|
||||
请求 → if/kimi-k2-thinking (免费层)
|
||||
成本: $0
|
||||
|
||||
下月(预算重置):
|
||||
请求 → 重新使用 glm/glm-4.7
|
||||
```
|
||||
|
||||
**结果**:绝不超过 $20/月,始终可用。
|
||||
|
||||
### 示例 3:仅订阅模式
|
||||
|
||||
**设置:**
|
||||
```
|
||||
仪表盘 → 设置:
|
||||
Auto Fallback: OFF
|
||||
Strict mode: ON
|
||||
```
|
||||
|
||||
**行为:**
|
||||
```
|
||||
请求 → cc/claude-opus-4-5
|
||||
✅ 配额可用 → 成功
|
||||
❌ 配额耗尽 → 返回错误(无回退)
|
||||
```
|
||||
|
||||
**适用场景**:只想用付费订阅,绝不产生额外成本。
|
||||
|
||||
### 示例 4:仅免费模式
|
||||
|
||||
**设置:**
|
||||
```
|
||||
Model: if/kimi-k2-thinking
|
||||
Fallback: qw/qwen3-coder-plus → kr/claude-sonnet-4.5
|
||||
```
|
||||
|
||||
**行为:**
|
||||
```
|
||||
所有请求 → 仅免费层
|
||||
成本: 永远 $0
|
||||
```
|
||||
|
||||
**适用场景**:个人项目、学习、试验。
|
||||
|
||||
---
|
||||
|
||||
## 最佳实践
|
||||
|
||||
### 1. 最大化订阅价值
|
||||
|
||||
```
|
||||
策略:
|
||||
- 将订阅模型设为第 1 层
|
||||
- 在仪表盘监控配额使用
|
||||
- 仅在订阅耗尽时使用低价层
|
||||
```
|
||||
|
||||
**示例组合:**
|
||||
```
|
||||
cc/claude-opus-4-5 → glm/glm-4.7 → if/kimi-k2-thinking
|
||||
```
|
||||
|
||||
### 2. 成本优化
|
||||
|
||||
```
|
||||
策略:
|
||||
- 先用 Gemini CLI 免费层(每月 180K)
|
||||
- 回退到 GLM/MiniMax(超低价)
|
||||
- 应急: iFlow(免费)
|
||||
```
|
||||
|
||||
**示例组合:**
|
||||
```
|
||||
gc/gemini-3-flash-preview → glm/glm-4.7 → if/kimi-k2-thinking
|
||||
```
|
||||
|
||||
### 3. 质量优先
|
||||
|
||||
```
|
||||
策略:
|
||||
- 使用最佳模型(Claude Opus、GPT-5.2)
|
||||
- 回退到优秀的低价模型(GLM-4.7)
|
||||
- 最后手段: 免费层
|
||||
```
|
||||
|
||||
**示例组合:**
|
||||
```
|
||||
cc/claude-opus-4-5 → cx/gpt-5.2-codex → glm/glm-4.7
|
||||
```
|
||||
|
||||
### 4. 24/7 可用性
|
||||
|
||||
```
|
||||
策略:
|
||||
- 回退链中总是包含免费层
|
||||
- 监控配额重置时间
|
||||
- 在多个提供商间分散使用
|
||||
```
|
||||
|
||||
**示例组合:**
|
||||
```
|
||||
cc/claude-opus-4-5 → glm/glm-4.7 → minimax/MiniMax-M2.1 → if/kimi-k2-thinking
|
||||
```
|
||||
|
||||
**结果**:永不耗尽配额,随时编码。
|
||||
|
||||
---
|
||||
|
||||
## 配额重置策略
|
||||
|
||||
围绕配额重置时间规划使用:
|
||||
|
||||
| 提供商 | 配额重置 | 策略 |
|
||||
|----------|-------------|----------|
|
||||
| **Claude Code** | 5 小时 + 每周 | 早上使用,配额最新鲜 |
|
||||
| **Codex** | 5 小时 + 每周 | Claude 配额用完后使用 |
|
||||
| **Gemini CLI** | 每日(1K)+ 每月(180K) | 全天均匀使用 |
|
||||
| **GLM-4.7** | 每日 10:00 AM | 晚上使用,次日上午重置 |
|
||||
| **MiniMax M2.1** | 5 小时滚动 | 任意时间用,跟踪滚动窗口 |
|
||||
| **iFlow/Qwen/Kiro** | 无限制 | 应急备用 |
|
||||
|
||||
**日常安排示例:**
|
||||
```
|
||||
08:00 - 13:00: Claude Code(全新 5h 配额)
|
||||
13:00 - 18:00: Gemini CLI(每日 1K 配额)
|
||||
18:00 - 22:00: GLM-4.7(便宜,10AM 重置)
|
||||
22:00 - 08:00: MiniMax 或 iFlow(5h 滚动 或 免费)
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 监控与告警
|
||||
|
||||
### 仪表盘配额跟踪
|
||||
|
||||
```
|
||||
仪表盘 → 配额概览:
|
||||
Claude Code: 剩余 2.5h / 5h (50%)
|
||||
Gemini CLI: 今日 450 / 1000 次请求
|
||||
GLM-4.7: 5M / 10M tokens (8h 后重置)
|
||||
MiniMax: 3M / 5M tokens (5h 滚动)
|
||||
```
|
||||
|
||||
### 实时通知
|
||||
|
||||
```
|
||||
仪表盘 → 通知:
|
||||
⚠️ Claude Code 配额使用 80%(剩 1h)
|
||||
✅ GLM-4.7 配额已重置(10M tokens 可用)
|
||||
💰 每日预算使用 50%($2.50 / $5)
|
||||
```
|
||||
|
||||
### 使用分析
|
||||
|
||||
```
|
||||
仪表盘 → 分析:
|
||||
今日: 50M tokens
|
||||
- 30M 通过 Claude Code(订阅)
|
||||
- 15M 通过 GLM-4.7($9)
|
||||
- 5M 通过 iFlow(免费)
|
||||
|
||||
成本: $9(对比 ChatGPT API $1000)
|
||||
节省: 99%
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 故障排除
|
||||
|
||||
**问题:"All providers quota exhausted"**
|
||||
|
||||
**方案:**
|
||||
1. 查看仪表盘配额跟踪
|
||||
2. 等待配额重置(查看倒计时)
|
||||
3. 在回退链中加入免费层
|
||||
4. 或提高预算上限
|
||||
|
||||
**问题:"Too many fallback switches"**
|
||||
|
||||
**方案:**
|
||||
1. 检查主提供商是否宕机
|
||||
2. 提高配额上限(升级订阅)
|
||||
3. 使用更便宜的主模型(用 GLM 代替 Claude)
|
||||
|
||||
**问题:"Unexpected costs"**
|
||||
|
||||
**方案:**
|
||||
1. 仪表盘 → 分析 → 查看使用情况
|
||||
2. 设置每日/每月预算上限
|
||||
3. 非关键任务切换到免费层
|
||||
4. 使用带免费回退的组合
|
||||
|
||||
---
|
||||
|
||||
## 相关
|
||||
|
||||
- [组合](./combos.md) - 创建自定义回退链
|
||||
- [配额跟踪](./quota-tracking.md) - 监控使用与成本
|
||||
Reference in New Issue
Block a user