Feat : Gitbook

This commit is contained in:
decolua
2026-05-11 11:50:24 +07:00
parent 7ad538bcf2
commit fd92af77a0
124 changed files with 34154 additions and 4 deletions

View File

@@ -0,0 +1,537 @@
# 组合(Combos)- 自定义回退链
创建自定义的模型组合并自动回退。组合让你根据成本、质量和可用性定义自己的路由策略。
---
## 什么是组合?
组合是你在仪表盘中创建的 **自定义回退链**。它不是单一模型,而是定义一组顺序模型,由 9Router 依次尝试。
**示例:**
```
组合名: premium-coding
模型:
1. cc/claude-opus-4-5-20251101 (首选)
2. glm/glm-4.7 (#1 配额耗尽时)
3. minimax/MiniMax-M2.1 (#2 配额耗尽时)
```
**CLI 中使用:**
```
Model: premium-coding
```
9Router 会按顺序自动尝试每个模型,直到成功为止。
---
## 为什么使用组合?
### 1. 最大化订阅价值
```
cc/claude-opus → glm/glm-4.7 → if/kimi-k2-thinking
→ 先用订阅,低价备用,免费应急
→ 充分利用你已付费的订阅
```
### 2. 最小化成本
```
glm/glm-4.7 → minimax/MiniMax-M2.1 → if/kimi-k2-thinking
→ 从最便宜的付费选项开始(每 1M $0.60)
→ 回退到更便宜的(每 1M $0.20)
→ 应急免费层
→ 总成本: 约 $5-10/月,而 ChatGPT API 需要 $2000
```
### 3. 保障 24/7 可用
```
cc/claude-opus → cx/gpt-5.2-codex → glm/glm-4.7 → if/kimi-k2-thinking
→ 末尾总是放免费层
→ 永不耗尽配额
→ 随时随地编码
```
### 4. 质量优化
```
cc/claude-opus-4-5 → cx/gpt-5.2-codex → gc/gemini-3-pro
→ 优先最好的模型
→ 回退到其他高端模型
→ 整个回退链保持高质量
```
---
## 如何创建组合
### 步骤 1:打开仪表盘
```
http://localhost:20128
→ 用密码登录
```
### 步骤 2:进入组合页面
```
仪表盘 → 组合 → 新建组合
```
### 步骤 3:配置组合
**组合名:**
```
premium-coding
```
**描述(可选):**
```
订阅优先,低价备用,免费应急
```
**选择模型:**
```
1. cc/claude-opus-4-5-20251101
2. glm/glm-4.7
3. minimax/MiniMax-M2.1
```
**拖动排序** - 自上而下表示优先级。
### 步骤 4:保存
```
点击 "Save Combo"
→ 组合出现在模型列表中
```
### 步骤 5:在 CLI 中使用
```
Cursor/Cline/任意工具:
Model: premium-coding
```
---
## 示例组合
### 示例 1:Premium Coding(订阅 → 低价 → 免费)
**目标**:最大化订阅价值,最小化额外成本。
```
仪表盘 → 组合 → 新建
名称: premium-coding
模型:
1. cc/claude-opus-4-5-20251101
2. glm/glm-4.7
3. minimax/MiniMax-M2.1
```
**用法:**
```
Cursor IDE:
Model: premium-coding
```
**行为:**
```
早上(全新配额):
请求 → cc/claude-opus-4-5 ✅
下午(Claude 配额用完):
请求 → glm/glm-4.7 ✅ (自动切换)
晚上(GLM 配额用完):
请求 → minimax/MiniMax-M2.1 ✅ (自动切换)
```
**月成本(100M tokens):**
```
80M 通过 Claude Code: $0(订阅)
15M 通过 GLM: $9
5M 通过 MiniMax: $1
合计: $10 + 你的订阅
```
**节省**:相比 ChatGPT API($2000)约 99%。
---
### 示例 2:Budget Combo(低价 → 免费)
**目标**:最小化成本,免费层作为备用。
```
仪表盘 → 组合 → 新建
名称: budget-combo
模型:
1. glm/glm-4.7
2. minimax/MiniMax-M2.1
3. if/kimi-k2-thinking
```
**用法:**
```
Cline:
Provider: OpenAI Compatible
Base URL: http://localhost:20128/v1
Model: budget-combo
```
**行为:**
```
请求 → glm/glm-4.7
✅ 每日配额可用 → 使用 GLM(每 1M $0.60)
❌ 配额耗尽 → 尝试 MiniMax(每 1M $0.20)
❌ MiniMax 配额用完 → 使用 iFlow(免费)
```
**月成本(100M tokens):**
```
70M 通过 GLM: $42
20M 通过 MiniMax: $4
10M 通过 iFlow: $0
合计: $46,而 ChatGPT API 需 $2000
```
**节省**:97%。
---
### 示例 3:Free Combo(零成本)
**目标**:100% 免费,永不付费。
```
仪表盘 → 组合 → 新建
名称: free-combo
模型:
1. if/kimi-k2-thinking
2. qw/qwen3-coder-plus
3. kr/claude-sonnet-4.5
```
**用法:**
```
Claude Desktop:
Model: free-combo
```
**行为:**
```
请求 → if/kimi-k2-thinking
✅ 可用 → 使用 iFlow
❌ 错误 → 尝试 Qwen
❌ 错误 → 尝试 Kiro
```
**月成本:**
```
100M tokens 通过免费提供商: $0
合计: 永远 $0
```
**适用场景**:个人项目、学习、试验。
---
### 示例 4:Quality First(仅高端模型)
**目标**:最高质量,无低价回退。
```
仪表盘 → 组合 → 新建
名称: quality-first
模型:
1. cc/claude-opus-4-5-20251101
2. cx/gpt-5.2-codex
3. gc/gemini-3-pro-preview
```
**用法:**
```
Codex CLI:
export OPENAI_BASE_URL="http://localhost:20128"
Model: quality-first
```
**行为:**
```
请求 → cc/claude-opus-4-5
❌ 配额用完 → cx/gpt-5.2-codex
❌ 配额用完 → gc/gemini-3-pro-preview
❌ 全部用完 → 返回错误(无低价回退)
```
**适用场景**:关键生产代码、复杂重构。
---
### 示例 5:Multi-Subscription(用足所有订阅)
**目标**:在产生额外费用前用足所有订阅。
```
仪表盘 → 组合 → 新建
名称: multi-sub
模型:
1. gc/gemini-3-flash-preview (每月免费 180K)
2. cc/claude-opus-4-5-20251101 (Pro 订阅)
3. cx/gpt-5.2-codex (Plus 订阅)
4. gh/gpt-5 (Copilot 订阅)
5. glm/glm-4.7 (低价备用)
6. if/kimi-k2-thinking (免费应急)
```
**月成本(200M tokens):**
```
50M 通过 Gemini CLI: $0(免费层)
80M 通过 Claude Code: $0(订阅)
40M 通过 Codex: $0(订阅)
20M 通过 Copilot: $0(订阅)
8M 通过 GLM: $4.80
2M 通过 iFlow: $0
合计: $4.80 + 你已有的订阅
```
**结果**:190M tokens 来自订阅,只有 $4.80 额外费用。
---
### 示例 6:配额重置优化
**目标**:根据重置时间分配使用。
```
仪表盘 → 组合 → 新建
名称: reset-optimized
模型:
1. cc/claude-opus-4-5 (5h 重置, 早上用)
2. gc/gemini-3-flash (每日 1K, 下午用)
3. glm/glm-4.7 (每日 10AM 重置, 晚上用)
4. minimax/MiniMax-M2.1 (5h 滚动, 夜里用)
5. if/kimi-k2-thinking (无限, 应急)
```
**日常安排:**
```
08:00 - 13:00: Claude Code(全新 5h 配额)
13:00 - 18:00: Gemini CLI(每日 1K 配额)
18:00 - 22:00: GLM(次日 10AM 重置)
22:00 - 08:00: MiniMax(5h 滚动)或 iFlow
```
**结果**:24/7 编码,成本极低。
---
## 在 CLI 工具中使用组合
### Cursor IDE
```
Settings → Models → Advanced:
OpenAI API Base URL: http://localhost:20128/v1
OpenAI API Key: [从仪表盘获取]
Model: premium-coding
```
### Claude Desktop
编辑 `~/.claude/config.json`:
```json
{
"anthropic_api_base": "http://localhost:20128/v1",
"anthropic_api_key": "your-9router-api-key",
"model": "budget-combo"
}
```
### Codex CLI
```bash
export OPENAI_BASE_URL="http://localhost:20128"
export OPENAI_API_KEY="your-9router-api-key"
codex --model quality-first "your prompt"
```
### Cline / Continue / RooCode
```
Provider: OpenAI Compatible
Base URL: http://localhost:20128/v1
API Key: [从仪表盘获取]
Model: free-combo
```
### API 请求
```bash
curl http://localhost:20128/v1/chat/completions \
-H "Authorization: Bearer your-api-key" \
-H "Content-Type: application/json" \
-d '{
"model": "premium-coding",
"messages": [
{"role": "user", "content": "Write a function to..."}
],
"stream": true
}'
```
---
## 最佳实践
### 1. 总是包含免费层
```
✅ 好:
cc/claude-opus → glm/glm-4.7 → if/kimi-k2-thinking
❌ 不好:
cc/claude-opus → glm/glm-4.7
(无免费回退,可能耗尽配额)
```
**原因**:确保 24/7 可用,绝不会被配额卡住。
### 2. 按成本排序(便宜 → 贵)
```
✅ 好:
glm/glm-4.7 → minimax/MiniMax-M2.1 → cc/claude-opus
❌ 不好:
cc/claude-opus → glm/glm-4.7
(在简单任务上浪费订阅配额)
```
**例外**:如果想充分利用订阅价值,把订阅放在最前面。
### 3. 匹配质量要求
```
生产代码:
cc/claude-opus → cx/gpt-5.2-codex → glm/glm-4.7
简单任务:
glm/glm-4.7 → if/kimi-k2-thinking
试验:
if/kimi-k2-thinking → qw/qwen3-coder-plus
```
### 4. 考虑配额重置时间
```
早上组合(配额刚刷新):
cc/claude-opus → cx/gpt-5.2-codex
晚上组合(配额大概率耗尽):
glm/glm-4.7 → minimax/MiniMax-M2.1 → if/kimi-k2-thinking
```
### 5. 为不同场景创建多个组合
```
premium-coding: 复杂任务
budget-combo: 简单任务
free-combo: 试验
quality-first: 生产代码
```
**根据任务需求切换组合**。
### 6. 监控组合性能
```
仪表盘 → 分析 → 组合使用:
premium-coding:
80% 通过 cc/claude-opus(良好,使用订阅)
15% 通过 glm/glm-4.7(可接受备用)
5% 通过 minimax(罕见回退)
```
**优化**:回退使用过多时,提高主配额或重新排序模型。
---
## 高级配置
### 为组合设置预算上限
```
仪表盘 → 组合 → 编辑 → 预算:
每日上限: $5
每月上限: $50
```
达到上限时,9Router 跳过付费模型,仅使用免费层。
### 启用/禁用组合中的模型
```
仪表盘 → 组合 → 编辑 → 模型:
✅ cc/claude-opus-4-5(启用)
❌ glm/glm-4.7(暂时禁用)
✅ if/kimi-k2-thinking(启用)
```
**用途**:暂时禁用昂贵模型而不删除组合。
### 克隆已有组合
```
仪表盘 → 组合 → 克隆 "premium-coding"
→ 生成带 "-copy" 后缀的副本
→ 修改后另存为新组合
```
**用途**:为不同场景创建变体。
---
## 故障排除
**问题:组合未出现在模型列表中**
**方案:**
1. 刷新仪表盘
2. 检查组合已保存(绿色对勾)
3. 重启 CLI 工具以刷新模型列表
**问题:组合总是用最后一个模型(免费层)**
**方案:**
1. 检查主模型的配额(仪表盘 → 配额)
2. 确认 API keys 有效(仪表盘 → 提供商)
3. 检查是否超出预算上限
**问题:组合成本超出预期**
**方案:**
1. 仪表盘 → 分析 → 查看组合使用情况
2. 检查主模型是否配额耗尽
3. 重新排序模型(更便宜的放前面)
4. 设置预算上限
---
## 相关
- [智能路由](./smart-routing.md) - 自动回退如何工作
- [配额跟踪](./quota-tracking.md) - 监控使用与成本

View File

@@ -0,0 +1,687 @@
# 配额跟踪 & 使用监控
实时跟踪 token 消耗、监控配额上限、估算成本,并在配额用尽前获得提醒。绝不浪费订阅配额,也不超出预算上限。
---
## 概览
9Router 为所有提供商提供完善的配额跟踪:
- **实时 token 消耗** - 查看每次请求使用的 tokens
- **配额上限与剩余** - 跟踪使用 vs 上限
- **重置倒计时** - 了解配额何时刷新
- **成本估算** - 计算付费层支出
- **月度报告** - 分析使用模式
- **告警与通知** - 接近上限时收到警告
---
## 仪表盘总览
### 配额摘要
```
仪表盘 → 主页 → 配额概览
┌─────────────────────────────────────────────┐
│ Claude Code (cc/) │
│ ████████████░░░░░░░░ 2.5h / 5h (50%) │
│ 重置剩余: 2h 30m │
│ 成本: $0(订阅) │
└─────────────────────────────────────────────┘
┌─────────────────────────────────────────────┐
│ Gemini CLI (gc/) │
│ ████████░░░░░░░░░░░░ 450 / 1000 (45%) │
│ 每日重置剩余: 18h 30m │
│ 本月: 45K / 180K (25%) │
│ 成本: $0(免费层) │
└─────────────────────────────────────────────┘
┌─────────────────────────────────────────────┐
│ GLM-4.7 (glm/) │
│ ██████████████░░░░░░ 7M / 10M tokens (70%) │
│ 重置: 每日 10:00 AM(5h 35m 后) │
│ 今日成本: $4.20 │
└─────────────────────────────────────────────┘
┌─────────────────────────────────────────────┐
│ MiniMax M2.1 (minimax/) │
│ ████████████████░░░░ 4M / 5M tokens (80%) │
│ 5h 滚动窗口 │
│ 成本(5h): $0.80 │
└─────────────────────────────────────────────┘
┌─────────────────────────────────────────────┐
│ iFlow (if/) │
│ ████████████████████ 无限 │
│ 成本: $0(永久免费) │
└─────────────────────────────────────────────┘
```
---
## 实时 Token 消耗
### 按请求跟踪
每次请求都会显示详细的 token 使用情况:
```
仪表盘 → 活动 → 最近请求
请求 #1234
模型: cc/claude-opus-4-5-20251101
时间戳: 2026-02-04 04:15:32
Tokens:
输入: 1,250 tokens
输出: 850 tokens
合计: 2,100 tokens
成本: $0(订阅配额)
耗时: 3.2s
状态: ✅ 成功
```
### 实时使用监控
```
仪表盘 → 实时监控
当前请求:
模型: glm/glm-4.7
已流式输出 tokens: 450 / 预计 ~800
当前成本: $0.0009
耗时: 1.8s
```
### 按模型分解 Token
```
仪表盘 → 分析 → Token 使用
今日(2026-02-04):
cc/claude-opus-4-5: 15M tokens($0,订阅)
glm/glm-4.7: 8M tokens($4.80)
if/kimi-k2-thinking: 3M tokens($0,免费)
合计: 26M tokens
成本: $4.80
```
---
## 配额上限与重置时间
### 订阅型提供商
**Claude Code (Pro/Max)**
```
配额类型: 基于时间(5 小时滚动)
上限: 5 小时使用时长
重置: 5 小时滚动窗口 + 每周刷新
跟踪: 每个模型的使用时间
仪表盘显示:
Opus: 已用 2.5h / 5h
Sonnet: 已用 1.2h / 5h
Haiku: 已用 0.8h / 5h
每周重置: 每周一 00:00 UTC
```
**OpenAI Codex (Plus/Pro)**
```
配额类型: 基于时间(5 小时滚动)
上限: 5 小时(Plus)/ 10 小时(Pro)
重置: 5 小时滚动窗口 + 每周刷新
仪表盘显示:
GPT-5.2 Codex: 已用 3.5h / 5h
重置剩余: 1h 30m
```
**Gemini CLI(免费)**
```
配额类型: 请求次数 + 月度 tokens
每日上限: 1,000 次请求
月度上限: 180,000 次补全
重置: 每日 00:00 UTC + 每月 1 日
仪表盘显示:
今日: 450 / 1,000 次请求 (45%)
本月: 45K / 180K 次补全 (25%)
每日重置剩余: 18h 30m
月度重置剩余: 26 天
```
**GitHub Copilot**
```
配额类型: 月度使用量
上限: 因套餐而异
重置: 每月 1 日
仪表盘显示:
使用: 月度配额 60%
重置: 2026 年 3 月 1 日(25 天后)
```
### 低价提供商
**GLM-4.7**
```
配额类型: 每日 token 上限
上限: 10M tokens/天(Coding Plan)
重置: 每日 10:00 AM 北京时间(UTC+8)
仪表盘显示:
已用: 7M / 10M tokens (70%)
剩余: 3M tokens
重置剩余: 5h 35m
今日成本: $4.20
```
**MiniMax M2.1**
```
配额类型: 5 小时滚动窗口
上限: 每 5 小时 5M tokens
重置: 连续滚动窗口
仪表盘显示:
已用(5h): 4M / 5M tokens (80%)
最早一次使用过期: 45m
成本(5h): $0.80
```
**Kimi K2**
```
配额类型: 月度订阅
上限: 10M tokens/月($9 固定)
重置: 订阅日每月一次
仪表盘显示:
已用: 6M / 10M tokens (60%)
重置: 2026 年 2 月 15 日(11 天后)
成本: $9/月(预付)
```
### 免费提供商
**iFlow / Qwen / Kiro**
```
配额类型: 无限(限速)
上限: 无硬上限
重置: 不适用
仪表盘显示:
今日已用: 5M tokens
成本: $0(永久免费)
状态: ✅ 可用
```
---
## 成本估算
### 实时成本跟踪
```
仪表盘 → 成本 → 今日
订阅型提供商: $0
Claude Code: 15M tokens($0,包含)
Gemini CLI: 3M tokens($0,免费层)
付费提供商: $4.80
GLM-4.7: 8M tokens($4.80)
输入: 6M × $0.60/1M = $3.60
输出: 2M × $2.20/1M = $4.40
合计: $4.80
免费提供商: $0
iFlow: 3M tokens($0)
今日合计: $4.80
```
### 月度支出报告
```
仪表盘 → 成本 → 本月(2026 年 2 月)
第 1 周(2 月 1-7 日):
订阅: $0(80M tokens)
付费: $15.20(25M tokens)
免费: $0(10M tokens)
合计: $15.20
第 2 周(2 月 8-14 日):
订阅: $0(75M tokens)
付费: $12.80(20M tokens)
免费: $0(8M tokens)
合计: $12.80
本月至今: $28.00
预计(30 天): ~$120
按提供商分解:
GLM-4.7: $22.00 (78%)
MiniMax M2.1: $6.00 (22%)
每 1M tokens 平均成本: $0.62
相比 ChatGPT API 节省: 97%($4,000 → $120)
```
### 成本预测
```
仪表盘 → 成本 → 预测
基于近 7 天使用:
日均: 50M tokens
日成本: $4.50
月度预测:
Tokens: 1,500M (1.5B)
成本: $135
分解:
订阅: 900M tokens($0)
GLM-4.7: 450M tokens($90)
MiniMax: 120M tokens($24)
免费: 30M tokens($0)
预算状态:
每日上限: $5 → 今日已用 90%
每月上限: $150 → 预计 90%
⚠️ 警告: 可能超出每月预算
```
---
## 使用仪表盘
### 总览统计
```
仪表盘 → 分析 → 总览
今日(2026-02-04):
请求: 1,234
Tokens: 26M
成本: $4.80
平均响应时间: 2.1s
本周:
请求: 8,456
Tokens: 180M
成本: $28.00
成功率: 99.2%
本月:
请求: 15,234
Tokens: 320M
成本: $52.00
Top 模型: cc/claude-opus-4-5 (45%)
```
### 按模型使用
```
仪表盘 → 分析 → 模型
Top 模型(本月):
1. cc/claude-opus-4-5: 145M tokens (45%)
2. glm/glm-4.7: 95M tokens (30%)
3. if/kimi-k2-thinking: 50M tokens (16%)
4. minimax/MiniMax-M2.1: 20M tokens (6%)
5. gc/gemini-3-flash: 10M tokens (3%)
成本分解:
cc/claude-opus: $0(订阅)
glm/glm-4.7: $45.00
if/kimi-k2-thinking: $0(免费)
minimax/MiniMax-M2.1: $7.00
gc/gemini-3-flash: $0(免费)
```
### 按时间使用
```
仪表盘 → 分析 → 时间线
按小时使用(今日):
00:00 - 01:00: 0.5M tokens
01:00 - 02:00: 0.2M tokens
...
08:00 - 09:00: 3.2M tokens(峰值)
09:00 - 10:00: 2.8M tokens
...
23:00 - 00:00: 0.8M tokens
峰值时段: 08:00 - 12:00(早上编码)
低谷时段: 00:00 - 06:00(夜间)
```
### 按组合使用
```
仪表盘 → 分析 → 组合
premium-coding:
请求: 456
Tokens: 12M
成本: $2.40
分解:
cc/claude-opus: 8M tokens (67%, $0)
glm/glm-4.7: 3M tokens (25%, $1.80)
minimax/MiniMax-M2.1: 1M tokens (8%, $0.20)
budget-combo:
请求: 234
Tokens: 6M
成本: $1.20
分解:
glm/glm-4.7: 4M tokens (67%, $2.40)
if/kimi-k2-thinking: 2M tokens (33%, $0)
```
---
## 告警与通知
### 配额告警
```
仪表盘 → 设置 → 告警
配额预警:
✅ 配额使用 80% 时告警
✅ 配额使用 90% 时告警
✅ 配额耗尽时告警
✅ 配额重置时通知
发送方式:
✅ 仪表盘通知
✅ 邮件(可选)
✅ Webhook(可选)
```
**通知示例:**
```
⚠️ Claude Code 配额已用 80%
剩余 2.5h(1h 30m 后重置)
⚠️ GLM-4.7 配额已用 90%
剩余 1M tokens(5h 后重置)
✅ Gemini CLI 配额已重置
1,000 次请求可用(每日上限)
```
### 预算告警
```
仪表盘 → 设置 → 预算告警
每日预算: $5
✅ 80%($4)告警
✅ 100%($5)告警
✅ 超额时自动切换到免费层
每月预算: $150
✅ 50%($75)告警
✅ 80%($120)告警
✅ 100%($150)告警
```
**通知示例:**
```
⚠️ 每日预算已用 80%
今日花费 $4.00 / $5.00
⚠️ 每月预算达到 50%
本月花费 $75 / $150
预计: $135(预算内)
🚨 每日预算超额
今日花费 $5.20 / $5.00
已自动切换到免费层
```
### 成本异常检测
```
仪表盘 → 设置 → 异常检测
✅ 检测异常支出模式
✅ 成本峰值告警(>2× 日均)
✅ 配额耗尽模式警告
告警示例:
⚠️ 检测到成本峰值
今日: $12.50(2.5× 日均)
原因: GLM-4.7 高用量(20M tokens)
建议: 检查主模型是否配额耗尽
```
---
## 最佳实践
### 1. 每日监控配额
```
日常:
1. 查看仪表盘配额概览(30 秒)
2. 检查重置时间
3. 根据配额可用性规划使用
```
**示例:**
```
早晨检查:
✅ Claude Code: 5h 可用(刚重置)
✅ Gemini CLI: 1K 请求可用
⚠️ GLM-4.7: 剩 2M tokens(10AM 重置)
行动: 早上工作用 Claude Code
```
### 2. 设置预算上限
```
仪表盘 → 设置 → 预算:
每日: $5(防止超支)
每月: $150(与预算对齐)
```
**结果**:达到上限时自动切换到免费层。
### 3. 优化组合使用
```
仪表盘 → 分析 → 组合:
查看哪些模型用得最多
调整组合顺序以最小化成本
```
**示例:**
```
当前: cc/claude-opus → glm/glm-4.7
80% 通过 Claude(好)
20% 通过 GLM($12/月)
优化后: gc/gemini-3-flash → cc/claude-opus → glm/glm-4.7
50% 通过 Gemini(免费)
40% 通过 Claude(订阅)
10% 通过 GLM($6/月)
节省: $6/月
```
### 4. 跟踪重置时间
```
仪表盘 → 配额 → 重置日程:
Claude Code: 5h 滚动 + 每周一
Gemini CLI: 每日 00:00 UTC + 每月 1 日
GLM-4.7: 每日 10:00 AM 北京时间
MiniMax: 5h 滚动窗口
```
**策略**:配额刚刷新时使用对应提供商。
### 5. 查看月度报告
```
仪表盘 → 分析 → 月度报告:
总 tokens: 1.5B
总成本: $120
节省: 相比 ChatGPT API 节省 97%
洞察:
- 60% 用量来自订阅($0)
- 30% 通过 GLM($90)
- 10% 通过免费层($0)
优化:
- 增加 Gemini CLI 用量(免费)
- 减少 GLM 用量(更贵)
```
---
## API 访问
### 获取配额状态
```bash
GET http://localhost:20128/api/quota
Authorization: Bearer your-api-key
Response:
{
"providers": [
{
"id": "cc",
"name": "Claude Code",
"quota": {
"used": 2.5,
"limit": 5,
"unit": "hours",
"percentage": 50
},
"reset": {
"type": "rolling",
"window": "5h",
"nextReset": "2026-02-04T06:45:00Z"
},
"cost": {
"today": 0,
"month": 0,
"currency": "USD"
}
},
{
"id": "glm",
"name": "GLM-4.7",
"quota": {
"used": 7000000,
"limit": 10000000,
"unit": "tokens",
"percentage": 70
},
"reset": {
"type": "daily",
"time": "10:00 AM UTC+8",
"nextReset": "2026-02-04T10:00:00+08:00"
},
"cost": {
"today": 4.20,
"month": 52.00,
"currency": "USD"
}
}
]
}
```
### 获取使用统计
```bash
GET http://localhost:20128/api/usage?period=today
Authorization: Bearer your-api-key
Response:
{
"period": "today",
"date": "2026-02-04",
"summary": {
"requests": 1234,
"tokens": 26000000,
"cost": 4.80
},
"byModel": [
{
"model": "cc/claude-opus-4-5",
"requests": 456,
"tokens": 15000000,
"cost": 0
},
{
"model": "glm/glm-4.7",
"requests": 234,
"tokens": 8000000,
"cost": 4.80
}
]
}
```
---
## 故障排除
**问题:配额显示 0% 但请求失败**
**方案:**
1. 检查提供商连接(仪表盘 → 提供商)
2. 确认 API keys 有效
3. 检查提供商是否宕机(状态页)
4. 尝试重新连接 OAuth 提供商
**问题:成本估算不正确**
**方案:**
1. 仪表盘 → 设置 → 定价
2. 确认每个提供商的定价与当前一致
3. 若提供商调整费率,更新定价
4. 若差异持续,联系支持
**问题:重置时间没有更新**
**方案:**
1. 刷新仪表盘(F5)
2. 检查系统时间是否正确
3. 确认时区设置
4. 若问题持续,重启 9Router
**问题:未收到告警**
**方案:**
1. 仪表盘 → 设置 → 告警
2. 确认邮箱地址正确
3. 检查垃圾邮件夹
4. 测试通知(Send Test 按钮)
---
## 相关
- [智能路由](./smart-routing.md) - 基于配额自动回退
- [组合](./combos.md) - 创建自定义回退链

View File

@@ -0,0 +1,407 @@
# 智能路由 & 自动回退
9Router 通过 3 层回退系统,自动将你的请求路由到最佳可用提供商。绝不再因配额限制或速率限制而中断编码。
---
## 工作原理
9Router 使用智能路由,最大化已有订阅价值、最小化成本,并保障 24/7 可用:
```
请求 → 9Router → 检查第 1 层 (订阅)
↓ 配额耗尽
检查第 2 层 (低价)
↓ 预算上限
检查第 3 层 (免费)
↓
响应
```
### 3 层回退系统
**第 1 层:订阅(主力)**
- Claude Code(Pro/Max)
- OpenAI Codex(Plus/Pro)
- Gemini CLI(每月免费 180K)
- GitHub Copilot
- Antigravity(Google)
**目标**:充分挖掘你已付费订阅的价值。
**第 2 层:低价(备用)**
- GLM-4.7(输入每 1M $0.60)
- MiniMax M2.1(输入每 1M $0.20)
- Kimi K2($9/月固定)
**目标**:订阅配额用完后的超低价备用(比 ChatGPT API 便宜 ~90%)。
**第 3 层:免费(应急)**
- iFlow(8 个模型)
- Qwen(3 个模型)
- Kiro(Claude 免费)
**目标**:零成本回退,实现无限编码。
---
## 自动切换
9Router 实时监控配额,自动切换提供商:
### 场景 1:订阅配额耗尽
```
用户请求 → cc/claude-opus-4-5
↓ 配额耗尽(达到 5 小时限制)
自动切换 → glm/glm-4.7
↓ 每日配额耗尽
自动切换 → minimax/MiniMax-M2.1
↓ 5 小时配额耗尽
自动切换 → if/kimi-k2-thinking (免费)
↓
响应已送达 ✅
```
**结果**:零停机,无缝体验。
### 场景 2:速率限制
```
用户请求 → cx/gpt-5.2-codex
↓ 速率受限(请求过多)
自动切换 → glm/glm-4.7
↓
响应已送达 ✅
```
### 场景 3:提供商不可用
```
用户请求 → cc/claude-opus-4-5
↓ 提供商错误(503)
自动切换 → 下一个可用模型
↓
响应已送达 ✅
```
---
## 模型选择逻辑
9Router 基于以下因素选择最佳模型:
1. **配额可用性** - 检查提供商是否仍有剩余配额
2. **成本层级** - 优先订阅 → 低价 → 免费
3. **重置时间** - 考虑配额何时重置
4. **提供商健康度** - 跳过有错误的提供商
### 优先级示例
对 `cc/claude-opus-4-5` 的请求:
```
1. 检查 Claude Code 配额
✅ 可用 → 使用 cc/claude-opus-4-5
❌ 耗尽 → 继续步骤 2
2. 检查回退层(若已配置)
✅ GLM 配额可用 → 使用 glm/glm-4.7
❌ 耗尽 → 继续步骤 3
3. 检查免费层
✅ iFlow 可用 → 使用 if/kimi-k2-thinking
❌ 全部耗尽 → 返回配额错误
```
---
## 配置选项
### 仪表盘设置
**1. 启用/禁用自动回退**
```
仪表盘 → 设置 → 智能路由
→ 切换 "Auto Fallback" ON/OFF
```
- **ON**(默认):自动层级切换
- **OFF**:严格模式,主模型不可用时返回错误
**2. 设置预算上限**
```
仪表盘 → 设置 → 预算控制
→ 每日上限: $5
→ 每月上限: $50
```
预算耗尽时,9Router 自动切换到免费层。
**3. 配置回退顺序**
```
仪表盘 → 设置 → 回退优先级
→ 拖动以重新排序每层内的提供商
```
自定义顺序示例:
```
第 1 层: Gemini CLI → Claude Code → Codex
第 2 层: MiniMax → GLM → Kimi
第 3 层: iFlow → Kiro → Qwen
```
**4. 配额重置通知**
```
仪表盘 → 设置 → 通知
→ 配额重置时邮件提醒
→ 配额使用 80% 时告警
```
---
## 示例
### 示例 1:基础自动回退
**设置:**
```
Model: cc/claude-opus-4-5-20251101
Fallback: 自动(默认 3 层)
```
**行为:**
```
早上(全新配额):
请求 → cc/claude-opus-4-5 ✅
下午(配额耗尽):
请求 → glm/glm-4.7 ✅ (自动切换)
晚上(GLM 配额用完):
请求 → minimax/MiniMax-M2.1 ✅ (自动切换)
深夜(付费配额全部耗尽):
请求 → if/kimi-k2-thinking ✅ (免费层)
```
**成本**:额外约 $5-10/月(大部分由订阅覆盖)。
### 示例 2:预算优先路由
**设置:**
```
仪表盘 → 设置:
每日预算: $2
每月预算: $20
Fallback: 启用
```
**行为:**
```
1-15 日(预算内):
请求 → glm/glm-4.7 (低价层)
成本: $1.50/天
第 16 日(达到预算):
请求 → if/kimi-k2-thinking (免费层)
成本: $0
下月(预算重置):
请求 → 重新使用 glm/glm-4.7
```
**结果**:绝不超过 $20/月,始终可用。
### 示例 3:仅订阅模式
**设置:**
```
仪表盘 → 设置:
Auto Fallback: OFF
Strict mode: ON
```
**行为:**
```
请求 → cc/claude-opus-4-5
✅ 配额可用 → 成功
❌ 配额耗尽 → 返回错误(无回退)
```
**适用场景**:只想用付费订阅,绝不产生额外成本。
### 示例 4:仅免费模式
**设置:**
```
Model: if/kimi-k2-thinking
Fallback: qw/qwen3-coder-plus → kr/claude-sonnet-4.5
```
**行为:**
```
所有请求 → 仅免费层
成本: 永远 $0
```
**适用场景**:个人项目、学习、试验。
---
## 最佳实践
### 1. 最大化订阅价值
```
策略:
- 将订阅模型设为第 1 层
- 在仪表盘监控配额使用
- 仅在订阅耗尽时使用低价层
```
**示例组合:**
```
cc/claude-opus-4-5 → glm/glm-4.7 → if/kimi-k2-thinking
```
### 2. 成本优化
```
策略:
- 先用 Gemini CLI 免费层(每月 180K)
- 回退到 GLM/MiniMax(超低价)
- 应急: iFlow(免费)
```
**示例组合:**
```
gc/gemini-3-flash-preview → glm/glm-4.7 → if/kimi-k2-thinking
```
### 3. 质量优先
```
策略:
- 使用最佳模型(Claude Opus、GPT-5.2)
- 回退到优秀的低价模型(GLM-4.7)
- 最后手段: 免费层
```
**示例组合:**
```
cc/claude-opus-4-5 → cx/gpt-5.2-codex → glm/glm-4.7
```
### 4. 24/7 可用性
```
策略:
- 回退链中总是包含免费层
- 监控配额重置时间
- 在多个提供商间分散使用
```
**示例组合:**
```
cc/claude-opus-4-5 → glm/glm-4.7 → minimax/MiniMax-M2.1 → if/kimi-k2-thinking
```
**结果**:永不耗尽配额,随时编码。
---
## 配额重置策略
围绕配额重置时间规划使用:
| 提供商 | 配额重置 | 策略 |
|----------|-------------|----------|
| **Claude Code** | 5 小时 + 每周 | 早上使用,配额最新鲜 |
| **Codex** | 5 小时 + 每周 | Claude 配额用完后使用 |
| **Gemini CLI** | 每日(1K)+ 每月(180K) | 全天均匀使用 |
| **GLM-4.7** | 每日 10:00 AM | 晚上使用,次日上午重置 |
| **MiniMax M2.1** | 5 小时滚动 | 任意时间用,跟踪滚动窗口 |
| **iFlow/Qwen/Kiro** | 无限制 | 应急备用 |
**日常安排示例:**
```
08:00 - 13:00: Claude Code(全新 5h 配额)
13:00 - 18:00: Gemini CLI(每日 1K 配额)
18:00 - 22:00: GLM-4.7(便宜,10AM 重置)
22:00 - 08:00: MiniMax 或 iFlow(5h 滚动 或 免费)
```
---
## 监控与告警
### 仪表盘配额跟踪
```
仪表盘 → 配额概览:
Claude Code: 剩余 2.5h / 5h (50%)
Gemini CLI: 今日 450 / 1000 次请求
GLM-4.7: 5M / 10M tokens (8h 后重置)
MiniMax: 3M / 5M tokens (5h 滚动)
```
### 实时通知
```
仪表盘 → 通知:
⚠️ Claude Code 配额使用 80%(剩 1h)
✅ GLM-4.7 配额已重置(10M tokens 可用)
💰 每日预算使用 50%($2.50 / $5)
```
### 使用分析
```
仪表盘 → 分析:
今日: 50M tokens
- 30M 通过 Claude Code(订阅)
- 15M 通过 GLM-4.7($9)
- 5M 通过 iFlow(免费)
成本: $9(对比 ChatGPT API $1000)
节省: 99%
```
---
## 故障排除
**问题:"All providers quota exhausted"**
**方案:**
1. 查看仪表盘配额跟踪
2. 等待配额重置(查看倒计时)
3. 在回退链中加入免费层
4. 或提高预算上限
**问题:"Too many fallback switches"**
**方案:**
1. 检查主提供商是否宕机
2. 提高配额上限(升级订阅)
3. 使用更便宜的主模型(用 GLM 代替 Claude)
**问题:"Unexpected costs"**
**方案:**
1. 仪表盘 → 分析 → 查看使用情况
2. 设置每日/每月预算上限
3. 非关键任务切换到免费层
4. 使用带免费回退的组合
---
## 相关
- [组合](./combos.md) - 创建自定义回退链
- [配额跟踪](./quota-tracking.md) - 监控使用与成本