Llmrouter

🔀 智能路由省成本,按需调用最优模型

智能LLM代理路由器,根据任务复杂度自动选择模型,使用本地Qwen分类器节省API成本,目前仅测试Anthropic

收藏
10.6k
安装
2.6k
版本
0.1.0
CLS 安全性认证2026-06-24
点击查看完整报告 >

使用说明

LLM Router 综合评估

核心用法

LLM Router 是一个开源的智能代理服务器,位于用户与大模型API之间,自动分析输入请求的复杂度并将其路由到成本最优的模型。系统采用本地运行的Ollama小型模型(默认Qwen2.5:3B)作为分类器,将任务分为5个复杂度等级(super_easy/easy/medium/hard/super_hard),对应Anthropic不同价位的Claude模型。

工作流程:用户请求 → 本地分类器判定复杂度 → 路由至Haiku/Sonnet/Opus → 返回结果。支持OpenAI兼容API格式,可无缝接入现有工具链。

显著优点

  • 成本优化:简单问候使用Haiku( cheapest),复杂架构设计才调用Opus,典型场景可节省50-80%成本
  • 透明可控:基于本地运行的开源模型做分类决策,无需额外API调用
  • 灵活配置:YAML配置+Markdown路由规则表,支持自定义复杂度定义和模型映射
  • OpenClaw集成:专为该生态设计,扩展性强

局限性与风险

  • 成熟度不足:核心功能仅Anthropic经测试,OpenAI/Google/Ollama均为"未测试"状态
  • 分类准确性依赖:3B参数模型的判断力有限,可能误判任务复杂度导致体验下降或成本失控
  • 单点故障:本地Ollama宕机则整个路由系统失效
  • 延迟增加:增加一次本地推理的额外延迟(通常<100ms但不可忽视)
  • 维护负担:需同时管理Ollama服务、分类器模型、代理服务器三层组件

适合人群

  • 高频使用Claude API且请求类型差异大的开发者
  • 希望精细控制AI预算的技术团队
  • 已部署OpenClaw生态的用户
  • 愿意承担运维复杂度换取成本优化的高级用户

常规风险

  • API密钥暴露:需配置Anthropic密钥于环境变量,存在泄露风险
  • 配置错误成本:路由规则误配可能导致意外调用高价模型
  • 本地服务安全:默认监听127.0.0.1,但生产环境暴露需谨慎
  • 供应商锁定:深度集成Anthropic,迁移至其他平台需重构配置

安全解读

核心用法

LLM Router 是一款智能代理服务器,通过本地运行的轻量级分类模型(如 Qwen2.5:3B)自动判定任务复杂度,并将请求路由至匹配的 Claude 模型层级:

  • super_easy/easy → Haiku(问候、简单问答)
  • medium → Sonnet(编码、邮件、研究)
  • hard/super_hard → Opus(复杂推理、系统架构)

部署流程极简:启动本地 Ollama 分类器 → 配置 YAML 路由表 → 运行 Python 服务器 → 将原有 API 端点指向 localhost:4001 即可。提供 OpenAI 兼容 API,支持 --openclaw 模式与 Claude Code 深度集成。

显著优点

1. 成本优化显著:简单任务使用 Haiku 替代 Opus,单次调用成本可降低 10-20 倍
2. 零代码侵入:作为透明代理层,无需修改现有应用代码

3. 延迟可控:本地分类器响应 <100ms,分类准确时整体延迟反而降低

4. 灵活可定制:通过 ROUTES.md 调整分类规则,YAML 配置支持多提供商扩展

5. 开源透明:纯 Python 实现,无黑盒逻辑,可自行审计路由决策

潜在缺点与局限性

| 局限 | 说明 |
|------|------|
| 生态锁定 | 当前**仅 Anthropic 经过实际测试**,OpenAI/Gemini/本地模型虽实现但未验证 |
| 分类单点依赖 | 依赖 3B 参数小模型判断复杂度,存在误分类风险(如将"简单代码"判为 hard) |
| 基础设施要求 | 必须本地运行 Ollama,对纯云环境用户增加运维负担 |
| 项目成熟度 | 个人开发者维护,GitHub 仅 5 stars,长期维护存疑 |
| 无自动回退 | 分类模型故障时缺乏 graceful degradation 机制 |

适合人群

  • 高频 Claude API 用户:日均调用 >100 次,任务类型差异大(客服+研发混用)
  • 成本敏感型团队:初创公司或个人开发者,希望在不牺牲质量前提下压缩 AI 预算
  • 已有本地 GPU 资源:已运行 Ollama 进行其他本地推理的用户,边际成本极低

常规风险

1. 分类误判导致体验降级:复杂任务被路由至 Haiku 可能输出质量骤降,需监控反馈循环
2. API 密钥泄露:配置需存储 Anthropic API Key,建议配合密钥管理服务

3. 服务可用性:本地代理成为新故障点,生产环境需考虑高可用部署

4. 供应商锁定加深:优化方案与 Anthropic 定价结构深度耦合,迁移成本上升

Llmrouter 内容

手动下载zip · 2.1 kB
SKILL.mdtext/markdown
请选择文件