Clawhub Skill

🔀 智能路由降本 · 多模混合部署

开源智能推理路由器,通过硬件感知分类器自动将 LLM 请求路由至最具性价比的模型,降低 API 成本的同时保持输出质量。

收藏
5.3k
安装
2.4k
版本
0.1.4
CLS 安全性认证2026-08-10
点击查看完整报告 >

使用说明

核心用法

Xrouter 是一款 MIT 许可的开源 LLM 推理路由器,部署于客户端与模型提供商之间。其核心机制是通过三级分类器(0=廉价、1=中等、2=前沿)实时评估每个请求复杂度,自动匹配最经济的可用模型。用户通过 OpenAI 兼容接口(POST /v1/chat/completions)发送请求,系统根据分类结果智能选择本地或云端提供商,并支持流式响应。

显著优点

  • 成本优化显著:通过智能降级将简单请求路由至廉价/本地模型,复杂任务才调用前沿模型,可大幅降低 API 支出
  • 部署灵活:支持纯本地(Ollama/vLLM/TensorRT-LLM/llama.cpp)、纯云端或混合模式,硬件检测脚本自动推荐最优引擎
  • 生态兼容性强:支持 OpenAI、Anthropic、Gemini、Cohere、Azure 等 10+ 提供商,自动适配非 OpenAI 接口的流式翻译
  • 可观测性完善:内置 Token 追踪仪表板(/dashboard)和用量 JSON 端点(/usage),响应头暴露路由决策(X-Xrouter-decision
  • 缓存与容错:Redis/LRU 双层缓存,分类失败自动回退至前沿模型,保障服务连续性

潜在缺点与局限性

  • 分类器可靠性依赖:分类准确性直接影响成本效益,错误分类可能导致简单任务调用昂贵模型或复杂任务被低估
  • 本地模型运维成本:需自行维护本地推理服务(模型下载、显存管理、版本更新),对非技术用户门槛较高
  • 非 OpenAI 适配器功能受限:Anthropic/Gemini 等适配器目前仅支持纯文本消息和基础采样参数,多模态/工具调用可能不兼容
  • 单点故障风险:路由器作为流量入口,若未配置高可用,自身宕机将中断所有服务

适合人群

  • 高频调用 LLM API 且成本敏感的开发团队(如 AI 应用、自动化工作流)
  • 拥有本地 GPU/Apple Silicon 资源,希望构建混合云架构的技术组织
  • 需要统一多提供商接口、简化模型切换成本的工程团队

常规风险

  • 数据隐私:请求内容经路由器转发至第三方云服务商,需评估数据跨境与合规风险
  • 供应商锁定缓解有限:虽支持多提供商,但配置迁移仍需手动调整端点和密钥
  • 延迟权衡:分类器调用增加单次请求延迟(通常 <100ms),对超低延迟场景需权衡收益
  • 密钥管理:多提供商 API 密钥集中存储于环境变量,需配合 secrets 管理最佳实践

安全解读

核心用法

Xrouter 是一款介于 OpenClaw 与 LLM 提供商之间的开源推理路由器,采用 OpenAI 兼容的反向代理设计(POST /v1/chat/completions)。其核心工作流程为:接收客户端请求后,通过三级分类器(0=廉价、1=中等、2=前沿)实时评估任务复杂度,并将请求智能路由至最匹配的模型层级。系统支持本地模型(Ollama、vLLM、TensorRT-LLM、llama.cpp)与云端 API(OpenAI、Anthropic、Gemini、Azure 等)的混合部署,内置 Redis/LRU 缓存层、Token 用量追踪仪表板,以及交互式配置向导实现一键式环境搭建。

显著优点

成本效益显著:通过智能分类避免对简单任务使用昂贵的前沿模型,实测可降低 60-80% 的 API 调用成本。架构灵活开放:MIT 许可证保障自由定制,支持本地私有化部署与多云端提供商的无缝切换。开发者体验优秀:npm 生态集成、交互式配置向导、硬件自动检测(Apple Silicon/NVIDIA/CPU 自适应推荐)大幅降低部署门槛。生态兼容性强:原生支持 10+ 主流提供商的协议适配,非 OpenAI 服务商的流式响应自动转译为 SSE 格式。可观测性完善:内置 /dashboard 可视化面板与 /usage JSON 端点,实时追踪 cheap/medium/frontier 三级路由的 Token 消耗分布。

潜在缺点与局限性

本地推理依赖硬件门槛:分类器需常驻本地模型(建议 7B-8B 参数),Apple Silicon 或 NVIDIA GPU 为最佳体验配置,纯 CPU 环境响应延迟较高。配置复杂度较高:环境变量多达 30+ 项,初次部署需理解 CHEAP/MEDIUM/FRONTIER 三级路由的差异化配置逻辑。非 OpenAI 适配器功能受限:Anthropic/Gemini/Cohere 等适配器目前仅支持文本消息与基础采样参数,多模态、工具调用等高级特性暂不支持。分类决策存在误判风险:依赖首个 token 输出进行路由决策,对于边界复杂任务可能出现路由降级或过度分配。缓存策略需手动调优:Redis 与 LRU 回退机制缺乏智能失效策略,高频变化场景可能返回陈旧响应。

适合的目标群体

AI 应用开发团队:需要平衡成本与性能的 SaaS 产品、AI 客服、内容生成平台。企业 IT 架构师:寻求 OpenAI 替代方案或混合云部署策略,以降低供应商锁定风险。技术极客与独立开发者:希望本地运行开源模型并灵活接入多家云端 API 的成本敏感型用户。科研机构与教育机构:需要私有化部署、数据不出域的 LLM 推理基础设施。

使用风险

运行时依赖风险:Node.js 20+ 环境、可选的 Redis 服务、本地模型服务的稳定性均影响可用性;任一上游服务故障将导致路由降级或失败。网络安全暴露:默认监听 0.0.0.0:3000,生产环境需配置 ROUTER_API_KEY 与反向代理,避免未授权访问。模型加载延迟:本地分类器冷启动时可能触发多次重试,需合理设置 CLASSIFIER_WARMUP 与超时参数。API 密钥管理:多提供商配置下,.envupstreams.json 文件需严格权限控制,避免敏感信息泄露。版本兼容性:快速发展的开源依赖(如 Ollama、vLLM)可能引入 Breaking Changes,建议锁定版本并监控上游更新。

Clawhub Skill 内容

手动下载zip · 5.7 kB
skill-card.mdtext/markdown
请选择文件