核心用法
LLM Supervisor 是一个专门处理大语言模型服务异常的智能中间层,主要解决云服务商(Anthropic、OpenAI)速率限制和过载错误导致的体验中断问题。
触发机制:当检测到 API 返回 429(Rate Limit)或 503(Overload)错误时,系统立即向用户透明报告,而非静默重试或失败。随后主动提供本地 Ollama 模型作为备选方案,支持 qwen2.5:7b 等开源模型无缝接管任务。
分层确认策略:
- 代码生成任务:强制人工确认("Cloud is rate-limited. Switch to local Ollama? Reply 'yes' to confirm"),防止本地模型代码质量风险
- 简单对话/摘要:若用户历史已授权,可自动降级切换
状态管理:会话级内存跟踪当前 provider、最近限流时间戳、代码任务授权状态;每次新会话重置为云端优先。
显著优点
1. 零中断体验:将硬错误转化为可选降级路径,避免工作流卡死
2. 安全边界清晰:代码任务强制确认体现对本地模型能力边界的清醒认知
3. 透明可控:/llm status 实时展示系统状态,用户始终掌握决策权
4. 隐私友好:本地运行敏感任务时无需数据出境
潜在缺点与局限性
- 模型能力落差:
qwen2.5:7b与 Claude/GPT-4 存在显著质量差距,复杂推理、长上下文、代码生成任务可能输出不稳定 - 本地资源依赖:需预装 Ollama 并拉取模型,对设备内存(建议 8GB+)和 GPU 有要求
- 状态非持久化:会话结束即重置,跨会话无法记住用户偏好
- 单点模型配置:仅硬编码
qwen2.5:7b,缺乏灵活模型选择机制
适合人群
- 高频调用 API 的开发者(易触限流阈值)
- 网络不稳定或需离线工作的用户
- 处理敏感代码/数据、偏好本地执行的安全导向用户
- 已部署 Ollama 环境的 macOS/Linux 开发者
常规风险
1. 代码质量风险:7B 参数模型生成代码未经充分验证直接采用,可能引入隐蔽 bug 或安全漏洞
2. 幻觉放大:本地模型事实准确性弱于云端,摘要类任务可能出现虚构信息
3. 配置漂移:用户环境 Ollama 版本/模型差异导致行为不一致
4. 确认疲劳:频繁限流下反复确认可能降低用户警惕性,习惯性点击 "yes"