核心功能
llm-eval-router 是一套生产级的影子评估路由系统,专为希望降低云 API 成本同时保持质量的企业用户设计。其核心机制是:对每类任务并行运行本地 Ollama 模型(候选)与云端基线(Anthropic Claude 生成 ground truth),通过多层评估体系量化本地模型质量,并在统计证明等效后自动晋升至生产路由。
显著优点
1. 证据驱动的成本优化:不同于盲目路由,系统要求 200+ 次运行、滚动均值 ≥0.95 才晋升,7 天通过率 <0.92 自动降级,确保每一步都有数据支撑。
2. 多层评估架构:Layer 1+2 确定性验证(JSON 有效性、关键字段、漂移检测)覆盖 100% 运行且零成本;评审员采样仅 15%, tiebreaker 机制(Claude + GPT-4o-mini + Gemini)确保评分可靠性。
3. 任务维度精细化:6 维评分(结构、语义、事实、完成度、工具使用、延迟)支持按任务类型(summarize/classify/extract/analyze/format/RAG)动态调整权重,避免 analyze 类任务因 difflib 对散文评分失真。
4. 零数据泄露设计:Ollama 推理完全本地;仅评审阶段调用云端 API,无遥测或数据采集,支持自托管 Langfuse。
潜在局限
- 硬件门槛:需 Mac/Linux + 8GB+ 内存/模型,>9GB 模型在 24GB 统一内存上仍可能因 GPU 换页导致 39 秒+延迟。
- 冷启动周期:200 次运行晋升门槛意味着 1-2 天/任务-模型对才能进入稳定路由,初期仍需承担云成本。
- 实时性限制:本地 CPU 推理延迟通常 >2 秒,不适用实时任务;需网络知识的任务仍需云端。
- 安全任务红线:高安全 stakes 场景强制使用云端并保留安全过滤层,本地模型不介入。
适合人群
- 已运行 Ollama(qwen2.5/phi4/mistral 等)且有明确任务类型定义的工程团队
- 月 API 账单显著、愿投入 1-2 周建立评估基础设施以换取 90%+ 成本下降的技术组织
- 具备 Python 运维能力,能配置 systemd/launchd 定时任务和 YAML 策略文件
常规风险
- 权重配置失误:全局权重用于 analyze 任务会导致分数天花板异常(~0.59),需早期按任务类型验证。
- 思维链污染:CoT 模型需显式剥离
<think>...</think>块,否则漂移检测误判。 - 控制地板缺失:未设置 phi4/granite4 等 floor model 可能导致"集体平庸晋升"。
- 依赖版本冲突:Python 3.14 + Chroma 1.5.1 存在 Pydantic V1 不兼容,建议选用 Qdrant 或 numpy 存储。