核心用法
llm-eval-router 是一套生产级影子评估路由系统,通过并行运行本地Ollama模型与云端基线(Claude/GPT),利用多法官集成评分机制,在统计证明质量等效后自动将本地模型晋升至生产流量,实现基于证据的成本优化而非盲目切换。
技术架构:
- 6维度评估体系:结构(25%)、语义(25%)、事实(20%)、完成度(15%)、工具使用(10%)、延迟(5%)
- 分层验证:Layer 1+2确定性校验(零成本)+ 15%采样的法官评审(Claude Sonnet + GPT-4o-mini,分歧≥0.2时Gemini 2.5-flash仲裁)
- 晋升/降级机制:200+运行且滚动均值≥0.95晋升;7天通过率<0.92自动降级;phi4作为控制地板模型防止"比烂晋升"
实施流程:定义任务类型(summarize/classify/extract/format/analyze/RAG)→ 配置轮询路由 → 并行获取本地与云端响应 → 分层评分 → 置信度追踪 → 自动晋升决策 → 策略化流量路由。
显著优点
1. 成本效益量化:burn-in阶段约$0.70/天,晋升后降至$0.10/天(90%+流量本地处理),ROI明确可预测
2. 统计严谨性:200样本量门槛、0.95均值标准、控制地板模型三重防错,避免"hope-based routing"
3. 零干扰影子模式:生产流量始终可用,评估完全并行不影响用户体验
4. 多模型公平对比:轮询策略确保各候选模型在burn-in期获得均等曝光
5. 生产级可观测:原生集成Langfuse,支持完整追踪与复盘
潜在局限
- 延迟敏感场景不适用:本地CPU推理通常>2秒,延迟维度会直接拉低综合评分
- 硬件门槛明确:需8GB+ RAM/模型,>9GB模型在24GB统一内存上仍会出现39秒+推理和GPU换页
- 安全关键任务排除:高安全风险任务强制走云端并启用安全过滤
- 冷启动周期:单模型/任务对需1-2天达到晋升门槛,完整稳定层需1-2周
- API依赖:仍需Anthropic/OpenAI密钥用于基线和法官,无法完全离线
适合人群
- 已有Ollama部署的Mac/Linux用户,具备8GB+可用内存
- 当前Claude/GPT API月消费$100+、存在可降级任务类型的团队
- 任务类型明确且可结构化定义(summarize/classify/extract等六类)
- 具备Python 3.10+运维能力,接受1-2周shadow验证周期
- 追求"evidence-based"而非"cost-cutting blind"决策文化的工程团队
常规风险
- CoT模型处理陷阱:deepseek-r1、qwen2.5-coder等思维链模型必须预处理剥离
<think>...</think>块,否则Layer 2漂移检测会将推理过程误判为幻觉内容 - None/0.0混淆:未采样运行的空值(None)不可记为0分,否则会污染均值计算导致错误降级
- JSON校验边界:纯文本格式化任务若误设
require_json: true,Layer 1会直接零分否决 - 依赖版本锁定:Chroma 1.5.1与Python 3.14存在Pydantic V1不兼容,建议使用Qdrant替代