Llm Eval Router

🧪 影子评估自动晋升本地模型降本

Shadow-test本地Ollama模型与云端基线对比,通过多维度评估自动晋升达标模型,以证据驱动降低API成本。

收藏
3.8k
安装
1k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

llm-eval-router 是一套生产级影子评估路由系统,通过并行运行本地Ollama模型与云端基线(Claude/GPT),利用多法官集成评分机制,在统计证明质量等效后自动将本地模型晋升至生产流量,实现基于证据的成本优化而非盲目切换。

技术架构

  • 6维度评估体系:结构(25%)、语义(25%)、事实(20%)、完成度(15%)、工具使用(10%)、延迟(5%)
  • 分层验证:Layer 1+2确定性校验(零成本)+ 15%采样的法官评审(Claude Sonnet + GPT-4o-mini,分歧≥0.2时Gemini 2.5-flash仲裁)
  • 晋升/降级机制:200+运行且滚动均值≥0.95晋升;7天通过率<0.92自动降级;phi4作为控制地板模型防止"比烂晋升"

实施流程:定义任务类型(summarize/classify/extract/format/analyze/RAG)→ 配置轮询路由 → 并行获取本地与云端响应 → 分层评分 → 置信度追踪 → 自动晋升决策 → 策略化流量路由。

显著优点

1. 成本效益量化:burn-in阶段约$0.70/天,晋升后降至$0.10/天(90%+流量本地处理),ROI明确可预测
2. 统计严谨性:200样本量门槛、0.95均值标准、控制地板模型三重防错,避免"hope-based routing"

3. 零干扰影子模式:生产流量始终可用,评估完全并行不影响用户体验

4. 多模型公平对比:轮询策略确保各候选模型在burn-in期获得均等曝光

5. 生产级可观测:原生集成Langfuse,支持完整追踪与复盘

潜在局限

  • 延迟敏感场景不适用:本地CPU推理通常>2秒,延迟维度会直接拉低综合评分
  • 硬件门槛明确:需8GB+ RAM/模型,>9GB模型在24GB统一内存上仍会出现39秒+推理和GPU换页
  • 安全关键任务排除:高安全风险任务强制走云端并启用安全过滤
  • 冷启动周期:单模型/任务对需1-2天达到晋升门槛,完整稳定层需1-2周
  • API依赖:仍需Anthropic/OpenAI密钥用于基线和法官,无法完全离线

适合人群

  • 已有Ollama部署的Mac/Linux用户,具备8GB+可用内存
  • 当前Claude/GPT API月消费$100+、存在可降级任务类型的团队
  • 任务类型明确且可结构化定义(summarize/classify/extract等六类)
  • 具备Python 3.10+运维能力,接受1-2周shadow验证周期
  • 追求"evidence-based"而非"cost-cutting blind"决策文化的工程团队

常规风险

  • CoT模型处理陷阱:deepseek-r1、qwen2.5-coder等思维链模型必须预处理剥离<think>...</think>块,否则Layer 2漂移检测会将推理过程误判为幻觉内容
  • None/0.0混淆:未采样运行的空值(None)不可记为0分,否则会污染均值计算导致错误降级
  • JSON校验边界:纯文本格式化任务若误设require_json: true,Layer 1会直接零分否决
  • 依赖版本锁定:Chroma 1.5.1与Python 3.14存在Pydantic V1不兼容,建议使用Qdrant替代

Llm Eval Router 内容

手动下载zip · 4.9 kB
SKILL.mdtext/markdown
请选择文件