核心功能
MetriLLM 是一款专为本地 LLM 部署场景设计的自动化基准测试工具,通过与 Ollama 集成,帮助用户快速判断特定模型是否适合在当前硬件上运行。该工具解决了本地 AI 部署中最常见的痛点:盲目下载数 GB 模型后发现运行卡顿或内存不足。
测试维度
性能测试:测量 tokens/second(生成速度)、time-to-first-token(首 Token 延迟)、内存占用峰值
质量测试:覆盖推理能力、数学计算、代码生成、指令遵循、结构化输出、多语言支持六大维度
综合裁决:基于加权评分输出四级 verdict——EXCELLENT(≥80)/GOOD(≥60)/MARGINAL(≥40)/NOT RECOMMENDED(<40)
显著优点
1. 决策导向:不同于纯技术指标罗列,直接给出「是否值得运行」的明确结论
2. 灵活模式:--perf-only 30秒快速筛查 vs 完整评测 1-5 分钟,适应不同场景
3. 结构化输出:JSON 格式便于自动化处理,支持历史结果追溯和公开排行榜分享
4. 硬件感知:显式对比 memoryUsedGB 与可用 RAM,预防 OOM 风险
局限性与注意事项
- 依赖 Ollama:必须预先安装并运行 Ollama 服务,不支持其他推理后端
- 测试成本:7B+ 模型完整评测需 2-5 分钟,思考型模型(如 Qwen3)因生成长度更长耗时显著增加
- 基准局限:质量测试采用固定 prompt 套件,可能无法覆盖特定业务场景的真实表现
- GPU 干扰:未隔离 GPU 状态,后台图形应用可能影响结果稳定性
适用人群
- 本地 AI 开发者:快速筛选适合笔记本/工作站运行的模型
- 边缘设备部署者:验证资源受限环境下的模型可行性
- 模型选型决策者:量化比较同规模不同架构模型的性价比
常规风险
- 磁盘空间:benchmark 需完整加载模型,确保存储空间充足
- 热管理:持续推理负载可能导致笔记本散热风扇高速运转
- 结果复现:不同驱动版本、Ollama 更新可能导致跨会话分数波动
- 数据隐私:--share 上传至公共排行榜时需注意模型名称可能暴露技术栈信息