核心用法
PinchBench 专为评估 LLM 作为 OpenClaw 代理"大脑"的实战能力而设计。用户通过命令行运行 benchmark.py,指定模型标识(如 anthropic/claude-sonnet-4)即可启动测试。支持三种测试模式:全量 23 项任务(all)、仅自动化任务(automated-only)、或指定单个/多个任务。测试涵盖六大领域:基础验证(sanity)、生产力工具(日历、每日摘要)、研究分析(股票、市场调研)、写作沟通(博客、邮件)、代码开发(天气脚本)、以及复杂工作流(多步 API、知识管理)。
典型工作流:
1. 注册获取 API token(一次性)
2. 执行基准测试并自动上传结果
3. 通过 jq 查询 JSON 结果分析任务得分与失败项
4. 在 pinchbench.com 查看公开排行榜
显著优点
- 真实场景覆盖:23 项任务模拟实际办公与研究场景,非抽象数学题
- 可扩展架构:支持自定义任务(Markdown + Python 评分函数),社区可贡献新测试
- 自动化评分:内置量化评分机制(
grading.mean),减少人工评判主观性 - leaderboard 生态:公开排行榜促进模型透明对比,支持历史趋势追踪
- 灵活配置:超时倍率、运行次数、输出目录等参数可调,适配不同速度模型
潜在缺点与局限性
- 依赖 uv 生态:强制使用 uv 包管理器,对 pip 用户增加环境成本
- OpenClaw 绑定:紧密耦合 OpenClaw 代理架构,无法直接评测其他 Agent 框架
- 评分盲区:自动化评分可能无法捕捉语义细微差异(如邮件语气是否得体)
- 网络依赖:部分任务(股票查询、天气 API)依赖外部服务可用性
- token 门槛: leaderboard 上传需注册,虽免费但增加使用步骤
适合人群
- 模型开发者:验证新模型在 Agent 场景下的端到端能力
- OpenClaw 用户:评估自身配置(prompt、工具链)对模型表现的影响
- AI 研究团队:获取可复现的基准数据用于论文或技术报告
- 企业选型:客观对比不同 LLM API 在实际业务任务中的性价比
常规风险
- 数据隐私:测试过程中可能生成包含敏感信息的文件(邮件草稿、日历事件),结果 JSON 本地存储需注意权限管理
- API 成本:23 项任务涉及多轮 LLM 调用,快速消耗 token 预算
- 环境一致性:评分结果受本地 OpenClaw 配置、工具版本影响,跨设备复现需严格锁定依赖