PinchBench

📊 真实场景 LLM 代理能力评测专家

PinchBench 是一款用于评测 LLM 驱动的 OpenClaw 代理在实际任务中表现的基准测试工具,涵盖日历、邮件、代码、研究等 23 项真实场景任务,结果可上传至公开排行榜。

收藏
4.4k
安装
1.5k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

PinchBench 专为评估 LLM 作为 OpenClaw 代理"大脑"的实战能力而设计。用户通过命令行运行 benchmark.py,指定模型标识(如 anthropic/claude-sonnet-4)即可启动测试。支持三种测试模式:全量 23 项任务(all)、仅自动化任务(automated-only)、或指定单个/多个任务。测试涵盖六大领域:基础验证(sanity)、生产力工具(日历、每日摘要)、研究分析(股票、市场调研)、写作沟通(博客、邮件)、代码开发(天气脚本)、以及复杂工作流(多步 API、知识管理)。

典型工作流
1. 注册获取 API token(一次性)

2. 执行基准测试并自动上传结果

3. 通过 jq 查询 JSON 结果分析任务得分与失败项

4. 在 pinchbench.com 查看公开排行榜

显著优点

  • 真实场景覆盖:23 项任务模拟实际办公与研究场景,非抽象数学题
  • 可扩展架构:支持自定义任务(Markdown + Python 评分函数),社区可贡献新测试
  • 自动化评分:内置量化评分机制(grading.mean),减少人工评判主观性
  • leaderboard 生态:公开排行榜促进模型透明对比,支持历史趋势追踪
  • 灵活配置:超时倍率、运行次数、输出目录等参数可调,适配不同速度模型

潜在缺点与局限性

  • 依赖 uv 生态:强制使用 uv 包管理器,对 pip 用户增加环境成本
  • OpenClaw 绑定:紧密耦合 OpenClaw 代理架构,无法直接评测其他 Agent 框架
  • 评分盲区:自动化评分可能无法捕捉语义细微差异(如邮件语气是否得体)
  • 网络依赖:部分任务(股票查询、天气 API)依赖外部服务可用性
  • token 门槛: leaderboard 上传需注册,虽免费但增加使用步骤

适合人群

  • 模型开发者:验证新模型在 Agent 场景下的端到端能力
  • OpenClaw 用户:评估自身配置(prompt、工具链)对模型表现的影响
  • AI 研究团队:获取可复现的基准数据用于论文或技术报告
  • 企业选型:客观对比不同 LLM API 在实际业务任务中的性价比

常规风险

  • 数据隐私:测试过程中可能生成包含敏感信息的文件(邮件草稿、日历事件),结果 JSON 本地存储需注意权限管理
  • API 成本:23 项任务涉及多轮 LLM 调用,快速消耗 token 预算
  • 环境一致性:评分结果受本地 OpenClaw 配置、工具版本影响,跨设备复现需严格锁定依赖

PinchBench 内容

assets文件夹
scripts文件夹
tasks文件夹
手动下载zip · 99.6 kB
ai_blog.txttext/plain
请选择文件