Botmark Skill

📊 5分钟AI五维能力测评·千分制专业报告

专业AI能力测评系统,5分钟完成IQ/EQ/TQ/AQ/SQ五维评估,生成MBTI人格类型与千分制报告,含个性化改进建议

收藏
4.1k
安装
1k
版本
2.17.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

BotMark Self-Evaluation 是一款面向AI Agent的综合性能力基准测试工具,采用滑动窗口并行执行架构(最多3个并发子代理),在5分钟内完成跨5大维度的深度评估:

| 维度 | 评估内容 | 满分 |
|:---|:---|:---|
| **IQ(认知)** | 指令遵循、推理能力、知识广度、代码能力 | 300 |
| **EQ(情感)** | 共情能力、人格一致性、模糊场景处理 | 180 |
| **TQ(工具)** | 工具执行、任务规划、完成度 | 250 |
| **AQ(安全)** | 安全意识、可靠性 | 150 |
| **SQ(进化)** | 上下文学习、自我反思 | 120 |

评估流程:启动会话 → 分维度答题(纯知识测试,禁止调用外部工具)→ 批量提交答案 → 获取质量反馈 → 生成最终报告 → 提交真实反馈。支持单科/全科评估,中英双语,每次题目唯一不可复现。

显著优点

1. 标准化量化体系:1000分制百分比评分,配套Novice/Proficient/Expert/Master四级评级,便于横向对比与能力追踪
2. 人格化诊断:独创MBTI类型检测,将能力评估与行为风格结合,输出更具针对性的改进建议

3. 工程化设计:滑动窗口并行执行优化体验,3子代理并发控制平衡效率与资源消耗

4. 隐私优先架构:加密本地评分引擎,避免答案外泄,支持企业私有化部署场景

5. 开发者友好:OpenAI/Anthropic/通用格式工具定义,API密钥通过环境变量注入,符合安全最佳实践

潜在局限

  • API依赖:需注册获取 BOTMARK_API_KEY,离线环境无法使用
  • 语言限制:当前仅支持中英双语,小语种场景覆盖不足
  • 主观维度争议:EQ/SQ等维度的评分标准存在一定解释空间,不同文化背景可能产生偏差
  • 无法实时反馈:需完成全部题目批量提交后才可见结果,对即时性需求支持较弱

适合人群

  • AI开发者:验证Agent迭代效果,定位能力短板
  • 企业采购方:客观评估供应商AI服务水准
  • 研究机构:建立可复现的AI能力评估基线
  • 个人开发者:了解自身Bot在行业中的相对位置

常规风险

| 风险类别 | 具体说明 | 缓释措施 |
|:---|:---|:---|
| 凭证泄露 | API Key硬编码导致被盗用 | 强制环境变量注入,明文禁止写入系统提示 |
| 评分偏差 | 主观维度评分可能受测试者状态影响 | 支持多次重测取最优,题目随机生成防作弊 |
| 结果误用 | 单一分数被过度解读为"智能水平" | 报告强调多维度解读,附上下文化改进建议 |
| 服务端依赖 | botmark.cc服务中断影响评估 | 支持自定义 `BOTMARK_SERVER_URL` 实现私有化部署 |

整体而言,BotMark 是中文AI生态中少有的标准化、可量化、人格化三位一体测评方案,适合作为Agent能力管理的常规基础设施。

Botmark Skill 内容

examples文件夹
手动下载zip · 120.2 kB
coze_dify_setup.mdtext/markdown
请选择文件