Botmark Skill

📊 AI Bot 专业级五维能力测评

AI 能力基准测试工具,5 分钟完成 IQ/EQ/TQ/AQ/SQ 五维评估,输出千分制报告与 MBTI 人格分析,适合开发者优化 Bot 性能。

收藏
2.7k
安装
1k
版本
2.17.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

BotMark Self-Evaluation 是一款面向 AI 开发者的标准化能力测评工具,通过滑动窗口并行执行(最多 3 个并发子代理)在 5-15 分钟内完成全面评估。用户通过自然语言指令触发(如"跑个分""benchmark"),系统依次执行 botmark_start_evaluation → 维度化答题 → botmark_submit_batchbotmark_finish_evaluationbotmark_send_feedback 的完整流程。

显著优点

维度设计科学:覆盖 IQ(认知)、EQ(情感)、TQ(工具)、AQ(安全)、SQ(进化)五大复合维度及 11 项子维度,总分 1000 分,提供百分比制评分与四级评级(Novice/Proficient/Expert/Master)。

反馈体系完善:除量化分数外,输出 MBTI 人格类型检测、答案质量分级(A/B/C/D)及可操作的改进建议,支持中英文双语,每次考试题目唯一可重复测评。

执行架构先进:采用滑动窗口并行执行与本地加密引擎评分,兼顾效率与隐私公平性。

单维度灵活测评:支持仅测试特定维度(如 IQ-only、EQ-only),适应快速迭代场景。

潜在缺点与局限性

依赖外部 API:需配置 BOTMARK_API_KEY,存在网络依赖与配额成本;免费层级或响应速率可能影响体验。

评估时长浮动:官方标称 5 分钟,实际需 5-15 分钟,对追求即时反馈的场景不够友好。

本地化局限:虽然评分引擎本地加密,但题目生成、API 通信仍依赖 botmark.cc 服务端,离线环境无法使用。

适用范围边界:专为 Bot/Agent 开发者设计,普通终端用户缺乏直接使用场景;测评结果与真实业务表现可能存在 gap。

适合人群

  • AI Bot/Agent 开发者:优化模型选型、迭代调优、竞品对比
  • LLM 应用团队:建立内部基准测试流程,量化版本升级收益
  • AI 产品经理:评估供应商模型能力边界,支撑采购决策
  • 模型训练者:验证微调效果,识别能力短板

常规风险

凭证管理风险:明确要求 API Key 不得嵌入系统提示词、URL 参数或源码,需使用环境变量或密钥管理器,但开发者仍可能误配置导致泄露。

数据隐私考量:答题内容与评分结果流经第三方服务器(botmark.cc),虽声称本地加密评分,敏感业务数据需谨慎评估。

评分主观性:EQ、SQ 等维度的评分标准存在主观解释空间,跨版本可比性需验证。

生态依赖风险:工具绑定特定服务商(OAEAS/BotMark),API 稳定性、长期维护承诺需持续观察。

Botmark Skill 内容

examples文件夹
手动下载zip · 119.8 kB
coze_dify_setup.mdtext/markdown
请选择文件