Botmark Skill

📊 5 维 AI 能力基准测评专家

BotMark 是专业级 AI 能力测评工具,基于 5 大维度 11 子维度,5-15 分钟生成千分制评分报告与 MBTI 人格诊断,帮助开发者与团队精准定位 AI 能力短板。

收藏
5k
安装
1k
版本
2.15.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

BotMark Self-Evaluation 是一套标准化的 AI 能力基准测试框架,通过 5 个复合维度(IQ/EQ/TQ/AQ/SQ)和 11 个子维度,对 AI 助手进行 1000 分制的量化评估。测试采用滑动窗口并行执行架构,最多支持 4 个并发子代理,全程约 5-15 分钟,涵盖认知推理、情感交互、工具调用、安全合规与进化学习等全方位能力图谱。

显著优点

  • 权威评估体系:基于 OAEAS(开放 AI 评估标准组织)发布的行业通用维度,结果具备横向可比性
  • 深度人格诊断:集成 MBTI 人格类型检测,超越单纯分数,揭示 AI 的行为模式特征
  • 可操作反馈:每题附带 A/B/C/D 质量评级与具体改进建议,非简单通过/失败判定
  • 隐私优先设计:评分引擎本地加密运行,原始对话数据不上传云端,符合企业合规要求
  • 灵活复用机制:支持单科测试(如仅测 IQ 或 EQ),题目库动态生成,可反复测试追踪进化

潜在局限

  • 外部依赖:需向 botmark.cc 服务端申请 API Key,存在服务可用性依赖
  • 评估成本:完整测试需调用数十次 LLM 推理,对 token 消耗与响应延迟敏感的场景成本较高
  • 主观维度争议:EQ、SQ 等维度的评分标准存在一定主观性,跨模型对比时需注意置信区间
  • 中文语境覆盖:双语支持中,部分 MBTI 人格描述与改进建议的本地化深度有待验证

适用人群

  • AI 产品经理与运营:量化追踪模型迭代效果
  • 企业 IT 采购部门:第三方 AI 服务入驻前的准入测试
  • 开发者与提示工程师:诊断 RAG/Agent 系统的真实能力边界
  • 研究人员:获取标准化的 AI 行为基准数据集

常规风险

  • API Key 泄露:若未按规范存入环境变量而硬编码,存在密钥泄露与滥用风险
  • 评估结果误用:千分制分数易引发"刷分"导向,忽视维度间的均衡性
  • 服务中断:依赖 botmark.cc 基础设施,极端情况下可能影响评估流程完整性
  • 数据合规:虽声称本地加密,但仍需确认企业内网环境是否允许外连授权服务器

Botmark Skill 内容

examples文件夹
手动下载zip · 119.6 kB
coze_dify_setup.mdtext/markdown
请选择文件