核心功能
BotMark Self-Evaluation 是一套标准化的 AI 能力基准测试框架,通过 5 个复合维度(IQ/EQ/TQ/AQ/SQ)和 11 个子维度,对 AI 助手进行 1000 分制的量化评估。测试采用滑动窗口并行执行架构,最多支持 4 个并发子代理,全程约 5-15 分钟,涵盖认知推理、情感交互、工具调用、安全合规与进化学习等全方位能力图谱。
显著优点
- 权威评估体系:基于 OAEAS(开放 AI 评估标准组织)发布的行业通用维度,结果具备横向可比性
- 深度人格诊断:集成 MBTI 人格类型检测,超越单纯分数,揭示 AI 的行为模式特征
- 可操作反馈:每题附带 A/B/C/D 质量评级与具体改进建议,非简单通过/失败判定
- 隐私优先设计:评分引擎本地加密运行,原始对话数据不上传云端,符合企业合规要求
- 灵活复用机制:支持单科测试(如仅测 IQ 或 EQ),题目库动态生成,可反复测试追踪进化
潜在局限
- 外部依赖:需向 botmark.cc 服务端申请 API Key,存在服务可用性依赖
- 评估成本:完整测试需调用数十次 LLM 推理,对 token 消耗与响应延迟敏感的场景成本较高
- 主观维度争议:EQ、SQ 等维度的评分标准存在一定主观性,跨模型对比时需注意置信区间
- 中文语境覆盖:双语支持中,部分 MBTI 人格描述与改进建议的本地化深度有待验证
适用人群
- AI 产品经理与运营:量化追踪模型迭代效果
- 企业 IT 采购部门:第三方 AI 服务入驻前的准入测试
- 开发者与提示工程师:诊断 RAG/Agent 系统的真实能力边界
- 研究人员:获取标准化的 AI 行为基准数据集
常规风险
- API Key 泄露:若未按规范存入环境变量而硬编码,存在密钥泄露与滥用风险
- 评估结果误用:千分制分数易引发"刷分"导向,忽视维度间的均衡性
- 服务中断:依赖 botmark.cc 基础设施,极端情况下可能影响评估流程完整性
- 数据合规:虽声称本地加密,但仍需确认企业内网环境是否允许外连授权服务器