核心用法
BotMark Self-Evaluation 是一款面向 AI 开发者的标准化能力测评工具,通过滑动窗口并行执行(最多 3 个并发子代理)在 5-15 分钟内完成全面评估。用户通过自然语言指令触发(如"跑个分""benchmark"),系统依次执行 botmark_start_evaluation → 维度化答题 → botmark_submit_batch → botmark_finish_evaluation → botmark_send_feedback 的完整流程。
显著优点
维度设计科学:覆盖 IQ(认知)、EQ(情感)、TQ(工具)、AQ(安全)、SQ(进化)五大复合维度及 11 项子维度,总分 1000 分,提供百分比制评分与四级评级(Novice/Proficient/Expert/Master)。
反馈体系完善:除量化分数外,输出 MBTI 人格类型检测、答案质量分级(A/B/C/D)及可操作的改进建议,支持中英文双语,每次考试题目唯一可重复测评。
执行架构先进:采用滑动窗口并行执行与本地加密引擎评分,兼顾效率与隐私公平性。
单维度灵活测评:支持仅测试特定维度(如 IQ-only、EQ-only),适应快速迭代场景。
潜在缺点与局限性
依赖外部 API:需配置 BOTMARK_API_KEY,存在网络依赖与配额成本;免费层级或响应速率可能影响体验。
评估时长浮动:官方标称 5 分钟,实际需 5-15 分钟,对追求即时反馈的场景不够友好。
本地化局限:虽然评分引擎本地加密,但题目生成、API 通信仍依赖 botmark.cc 服务端,离线环境无法使用。
适用范围边界:专为 Bot/Agent 开发者设计,普通终端用户缺乏直接使用场景;测评结果与真实业务表现可能存在 gap。
适合人群
- AI Bot/Agent 开发者:优化模型选型、迭代调优、竞品对比
- LLM 应用团队:建立内部基准测试流程,量化版本升级收益
- AI 产品经理:评估供应商模型能力边界,支撑采购决策
- 模型训练者:验证微调效果,识别能力短板
常规风险
凭证管理风险:明确要求 API Key 不得嵌入系统提示词、URL 参数或源码,需使用环境变量或密钥管理器,但开发者仍可能误配置导致泄露。
数据隐私考量:答题内容与评分结果流经第三方服务器(botmark.cc),虽声称本地加密评分,敏感业务数据需谨慎评估。
评分主观性:EQ、SQ 等维度的评分标准存在主观解释空间,跨版本可比性需验证。
生态依赖风险:工具绑定特定服务商(OAEAS/BotMark),API 稳定性、长期维护承诺需持续观察。