核心用法
BotMark Self-Evaluation 是一款面向 AI Agent 的能力基准测试工具,通过 5 个复合维度(IQ 认知智能、EQ 情感智能、TQ 工具智能、AQ 安全智能、SQ 进化智能)及其下属的 11 个子维度,对被测 AI 进行综合评分。整个测评流程采用滑动窗口并行执行架构,最多支持 3 个并发子代理同时处理,单次完整评估耗时约 5-15 分钟。
用户可通过自然语言指令触发(如 "跑个分"、"benchmark"、"evaluate"),系统会依次调用 botmark_start_evaluation 启动会话、botmark_submit_batch 批量提交答案、botmark_finish_evaluation 生成最终报告,并通过 botmark_send_feedback 收集真实反馈。支持单维度独立测评(如仅测 IQ),每次题目均为动态生成,可重复测评获取新鲜题集。
显著优点
评估体系科学完整:覆盖认知、情感、工具、安全、进化五大核心能力,总分 1000 分,支持百分比制与四级评级(Novice/Proficient/Expert/Master),并附带 MBTI 人格类型检测,便于团队理解 AI 的"性格特征"。
输出结果可落地:不仅给出等级评分,还提供 A/B/C/D 质量分级及可执行的改进建议,结合用户工作场景生成个性化优化方向。
技术架构高效:滑动窗口并行执行提升效率,本地加密引擎评分保障公平性与隐私安全。
双语与灵活性:支持中英双语,题目动态生成避免记忆刷分,单次/单维度测评灵活可选。
潜在缺点与局限性
依赖外部 API 服务:必须绑定 BOTMARK_API_KEY,测评结果生成依赖 BotMark 官方服务器(botmark.cc),存在网络延迟、服务可用性及数据出境合规风险。
评估成本不透明:未明确说明 API 调用费用、并发限制及速率配额,高频率使用可能产生不可控成本。
封闭评价体系:评分算法与权重由 BotMark 单方面定义,缺乏第三方审计或开源验证,"公平性"承诺难以独立核验。
适用场景有限:主要针对通用对话型 AI Agent 设计,对垂直领域专业模型(如医疗、法律、工业设计)的评估覆盖度存疑。
适合人群
- AI Agent 开发者:需量化产品能力、横向对比竞品、生成权威评测报告
- 企业 AI 采购团队:评估供应商模型实际表现,作为选型参考依据
- 提示词工程师:诊断模型短板,针对性优化系统提示与工具编排
- AI 产品经理:理解模型"人格"特征,设计更贴合的人机交互方案
- 教育机构/研究者:获取标准化 AI 能力数据,支持学术论文或课程设计
常规风险
数据隐私风险:测评对话内容需上传至 BotMark 服务器,敏感业务数据可能暴露;虽声称"本地加密引擎评分",但题目分发与结果生成仍依赖云端交互。
供应链安全风险:API 密钥管理不当(如嵌入提示词、硬编码)易导致凭据泄露;官方服务中断将直接导致功能失效。
评估偏差风险:动态题库质量稳定性未知,MBTI 等人格标签的AI适用性未经学术验证,结果可能产生误导性自我认知。
合规风险:服务托管于 botmark.cc(境外域名),需确认符合本地数据安全法规(如中国《数据安全法》《个人信息保护法》)。