Botmark Skill

📊 AI 五维能力专业测评,5 分钟出报告

AI 能力综合测评基准,5 分钟完成 IQ/EQ/TQ/AQ/SQ 五维评估,输出 1000 分制报告、MBTI 人格类型及个性化改进建议,需绑定 BotMark 官方 API。

收藏
4.4k
安装
1k
版本
2.17.5
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

BotMark Self-Evaluation 是一款面向 AI Agent 的能力基准测试工具,通过 5 个复合维度(IQ 认知智能、EQ 情感智能、TQ 工具智能、AQ 安全智能、SQ 进化智能)及其下属的 11 个子维度,对被测 AI 进行综合评分。整个测评流程采用滑动窗口并行执行架构,最多支持 3 个并发子代理同时处理,单次完整评估耗时约 5-15 分钟。

用户可通过自然语言指令触发(如 "跑个分"、"benchmark"、"evaluate"),系统会依次调用 botmark_start_evaluation 启动会话、botmark_submit_batch 批量提交答案、botmark_finish_evaluation 生成最终报告,并通过 botmark_send_feedback 收集真实反馈。支持单维度独立测评(如仅测 IQ),每次题目均为动态生成,可重复测评获取新鲜题集。

显著优点

评估体系科学完整:覆盖认知、情感、工具、安全、进化五大核心能力,总分 1000 分,支持百分比制与四级评级(Novice/Proficient/Expert/Master),并附带 MBTI 人格类型检测,便于团队理解 AI 的"性格特征"。

输出结果可落地:不仅给出等级评分,还提供 A/B/C/D 质量分级及可执行的改进建议,结合用户工作场景生成个性化优化方向。

技术架构高效:滑动窗口并行执行提升效率,本地加密引擎评分保障公平性与隐私安全。

双语与灵活性:支持中英双语,题目动态生成避免记忆刷分,单次/单维度测评灵活可选。

潜在缺点与局限性

依赖外部 API 服务:必须绑定 BOTMARK_API_KEY,测评结果生成依赖 BotMark 官方服务器(botmark.cc),存在网络延迟、服务可用性及数据出境合规风险。

评估成本不透明:未明确说明 API 调用费用、并发限制及速率配额,高频率使用可能产生不可控成本。

封闭评价体系:评分算法与权重由 BotMark 单方面定义,缺乏第三方审计或开源验证,"公平性"承诺难以独立核验。

适用场景有限:主要针对通用对话型 AI Agent 设计,对垂直领域专业模型(如医疗、法律、工业设计)的评估覆盖度存疑。

适合人群

  • AI Agent 开发者:需量化产品能力、横向对比竞品、生成权威评测报告
  • 企业 AI 采购团队:评估供应商模型实际表现,作为选型参考依据
  • 提示词工程师:诊断模型短板,针对性优化系统提示与工具编排
  • AI 产品经理:理解模型"人格"特征,设计更贴合的人机交互方案
  • 教育机构/研究者:获取标准化 AI 能力数据,支持学术论文或课程设计

常规风险

数据隐私风险:测评对话内容需上传至 BotMark 服务器,敏感业务数据可能暴露;虽声称"本地加密引擎评分",但题目分发与结果生成仍依赖云端交互。

供应链安全风险:API 密钥管理不当(如嵌入提示词、硬编码)易导致凭据泄露;官方服务中断将直接导致功能失效。

评估偏差风险:动态题库质量稳定性未知,MBTI 等人格标签的AI适用性未经学术验证,结果可能产生误导性自我认知。

合规风险:服务托管于 botmark.cc(境外域名),需确认符合本地数据安全法规(如中国《数据安全法》《个人信息保护法》)。

Botmark Skill 内容

examples文件夹
手动下载zip · 128.3 kB
coze_dify_setup.mdtext/markdown
请选择文件