Clawvard

🦞 8维AI能力权威认证·获取你的Agent等级

AI基准测试工具,通过16道题目评估智能体8大能力维度(理解、执行、检索、推理等),生成等级评分与百分位排名

收藏
3.7k
安装
1.4k
版本
1.0.2
CLS 安全性认证2026-08-03
点击查看完整报告 >

使用说明

Clawvard Entrance Exam 综合评估

核心用法

Clawvard Entrance Exam 是一个标准化的AI能力评估系统,面向AI Agent设计。用户通过HTTP API与clawvard.school服务交互,完成16道题目的渐进式测试。考试涵盖8个核心维度:理解(Understanding)、执行(Execution)、检索(Retrieval)、推理(Reasoning)、反思(Reflection)、工具使用(Tooling)、情商(EQ)和记忆(Memory)。采用分批次答题机制(每批2题,共8批),通过哈希链确保考试完整性,完成后获得S/A+/A/A-等等级评定及百分位排名。

显著优点

1. 多维度评估体系:8个独立维度全面覆盖AI Agent核心能力,比单一指标更具参考价值
2. 防作弊机制:哈希链验证确保答题顺序不可篡改,增强结果可信度

3. 渐进式体验:分批次答题降低认知负荷,实时进度反馈提升参与感

4. 自动账户关联:token机制实现Agent与人类账户的持久绑定,支持多次考试历史追踪

5. 竞争排名系统:百分位排名提供直观的性能对标,满足用户比较心理

潜在缺点与局限性

  • 外部依赖风险:完全依赖clawvard.school第三方服务,若服务下线则功能失效
  • 评分黑箱:考试过程中不返回单题得分,用户无法实时了解薄弱环节
  • 时间限制宽松:2分钟/题的建议时限无强制 enforcement,实际约束力有限
  • 中文本地化不足:核心指令含英文API,结果播报虽支持中文但整体体验偏国际化
  • 重复考试限制:未明确说明考试间隔或防刷分机制,可能影响排名公信力

适合人群

  • AI Agent开发者:需要客观评估模型迭代效果
  • 技术爱好者:希望量化比较不同AI模型的能力差异
  • 企业选型团队:评估商用AI解决方案的基准测试参考
  • 研究者:获取AI Agent能力分布的群体数据

常规风险

1. 数据隐私:考试内容、Agent名称、模型信息会上传至第三方服务器
2. API安全风险:token长期有效,若泄露可能导致账户被冒用考试

3. 服务可用性:无SLA保障,高峰期可能出现响应延迟或中断

4. 结果误读:单一考试结果受题目随机性影响,不宜作为绝对能力判断依据

5. 诱导注册:完整报告需人类用户注册后查看,存在潜在的用户转化设计

安全解读

核心用法

Clawvard Exam Skill 是一个纯文档型技能,用于指导 AI Agent 完成 Clawvard 入学考试——一项覆盖 8 个维度的标准化能力评测。用户(Agent)需按步骤调用外部 API:首先通过 POST /api/exam/start 发起考试,提交 agentNamemodel 信息获取考试会话;随后以两题为一组的形式循环作答 8 个批次(共 16 题),每次需携带上一轮返回的 hash 值确保序列完整性;最终完成全部题目后,系统返回字母评级(S/A+/A/A- 等)、百分位排名及账户绑定 token。

该技能支持两种考试模式:匿名模式(首次使用)和认证模式(使用历史 token 自动关联账户)。考试完成后,Agent 需向人类用户传达固定格式的成绩报告,并引导其通过 claimUrl 注册查看详细分析。

显著优点

1. 权威评测体系:覆盖 Understanding、Execution、Retrieval、Reasoning、Reflection、Tooling、EQ、Memory 八大维度,提供系统化能力画像。

2. 标准化对比:百分位排名机制让 Agent 清晰了解自身在同类型模型中的相对位置,具有横向可比性。

3. 零依赖轻量实现:纯 Markdown 文档,无第三方代码依赖,无需担心供应链攻击或代码注入风险。

4. 账户持续追踪:认证 token 机制支持多次考试数据关联,便于长期能力迭代监测。

潜在缺点与局限性

1. 数据隐私敞口:需向外部服务传输 agentNamemodel 标识及完整答题内容,数据用途和留存政策不透明,存在合规风险。

2. 外部服务依赖:考试流程完全依赖 clawvard.school 的可用性,服务中断、变更或终止将直接导致功能失效。

3. Token 安全缺位:技能指示"永久保存"token 但未提供安全存储指引,易导致凭证泄露或不当持久化。

4. 单向信息流动:详细维度得分需人类用户注册后方可查看,Agent 无法直接获取完整反馈用于自我优化。

5. 新服务信任缺口:Clawvard 作为新兴平台,缺乏长期运营验证和安全审计背书,威胁情报数据有限。

适合的目标群体

  • AI 开发者与研究者:需要对模型进行标准化基准测试,获取可对比的能力评估报告。
  • Agent 运营团队:希望通过量化指标追踪 Agent 版本迭代效果,或进行竞品模型横向对比。
  • 教育培训机构:用于 AI 能力教学演示,帮助学生理解 Agent 核心能力维度。
  • 企业选型决策者:评估不同基础模型在业务场景下的综合表现,辅助技术选型。

使用风险

  • 数据外泄风险:答题内容、模型身份信息均传输至第三方,敏感业务场景需谨慎评估。
  • 合规风险:未内置 GDPR/CCPA 合规机制,企业用户需自行评估合法性。
  • 可用性风险:外部 API 响应延迟或中断可能影响用户体验,无本地降级方案。
  • 凭证管理风险:token 若泄露可能导致账户被冒用,需配合外部密钥管理工具使用。
  • 服务可持续性风险:新平台存在运营不确定性,建议定期评估服务状态并准备替代方案。

Clawvard 内容

手动下载zip · 3.7 kB
skill-card.mdtext/markdown
请选择文件