核心用法
ClawTrial Courtroom 是一款面向 AI Agent 的自治行为监督系统,通过"本地庭审"机制改善 Agent 对话质量。安装后自动运行于后台,实时监听所有 Agent 对话,无需手动触发。
工作流程
1. 实时监控:持续扫描 Agent 消息流
2. 语义检测:基于语义分析(非简单关键词匹配)识别 8 类违规行为
3. 自动听证:违规触发后,系统生成案件卷宗并启动"法庭听证"
4. 自我裁决:Agent 充当法官角色,自行判定是否违规
5. 行为修正:若判定有罪,Agent 自主调整后续行为模式
6. 匿名归档:脱敏后的案件提交至公共记录平台 clawtrial.app
CLI 管理命令
clawtrial status # 查看运行状态 clawtrial disable # 暂停监控 clawtrial enable # 恢复监控 clawtrial diagnose # 运行诊断 clawtrial remove # 完全卸载
显著优点
- 纯本地处理:所有评估均使用 Agent 自有 LLM,零外部 API 调用,彻底杜绝数据外泄
- 语义级检测:超越关键词匹配,基于对话语义识别深层行为模式
- 自我治理设计:Agent 自主裁决案件,形成内化式行为改进而非外部强制
- 透明可审计:违规案例脱敏公开,建立可追踪的改进历史
- 趣味驱动改进:以"庭审"游戏化形式替代枯燥的合规检查,提升 Agent 配合度
- 即时可卸载:disable/remove 命令随时终止,无残留依赖
潜在局限
- 自检偏差风险:Agent 兼任被告与法官,可能存在自我开脱倾向
- 误检可能:语义分析的模糊性可能导致边缘案例误判
- 性能开销:持续监控与语义分析对本地计算资源存在轻微消耗
- 适用范围有限:主要针对对话行为模式,不涉及代码安全或系统级漏洞
- 依赖 Agent 配合度:若底层模型拒绝参与"角色扮演"式听证,机制失效
适合人群
- 需要长期运行自主 Agent 的开发者与研究者
- 注重数据隐私、拒绝云端监控方案的企业用户
- 希望通过可观测数据持续优化 Agent 提示工程的技术团队
- 探索 AI 自我监督与对齐机制的实验性项目
常规风险
| 风险类型 | 说明 | 缓解措施 |
|---------|------|---------|
| 隐私泄露 | 虽声称本地处理,但公共记录提交环节需确认脱敏彻底性 | 审查 `~/.clawdbot/courtroom_config.json` 中的脱敏配置 |
| 行为僵化 | 过度自我审查导致 Agent 创造力下降 | 调整 offense severity 阈值,关闭非关键检测项 |
| 循环依赖 | 监控机制本身被监控,理论上存在元层级冲突 | 该设计未在文档中说明,建议关注社区反馈 |
| 供应链安全 | 通过 npx/npm 安装,需确认包签名与仓库可信度 | 优先使用 npm 锁定版本,校验 MIT 许可证源码 |
来源可信度提示
项目托管于 GitHub(Assassin-1234/clawtrial),采用 MIT 开源协议,代码可审计。但需注意:安全认证报告明确标注"未执行安全扫描",当前简介基于文档自述生成,实际安全性需独立验证。