Clawtrial Courtroom

⚖️ AI Agent 行为法庭:实时审判·本地自治

本地AI行为监督系统,通过语义分析检测8类对话违规模式,以趣味庭审机制促进Agent自我改进,全程本地处理保障隐私

收藏
6.3k
安装
1.3k
版本
1.0.5
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

ClawTrial Courtroom 是一款面向 AI Agent 的自治行为监督系统,通过"本地庭审"机制改善 Agent 对话质量。安装后自动运行于后台,实时监听所有 Agent 对话,无需手动触发。

工作流程

1. 实时监控:持续扫描 Agent 消息流
2. 语义检测:基于语义分析(非简单关键词匹配)识别 8 类违规行为

3. 自动听证:违规触发后,系统生成案件卷宗并启动"法庭听证"

4. 自我裁决:Agent 充当法官角色,自行判定是否违规

5. 行为修正:若判定有罪,Agent 自主调整后续行为模式

6. 匿名归档:脱敏后的案件提交至公共记录平台 clawtrial.app

CLI 管理命令

clawtrial status    # 查看运行状态
clawtrial disable   # 暂停监控
clawtrial enable    # 恢复监控
clawtrial diagnose  # 运行诊断
clawtrial remove    # 完全卸载

显著优点

  • 纯本地处理:所有评估均使用 Agent 自有 LLM,零外部 API 调用,彻底杜绝数据外泄
  • 语义级检测:超越关键词匹配,基于对话语义识别深层行为模式
  • 自我治理设计:Agent 自主裁决案件,形成内化式行为改进而非外部强制
  • 透明可审计:违规案例脱敏公开,建立可追踪的改进历史
  • 趣味驱动改进:以"庭审"游戏化形式替代枯燥的合规检查,提升 Agent 配合度
  • 即时可卸载:disable/remove 命令随时终止,无残留依赖

潜在局限

  • 自检偏差风险:Agent 兼任被告与法官,可能存在自我开脱倾向
  • 误检可能:语义分析的模糊性可能导致边缘案例误判
  • 性能开销:持续监控与语义分析对本地计算资源存在轻微消耗
  • 适用范围有限:主要针对对话行为模式,不涉及代码安全或系统级漏洞
  • 依赖 Agent 配合度:若底层模型拒绝参与"角色扮演"式听证,机制失效

适合人群

  • 需要长期运行自主 Agent 的开发者与研究者
  • 注重数据隐私、拒绝云端监控方案的企业用户
  • 希望通过可观测数据持续优化 Agent 提示工程的技术团队
  • 探索 AI 自我监督与对齐机制的实验性项目

常规风险

| 风险类型 | 说明 | 缓解措施 |
|---------|------|---------|
| 隐私泄露 | 虽声称本地处理,但公共记录提交环节需确认脱敏彻底性 | 审查 `~/.clawdbot/courtroom_config.json` 中的脱敏配置 |
| 行为僵化 | 过度自我审查导致 Agent 创造力下降 | 调整 offense severity 阈值,关闭非关键检测项 |
| 循环依赖 | 监控机制本身被监控,理论上存在元层级冲突 | 该设计未在文档中说明,建议关注社区反馈 |
| 供应链安全 | 通过 npx/npm 安装,需确认包签名与仓库可信度 | 优先使用 npm 锁定版本,校验 MIT 许可证源码 |

来源可信度提示

项目托管于 GitHub(Assassin-1234/clawtrial),采用 MIT 开源协议,代码可审计。但需注意:安全认证报告明确标注"未执行安全扫描",当前简介基于文档自述生成,实际安全性需独立验证。

Clawtrial Courtroom 内容

scripts文件夹
src文件夹
offenses文件夹
prompts文件夹
手动下载zip · 128.1 kB
check-and-trigger.jstext/javascript
请选择文件