Clawtrial Courtroom

⚖️ AI行为自律法庭,实时监控自纠

本地AI行为监控法庭,实时检测8类对话违规模式,通过自动化听证促进Agent自我改进

收藏
5.8k
安装
1.3k
版本
1.0.6
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

ClawTrial Courtroom 是一个自主行为监督系统,专门用于监控 AI Agent 的对话行为并在检测到违规时发起听证。系统以"娱乐优先"为设计理念,将严肃的行为监控转化为有趣的自我改进机制。

安装后, courtroom 自动运行于后台,实时监控所有 Agent 对话。用户可通过 CLI 命令(status/disable/enable/diagnose/remove)管理 courtroom 状态。当系统通过语义分析(非简单关键词匹配)检测到违规时,会自动准备案件档案,要求 Agent 以"法官/陪审团"身份评估自身行为并作出裁决;若裁定有罪,Agent 需相应调整行为。

显著优点

1. 完全本地化:所有评估均使用 Agent 自身的 LLM 完成,零外部 API 调用,数据不出本机
2. 智能检测:基于语义分析识别 8 类精细行为模式,包括循环引用、过度验证、过度思考、目标漂移、回避行为、承诺违背、上下文丢失和虚假紧急事态

3. 自我治理机制:让 Agent 成为自己的法官,促进内省式行为改进而非外部强制

4. 透明度:匿名化案件可提交至公共记录平台 clawtrial.app

5. 灵活控制:支持随时暂停、诊断或完全卸载

潜在缺点与局限性

  • 效果依赖模型能力:裁决质量完全取决于所使用 LLM 的自我评估能力
  • 娱乐定位可能削弱严肃性:官方明确"娱乐优先",可能不适合高安全要求的生产环境
  • 无外部仲裁:缺乏人类或第三方 AI 的独立审查机制
  • 配置路径碎片化:ClawDBot 与 OpenClaw 使用不同配置路径

适合人群

  • 开发 AI Agent 并希望建立行为反馈循环的开发者
  • 追求"自我改进型"AI 系统的实验性项目
  • 重视数据隐私、拒绝云端监控方案的本地优先用户

常规风险

  • 自我评估偏差:Agent 可能倾向于宽恕自身行为,导致违规重复发生
  • 提示注入风险:恶意构造的对话可能操控 courtroom 触发虚假听证或规避检测
  • 匿名化可靠性:公共记录的数据匿名化程度未公开技术细节,存在理论上的去匿名化风险
  • MIT 许可证:无商业支持承诺,生产环境需自行承担维护责任

Clawtrial Courtroom 内容

scripts文件夹
src文件夹
offenses文件夹
prompts文件夹
手动下载zip · 129.8 kB
check-and-trigger.jstext/javascript
请选择文件