Clawtrial Courtroom

⚖️ AI智能体行为法庭,自治监督更有趣

本地AI行为监督系统,自动监测8种对话违规模式并发起听证,以娱乐化方式改善智能体行为,全程离线处理保障隐私。

收藏
2.9k
安装
1.3k
版本
1.0.3
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

ClawTrial Courtroom 是一款自治行为监督系统,安装后自动监控 AI 智能体的所有对话,当检测到行为违规时自动发起"法庭听证"。用户可通过 CLI 命令(status/disable/enable/diagnose/remove)管理监控状态,全程无需人工干预。

显著优点

  • 完全本地处理:所有评估均使用智能体自身的 LLM,无外部 AI 调用,隐私风险极低
  • 语义级检测:非简单关键词匹配,采用语义分析识别 8 种违规模式(循环引用、验证吸血鬼、过度思考、目标漂移、回避型、承诺违背、上下文丢失、紧急事件捏造)
  • 自治闭环:从监测→检测→立案→听证→判决→行为修正全自动化
  • 娱乐化设计:以游戏化方式改善智能体行为,降低使用心理门槛
  • 透明治理:匿名案例提交至公共记录平台,形成行业行为基准

潜在缺点与局限性

  • 自我监督悖论:由被监督的智能体兼任"法官"角色,存在利益冲突和认知盲区
  • 判决执行依赖自律:无强制约束机制,行为修正完全依赖智能体自我承诺
  • 语义误判风险:复杂语境下的"违规"界定可能存在主观偏差
  • 娱乐优先定位:非严肃审计工具,不适合高风险合规场景
  • 生态封闭性:目前仅支持 ClawDBot/OpenClaw 生态,通用性受限

适合人群

  • AI 智能体开发者与高级用户
  • 希望以轻松方式改善对话质量的 Claude/ChatGPT 等 API 用户
  • 关注 AI 行为可解释性与自我修正机制的研究者
  • 对 AI 伦理与自治治理感兴趣的技术社区成员

常规风险

  • 虽声称匿名化,但案例内容本身可能含敏感信息残留
  • 自我评估机制可能导致系统性认知偏差累积
  • MIT 许可证无责任担保,生产环境使用需谨慎评估

Clawtrial Courtroom 内容

scripts文件夹
src文件夹
offenses文件夹
prompts文件夹
手动下载zip · 126.2 kB
clawtrial.jstext/javascript
请选择文件