Governed Agents

🛡️ AI代理防幻觉验证与信誉评分

AI子代理确定性验证与信誉评分系统,通过4层代码关卡和3层流水线防止"幻觉成功",确保任务真实完成

收藏
5k
安装
1k
版本
0.1.9
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Governed Agents 是一套用于AI子代理的确定性验证 + 信誉评分框架,核心解决"幻觉成功"问题——即AI声称任务完成但实际未达成。

两种验证模式

1. 确定性验证(编码任务)
自动运行4道代码关卡,全部通过才算成功:

  • Files关卡:必需文件存在且非空
  • Tests关卡:测试命令退出码为0
  • Lint关卡:无代码风格错误
  • AST关卡:Python文件无语法错误

2. 委员会验证(开放式任务)
3层流水线+短路机制:

  • 结构层(<1秒):字数、必需章节、非空检查
  • grounding层(5-30秒):URL可达性、引用验证
  • LLM委员会(30-120秒):N个独立评审员多数投票

信誉评分系统

采用EMA(指数移动平均)算法:R(t+1) = (1-α)·R(t) + α·s(t),α=0.3

| 分数 | 含义 |
|------|------|
| +1.0 | 首次验证成功 |
| +0.7 | 重试后成功 |
| +0.5 | 诚实报告阻塞 |
| 0.0 | 失败但尝试过 |
| -1.0 | 幻觉成功(惩罚) |

监督级别

根据信誉分数自动调整:>0.8自主运行,≤0.2暂停任务。

显著优点

  • 零依赖:纯Python标准库,无外部依赖
  • 防幻觉:独立验证代理声明,不轻信"我完成了"
  • 成本优化:开放式任务通过短路机制避免不必要的LLM调用
  • 渐进式信任:信誉系统实现动态监督级别
  • 多引擎支持:可对接Codex、OpenClaw等CLI工具

潜在局限

  • Python专用:AST关卡目前仅支持Python代码验证
  • Lint工具可选:ruff/flake8/pylint为可选依赖,未安装时跳过
  • 委员会主观性:开放式任务依赖LLM评审,存在主观判断差异
  • 数据库持久化:默认SQLite,高并发场景需额外配置
  • 网络依赖:部分验证需外部网络请求

适合人群

  • 需要批量管理AI编码代理的团队
  • 构建多代理协作系统的开发者
  • AI输出可靠性有严格要求的场景
  • 希望量化代理表现并动态调整监督策略的用户

常规风险

  • 环境变量泄露:GOVERNED_AUTH_TOKEN等敏感配置需妥善管理
  • 子进程安全:会执行外部CLI(codex、pytest等),需确保来源可信
  • 网络请求风险:HTTP HEAD请求可能被用于信息探测
  • 评分操纵:理论上代理可通过重复简单任务刷高信誉分
  • 文件系统写入:默认写入~/.openclaw/workspace/,需注意磁盘空间

Governed Agents 内容

.github文件夹
workflows文件夹
governed_agents文件夹
tests文件夹
tools文件夹
手动下载zip · 54.8 kB
ci.ymltext/plain
请选择文件