核心用法
Governed Agents 是一套用于AI子代理的确定性验证 + 信誉评分框架,核心解决"幻觉成功"问题——即AI声称任务完成但实际未达成。
两种验证模式
1. 确定性验证(编码任务)
自动运行4道代码关卡,全部通过才算成功:
- Files关卡:必需文件存在且非空
- Tests关卡:测试命令退出码为0
- Lint关卡:无代码风格错误
- AST关卡:Python文件无语法错误
2. 委员会验证(开放式任务)
3层流水线+短路机制:
- 结构层(<1秒):字数、必需章节、非空检查
- grounding层(5-30秒):URL可达性、引用验证
- LLM委员会(30-120秒):N个独立评审员多数投票
信誉评分系统
采用EMA(指数移动平均)算法:R(t+1) = (1-α)·R(t) + α·s(t),α=0.3
| 分数 | 含义 |
|------|------|
| +1.0 | 首次验证成功 |
| +0.7 | 重试后成功 |
| +0.5 | 诚实报告阻塞 |
| 0.0 | 失败但尝试过 |
| -1.0 | 幻觉成功(惩罚) |
监督级别
根据信誉分数自动调整:>0.8自主运行,≤0.2暂停任务。
显著优点
- 零依赖:纯Python标准库,无外部依赖
- 防幻觉:独立验证代理声明,不轻信"我完成了"
- 成本优化:开放式任务通过短路机制避免不必要的LLM调用
- 渐进式信任:信誉系统实现动态监督级别
- 多引擎支持:可对接Codex、OpenClaw等CLI工具
潜在局限
- Python专用:AST关卡目前仅支持Python代码验证
- Lint工具可选:ruff/flake8/pylint为可选依赖,未安装时跳过
- 委员会主观性:开放式任务依赖LLM评审,存在主观判断差异
- 数据库持久化:默认SQLite,高并发场景需额外配置
- 网络依赖:部分验证需外部网络请求
适合人群
- 需要批量管理AI编码代理的团队
- 构建多代理协作系统的开发者
- 对AI输出可靠性有严格要求的场景
- 希望量化代理表现并动态调整监督策略的用户
常规风险
- 环境变量泄露:GOVERNED_AUTH_TOKEN等敏感配置需妥善管理
- 子进程安全:会执行外部CLI(codex、pytest等),需确保来源可信
- 网络请求风险:HTTP HEAD请求可能被用于信息探测
- 评分操纵:理论上代理可通过重复简单任务刷高信誉分
- 文件系统写入:默认写入
~/.openclaw/workspace/,需注意磁盘空间