Governed Agents

🛡️ AI子代理的确定性验证与声誉治理

AI子代理的确定性验证与声誉评分系统,通过4层代码关卡和3层验证管道防止幻觉式成功声明,实现自动化质量管控与可信度追踪。

收藏
3.2k
安装
1k
版本
0.1.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

Governed Agents 是一个专为AI子代理设计的验证与治理框架,通过确定性检查 + 声誉评分双机制,解决AI代理常见的"幻觉成功"问题(即代理声称任务完成,但实际未达成目标)。

两大验证模式

1. 确定性验证(编程任务)

  • 4道硬关卡:文件存在性、测试通过、代码规范、语法解析
  • 任一关卡失败即判定为失败,并触发-1.0声誉惩罚

2. 委员会验证(开放任务)

  • 3层短回路管道:结构检查→事实核查→LLM多评审投票
  • 第一层失败立即返回,避免无效API调用

声誉系统

采用EMA(指数移动平均)动态评分,根据历史表现自动调整监督级别:

  • >0.8: 完全自主
  • 0.4-0.6: 需检查点
  • ≤0.2: 任务暂停

显著优势

  • 零依赖:纯Python标准库,部署零摩擦
  • 成本优化:开放任务通过短回路设计减少无效LLM调用
  • 防作弊:客观指标优先,LLM仅作最终仲裁
  • 可扩展:TaskContract + TaskProfile 支持自定义验证规则

局限与风险

| 方面 | 说明 |
|------|------|
| **适用范围** | 主要针对代码和结构化文档,创意/设计类任务验证较弱 |
| **委员会成本** | 开放任务需多次LLM调用,延迟30-120秒 |
| **评分主观性** | LLM评审存在模型偏见,建议配合人类抽检 |
| **依赖契约质量** | TaskContract定义不清会导致验证失效 |

适用场景

  • AI辅助开发流水线(如Claude Code、Codex CLI)
  • 多代理协作系统的可靠性保障
  • 自动化代码评审与回归测试集成
  • 研究/分析任务的事实性校验

风险提醒

  • 声誉系统可能产生反馈循环:高声誉代理获更多机会,但初始评分需谨慎校准
  • 建议定期用黄金标准任务重新校准评分阈值

Governed Agents 内容

.github文件夹
workflows文件夹
governed_agents文件夹
tests文件夹
手动下载zip · 43.4 kB
ci.ymltext/plain
请选择文件