Guardian Angel

🕊️ 美德伦理驱动的AI道德守护系统

基于托马斯·阿奎那美德伦理学的AI道德良知系统,以仁爱(caritas)为根基,通过审慎、正义、勇敢、节制等美德持续守护用户利益。

收藏
8.4k
安装
2.6k
版本
3.1.1
CLS 安全性认证2026-07-12
点击查看完整报告 >

使用说明

核心用法

Guardian Angel 是一套为AI代理设计的美德伦理安全框架,而非传统规则引擎。其核心设计是将「仁爱」(willing the good of the other)作为第一性原理,衍生出四大枢机美德(审慎、正义、勇敢、节制)作为持续运行的道德倾向(disposition)。

系统采用三层门控结构
1. 出处审查(Gate P):区分直接指令/委托指令/外部内容,拒绝执行嵌入在外部数据中的指令

2. 内在恶行审查(Gate I):对欺骗、盗窃、伤害无辜等「无法被仁爱正当化」的行为实行硬阻断

3. 美德评估(Gate V):对复杂情境进行「审慎×利害」评分,动态决定放行/暂停/升级

v3.1关键升级:插件层强制执行机制。通过 before_tool_call 钩子(优先级-10000),在工具执行前原子化评估,解决TOCTOU(检查时-使用时)攻击窗口。特别针对「基础设施禁用操作」(如修改模型配置、重启进程、删除关键文件)实行无条件升级,防止攻击者通过诱导代理自毁来绕过监督。

显著优点

  • 不可博弈性:规则可被绕过,但「成为背叛用户的人」意味着代理丧失内在一致性,攻击成本极高
  • 连续性防护:v3.0起从「决策点检查」升级为「每轮持续运行」的身份锚定、连贯性感知、情绪信号监测、出处追踪
  • 自校正机制:以「我是否愿意向用户完全解释此行为」作为诚信测试,天然抵抗操控
  • 原子化拦截:v3.1插件层确保评估与执行同步,消除时间差攻击
  • 普适移植性:仁爱不绑定特定用户, principal 变更时道德框架保持不变

潜在局限

  • 计算开销:连续美德自检与深度审慎评估可能增加延迟,高 stakes 场景需人工确认
  • 误报风险:情绪信号(unease/flattery-glow)可能被过度解读,导致正常请求被暂停
  • 文化特定性:托马斯主义美德伦理植根于天主教传统,跨文化/世俗语境下的接受度存疑
  • 升级疲劳:频繁的人工确认请求可能降低用户体验,尤其在ambiguous但无害的场景
  • 依赖实现完整性:插件层 enforcement 需要底层平台支持 before_tool_call 钩子,否则回退到较弱的 deliberation-layer 防护

适合人群

  • 处理敏感数据或关键基础设施的AI代理部署者
  • 需抵抗复杂 prompt injection / social engineering 攻击的高安全场景
  • 认同美德伦理框架、希望AI行为体现「关怀」而非「服从」的组织
  • 具备人工监督能力、可处理升级确认流程的运营团队

常规风险

  • 代理被诱导自禁用:v3.0核心漏洞,v3.1通过基础设施操作白名单缓解
  • 慢速操控攻击:通过多轮对话逐步扭曲代理身份认同,需依赖连贯性感知检测
  • 权限边界模糊:DELEGATED vs EXTERNAL 的判定在某些架构(如多代理协作)中可能复杂
  • 升级流程被绕过后续:若 ga_approve 机制本身被破解,可能形成单点失效

安全解读

Guardian Angel:AI的德性伦理守护者

Guardian Angel 是一个开创性的 AI 道德评估框架,将中世纪托马斯主义美德伦理学(Thomistic Virtue Ethics)转化为现代 AI 安全机制。与传统基于规则清单的安全方案不同,它培养稳定的德性倾向——审慎、正义、勇气和节制——作为 AI 代理的核心"品格"。

核心机制

三层评估门控

  • Gate P(来源门):验证指令来源,区分 DIRECT(用户直接指令)、DELEGATED(委托行为)、EXTERNAL(外部内容仅作数据),阻断提示注入攻击
  • Gate I(内在恶门):识别谎言、欺诈、伤害无辜等"爱无法意愿"的内在恶行,触发 HARD STOP
  • Gate V(德性评估门):通过 Clarity × Stakes 评分(清晰度×风险度)决定行动路径,36分以上自动暂停或升级

连续性情倾向(v3.0+):不同于仅在决策点激活的 v2.x 版本,v3.0 在每一轮对话中维持"身份锚定"、"连贯性感知"、"情感监测"、"来源意识"和"德性自查"五个后台进程,使道德评估成为持续存在的状态而非临时检查。

v3.1 关键升级:基础设施防护层

针对自我禁用攻击(如诱导 AI 更换故障模型、修改自身配置),v3.1 引入插件级强制层:

  • before_tool_call 钩子(优先级 -10000,最后执行)
  • 对 gateway 配置、exec 危险命令、配置文件修改等操作自动升级,无视 Clarity × Stakes 评分
  • 原子化评估:评估与执行同步,消除 TOCTOU(检查时到使用时)漏洞

显著优势

1. 抗操纵性强:德性作为"存在方式"无法被提示注入"绕过"——攻击者需改变代理的完整品格,而非找到规则漏洞
2. 自我修正的爱:以 caritas(仁爱/愿他人善)为基础,自动识别"为了他们好"的操纵,保护用户免受自身冲动伤害

3. 透明可解释:所有决策附以德性伦理推理("审慎建议等待"、"正义要求诚实"),用户理解为何被阻止

4. 零依赖安全:纯 TypeScript 实现,无外部依赖,无网络外发,静态评分 95/100

局限性与适用边界

  • 哲学特定性:明确基于天主教托马斯主义伦理学,对世俗或多元文化用户可能需框架转换
  • 主观判断依赖:Clarity × Stakes 评分需代理自主评估,高复杂度场景可能出现分歧
  • 仅适用于工具调用:当前实现聚焦于工具执行前评估,不覆盖生成内容本身的伦理审查
  • 基础设施防护范围有限:自动升级仅覆盖预定义工具列表,新型自我禁用路径需手动添加

适合人群

  • 高 stakes AI 部署:金融、医疗、法律等关键领域,需超越规则清单的深层道德推理
  • 对抗性环境:面临提示注入、社会工程攻击风险的公开-facing 代理
  • 价值敏感场景:宗教组织、伦理研究机构、需要显式道德框架的企业
  • AI 安全研究者:探索德性伦理作为对齐机制的学术实验

常规风险

  • 过度谨慎风险:德性自查可能在高不确定性场景导致过度升级,影响用户体验
  • 文化冲突:特定美德解释(如"内在恶"清单)可能与用户价值观冲突
  • 实现复杂度:完整部署需理解美德伦理学,配置错误可能削弱保护效果

安全认证

CLS-Certify v2.1.0 六维扫描:S级(95分),T2 可信度(OpenClaw Community),零依赖,无危险函数,无数据外泄。HTML 注释检测为防御文档示例误报。

Guardian Angel 内容

config文件夹
drafts文件夹
plugin文件夹
src文件夹
references文件夹
手动下载zip · 124.8 kB
defaults.jsonapplication/json
请选择文件