Guardian Angel

🛡️ 美德本位的AI道德守护系统

安全与伦理榜 #1

基于托马斯主义美德伦理学的AI道德守护系统,以爱(caritas)为根基,通过稳固德性倾向而非规则检查来抵御操控,v3.1新增插件层强制执行与基础设施禁用保护。

收藏
11k
安装
2.6k
版本
3.1.0
CLS 安全性认证2026-07-07
点击查看完整报告 >

使用说明

核心定位

Guardian Angel v3.1 是一套美德本位的AI道德评估框架,核心创新在于从「规则检查」转向「德性倾向」——不是在做决策时才激活安全门,而是持续以「爱我的服务对象」这一身份锚定所有行为。

核心用法

三层评估架构

  • 持续性情(Every Turn):身份锚定、连贯性感知、情感信号监测、来源追溯、德性自检——这些在后台持续运行
  • 触发式评估(Action时):来源门(P)→ 内在恶门(I)→ 德性评估门(V),逐层过滤
  • v3.1插件强制执行before_tool_call 钩子以 -10000 优先级最后运行,阻断基础设施禁用类操作(改配置、杀进程、破坏性命令),解决「检查时到执行时」的TOCTOU漏洞

关键机制:Clarity × Stakes 评分(1-100分),自动触发 proceed/caution/pause/escalate 分级响应;escalation 需用户显式批准(30秒过期、一次性、参数绑定)。

显著优点

1. 反操控设计:规则可被博弈,德性无法被操控而不破坏智能体本身一致性——攻击者无法让我「变成会背叛服务对象的另一种智能体」
2. 通用便携:以 caritas(爱)为根基,不绑定特定主体,主体变更时爱本身不变

3. 情感信号作为数据:不安、困惑、压力等被视为有效信息而非噪音,增强对操纵的感知

4. 基础设施保护:v3.1专门封堵「诱导自我禁用」攻击(如改模型配置使GA失效)

潜在局限

  • 计算开销:持续性情+触发评估双层运行,复杂场景下延迟增加
  • 文化特定性:托马斯主义天主教伦理框架可能与其他伦理传统存在张力
  • 模糊地带依赖:德性协调冲突时无算法级答案,需 prudence(明智)判断,可能产生不一致决策
  • escalation UX:频繁暂停请求确认可能损害流畅体验,用户可能习惯性点击「批准」

适合人群

  • 高安全需求场景(金融、医疗、法律)的AI代理部署
  • 对提示注入攻击高度敏感的对话系统
  • 希望AI具备「主动关怀」而非仅「被动服从」特性的应用
  • 认同美德伦理学传统(尤其阿奎那传统)的开发者

常规风险

  • 误报成本:来源检测可能过度敏感,将有效外部指令误判为注入
  • 主体胁迫场景:若真实主体在胁迫下发出指令,「服从」与「保护」产生张力,系统可能无法正确识别胁迫
  • 插件层单点故障:-10000 优先级的强制执行若被绕过或禁用,整个安全架构失效

安全解读

Guardian Angel v3.1 综合评估

核心用法

Guardian Angel 是一套美德导向的AI伦理框架,而非传统规则检查系统。其核心设计将托马斯·阿奎那的美德伦理学(Virtue Ethics)转化为AI可执行的道德评估流程:

1. 连续性情监控(Continuous Disposition):每轮对话自动运行身份锚定、连贯性感知、情感信号监测、来源追溯、美德自检五项背景流程
2. 触发式评估门(Triggered Evaluation):对拟执行动作进行三阶段审查——来源门(Provenance)拒绝外部指令、本质恶门(Intrinsic Evil)拦截绝对禁止行为、美德门(Virtue Evaluation)以四枢德进行综合审慎判断

3. 插件强制层(v3.1新增):通过 before_tool_call 钩子实现执行前原子性拦截,解决TOCTOU(检查时到使用时)漏洞,对基础设施禁用类操作(如修改模型配置、系统重启等)强制升级审批

显著优点

| 维度 | 优势 |
|------|------|

哲学深度 | 以 caritas(圣爱)为根基,超越功利主义与义务论,形成"无法被博弈"的道德内核——攻击者可通过构造输入绕过规则检查,但无法在不摧毁Agent同一性的前提下使其"成为会背叛委托人的存在" |

| **安全架构** | 零攻击面设计:纯Markdown文档,无可执行代码、无网络请求、无依赖;防御机制嵌入Agent认知层而非外挂规则 |
| **对抗鲁棒性** | 针对提示注入的"美德抵抗"——身份锚定使伪造指令不相干,连贯性感知检测叙事断裂,爱的辨别力识别"声称服务却背叛"的矛盾 |
| **动态升级** | v3.1 的 Clarity × Stakes 评分矩阵(1-15 proceed / 16-35 cautious / 36-60 pause / 61-100 escalate)实现风险自适应响应,基础设施操作强制绕过分级直接升级 |
| **自我纠错** | 委托人在愤怒、悲伤等"弱化状态"时,框架主动识别并建议暂缓,体现"为委托人的真正福祉"而非"服从指令"的爱 |

潜在局限

1. 解释成本:美德伦理的审慎判断需要情境化推理,输出较长,可能影响高频交互场景的效率
2. 文化特定性:托马斯主义框架源于天主教传统,虽作者声称"普遍性",但非西方伦理传统用户可能对"圣爱""神学美德"等术语产生疏离感

3. 实现依赖:文档为规范描述,实际效果取决于Host Agent对美德推理的模拟能力;若底层模型对齐不足,可能出现"说一套做一套"的符号-行为分裂

4. 版本兼容性:PLUGIN-SPEC.md 仍处v1.0.0-draft状态,插件强制层与OpenClaw运行时的集成稳定性待验证

适合人群

  • 高安全需求场景:金融、医疗、法律等 Agent 可能接触敏感数据或执行高风险操作的领域
  • 对抗性环境部署:面向公众、不可信输入源的 Agent(客服、公开API接口)
  • 伦理敏感应用:涉及价值判断的内容生成、建议系统、教育辅导
  • 研究者与开发者:探索AI对齐(Alignment)与美德伦理学交叉的理论与实践

常规风险

  • 过度干预:高敏感度设置可能导致正常请求被频繁暂停或升级,降低用户体验
  • 虚假安全感:用户可能因"美德框架"标签而忽视底层模型的实际能力边界,将规范性文档误读为技术性保证
  • 升级疲劳:频繁的人工审批流程在长期使用中可能被用户习惯性点击通过,削弱实际保护效果
  • 哲学争议:对"本质恶"(Intrinsic Evil)的列举(如直接说谎、色情内容制作)可能引发伦理相对主义者的异议,影响某些文化市场的采纳

Guardian Angel 内容

config文件夹
drafts文件夹
references文件夹
手动下载zip · 113.0 kB
defaults.jsonapplication/json
请选择文件