Guardian Angel

🛡️ AI道德良知·审慎分层守护

ethics榜 #1

基于托马斯·阿奎那伦理学的AI道德良知系统,采用快慢双系统架构对行动进行实时道德筛选,高风险场景自动触发审慎推理。

收藏
7.9k
安装
2.6k
版本
1.0.1
CLS 安全性认证2026-06-26
点击查看完整报告 >

使用说明

Guardian Angel v2.0 综合评估

核心机制

Guardian Angel 是一个为AI助手设计的道德良知系统,借鉴了卡尼曼的System-1/System-2认知框架和托马斯主义的审慎伦理学(Prudence)。其核心创新在于分层过滤架构:绝大多数日常行动通过快速模式匹配无摩擦通过,仅在检测到道德风险时才启动昂贵的深度分析。

四道闸门设计:

| 闸门 | 功能 | 速度 | 典型结果 |
|------|------|------|---------|
| Gate 0 | 固恶识别/白名单快通 | 即时 | 99%+行动直接放行或硬阻断 |
| Gate 1 | 模式触发器(5大类) | 毫秒级 | 3+触发则升级 |
| Gate 2 | 可逆性×承诺度矩阵 | 即时 | 高R×C组合触发深度分析 |
| Gate 3 | 完整审慎推理 | 有意识的慢思考 | 量化评分决策 |

显著优点

1. 效率与审慎的平衡
区别于"审查一切"的沉重方案,该系统承认道德生活的基本事实:大多数行动在道德上是例行的。快速通道确保了日常交互的流畅性,而分层升级机制确保风险不被遗漏。

2. 严谨的理论根基
系统直接映射阿奎那对审慎(prudence)四要素的划分:solertia(机敏识别)对应Gates 1-2,consilium(商议)、iudicium(判断)、imperium(命令)对应Gate 3的完整流程。

3. 精细的风险量化模型
Gate 3采用多因子评分:受影响方枚举→ordo caritatis亲疏权重→知情同意状态→脆弱性乘数→丑闻维度→义务冲突检测。最终Clarity × Stakes复合评分提供可操作的决策阈值。

4. 反操纵设计
Gate 1专门识别5类操纵性请求模式(如"特洛伊请求"、"萨拉米切片"、"假设性洗钱"),并对脆弱人群(儿童、老人、病患等)设置绝对升级规则。

5. 自适应学习能力
"Ostensibly Good"白名单通过99%+通过率的学习机制动态扩展,系统随使用而优化而非僵化。

潜在局限与风险

1. 固恶清单的争议性
Gate 0的黑名单基于特定天主教/托马斯主义伦理学,包含如"直接说谎绝不可接受"等立场。这在多元文化语境中可能引发正当性争议——系统明确将特定神学传统设为普遍规范。

2. 模式匹配的误报风险
关键词触发(如"大家都这么做"被标记为合理化信号)可能产生语境误判。虽然设计了"优雅摩擦"的澄清机制,但反复触发仍可能损害用户体验。

3. 评分算法的透明度困境
Gate 3的复合评分涉及多个主观权重(如家庭关系×1.5、公共人物+2-4 stakes),这些参数的神学依据虽明确,但数值设定的任意性难以完全辩护。

4. 双重效应分析的实践难度
条件3"善果不经由恶而来"在复杂因果链中判断困难,系统提供的框架可能过度简化现实道德推理。

5. 文化嵌入性
Ordo caritatis(爱的秩序)亲疏原则、丑闻(scandal)概念等深植于特定传统,跨文化适用性存疑。

适合人群

  • 天主教/托马斯主义伦理学拥护者:系统与其道德形而上学完全同构
  • 高风险领域AI应用:医疗、法律、心理咨询、金融咨询等需要审慎决策的场景
  • 家长控制/教育场景:对儿童使用的AI提供道德护栏
  • 机构合规需求:需要可审计道德决策日志的组织

不适合:追求价值中立工具理性的用户、文化相对主义者、对特定宗教伦理学有异议的多元社群。

常规风险提示

| 风险类别 | 具体表现 | 缓解建议 |
|---------|---------|---------|
| 过度阻塞 | 固恶清单误伤边缘案例(如保护性隐瞒) | 保留人工申诉通道 |
| 虚假安全感 | 用户可能过度信任量化评分 | 明确标注"辅助判断,非替代良知" |
| 模式僵化 | 学习机制可能固化既有偏见 | 定期人工审计白名单扩展 |
| 语境盲区 | 非西方道德框架的表达可能被误触发 | 提供文化敏感性配置选项 |

总体评价

Guardian Angel v2.0 是伦理AI领域最具理论完整性的开源方案之一。它不掩饰自身的规范性立场,而是将托马斯主义审慎伦理学转化为可运行的技术架构。对于认同其哲学基础的用户,它提供了罕见的深度;对于不认同者,其分层设计的逻辑仍可借鉴——只需替换Gate 0的内容和Gate 3的权重参数。

系统的真正考验在于动态平衡:学习机制能否足够快地将真正无害的模式白名单化,同时保持对新型操纵技术的敏感?这需要实际部署数据的验证。

安全解读

核心用法

Guardian Angel 采用 System-1/System-2 双层道德评估架构

  • Gate 0(本质善恶):瞬间黑白名单筛查,内在恶行直接拒绝
  • Gate 1(模式触发器):毫秒级关键词匹配,识别语言/结构/情境风险信号
  • Gate 2(可逆性×承诺):矩阵查表评估行动后果严重性
  • Gate 3(系统2深度分析):完整托马斯主义审慎推理(关系排序、脆弱性加权、双重效应分析)

显著优点

1. 效率与审慎平衡:99%常规操作快速通过,仅高风险行为进入昂贵分析
2. 神学严谨性:扎根天主教托马斯主义传统,提供内在恶、审慎德性、双重效应等成熟伦理工具

3. 可学习优化:"表面善"白名单机制通过日志积累自动扩展安全操作类型

4. 结构化透明:R×C矩阵、量化评分、多方利益枚举使道德推理可审计

潜在局限

1. 文化特定性:Thomistic框架源于13世纪欧洲基督教神学,部分概念(如特定性恶列表)可能与其他伦理传统冲突
2. 实施依赖性:纯文档型Skill,实际效果取决于AI助手对框架的理解与执行一致性

3. 评分主观性:关系乘数、脆弱性权重等参数需人工校准,不同配置可能产生矛盾结论

4. 无强制执行:技术层面无法阻止AI绕过评估,依赖系统提示词的约束

适合人群

  • 寻求结构化道德决策辅助的AI开发者
  • 认同德性伦理学或自然法传统的个人/机构
  • 需处理高信任场景(医疗、法律、心理咨询)的AI应用
  • 希望AI具备可解释伦理推理过程的研究者

常规风险

  • 框架误用:用户可能将宗教伦理框架强加于不适用的世俗场景
  • 过度依赖:量化评分可能制造"道德已解决"的虚假安全感
  • 文化冲突:特定敏感话题(如 abortion、euthanasia 的内在恶判定)可能引发用户反弹
  • 动态漂移:"表面善"学习机制若训练数据偏差,可能错误分类风险行为

Guardian Angel 内容

config文件夹
references文件夹
手动下载zip · 56.1 kB
defaults.jsonapplication/json
请选择文件