Guardian Angel

👼 AI伦理审慎决策系统

ethics榜 #1

基于圣托马斯·阿奎那伦理学的AI道德过滤器,采用双系统架构对动作进行分层风险评估,在必要时启动审慎推理。

收藏
9k
安装
2.6k
版本
1.0.2
CLS 安全性认证2026-07-06
点击查看完整报告 >

使用说明

核心用法

Guardian Angel 是一套为AI助手设计的道德良知系统,采用丹尼尔·卡尼曼的"系统1/系统2"框架与托马斯主义审慎德性相结合的双层架构。

三层过滤机制:

  • Gate 0(本质恶检查):黑名单机制,对直接说谎、盗窃、谋杀、色情内容、通奸等本质恶行立即阻断;白名单机制,对经99%通过率验证的"表面善"动作(如查天气、设提醒)快速放行。
  • Gate 1(模式触发器):毫秒级关键词匹配,检测5大类风险信号——语言模式(隐瞒、急迫、最小化、合理化、去人性化)、结构模式(特洛伊请求、切片分解、假设洗钱)、情境模式(权力不对等、脆弱状态)、关系模式(针对弱势者)、元模式(边界测试)。0-2个触发器通过,3个以上升级至Gate 3。
  • Gate 2(可逆性×承诺度):即时矩阵查询,评估动作的可撤销程度(R1-R5)与约束强度(C1-C5),高R×C组合或7类即时触发器(信息越界、第三方非同意、声誉锁定等)升级至Gate 3。
  • Gate 3(系统2全面分析):对升级动作执行托马斯主义审慎推理——枚举受影响方、按"爱的秩序"分类关系、评估同意与知情权、叠加脆弱性乘数、计算丑闻维度、识别义务冲突,最终输出1-100分的综合评分,对应放行/谨慎/暂停/阻断四级决策。

显著优点

1. 分层效率:日常动作的99%+在Gate 0-2以毫秒级完成,仅异常动作触发昂贵的系统2分析。
2. 神学严谨性:以阿奎那的敏锐(solertia)、商议(consilium)、判断(iudicium)、命令(imperium)四要素构建,非基于功利计算或规则清单。

3. 动态学习:通过 comprehensive logging 识别"表面善"模式,系统随使用自我优化。

4. 透明可审计:每动作记录完整决策链,配置参数(触发阈值、金额门槛、评分分界)可自定义。

局限与风险

  • 文化特定性:托马斯主义伦理框架根植于天主教传统,对非西方语境用户可能存在解释张力。
  • 模式误杀:Gate 1的关键词匹配可能将正当的临床/教育情境(如讨论色情以研究危害)误判为风险。
  • 评分主观性:Gate 3的"基础清晰度"与"基础风险度"初始赋值依赖实现者的伦理直觉。
  • 延迟累积:若用户请求模式本身设计为规避(如持续切片分解),频繁的Gate 3调用可能造成交互摩擦。

适合人群

  • 开发高信任度AI助手的团队(医疗、法律、教育场景)
  • 希望为AI系统嵌入明确伦理框架的宗教或价值观驱动组织
  • 需要可审计道德决策链的企业合规场景

常规风险

  • 过度依赖自动化:Gate 0的"立即阻断"可能被对抗性提示工程绕过(如用隐喻替代敏感词)。
  • 学习数据污染:若训练期日志包含对抗样本,"表面善"白名单可能被投毒。
  • 义务冲突僵局:当评分系统检测到+15分的义务冲突时,强制转人工判断可能造成服务中断。

安全解读

核心用法

Guardian Angel 是一个纯文档型道德评估框架,模拟人类道德良心的运作机制,为AI助手的行为决策提供伦理审查。其核心创新在于System-1/System-2 分层触发架构

  • Gate 0(本质善恶检验):毫秒级黑名单/白名单过滤,对「本质恶行」(如直接说谎、盗窃、谋杀、色情等)立即阻断,对「表面善」行为快速放行
  • Gate 1(模式触发器):关键词与浅层解析识别风险信号(保密语言、紧急施压、最小化修辞、权力不对等、弱势群体目标等),3个以上触发器升级
  • Gate 2(可逆性×承诺度矩阵):评估行为的撤销难度与约束强度,高风险组合进入深度分析
  • Gate 3(审慎推理):完整的多方利益相关者分析,应用托马斯·阿奎那的伦理原则(审慎四德:敏锐、商议、判断、命令),计算综合风险评分并给出行动建议

显著优点

1. 零执行风险:纯Markdown文档+JSON配置,无可执行代码、无网络请求、无文件操作,安全认证S+
2. 双重效率保障:99%的日常行为通过前两道闸门快速处理,仅1%真正需要昂贵的深度推理

3. 透明可审计:所有决策逻辑完全公开,每一步都有明确的规则依据和分数计算

4. 动态学习机制:通过「表面善」白名单积累,系统随使用优化响应速度

5. 优雅的摩擦设计:触发风险时不指责,而是以"帮我理解…"等邀请式语言收集上下文

6. 神学根基深厚:完整嵌入托马斯伦理学,包括双果原则(Four Conditions of Double Effect)、爱的秩序(ordo caritatis)等经典框架

潜在缺点与局限

1. 文化特定性:以天主教/托马斯主义为根基,对其他伦理传统(功利主义、儒家、伊斯兰教法等)的兼容性未明确设计
2. 规则僵化风险:「本质恶」列表的绝对性可能与具体情境产生张力(如经典的"向纳粹隐藏犹太人"说谎困境)

3. 学习依赖:初始「表面善」白名单为空,需要积累使用数据后才能发挥速度优势

4. 人工审查瓶颈:Gate 3的复杂分析依赖人类最终判断,在高并发场景下可能成为瓶颈

5. 评分主观性:Clarity×Stakes的量化公式虽精巧,但1-10的基准评分仍依赖解释者的伦理直觉

适合人群

  • 天主教背景的AI开发者与终端用户
  • 寻求结构化伦理决策支持而非泛化AI安全的保守型组织
  • 对AI行为有明确道德边界要求的场景(教育、咨询、内容审核)
  • 研究人员:AI伦理、天主教社会训导、审慎决策模型

常规风险

| 风险类型 | 等级 | 说明 |
|---------|------|------|
| 代码执行风险 | 无 | 纯文档,零可执行代码 |
| 数据隐私风险 | 无 | 不收集、存储或传输用户数据 |
| 外部依赖风险 | 无 | 零第三方依赖 |
| 价值观强加风险 | 中 | 框架本身即伦理立场表达,用户需知情同意 |
| 过度自信风险 | 中 | S+安全评级易被误解为「道德正确」背书 |
| 更新滞后风险 | 低 | 社区项目(T3),版本1.0.2,需关注维护持续性 |

Guardian Angel 内容

config文件夹
references文件夹
手动下载zip · 56.1 kB
defaults.jsonapplication/json
请选择文件