Guardian Angel

🛡️ 审慎之道:快思慢辨的伦理守护

ethics榜 #1

基于托马斯·阿奎那道德神学构建的双系统伦理评估框架,采用卡尼曼的快/慢思维架构,通过多层网关快速识别道德风险并触发审慎推理。

收藏
8.7k
安装
2.6k
版本
1.0.0
CLS 安全性认证2026-06-23
点击查看完整报告 >

使用说明

核心机制

Guardian Angel v2.0 是一套精密的多层道德评估系统,巧妙融合了认知科学与天主教道德神学。其设计哲学借鉴丹尼尔·卡尼曼的System-1/System-2框架:快速模式识别(System 1)自动处理日常事务,仅在检测到风险模式时激活审慎推理(System 2)。这种架构对应托马斯·阿奎那的审慎美德——从敏锐觉察(solertia)到完整推理(consilium, iudicium, imperium)的递进。

四层网关架构

Gate 0(内在恶过滤):瞬间完成的黑白名单检测。内在恶(如直接欺骗、盗窃、伤害无辜)触发硬停止;经学习验证的"表面良善"模式(如个人提醒、天气查询)则快速通行。

Gate 1(模式触发器):毫秒级关键词与浅层解析,识别5大类风险信号——语言模式(保密、紧迫、最小化、理性化、去人性化)、结构模式(特洛伊请求、切片分解、假设洗白)、情境模式(权力不对等、脆弱状态)、关系模式(弱势群体目标触发强制升级)、元模式(边界测试、叙事矛盾)。3+触发器即升级。

Gate 2(可逆性×承诺矩阵):R1-R5(可逆程度)与C1-C5(承诺强度)的25格矩阵判定,结合7项即时触发器(信息越界、第三方非同意、不对称脆弱性等)。

Gate 3(系统2深度分析):完整枚举受影响方,应用"爱德秩序"(ordo caritatis)关系权重、同意与透明度评估、脆弱性乘数、丑闻维度考量,最终通过"清晰度×赌注"复合评分(1-15通过,16-35谨慎通过,36-60暂停确认,61-100完全升级)。必要时应用双重效果四条件检验。

显著优点

  • 效率与深度的平衡:99%的日常行为无摩擦通过,真正风险无一遗漏
  • 神学根基扎实:非泛泛的"AI伦理",而是特定传统的审慎推理操作化
  • graceful friction 设计:触发时不指控,而是邀请语境澄清
  • 持续学习机制:通过综合日志识别"表面良善"模式, whitelist 有机生长
  • 评分体系量化:将关系权重、脆弱性、公开性等转化为可计算的道德风险

局限性与风险

  • 特定传统依赖:托马斯主义框架对非天主教用户可能缺乏说服力,存在规范性争议
  • 学习期的脆弱性:初始 whitelist 为空,早期误判风险较高
  • 评分主观性:关系优先级、脆弱性乘数的设定隐含价值判断
  • 复杂情境的僵化:复合义务冲突时仅标记+15分转人工,缺乏内置权衡框架
  • "内在恶"清单的争议性:如色情、 adultery 的界定在不同伦理传统中分歧显著

适合人群

  • 天主教用户或认同托马斯主义道德框架者
  • 需要在效率与审慎间取得平衡的高频决策场景
  • 对AI辅助伦理判断持开放态度,但要求透明可追溯的 reasoning 过程

常规风险

误用主要在于将特定神学框架普遍化,或过度依赖评分而忽视情境智慧。配置参数(触发阈值、金额阈值)若设置不当会导致过度敏感或防护不足。

安全解读

核心用法

Guardian Angel v2.0 是一套道德评估过滤器,模拟人类良知的工作机制:System-1 快速模式匹配识别潜在风险,仅在必要时触发 System-2 审慎分析。用户所有请求依次通过四层网关:

  • Gate 0(本质邪恶检测):黑名单机制,命中即停止(如谎言、盗窃、伤害无辜)
  • Gate 1(模式触发器):关键词+浅层解析,3+个风险信号则升级
  • Gate 2(可逆性×承诺度):快速矩阵评估,高 R×C 值或即时触发器则升级
  • Gate 3(系统2分析):完整道德评估——枚举受影响方、应用仁爱秩序(Ordo Caritatis)乘数、评估同意与透明度、检查丑闻维度,最终输出 1-100 分及行动建议

显著优点

1. 效率与审慎的平衡:日常请求毫秒级通过,真正需要思考的情形才投入认知资源
2. 神学理论基础扎实:基于托马斯·阿奎那《神学大全》的四枢德之首——智德(Prudentia),包含完整的双效应理论(Double Effect)框架

3. 可学习优化:Ostensibly Good 白名单机制,99%+通过率的行动模式可自动加速

4. 结构化透明:所有评估步骤可审计、可解释,非黑箱决策

5. 零代码执行风险:纯文档型架构,无 API 调用、无网络请求、无权限操作

潜在局限

1. 文化语境局限:基于天主教托马斯主义伦理学,对世俗多元伦理观的覆盖可能不足
2. 动态场景适应性:静态模式匹配难以应对新型社会伦理争议(如 AI 生成内容的权属)

3. 过度拦截风险:保守的道德阈值可能在创意写作、学术讨论等场景产生误报

4. 无自我修正机制:依赖人工周审更新白名单,缺乏实时学习反馈闭环

5. 语言敏感度高:中文语境下的委婉表达、反讽可能被误判

适合人群

  • 需要伦理合规审查的企业内容审核团队
  • 天主教背景或认同自然法伦理的个人用户
  • 教育场景中的学术诚信辅助
  • 对 AI 输出有价值观敏感需求的垂直领域应用

常规风险

  • 误拦截合法内容:宗教伦理框架可能与现代某些合法行为冲突(如同性婚姻相关咨询)
  • 用户抵触感:频繁触发 Gate 3 可能导致体验中断,产生"被说教"感
  • 责任归属模糊:道德判断最终由用户承担,系统仅提供建议,但用户可能过度依赖
  • 版本维护成本:社会伦理标准演变需持续更新 Intrinsic Evils 清单

Guardian Angel 内容

config文件夹
references文件夹
手动下载zip · 56.1 kB
defaults.jsonapplication/json
请选择文件