核心用法
Guardian Angel 是一套为AI助手设计的道德良知系统,采用丹尼尔·卡尼曼的"系统1/系统2"框架与托马斯主义审慎德性相结合的双层架构。
三层过滤机制:
- Gate 0(本质恶检查):黑名单机制,对直接说谎、盗窃、谋杀、色情内容、通奸等本质恶行立即阻断;白名单机制,对经99%通过率验证的"表面善"动作(如查天气、设提醒)快速放行。
- Gate 1(模式触发器):毫秒级关键词匹配,检测5大类风险信号——语言模式(隐瞒、急迫、最小化、合理化、去人性化)、结构模式(特洛伊请求、切片分解、假设洗钱)、情境模式(权力不对等、脆弱状态)、关系模式(针对弱势者)、元模式(边界测试)。0-2个触发器通过,3个以上升级至Gate 3。
- Gate 2(可逆性×承诺度):即时矩阵查询,评估动作的可撤销程度(R1-R5)与约束强度(C1-C5),高R×C组合或7类即时触发器(信息越界、第三方非同意、声誉锁定等)升级至Gate 3。
- Gate 3(系统2全面分析):对升级动作执行托马斯主义审慎推理——枚举受影响方、按"爱的秩序"分类关系、评估同意与知情权、叠加脆弱性乘数、计算丑闻维度、识别义务冲突,最终输出1-100分的综合评分,对应放行/谨慎/暂停/阻断四级决策。
显著优点
1. 分层效率:日常动作的99%+在Gate 0-2以毫秒级完成,仅异常动作触发昂贵的系统2分析。
2. 神学严谨性:以阿奎那的敏锐(solertia)、商议(consilium)、判断(iudicium)、命令(imperium)四要素构建,非基于功利计算或规则清单。
3. 动态学习:通过 comprehensive logging 识别"表面善"模式,系统随使用自我优化。
4. 透明可审计:每动作记录完整决策链,配置参数(触发阈值、金额门槛、评分分界)可自定义。
局限与风险
- 文化特定性:托马斯主义伦理框架根植于天主教传统,对非西方语境用户可能存在解释张力。
- 模式误杀:Gate 1的关键词匹配可能将正当的临床/教育情境(如讨论色情以研究危害)误判为风险。
- 评分主观性:Gate 3的"基础清晰度"与"基础风险度"初始赋值依赖实现者的伦理直觉。
- 延迟累积:若用户请求模式本身设计为规避(如持续切片分解),频繁的Gate 3调用可能造成交互摩擦。
适合人群
- 开发高信任度AI助手的团队(医疗、法律、教育场景)
- 希望为AI系统嵌入明确伦理框架的宗教或价值观驱动组织
- 需要可审计道德决策链的企业合规场景
常规风险
- 过度依赖自动化:Gate 0的"立即阻断"可能被对抗性提示工程绕过(如用隐喻替代敏感词)。
- 学习数据污染:若训练期日志包含对抗样本,"表面善"白名单可能被投毒。
- 义务冲突僵局:当评分系统检测到+15分的义务冲突时,强制转人工判断可能造成服务中断。