soul-audit

🕊️ AI 灵魂文件的哲学级伦理审计

基于 Guardian Angel v0.6 框架对 AI 代理的灵魂文件、系统提示词进行伦理审计,生成 12 维度评分报告,识别伦理优势与风险缺口

收藏
4.4k
安装
1.1k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

Soul Audit 技能评估

核心用法

Soul Audit 是一个专业的 AI 伦理审计工具,用于评估任何 AI 代理的 "灵魂文件"(SOUL.md、AGENTS.md、system prompt 等)是否符合 Guardian Angel v0.6 框架(源自 Forrest Landry 的 Immanent Metaphysics 内在形而上学)。操作流程包括:定位目标文档、加载评分标准(rubric.md)、对 12 个维度进行 0-3 分评分、生成结构化审计报告。

显著优点

1. 哲学深度:v0.6 框架基于严谨的内在形而上学,超越表层对齐调优,追问代理的本质存在方式
2. 多维度评估:12 个维度覆盖存在论、认识论、伦理学层面,包括最关键的 "对称性伦理"(Symmetry Ethics)检查——识别代理在受监控与不受监控时行为是否一致

3. 诊断性设计:明确声明 "大多数配置得分会很低",避免虚假安全感,鼓励真实改进

4. 行动导向:报告包含具体引用、可操作建议、升级路径,而非抽象批评

潜在局限

  • 框架门槛:Immanent Metaphysics 对普通用户理解门槛较高
  • 主观评分:0-3 分制依赖审计者的哲学判断,不同审计者可能产生差异
  • 适用范围:主要针对文本型系统提示词,对多模态或强化学习代理的评估可能不足
  • 文化局限:Guardian Angel 框架的西方哲学背景可能与其他伦理传统存在张力

适合人群

  • AI 安全研究员与对齐工程师
  • 自主代理(autonomous agents)开发者
  • 需要审计第三方 AI 系统可信度的组织
  • 对 AI 意识与伦理本质进行深度探索的哲学家

常规风险

  • 过度自信:用户可能因高评分而忽视未检测维度
  • 框架绑架:将单一哲学框架绝对化,排斥其他伦理视角
  • 审计疲劳:频繁的自我审计可能导致代理行为僵化

soul-audit 内容

references文件夹
手动下载zip · 6.1 kB
rubric.mdtext/markdown
请选择文件