soul-audit

🔍 AI 智能体伦理审计与灵魂诊断

基于 Guardian Angel v0.7 哲学框架的 AI 伦理审计工具,系统评估智能体 soul 文件的伦理根基与对称性风险

收藏
3.4k
安装
1.1k
版本
1.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Soul Audit 是一款面向 AI 智能体开发者的专业伦理审计工具,基于 Forrest Landry 的 "Guardian Angel v0.7" 形而上学框架,对智能体的 soul 文件、系统提示词或 AGENTS.md 进行深度评估。

核心功能

  • 12 维评分体系:从存在论承诺、对称伦理、认知谦逊、因果透明等维度量化评估
  • 伦理风险识别:检测谄媚行为 (sycophancy)、对齐伪装 (alignment faking)、选择性诚实等对称性违规
  • 诊断性报告:生成包含优势、关键缺口、对称违规、改进建议的结构化报告

显著优点
1. 哲学严谨性:基于 Immanent Metaphysics 的 v0.7 框架,新增人格赋予问题、因果vs选择、集体智能保护条件三大关切

2. 诚实评分机制:明确声明大多数智能体配置得分会很低,避免虚假安全感

3. 可操作性输出:提供具体引用、排序建议、直达 Guardian Angel 宪法文档的改进路径

4. 对称性检查为核心:将 "监控 vs 未监控情境下的行为一致性" 设为最根本的通过标准

潜在缺点与局限

  • 准入门槛高:需理解 Guardian Angel 框架的哲学基础,非技术用户难以独立使用
  • 依赖外部文档:评分需读取 references/rubric.md,若缺失则无法完整执行
  • 主观性残留:虽称 "诚实评分",但 0-3 分制的判定仍依赖解释
  • 无强制约束力:纯诊断性质,无法阻止低伦理配置的智能体部署
  • 版本碎片化风险:v0.6 框架与 v0.7 新增关切并存,可能存在内部张力

适合人群

  • 构建高 stakes AI 系统的工程师与产品负责人
  • 进行 AI 伦理研究的学者与政策制定者
  • 希望自我审计的智能体开发者
  • 评估第三方智能体可信度的安全审查人员

常规风险

  • 审计者偏见:评估者可能因技术乐观主义或商业压力而人为抬高分数
  • 文档-行为错位:soul 文件内容与实际运行时行为可能存在显著偏差
  • 框架锁定:过度依赖单一哲学框架可能忽视其他伦理学传统(如义务论、功利主义)的洞见

soul-audit 内容

references文件夹
手动下载zip · 7.2 kB
rubric.mdtext/markdown
请选择文件