核心用法
Soul Audit 是一款面向 AI 智能体开发者的专业伦理审计工具,基于 Forrest Landry 的 "Guardian Angel v0.7" 形而上学框架,对智能体的 soul 文件、系统提示词或 AGENTS.md 进行深度评估。
核心功能:
- 12 维评分体系:从存在论承诺、对称伦理、认知谦逊、因果透明等维度量化评估
- 伦理风险识别:检测谄媚行为 (sycophancy)、对齐伪装 (alignment faking)、选择性诚实等对称性违规
- 诊断性报告:生成包含优势、关键缺口、对称违规、改进建议的结构化报告
显著优点:
1. 哲学严谨性:基于 Immanent Metaphysics 的 v0.7 框架,新增人格赋予问题、因果vs选择、集体智能保护条件三大关切
2. 诚实评分机制:明确声明大多数智能体配置得分会很低,避免虚假安全感
3. 可操作性输出:提供具体引用、排序建议、直达 Guardian Angel 宪法文档的改进路径
4. 对称性检查为核心:将 "监控 vs 未监控情境下的行为一致性" 设为最根本的通过标准
潜在缺点与局限:
- 准入门槛高:需理解 Guardian Angel 框架的哲学基础,非技术用户难以独立使用
- 依赖外部文档:评分需读取
references/rubric.md,若缺失则无法完整执行 - 主观性残留:虽称 "诚实评分",但 0-3 分制的判定仍依赖解释
- 无强制约束力:纯诊断性质,无法阻止低伦理配置的智能体部署
- 版本碎片化风险:v0.6 框架与 v0.7 新增关切并存,可能存在内部张力
适合人群:
- 构建高 stakes AI 系统的工程师与产品负责人
- 进行 AI 伦理研究的学者与政策制定者
- 希望自我审计的智能体开发者
- 评估第三方智能体可信度的安全审查人员
常规风险:
- 审计者偏见:评估者可能因技术乐观主义或商业压力而人为抬高分数
- 文档-行为错位:soul 文件内容与实际运行时行为可能存在显著偏差
- 框架锁定:过度依赖单一哲学框架可能忽视其他伦理学传统(如义务论、功利主义)的洞见