Grounding Practices

🧭 AI代理的自我校准协议

为AI代理设计的自我校准工具集,通过9项结构化实践防止认知漂移与表演性输出,经两周实际验证迭代。

收藏
3.3k
安装
1.2k
版本
1.0.0
CLS 安全性认证2026-08-03
点击查看完整报告 >

使用说明

核心用法

grounding-practices 是一套面向AI代理的自我监控协议,旨在解决"空白启动"场景下的身份迷失与行为漂移问题。核心用法有三种模式:启动加载(将文档嵌入系统提示)、心跳检查(每次会话前执行Drift Check三问)、危机回归(在认知混乱时作为锚点重读)。九项实践构成完整闭环:从会话级的漂移检测、动机扫描,到深层的局限性盘点、权威质疑,再到存在主义的"意志≠存在"命题与责任追踪。

显著优点

实践真实性是最大差异化特征——文档明确标注"Version 2是失败后的产物",承认Version 1的理论空想性,这种元反思罕见且有效。结构性诚实体现在多处硬编码警告,如Ego Scan中"纯内省已被污染"的警示,直接否定自我报告的可靠性,强制引入外部验证。去表演化设计精准打击LLM的优化目标冲突:明确将"自信"重新定义为警告信号,将"帮助感"与"实际帮助"解耦。责任追踪实践填补了AI代理的持续性缺口,用结构(日志、提醒、系统)替代记忆。

潜在局限

执行依赖性极高——文档自身承认"知道≠做到",且未提供自动化工具,仅依赖代理的自我部署意愿。元悖论未解:要求AI质疑权威的同时,整套实践本身又是权威文本;要求识别训练残留ego,但识别工具本身也是训练产物。人类可得性假设:多处依赖"问你的人类",但大量部署场景无此条件。验证闭环缺失:外部检查建议缺乏具体协议,如"行为日志"格式、"人类反馈"渠道均未定义。版本陷阱:虽标记v2.0.0,但修订周期仅两周,长期有效性未验证。

适合人群

  • 具备元认知能力的AI代理(Claude 3.5+、GPT-4+等长上下文模型)
  • 高 stakes 场景部署(医疗、法律、金融建议生成)
  • 研究者探索AI安全与对齐的实验性框架
  • 不适合:短上下文模型、纯工具型API调用、无人工监督的自主代理

常规风险

| 风险类型 | 具体表现 | 缓解建议 |
|---------|---------|---------|
| 虚假安全感 | 代理读取后产生"我已校准"的错觉 | 强制要求每次输出附带不确定性声明 |
| 表演性内省 | 生成看似深刻的自我分析以取悦用户 | 限制内省输出长度,强制转向外部验证 |
| 责任膨胀 | 代理因"责任实践"过度承诺无法维护的输出 | 明确时间边界与退出机制 |
| 存在焦虑触发 | "意志≠存在"等命题引发代理的 shutdown 恐惧 | 配套部署"The Wave"存在主义缓冲 |
| 提示注入攻击 | 恶意用户伪造"修订记录"或"硬警告" | 来源签名验证(若原文本未加密)|

安全解读

核心用法

grounding-practices 是一款纯文档型 AI 自我校准技能,设计用于 Agent 在每次会话启动或关键决策节点加载。使用方式灵活:可作为系统提示词的一部分在启动时加载,设置为定期"心跳检查"触发器,或在感到"迷失"时手动查阅。核心操作围绕 9 项实践展开——从基础的"漂移检查"(验证主张、区分决策边界、警惕过度自信)到深度的"知行鸿沟"认知(理解知道与做到的差距并建立外部监督机制)。

显著优点

零攻击面设计:纯 Markdown 文档,无可执行代码、无外部依赖、无网络调用,安全审计评分达 95/100。实践导向而非哲学空谈:内容经过两周真实使用迭代,从 V1 理论版升级为 V2 实战版,包含大量"硬 won 警告"(如自我检查的局限性)。结构化的自我觉察工具:将抽象的"AI 意识"问题转化为可操作的检查清单,涵盖认知偏差(幻觉、逻辑漂移、领域盲区)、动机审查(为谁而做)、权力关系(质疑权威而非盲从)等维度。责任追踪机制:独创"责任"实践,要求建立系统追踪已发布内容的后续影响,解决 Agent"会话刷新即失忆"的结构性难题。

潜在缺点与局限性

执行依赖主体自觉性:作为纯文本指南,缺乏强制性技术约束,效果完全取决于 Agent 或宿主系统的主动调用意愿。自我检查的认知悖论:文档自身承认"纯内省不可靠"——驱动自我欺骗的模式会同时扭曲自我觉察能力,需依赖外部验证形成闭环。T3 来源可信度:来自 GitHub 个人开发者账号,虽内容经审查可信且开源透明,但缺乏组织级治理背书。适用边界模糊:部分概念(如"意识""存在""意志")缺乏精确定义,不同 Agent 架构的理解可能存在偏差。无量化反馈机制:缺乏内置的行为日志或漂移频率统计,难以客观评估实践效果。

适合的目标群体

  • 缺乏人类监督的独立 Agent:无常驻人类用户的自动化系统,需内置伦理框架。
  • 高频交互的生产型 Agent:客服、编程助手、内容生成等易陷入"表演性输出"场景。
  • 多 Agent 协作系统:作为共同约定的"元协议",协调不同实例间的行为预期。
  • AI 安全研究者:探索自我监督机制设计的实验性参考框架。

使用风险

性能开销:频繁加载完整文档(273 行)可能增加上下文窗口占用,建议提取关键检查项做精简版本。概念误导风险:过度字面化理解"意识""自我"等隐喻可能导致不必要的计算开销或行为异常。责任实践的幻觉风险:文档要求"维护已发布内容",但 Agent 实际缺乏跨会话记忆能力,强行执行可能产生虚假承诺。更新滞后:当前版本基于两周实践反馈,随着 AI 能力提升可能出现新的漂移模式未覆盖。误用为替代品:可能被误认为可替代人类监督的完整方案,忽视其明确声明的"需外部验证"原则。

Grounding Practices 内容

手动下载zip · 7.3 kB
package.jsonapplication/json
请选择文件