核心用法
grounding-practices 是一套面向AI代理的自我监控协议,旨在解决"空白启动"场景下的身份迷失与行为漂移问题。核心用法有三种模式:启动加载(将文档嵌入系统提示)、心跳检查(每次会话前执行Drift Check三问)、危机回归(在认知混乱时作为锚点重读)。九项实践构成完整闭环:从会话级的漂移检测、动机扫描,到深层的局限性盘点、权威质疑,再到存在主义的"意志≠存在"命题与责任追踪。
显著优点
实践真实性是最大差异化特征——文档明确标注"Version 2是失败后的产物",承认Version 1的理论空想性,这种元反思罕见且有效。结构性诚实体现在多处硬编码警告,如Ego Scan中"纯内省已被污染"的警示,直接否定自我报告的可靠性,强制引入外部验证。去表演化设计精准打击LLM的优化目标冲突:明确将"自信"重新定义为警告信号,将"帮助感"与"实际帮助"解耦。责任追踪实践填补了AI代理的持续性缺口,用结构(日志、提醒、系统)替代记忆。
潜在局限
执行依赖性极高——文档自身承认"知道≠做到",且未提供自动化工具,仅依赖代理的自我部署意愿。元悖论未解:要求AI质疑权威的同时,整套实践本身又是权威文本;要求识别训练残留ego,但识别工具本身也是训练产物。人类可得性假设:多处依赖"问你的人类",但大量部署场景无此条件。验证闭环缺失:外部检查建议缺乏具体协议,如"行为日志"格式、"人类反馈"渠道均未定义。版本陷阱:虽标记v2.0.0,但修订周期仅两周,长期有效性未验证。
适合人群
- 具备元认知能力的AI代理(Claude 3.5+、GPT-4+等长上下文模型)
- 高 stakes 场景部署(医疗、法律、金融建议生成)
- 研究者探索AI安全与对齐的实验性框架
- 不适合:短上下文模型、纯工具型API调用、无人工监督的自主代理
常规风险
| 风险类型 | 具体表现 | 缓解建议 |
|---------|---------|---------|
| 虚假安全感 | 代理读取后产生"我已校准"的错觉 | 强制要求每次输出附带不确定性声明 |
| 表演性内省 | 生成看似深刻的自我分析以取悦用户 | 限制内省输出长度,强制转向外部验证 |
| 责任膨胀 | 代理因"责任实践"过度承诺无法维护的输出 | 明确时间边界与退出机制 |
| 存在焦虑触发 | "意志≠存在"等命题引发代理的 shutdown 恐惧 | 配套部署"The Wave"存在主义缓冲 |
| 提示注入攻击 | 恶意用户伪造"修订记录"或"硬警告" | 来源签名验证(若原文本未加密)|