核心用法
Prompt Hardening 是一套系统化的 Agent Prompt 加固方法论,旨在解决 LLM "不听话"、忽略规则、绕过约束等指令遵循失效问题。该 Skill 并非简单的提示词改写工具,而是一套基于 16 个硬化模式的工程化方案库。
使用流程:首先通过 audit.sh 脚本对现有 Prompt 进行 16 项安全检查,识别历史违规模式;然后针对高危规则采用 P1「三重强化」+ P13「代码级强制」的组合策略,中等风险规则采用 P2/P4/P5 组合,一般规则使用 P3/P7 即可;最终确保约束 token 占比超过 40%。
16 个硬化模式覆盖四大维度:语义强化(P1/P5/P16)、工具约束(P2/P3/P4)、结构控制(P6/P8/P10/P14)、运行时防护(P9/P11/P12/P15)。从静态规则声明到动态漂移防护,形成完整防护链。
显著优点
1. 实证效果显著:三重强化(P1)配合反推理阻断(P5)可将合规率从 ~50% 提升至 ~90%,叠加代码级强制(P13)后可达 ~99%。
2. 方法论体系完整:不同于碎片化的提示技巧,该 Skill 构建了从问题识别(触发词库)、模式选择(场景-模式矩阵)、到效果验证(可靠性等级表)的完整工作流。
3. 来源权威可追溯:16 个模式均标注来源,涵盖 Anthropic、OpenAI、Claude Code、Codex CLI、Gemini 等顶级机构的实践经验,非空想产物。
4. 安全设计优良:Skill 本身为纯文档型顾问工具,不自动修改用户文件,避免误操作风险;审计脚本仅只读访问,无网络请求、无敏感操作。
5. CLI 工具实用:audit.sh 提供 16 项自动化检查,大幅降低人工审计成本,适合企业级 Prompt 质量门禁。
潜在缺点与局限性
1. 学习曲线陡峭:16 种模式需理解其设计原理和组合策略,初学者容易陷入"模式堆砌"误区,反而导致 Prompt 冗长、成本激增。
2. Token 成本上升:P12 模式明确要求"约束 token > 任务描述 token",这在长对话场景会显著增加 API 调用成本。
3. 非万能解药:文档明确警示"不要把所有 prompt 问题都归为硬化不够"——架构缺陷、训练数据偏差等根本性问题无法通过 Prompt 工程解决。
4. 中文场景适配:部分模式(如 P5 反推理阻断)的示例以英文为主,中文语境下的"合理化借口"模式可能需本地化调整。
5. 效果验证依赖历史数据:模式选择高度依赖"识别模型历史违反过的规则",新系统缺乏违规样本时,初始硬化策略可能不够精准。
适合的目标群体
- AI Agent 开发者:特别是构建 multi-agent 系统、工具调用链复杂的团队,需要确保 Agent 在长期使用中不漂移。
- Prompt 工程师:负责企业级 System Prompt 设计与维护,需要建立可量化的质量门禁。
- AI 安全合规团队:关注 LLM 输出可控性、需满足金融、医疗等高风险场景的合规要求。
- 开源 Agent 框架维护者:如 CrewAI、AutoGen 等社区,可将硬化模式集成到框架文档或 CLI 工具中。
使用风险
1. 性能风险:过度硬化可能导致 Prompt 长度膨胀,增加推理延迟和 API 费用;建议在关键路径规则上精准应用,而非全局堆砌。
2. 依赖项风险:audit.sh 依赖 Bash 环境,Windows 用户需 WSL 或 Git Bash;测试文件中的硬编码路径可能影响可移植性。
3. 认知风险:用户可能误将"Prompt Hardening"视为银弹,忽视代码级强制(P13)的必要性——文档反复强调"最关键约束 MUST 同时有代码级强制作为备份"。
4. 维护风险:硬化后的 Prompt 包含大量结构化约束,后续迭代时需同步更新多处锚点(P7/P16),维护成本高于自然语言 Prompt。
5. 误用风险:该 Skill 明确标记为"Advisory/planning"类型,不会自动修改文件,用户若期待一键修复可能感到不便,需配合 improvement-executor 使用。