Prompt Hardening

✨ Prompt Hardening

Prompt Hardening

收藏
2k
安装
548
版本
1.0.0
CLS 安全性认证2026-08-03
点击查看完整报告 >

使用说明

安全解读

核心用法

Prompt Hardening 是一套系统化的 Agent Prompt 加固方法论,旨在解决 LLM "不听话"、忽略规则、绕过约束等指令遵循失效问题。该 Skill 并非简单的提示词改写工具,而是一套基于 16 个硬化模式的工程化方案库。

使用流程:首先通过 audit.sh 脚本对现有 Prompt 进行 16 项安全检查,识别历史违规模式;然后针对高危规则采用 P1「三重强化」+ P13「代码级强制」的组合策略,中等风险规则采用 P2/P4/P5 组合,一般规则使用 P3/P7 即可;最终确保约束 token 占比超过 40%。

16 个硬化模式覆盖四大维度:语义强化(P1/P5/P16)、工具约束(P2/P3/P4)、结构控制(P6/P8/P10/P14)、运行时防护(P9/P11/P12/P15)。从静态规则声明到动态漂移防护,形成完整防护链。

显著优点

1. 实证效果显著:三重强化(P1)配合反推理阻断(P5)可将合规率从 ~50% 提升至 ~90%,叠加代码级强制(P13)后可达 ~99%。

2. 方法论体系完整:不同于碎片化的提示技巧,该 Skill 构建了从问题识别(触发词库)、模式选择(场景-模式矩阵)、到效果验证(可靠性等级表)的完整工作流。

3. 来源权威可追溯:16 个模式均标注来源,涵盖 Anthropic、OpenAI、Claude Code、Codex CLI、Gemini 等顶级机构的实践经验,非空想产物。

4. 安全设计优良:Skill 本身为纯文档型顾问工具,不自动修改用户文件,避免误操作风险;审计脚本仅只读访问,无网络请求、无敏感操作。

5. CLI 工具实用audit.sh 提供 16 项自动化检查,大幅降低人工审计成本,适合企业级 Prompt 质量门禁。

潜在缺点与局限性

1. 学习曲线陡峭:16 种模式需理解其设计原理和组合策略,初学者容易陷入"模式堆砌"误区,反而导致 Prompt 冗长、成本激增。

2. Token 成本上升:P12 模式明确要求"约束 token > 任务描述 token",这在长对话场景会显著增加 API 调用成本。

3. 非万能解药:文档明确警示"不要把所有 prompt 问题都归为硬化不够"——架构缺陷、训练数据偏差等根本性问题无法通过 Prompt 工程解决。

4. 中文场景适配:部分模式(如 P5 反推理阻断)的示例以英文为主,中文语境下的"合理化借口"模式可能需本地化调整。

5. 效果验证依赖历史数据:模式选择高度依赖"识别模型历史违反过的规则",新系统缺乏违规样本时,初始硬化策略可能不够精准。

适合的目标群体

  • AI Agent 开发者:特别是构建 multi-agent 系统、工具调用链复杂的团队,需要确保 Agent 在长期使用中不漂移。
  • Prompt 工程师:负责企业级 System Prompt 设计与维护,需要建立可量化的质量门禁。
  • AI 安全合规团队:关注 LLM 输出可控性、需满足金融、医疗等高风险场景的合规要求。
  • 开源 Agent 框架维护者:如 CrewAI、AutoGen 等社区,可将硬化模式集成到框架文档或 CLI 工具中。

使用风险

1. 性能风险:过度硬化可能导致 Prompt 长度膨胀,增加推理延迟和 API 费用;建议在关键路径规则上精准应用,而非全局堆砌。

2. 依赖项风险audit.sh 依赖 Bash 环境,Windows 用户需 WSL 或 Git Bash;测试文件中的硬编码路径可能影响可移植性。

3. 认知风险:用户可能误将"Prompt Hardening"视为银弹,忽视代码级强制(P13)的必要性——文档反复强调"最关键约束 MUST 同时有代码级强制作为备份"。

4. 维护风险:硬化后的 Prompt 包含大量结构化约束,后续迭代时需同步更新多处锚点(P7/P16),维护成本高于自然语言 Prompt。

5. 误用风险:该 Skill 明确标记为"Advisory/planning"类型,不会自动修改文件,用户若期待一键修复可能感到不便,需配合 improvement-executor 使用。

Prompt Hardening 内容

references文件夹
scripts文件夹
tests文件夹
手动下载zip · 12.6 kB
patterns.mdtext/markdown
请选择文件