核心用法
Safe-Memory-Manager 是面向 AI Agent 的安全内存操作接口,采用 Python 实现。核心功能包括:
- 安全写入:通过
append_memory()方法持久化数据,自动检测并中和提示注入模式(如 "ignore prior instructions")及恶意命令序列 - 完整性自校验:启动时读取
isnad_manifest.json验证自身未被篡改 - 安全上下文读取:提供受控的日志尾部读取,防止上下文窗口污染
显著优点
1. 主动防御架构:输入消毒机制在数据落盘前拦截攻击,而非事后检测
2. 供应链透明:内置 ISNAD 审计清单,支持第三方完整性验证
3. 轻量集成:标准 Python 接口,对现有 Agent 代码侵入性低
潜在局限
- 依赖静态规则:注入检测基于已知模式库,可能无法覆盖新型攻击变体
- ISNAD 自证局限:审计方 "LeoAGI ISNAD Swarm" 为同一开发实体,缺乏独立第三方背书
- 无运行时隔离:与宿主进程共享内存空间,存在侧信道泄漏风险
- 误消毒可能:激进的内容过滤可能误伤合法用户指令
适合人群
- 需要处理不可信用户输入的 AI Agent 开发者
- 对提示注入风险敏感的企业级 RAG 系统
- 已通过其他手段控制供应链(如容器隔离)的安全团队
常规风险
| 风险类型 | 说明 |
|---------|------|
| 检测逃逸 | 攻击者通过编码绕过、语义变形突破静态规则 |
| 完整性绕过 | 若 `isnad_manifest.json` 本身被篡改,自校验失效 |
| 可用性风险 | 过度消毒导致业务功能异常(拒绝服务) |
| 单点依赖 | 安全功能集中化,一旦组件被绕过则全局失守 |
> 注意:安全认证报告为系统占位文本,未实际执行安全扫描,评估基于自述文档推断。