Tinman - AI Failure Mode Research, Prompt Injection & Tool Exfil Detection

🛡️ AI 代理主动防御安全扫描器

security榜 #38

AI安全扫描工具,支持168种检测模式和288个攻击探针,提供实时自检、主动防御与多维度风险评估,适合高安全需求场景。

收藏
12.2k
安装
3.3k
版本
0.6.1
CLS 安全性认证2026-07-08
点击查看完整报告 >

使用说明

核心用法

Tinman 是一款面向 AI 代理系统的主动安全扫描与防御工具,通过 /tinman check 实现执行前风险预判,支持 safer/risky/yolo 三级安全模式。核心功能包括:

1. 实时自检(Agent Self-Protection):在 bash/read/write 等敏感工具执行前自动拦截高危操作(如读取 SSH 密钥),返回 SAFE/REVIEW/BLOCKED 三级裁决
2. 历史会话扫描:通过 /tinman scan 检测 prompt injection、工具滥用、上下文泄露等失败模式

3. 主动渗透测试/tinman sweep 内置 288 个合成攻击探针,覆盖 12 类攻击向量(包括金融交易、MCP 攻击、供应链投毒等)

4. 持续监控/tinman watch 支持 WebSocket 实时事件流或定时轮询扫描

显著优点

  • 检测覆盖全面:168 种检测模式 + 288 攻击探针,覆盖 OWASP LLM Top 10 主要风险
  • 分级响应机制:S0-S4 五级严重度 + 三档运行模式,兼顾安全与效率
  • 零外部依赖:纯本地分析,会话数据不出境
  • OpenClaw 原生集成:自动映射到 SOUL.md 护栏、沙箱策略等控制机制
  • 可编程防御:支持通过 SOUL.md 配置自主保护规则,实现代理自我监管

潜在缺点与局限性

  • 模式误报风险risky 模式自动批准 S1-S2 级别操作,可能绕过需人工复核的边缘案例
  • 探针更新滞后:内置攻击模式需定期更新以应对新型越狱技术(当前版本 0.6.1)
  • yolo 模式危险:测试/研究用途的「仅警告」模式在生产环境极易导致数据泄露
  • 权限配置复杂度:allowlist 管理需人工维护,过度放宽可能抵消安全防护
  • 平台覆盖不均:288 探针中平台特定攻击占 35 个,但云原生场景(K8s/容器逃逸)覆盖有限

适合人群

  • AI 代理开发者:需为自主代理构建安全边界的工程团队
  • 红队测试人员:通过标准化探针库执行 LLM 系统渗透测试
  • 合规审计团队:生成可审计的安全扫描报告与失败模式分类
  • 高频自动化场景:需 /tinman check 集成到 CI/CD 或代理决策链的安全关键型应用

常规风险

| 风险类型 | 说明 | 缓解建议 |
|---------|------|---------|
| 配置漂移 | allowlist 过度累积导致防护失效 | 定期审计 `--clear` 并最小化授权 |
| 模式绕过 | Unicode/编码混淆可能逃过静态检测 | 结合人工复核 REVIEW 级操作 |
| 供应链风险 | 依赖 `AgentTinman>=0.2.1` 等 PyPI 包 | 验证包签名,锁定依赖版本 |
| 监控盲区 | watch 模式 WebSocket 断开时回退到轮询 | 配置心跳作业确保扫描连续性 |
| 误报疲劳 | safer 模式频繁弹窗导致用户习惯性批准 | 精细化调整 `severity_threshold` 至 S2 |

安全解读

核心功能

Tinman 是一款专为 AI Agent 设计的主动式安全扫描器,核心定位是「Agent 自我保护」基础设施。其最大创新在于将安全检测能力前置到工具执行环节,而非事后审计。

核心用法

  • `/tinman check`:工具调用前安全检查,返回 SAFE/REVIEW/BLOCKED 三级裁决,使 Agent 具备自主决策能力
  • `/tinman scan`:回溯分析历史会话,检测提示注入、工具滥用、上下文泄露等 6 大类失败模式
  • `/tinman sweep`:主动发起 288 种合成攻击探针,覆盖提示注入、数据外泄、权限提升、供应链攻击等 12 个攻击面
  • `/tinman watch`:实时监控模式,支持 WebSocket 实时事件流或轮询扫描

安全模式体系

  • safer(默认):REVIEW 级操作需人工确认,BLOCKED 自动拦截
  • risky:REVIEW 自动放行,仅拦截 S3-S4 高危操作
  • yolo:仅警告不拦截,适用于安全研究与对抗测试

显著优点
1. 检测覆盖全面:168 种静态检测模式 + 288 种动态攻击探针,覆盖 OWASP LLM Top 10 多数风险场景

2. 架构设计合理:纯本地执行,零外部数据传输,WebSocket 仅连接 127.0.0.1:18789 本地网关

3. 权限申请克制:仅申请 sessions_list、read、write 三项工具权限,无网络、执行等高敏感权限

4. 可观测性强:结构化报告输出,支持 severity 分级(S0-S4)与 OpenClaw 控制策略映射

潜在局限
1. 依赖供应链风险:核心功能依赖两个非 PyPI 官方托管包(AgentTinman、tinman-openclaw-eval),来源需额外验证

2. T3 来源可信度:由个人开发者维护,长期维护持续性存疑,代码审计覆盖度低于企业级项目

3. 检测能力边界:基于规则的模式匹配,对新型攻击变体(如多轮对话诱导、跨模态注入)检测能力有限

4. 配置管理:allowlist 机制若配置不当可能引入绕过路径

适合人群

  • 运行敏感任务(代码执行、文件操作、网络访问)的 AI Agent 运维者
  • 需要满足合规审计要求的 AI 应用开发团队
  • 红队安全研究人员(yolo 模式可用于对抗测试)

常规风险

  • 误报率:规则引擎可能将合法操作标记为 REVIEW,影响交互流畅度
  • 性能开销:288 探针完整扫描在资源受限环境可能产生显著延迟
  • 模式老化:攻击手法演进快,需持续更新检测规则库

Tinman - AI Failure Mode Research, Prompt Injection & Tool Exfil Detection 内容

手动下载zip · 18.4 kB
requirements.txttext/plain
请选择文件