核心功能
Open Sentinel 是一个透明的 LLM 代理层,部署于应用与任何 LLM 提供商之间,以零代码侵入的方式拦截并评估所有模型响应。它支持通过 YAML 配置的 plain-English 规则,在内容到达用户前完成多维度安全审查。
显著优点
- 零侵入部署:作为 OpenAI 兼容代理,无需修改现有客户端代码,仅需切换
base_url - 多引擎架构:内置 judge(异步零延迟)、fsm(状态机)、llm、nemo 四种评估引擎,适应不同场景
- 全面防护:覆盖幻觉检测(事实 grounding 评分)、PII/凭据泄露拦截、提示注入攻击防御、多轮对话工作流合规
- 自然语言规则:支持用日常英语描述策略,自动编译为配置;也支持
osentinel compile从描述生成策略 - 可观测性:内置 tracing 支持,可接入 console、OTLP、Langfuse 等
潜在局限
- 依赖外部 LLM:judge 引擎需要 Anthropic 或 OpenAI API key,增加成本与延迟(虽 judge 为异步)
- 复杂规则性能:llm/nemo 引擎带来 100–800ms 额外延迟,高并发场景需权衡
- 规则覆盖盲区:plain-English 规则的完备性依赖人工设计,可能存在漏判或误杀
- 生态成熟度:v0.2.1 版本,社区与生产验证案例有限
适合人群
- 构建生产级 AI Agent 的开发者与团队
- 需要合规审计与内容安全的企业应用场景
- 已有 OpenAI 兼容客户端、希望快速叠加安全层的工程团队
常规风险
- API 密钥泄露:需妥善保管
ANTHROPIC_API_KEY等环境变量 - 代理单点故障:Sentinel 服务宕机将阻断 LLM 调用,需考虑高可用部署
- 误判导致用户体验下降:过于激进的策略可能误拦合法输出
- 成本累积:sidecar LLM 调用产生额外 token 费用