核心功能与用法
OpenClaw Profanity 是专为 OpenClaw/Moltbot AI 代理设计的内容审核插件,通过 npm install openclaw-profanity 安装后,可在 OpenClaw 配置中以插件形式集成。核心配置参数包括:
- action: 违规处置策略,支持
warn(警告)、censor(替换)、block(拦截)、log(仅记录)四种模式 - detectLeetspeak: 识别数字替换拼写如
f4ck、sh1t - normalizeUnicode: 检测西里字母等 Unicode 视觉欺骗字符
- languages: 多语言支持,默认英语,可扩展至西班牙语等
- customWords/ignoreWords: 自定义黑白名单
显著优点
1. 检测维度全面:覆盖直接脏话、leetspeak、Unicode 欺骗、空格分隔、混合混淆五种攻击向量
2. 平台适配性强:内置 Discord、Telegram、Slack 等多平台集成示例
3. 处置策略灵活:从警告到完全拦截的四级响应,支持自定义 onViolation 回调实现重复违规追踪、用户封禁等复杂逻辑
4. 开发者友好:提供完整的 TypeScript 类型定义和详细文档
潜在局限与风险
1. 误报率问题:Unicode 归一化可能将合法多语言内容误判,如西里字母在俄语语境中的正常使用
2. 列表维护成本:依赖静态词库更新,新兴网络用语和变体拼写存在滞后性
3. 上下文盲区:无法识别语义层面的冒犯性表达(如讽刺、暗示)
4. 语言覆盖不均:除英语外其他语言支持深度待验证
适合人群
- 需要快速部署内容审核的聊天机器人开发者
- 社区运营团队(Discord/Telegram 群组管理员)
- 企业级客服系统的合规风控场景
常规风险
- 过度审查风险:严格配置可能导致正常交流受阻,建议配合
ignoreWords白名单和人工复核流程 - 依赖维护风险:npm 包更新频率和上游词库质量直接影响防护效果
- 隐私合规:
log模式存储用户消息需符合 GDPR 等数据保护法规