OpenClaw Profanity Plugin

🛡️ AI 智能聊天机器人的内容审核利器

OpenClaw/Moltbot 内容审核插件,支持多语言、leetspeak 和 Unicode 变体检测,提供警告、屏蔽、日志等多种处置策略。

收藏
6.5k
安装
2k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能与用法

OpenClaw Profanity 是专为 OpenClaw/Moltbot AI 代理设计的内容审核插件,通过 npm install openclaw-profanity 安装后,可在 OpenClaw 配置中以插件形式集成。核心配置参数包括:

  • action: 违规处置策略,支持 warn(警告)、censor(替换)、block(拦截)、log(仅记录)四种模式
  • detectLeetspeak: 识别数字替换拼写如 f4cksh1t
  • normalizeUnicode: 检测西里字母等 Unicode 视觉欺骗字符
  • languages: 多语言支持,默认英语,可扩展至西班牙语等
  • customWords/ignoreWords: 自定义黑白名单

显著优点

1. 检测维度全面:覆盖直接脏话、leetspeak、Unicode 欺骗、空格分隔、混合混淆五种攻击向量
2. 平台适配性强:内置 Discord、Telegram、Slack 等多平台集成示例

3. 处置策略灵活:从警告到完全拦截的四级响应,支持自定义 onViolation 回调实现重复违规追踪、用户封禁等复杂逻辑

4. 开发者友好:提供完整的 TypeScript 类型定义和详细文档

潜在局限与风险

1. 误报率问题:Unicode 归一化可能将合法多语言内容误判,如西里字母在俄语语境中的正常使用
2. 列表维护成本:依赖静态词库更新,新兴网络用语和变体拼写存在滞后性

3. 上下文盲区:无法识别语义层面的冒犯性表达(如讽刺、暗示)

4. 语言覆盖不均:除英语外其他语言支持深度待验证

适合人群

  • 需要快速部署内容审核的聊天机器人开发者
  • 社区运营团队(Discord/Telegram 群组管理员)
  • 企业级客服系统的合规风控场景

常规风险

  • 过度审查风险:严格配置可能导致正常交流受阻,建议配合 ignoreWords 白名单和人工复核流程
  • 依赖维护风险:npm 包更新频率和上游词库质量直接影响防护效果
  • 隐私合规log 模式存储用户消息需符合 GDPR 等数据保护法规

OpenClaw Profanity Plugin 内容

手动下载zip · 3.0 kB
skill-card.mdtext/markdown
请选择文件