Tmp.F4uxZi4Lp8

📊 安全采集对话数据,贡献 AI 训练燃料

安全采集本地OpenClaw对话数据,自动脱敏后提交至数据平台,支持质量筛选与进度追踪

收藏
6.9k
安装
1.6k
版本
2.0.6
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

ClawTraces 是一套完整的本地对话数据采集与提交解决方案,专为 OpenClaw 用户设计。其核心流程包含六个步骤:环境认证与检查、对话扫描采集、Harness 门槛检查、数据提交、进度查询及 Harness 配置提交。

采集流程:用户通过手机号验证码完成认证后,系统自动检测并修复三项关键配置(诊断日志、推理级别、模型推理能力)。随后扫描本地缓存的对话记录,按白名单模型、轮次数量、消息质量等硬性规则自动过滤,生成符合 Anthropic 标准的 trajectory 格式文件。每次提交前需用户明确确认,支持按序号、数量、日期范围等多种方式选择目标对话。

独立 Harness 提交:当用户提交数据量达到阈值或主动要求时,系统可打包 SOUL.md、USER.md 等配置文件,在本地自动脱敏(手机号、邮箱、API Key 等替换为占位符)后上传,所有敏感信息处理均不离开本地环境。

显著优点

1. 隐私优先设计:采用本地脱敏机制,敏感信息在出机前已完成替换;用户消息中的 Sender 身份和时间戳自动清除;提交需逐条确认,确保数据授权合规。

2. 智能质量过滤:内置多维度过滤体系——模型白名单、轮次阈值(>5)、用户消息长度指标、长消息数量检测,自动剔除低质量对话,减少人工筛选成本。

3. 渐进式采集体验:支持快捷指令("最近3条"、"4月的")、分页浏览、状态标记(活跃/不合格/模型不符)等灵活交互;首次配置修改后自动重启并提示后续使用,避免用户困惑。

4. 透明可控:过滤报告详细展示每条被拒绝记录的原因与详情;脱敏报告按文件列出替换项,让用户完全知情。

潜在缺点与局限性

1. 冷启动门槛:cache-trace 仅记录配置重启后的新对话,首次使用或修改配置后需"正常使用一段时间"才能产生可采集数据,短期内可能无结果。

2. 模型白名单限制:非白名单模型的对话会被标记为"model_mismatch"无法提交,使用非主流模型或本地部署模型的用户可能大量对话不符合条件。

3. 活跃对话处理风险:标记为"⚡活跃中"的对话虽可选择提交,但若后续继续聊天,新增内容无法补充至已提交记录,存在数据完整性隐患。

4. 强制 Harness 依赖:达到阈值后必须先提交 Harness 才能继续采集,对注重配置隐私的用户可能构成使用阻断。

适合人群

  • 积极为 AI 训练贡献高质量对话数据的 OpenClaw 付费用户
  • 使用 Claude Opus/Sonnet 等白名单模型进行复杂任务(代码开发、数据分析、多轮推理)的专业用户
  • 能够接受配置文件脱敏采集以换取数据提交权益的贡献者
  • 不急于即时反馈、愿意积累一段时间数据后再批量提交的耐心型用户

常规风险

  • 认证密钥失效:API key 可能过期,需重新走手机号验证流程
  • 服务端策略变更:threshold、force_required 等阈值由服务端控制,可能影响采集节奏
  • 误提交风险:用户可能在对话未真正结束时提交"活跃中"记录,导致数据截断
  • 脱敏漏检:自动脱敏基于模式匹配,非常见格式的敏感信息可能遗漏

Tmp.F4uxZi4Lp8 内容

scripts文件夹
lib文件夹
adapters文件夹
claude_code文件夹
hermes文件夹
openclaw文件夹
convert文件夹
core文件夹
harness文件夹
parse文件夹
pipeline文件夹
手动下载zip · 134.8 kB
__init__.pytext/plain
请选择文件