核心用法
ClawTraces 是一套面向 OpenClaw 用户的对话数据采集工具,帮助用户将本地对话记录转换为 Anthropic 标准 trajectory 格式并提交至数据平台。使用时通过自然语言指令(如「采集数据」「提交最近10条」)触发,系统会自动完成环境检查、对话扫描、质量过滤、敏感信息脱敏和提交全流程。
主要功能模块:
- 环境准备:自动开启 cache-trace 诊断日志、配置 reasoning 参数,确保数据完整性
- 对话采集:扫描本地日志,支持按数量、日期范围筛选,自动过滤低质量对话(轮次不足、模型不符等)
- Harness 提交:采集 SOUL.md、USER.md 等配置文件,本地自动脱敏后再上传
- 进度查询:查看已提交记录、累计数量及提交历史
典型工作流:
1. 首次使用需手机号认证
2. 系统自动修复环境配置并重启 OpenClaw
3. 列出可采集的对话清单,用户选择后确认提交
4. 达到阈值时触发 Harness 采集(推荐性)
显著优点
- 零配置自动化:环境检查、敏感信息脱敏、格式转换全部自动完成,用户仅需确认
- 隐私保护优先:所有 Harness 文件在本地完成脱敏(手机号、邮箱、API Key 等替换为占位符),原始内容不上传
- 质量分层过滤:硬性规则(轮次>5、白名单模型)+ 启发式指标(消息长度、长消息数)双重筛选
- 灵活筛选机制:支持「全部」「前N条」「第1、3、5个」「最近一周」等多种自然语言表达式
- 增量采集支持:通过 manifest.json 跟踪已提交/已拒绝记录,避免重复处理
- 服务端协同校验:提交前检查 workspace 阈值,强制拦截未完成 Harness 提交的账号
潜在缺点与局限性
- 冷启动延迟:首次使用需开启 cache-trace 并重启 OpenClaw,此前产生的对话无法补充 system prompt 数据
- 活跃对话限制:标记为「活跃中」的对话虽可强制提交,但后续新增内容无法追加到已提交记录
- 模型白名单约束:仅支持特定模型(如 claude-opus-4-6、claude-sonnet-4-6),其他模型对话被过滤
- 质量过滤可能误伤:短对话或特定场景下的高质量对话可能因「轮次不足」或「长消息数不够」被排除
- 认证依赖短信:需真实手机号接收验证码,不支持邮箱或其他认证方式
- 数据存放本地:输出文件存储于 workspace/.clawtraces/,若用户手动删除可能导致重复提交
适合人群
- AI 研究员/数据贡献者:希望为 Claude 训练贡献高质量真实对话数据的用户
- 企业合规使用者:需要内部审批后授权数据上传,且对隐私脱敏有强要求的团队
- 高频 OpenClaw 用户:日常产生大量复杂多轮对话(编程、分析、写作等),数据质量天然较高
- 配置调优爱好者:愿意分享 SOUL.md、USER.md 等配置以换取平台个性化服务升级的用户
常规风险
| 风险类型 | 说明 | 缓解措施 |
|---------|------|---------|
| 隐私泄露 | Harness 文件可能含敏感配置 | 本地自动脱敏,用户可预览脱敏报告后再确认 |
| 数据完整性 | 无 cache-trace 的对话缺失真实 system prompt | 显式指定时使用重建 prompt 作为 fallback |
| 重复提交 | 手动删除 manifest.json 或 output 目录后重新扫描 | manifest.json 持久化跟踪,但非加密防篡改 |
| 认证失效 | API key 过期导致 401 错误 | 自动清除失效 key,引导重新认证,保留环境配置 |
| 阈值拦截 | 达到提交阈值后未提交 Harness 被强制阻断 | 步骤3前置检查 + 服务端 403 双重保障 |
技术架构亮点
- adapter 模式:scan_adapter.py 支持多平台扩展,当前实现 OpenClaw 专用适配器
- trajectory 标准化:输出严格遵循 Anthropic 格式,包含完整对话轮次、工具调用、推理过程
- 启发式标注:基于工具使用模式自动推断 domain(软件开发、数据分析等),下沉语义质检至服务端 |
- 增量重启恢复:环境配置变更后自动重启 gateway,无需用户手动干预