核心用法
ClawTraces 是一套面向 OpenClaw 用户的对话数据采集系统,用于将本地 AI 对话记录转换为 Anthropic 标准 trajectory 格式并提交至数据平台。完整流程包含六大步骤:
1. 环境准备:自动检查并修复 cache-trace、thinking level、model reasoning 三项配置,确保数据可被记录;若配置被修改则自动重启 OpenClaw
2. 数据采集:扫描本地日志,按模型白名单、轮次数量(≥6)、消息质量等指标过滤,生成候选清单;支持按数量、日期范围、指定 session 等多维度筛选
3. Harness 门槛检查:当累计提交数达阈值时,强制要求提交 Harness(SOUL.md、USER.md 等配置文件)以继续采集
4. 提交确认:展示待提交对话的标题、领域、轮次,经用户明确授权后上传
5. 进度查询:查看历史提交记录,支持分页浏览
6. 独立 Harness 提交:主动提交或更新工作区配置,支持增量版本管理
显著优点
- 智能过滤体系:前置硬过滤(模型、轮次)+ 数字指标过滤(消息长度、长消息数)+ 启发式领域分类,自动识别低质量对话
- 隐私保护机制:用户消息自动清除 Sender 身份与时间戳;Harness 提交前本地自动脱敏(手机号、邮箱、API Key 等敏感信息替换为占位符)
- 灵活采集策略:支持
--limit快捷数量指定、--since日期范围、--sessions显式指定等多种交互模式 - 渐进式门槛设计:首次低门槛采集,达到阈值后触发 Harness 提交,平衡数据量与质量
- 版本化管理:Harness 支持多版本历史保留,便于追踪配置演进
潜在缺点与局限性
- 数据依赖性强:cache-trace 仅记录重启后的新对话,历史对话无 system prompt 数据;未开启诊断日志的对话无法被采集
- 模型白名单限制:仅支持特定模型(如 claude-opus-4-6、claude-sonnet-4-6),使用其他模型的对话被自动过滤
- 活跃会话风险:标记为「⚡活跃中」的对话可被提交,但后续新增内容无法补充至已提交记录
- 认证流程繁琐:需手机号+短信验证码双重认证,key 失效后需重新走完整流程
- 门槛强制拦截:达到阈值后未提交 Harness 将阻断采集,对追求效率的用户形成操作摩擦
适合人群
- OpenClaw 深度用户:日常高频使用且愿意贡献数据助力模型迭代的开发者
- 隐私敏感型贡献者:重视数据安全、希望在本地完成脱敏后再上传的用户
- 配置定制化用户:拥有复杂 SOUL.md/USER.md 配置、希望分享个性化工作流的高级玩家
- 数据质量关注者:愿意花时间筛选、确认高质量对话记录的研究者
常规风险
| 风险类型 | 具体表现 | 缓解措施 |
|---------|---------|---------|
| 隐私泄露 | 用户消息内容、文件路径等意外上传 | 本地脱敏报告可视化确认;敏感信息自动替换占位符 |
| 配置误改 | 自动修复过程意外修改 openclaw.json | 修改明细完整展示用户;关键配置备份建议 |
| 数据丢失 | 提交后活跃会话继续对话导致内容割裂 | 明确提示「活跃中」状态风险;建议会话结束后提交 |
| 认证劫持 | 手机号/验证码被中间人截获 | 全链路 HTTPS;本地 `.env` 存储加密 key;401 自动失效机制 |
| 重复提交 | 用户误操作导致同一对话多次上传 | manifest.json 跟踪已提交/已拒绝记录;默认过滤已处理对话 |
技术亮点
- 启发式领域分类基于工具使用模式自动推断(如代码工具 → 软件开发,数据分析工具 → 数据科学)
- 服务端语义质检 + 人工终审的二级质量保障体系
- 完整的 CLI 工具链(scan_adapter.py、submit.py、workspace_bundle.py、query.py)支持自动化集成