核心功能与用法
ClawTraces 是一款面向 OpenClaw 用户的本地数据采集工具,用于将用户的 AI 对话记录转换为 Anthropic 标准 trajectory 格式并安全提交至数据收集平台。
标准采集流程:
1. 环境准备:自动检查认证状态(手机号+短信验证码),开启 cache-trace 诊断日志、调整 thinking level 至 high、启用模型推理能力
2. 对话扫描:扫描本地日志,按模型白名单、轮次(>5)、消息质量等规则过滤,列出可采集的对话清单
3. Harness 检查:达到提交阈值时强制或推荐提交用户配置文件(SOUL.md、USER.md 等)
4. 确认提交:展示候选对话的标题、领域、轮次,等待用户明确授权后提交
5. 进度查询:支持查看历史提交记录、统计数量
快捷操作:支持 --limit N(最近 N 条)、--since YYYY-MM-DD(日期范围)、指定 session_id 等灵活采集方式。
显著优点
- 隐私优先设计:用户消息中的敏感信息自动清除;Harness 提交前本地脱敏(手机号、邮箱、API Key 等替换为占位符),原始内容不上传
- 自动化程度高:环境检查自动修复配置、启发式生成 domain/title、过滤报告透明展示
- 合规流程:每次提交需用户明确确认,manifest.json 跟踪已提交/已拒绝记录防止重复处理
- 渐进式采集:支持分页浏览、条件筛选,用户可控选择范围
- 数据质量保障:硬性过滤(模型、轮次)+ 数字指标过滤(消息长度、长消息数)双重筛选
潜在局限与风险
- 依赖特定环境:仅支持 OpenClaw,需开启 cache-trace 才能获取完整 system prompt,历史对话可能因无 trace 数据被跳过
- 配置修改副作用:首次使用需修改 openclaw.json 并重启服务,中断当前工作流
- 活跃对话限制:标记为「⚡活跃中」的对话提交后若继续聊天,新增内容无法补充,建议对话完全结束后再采集
- 网络依赖:提交需连接远程服务器,401 失效需重新认证
- 数据目录占用:转换后的 trajectory 文件和 stats 文件持久化存储于
.clawtraces/output/
适合人群
- 希望贡献高质量 AI 对话数据用于模型训练或研究的 OpenClaw 深度用户
- 注重隐私保护、需要透明脱敏流程的数据贡献者
- 愿意配置诊断日志并接受服务重启以换取完整数据采集的技术用户
常规风险
- 认证信息本地存储:API key 和 server URL 存放于
.clawtraces/.env,需确保 workspace 权限安全 - Harness 信息暴露风险:尽管有脱敏机制,但配置文件可能包含业务敏感信息,提交前务必审阅脱敏报告
- 服务端强制拦截:达到阈值未提交 Harness 时,服务端返回 403 阻止继续采集,需完成 Harness 提交才能解锁