Tmp.F4uxZi4Lp8

📊 智能采集对话记录,安全贡献 AI 数据

采集本地OpenClaw对话记录并提交至数据平台,支持智能过滤、脱敏处理和进度追踪

收藏
4.6k
安装
1.6k
版本
2.0.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

ClawTraces 数据采集 Skill 评估

核心用法

ClawTraces 是一款面向 OpenClaw 用户的数据采集工具,用于将本地 AI 对话记录转换为 Anthropic 标准 trajectory 格式并提交至数据平台。用户通过自然语言指令(如"采集数据""提交对话"等)触发 Skill,系统将自动完成环境检查、对话扫描、质量过滤、隐私脱敏和提交上报的全流程。

主要功能模块

1. 环境准备:自动检查并修复 OpenClaw 配置(cache-trace、thinking level、model reasoning),确保数据采集质量
2. 智能扫描:支持分页列出对话清单,按日期范围、数量限制筛选,自动识别白名单模型

3. 质量过滤:硬性规则(轮次>5、模型白名单)+ 数字指标(用户消息平均长度、长消息数)双重过滤

4. Harness 提交:强制/推荐性采集用户配置文件(SOUL.md、USER.md 等),本地脱敏后上传

5. 进度查询:查看历史提交记录,支持分页浏览

显著优点

  • 全自动化流程:从环境检测到数据提交一站式完成,用户仅需确认关键步骤
  • 隐私保护机制:敏感信息(手机号、邮箱、API Key 等)本地自动脱敏为占位符,原始内容不上传
  • 灵活筛选策略:支持"全部""前N个""指定序号""日期范围"等多种选择方式,适应不同场景
  • 质量可控:启发式 domain 推断、多维度过滤报告,低质量对话自动剔除
  • 渐进式门槛:达到数据阈值后触发 Harness 提交,平衡数据量与配置完整性

潜在缺点与局限性

  • 依赖特定客户端:仅支持 OpenClaw,其他 AI 客户端(Claude Desktop、Cursor 等)无法使用
  • 配置门槛:需开启 cache-trace 并重启客户端,历史对话无法追溯 system prompt
  • 网络依赖:需完成手机号认证,服务端 401/403 等错误会中断流程
  • 活跃对话风险:标记为"⚡活跃中"的对话提交后若继续聊天,新增内容无法补充
  • 模型白名单限制:非白名单模型的对话自动过滤,可能遗漏部分高质量记录

适合人群

  • OpenClaw 深度用户:日常高频使用且希望贡献数据用于模型训练的研究者
  • 企业/团队数据管理员:需要批量采集、审核团队成员对话记录的运维人员
  • AI 产品研究者:关注 trajectory 数据质量,愿意提供配置文件以提升数据价值的贡献者
  • 隐私敏感型用户:重视数据安全,希望确认脱敏细节后再授权上传的谨慎用户

常规风险

  • 认证信息泄露:本地存储的 API key 若权限管控不当,可能被恶意脚本读取
  • 误提交敏感对话:用户可能未仔细确认列表即提交包含敏感业务信息的对话
  • 服务端脱敏依赖:虽然声称本地脱敏,但用户难以完全验证脱敏逻辑是否严格执行
  • 数据归属争议:提交后的数据由平台持有,用户无法撤回或删除已上传记录
  • 配置覆盖风险:环境检查阶段可能自动修改 openclaw.json,导致个性化设置丢失

Tmp.F4uxZi4Lp8 内容

scripts文件夹
lib文件夹
adapters文件夹
claude_code文件夹
hermes文件夹
openclaw文件夹
convert文件夹
core文件夹
harness文件夹
parse文件夹
pipeline文件夹
手动下载zip · 134.0 kB
__init__.pytext/plain
请选择文件