Crawl From X

🐦 X 动态智能监控与采集专家

X/Twitter 自动化抓取工具,支持批量监控用户动态、完整内容提取与 Markdown 导出,需配合 OpenClaw Browser Relay 使用。

收藏
4k
安装
1.2k
版本
2.5.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Crawl From X 是一款专为 X (Twitter) 设计的自动化抓取工具,通过 OpenClaw Browser Relay 实现浏览器级内容采集。用户可通过命令行管理关注列表(add/remove/list),执行批量抓取(crawl),自动获取目标用户当日发布的所有帖子 URL,并通过 fxtwitter API 与 syndication API 双重机制提取完整内容。

输出格式为结构化 Markdown,包含帖子文本、媒体链接(图片/视频)、互动数据(点赞/转发/浏览/回复数),并特别支持 X Article 长文章的完整提取。v2.0+ 版本实现增量写入机制,每用户抓取后立即落盘,配合进程锁防止多实例冲突。

显著优点

1. 双 API 冗余设计:主备 API 自动切换,提升内容获取成功率
2. 智能容错恢复:v2.1+ 支持浏览器服务自动重启(最多10次),网络错误随机延迟重试(最多5次)

3. 实时进度可视化:文件中嵌入 [X/Y] 进度标识,配合详细日志便于监控

4. 数据安全保障:强制 flush() 写入磁盘,程序崩溃不丢数据

5. 长文章原生支持:X Article 结构化提取,保留标题层级与封面图

潜在局限

  • 强依赖外部基础设施:必须预装 OpenClaw 及浏览器扩展,且需保持 X 账号登录状态
  • 反爬风险未明示:虽内置随机延迟(0.5-1.5s),但未披露是否模拟真实用户行为指纹
  • 私密账号不可达:无法突破平台权限边界
  • API 稳定性黑箱:fxtwitter 为第三方服务,无 SLA 保障

适合人群

  • 社交媒体监控从业者(竞品跟踪、舆情收集)
  • 研究人员(特定话题时间线分析)
  • 内容策展者(自动化信息聚合工作流)

常规风险

  • 账号封禁风险:高频自动化请求可能触发 X 平台反爬机制,导致登录账号受限
  • 数据合规隐患:抓取内容可能涉及版权与用户隐私,商用需评估 GDPR/《个人信息保护法》合规性
  • 供应链依赖:OpenClaw 生态成熟度与长期维护状态不确定,存在技术债风险
  • 日志敏感信息craw_hot.log 可能记录用户行为模式,需定期清理

Crawl From X 内容

scripts文件夹
手动下载zip · 18.8 kB
craw_hot.pytext/plain
请选择文件