Crawl From X

🐦 X 帖子智能抓取与 Markdown 归档

X/Twitter 自动化抓取工具,支持用户管理、批量采集帖子全文与互动数据,输出 Markdown 格式,具备浏览器故障自动恢复与进程锁保护。

收藏
4.3k
安装
1.2k
版本
2.4.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

Crawl From X 是一款专为 X (Twitter) 设计的帖子自动化抓取与管理工具。用户可通过命令行管理关注列表(增删改查),批量抓取指定用户当天发布的所有帖子 URL,并通过 fxtwitter API 与 syndication API 双通道获取完整内容,最终输出包含文本、媒体、互动数据的格式化 Markdown 文件。

显著优点

1. 高可靠性架构:v2.1 起内置浏览器故障自动恢复机制,检测到 tab not found 等错误时可自动重启浏览器服务(最多 10 次),无需人工干预即可继续任务;v2.4 引入进程锁,防止多实例并发导致数据混乱。
2. 数据安全设计:v2.3 采用增量写入策略,每完成一个用户立即 flush 到磁盘,避免故障导致批量数据丢失;实时进度显示便于监控长任务。

3. 智能容错:区分"无新帖"与"真实失败",24 小时内无更新自动跳过,网络错误随机延迟重试(最多 5 次)。

4. 内容丰富度:支持 X Article 长文章完整提取、多媒体链接、点赞/转发/浏览/回复等互动数据,输出结构清晰。

潜在局限

  • 依赖外部服务:核心功能依赖 fxtwitter 第三方 API,若服务不可用则降级至 syndication API,仍失败时仅能保留 URL。
  • 浏览器环境强依赖:必须安装 OpenClaw 浏览器扩展并保持登录状态,私密账号无法抓取。
  • 速率与合规风险:虽内置 0.5-1.5 秒随机延迟,但高频抓取仍存在触发平台反爬机制或 API 限流的可能。

适合人群

  • 需定期追踪特定 X 用户/行业 KOL 动态的研究者、分析师
  • 进行社交媒体监控、竞品情报收集的运营团队
  • 希望本地化归档推文内容的内容创作者

常规风险

  • 账号风险:高频抓取可能导致 X 账号被限流或封禁
  • 数据一致性:API 返回与网页实际展示可能存在延迟或差异
  • 隐私合规:抓取公开内容仍需注意当地数据保护法规

Crawl From X 内容

docs文件夹
results文件夹
scripts文件夹
手动下载zip · 87.6 kB
REFACTORING_SIMPLE.mdtext/markdown
请选择文件