核心功能
Crawl From X 是一款专为 X (Twitter) 设计的帖子自动化抓取与管理工具。用户可通过命令行管理关注列表(增删改查),批量抓取指定用户当天发布的所有帖子 URL,并通过 fxtwitter API 与 syndication API 双通道获取完整内容,最终输出包含文本、媒体、互动数据的格式化 Markdown 文件。
显著优点
1. 高可靠性架构:v2.1 起内置浏览器故障自动恢复机制,检测到 tab not found 等错误时可自动重启浏览器服务(最多 10 次),无需人工干预即可继续任务;v2.4 引入进程锁,防止多实例并发导致数据混乱。
2. 数据安全设计:v2.3 采用增量写入策略,每完成一个用户立即 flush 到磁盘,避免故障导致批量数据丢失;实时进度显示便于监控长任务。
3. 智能容错:区分"无新帖"与"真实失败",24 小时内无更新自动跳过,网络错误随机延迟重试(最多 5 次)。
4. 内容丰富度:支持 X Article 长文章完整提取、多媒体链接、点赞/转发/浏览/回复等互动数据,输出结构清晰。
潜在局限
- 依赖外部服务:核心功能依赖 fxtwitter 第三方 API,若服务不可用则降级至 syndication API,仍失败时仅能保留 URL。
- 浏览器环境强依赖:必须安装 OpenClaw 浏览器扩展并保持登录状态,私密账号无法抓取。
- 速率与合规风险:虽内置 0.5-1.5 秒随机延迟,但高频抓取仍存在触发平台反爬机制或 API 限流的可能。
适合人群
- 需定期追踪特定 X 用户/行业 KOL 动态的研究者、分析师
- 进行社交媒体监控、竞品情报收集的运营团队
- 希望本地化归档推文内容的内容创作者
常规风险
- 账号风险:高频抓取可能导致 X 账号被限流或封禁
- 数据一致性:API 返回与网页实际展示可能存在延迟或差异
- 隐私合规:抓取公开内容仍需注意当地数据保护法规