核心功能
Craw Hot 是一款专注于 X (Twitter) 的自动化帖子抓取与管理工具,主要解决批量跟踪特定用户动态的痛点。核心能力包括:用户列表的增删改查管理、自动抓取当日发布的所有帖子 URL、通过 fxtwitter API 和 syndication API 双通道获取完整内容(含长文章、媒体、互动数据)、自动生成结构化 Markdown 报告。
显著优点
可靠性设计突出:v2.4 引入进程锁防止多实例冲突;v2.3 增量写入 + flush() 确保数据零丢失;v2.1 智能浏览器自动恢复机制,遇 tab not found 错误可自动重启服务并续传任务,无需人工干预;智能重试策略区分"无新帖"与"真正失败",避免无效重试。
输出质量高:支持 X Article 长文章完整提取、媒体文件链接自动提取、点赞/转发/浏览/回复等互动数据,Markdown 格式规范,便于二次加工与知识库沉淀。
运维友好:详细日志记录、实时进度显示 [X/Y]、清晰的故障排查指引。
潜在局限
- 依赖外部 API:fxtwitter 为第三方服务,存在可用性风险;syndication API 虽为官方但功能受限
- 浏览器依赖:必须安装 OpenClaw 浏览器扩展并保持登录状态,增加了环境配置复杂度
- 隐私限制:无法抓取私密账号,对封闭社群监控无能为力
- 速率与合规:内置 0.5-1.5 秒随机延迟虽降低封禁风险,但大规模抓取仍可能触发平台限制,且需关注 X 服务条款合规性
适合人群
- 市场研究员、公关舆情分析师:需要监控品牌、竞品或 KOL 动态
- 投资人、行业分析师:追踪特定领域意见领袖的实时观点
- 内容策展者、知识管理爱好者:批量归档有价值的社交内容
- 开发者、自动化爱好者:需要可扩展的社交媒体数据采集方案
常规风险
- 账号风险:自动化抓取可能触发 X 的反爬机制,导致账号受限
- 数据完整性:API 变更或帖子删除/设私可能导致内容获取失败
- 法律合规:需遵守 X Developer Agreement 及当地数据保护法规,商业用途建议申请官方 API
- 锁文件残留:异常退出可能导致
.craw_hot.lock残留,需手动清理