核心用法
wechat-article-scraper 是一款微信公众号文章自动化采集工具,通过搜狗微信搜索入口获取公开文章数据。用户以自然语言触发(如"搜索微信文章 人工智能 10"),系统自动完成四阶段流水线:Playwright 驱动的搜狗搜索与页面解析 → LLM 逐篇生成 100-200 字摘要 → Playwright 抓取原文渲染为 PDF → 整合生成带双链接的行业动态报告 PDF。
显著优点
1. 端到端自动化:从搜索关键词到产出格式化 PDF 报告,全程无需人工介入,支持批量处理
2. 双备份机制:同时保留原始微信链接(带时效性提醒)和本地 PDF 存档,兼顾即时访问与长期留存
3. 结构化输出:JSON 中间态便于二次开发,最终 PDF 排版规范,含标题、来源、日期、摘要、双链接等完整字段
4. 时效性过滤:默认 90 天窗口,有效聚焦近期行业动态
潜在缺点与局限性
1. 数据源依赖搜狗:搜狗微信搜索的收录完整度、排序算法与反爬策略直接影响抓取成功率,非微信官方 API
2. 时效性风险:微信原文链接存在失效可能(如公众号删除、迁移),系统已标注但无法保证可访问
3. Playwright 资源消耗:浏览器渲染对内存和 CPU 要求较高,大规模采集时性能瓶颈明显
4. 摘要质量波动:依赖外部 LLM(MiniMax)生成摘要,长文关键信息可能遗漏或理解偏差
5. 缺乏精细筛选:无按阅读量、点赞数、原创标识等维度的过滤能力
适合人群
- 市场研究人员:快速生成竞品动态、行业趋势简报
- 公关与舆情分析师:监测品牌提及、热点事件传播
- 投资研究员:追踪特定赛道(如 AI、新能源)的草根视角与一线信息
- 内容运营:批量采集选题素材,建立本地知识库
常规风险
1. 合规风险:微信公众号内容受版权保护,自动化抓取需确保符合《网络安全法》《著作权法》及微信 robots 协议,商业用途建议获取授权
2. 账号封禁:搜狗/微信可能识别自动化访问模式,存在 IP 限制或搜索功能临时封锁可能
3. 数据隐私:抓取内容可能含个人信息,存储与处理需符合 GDPR、PIPL 等法规
4. 依赖维护:Playwright 与搜狗页面结构耦合紧密,目标站点改版可能导致脚本失效