核心用法
wechat-article-spider 是一款针对微信公众号文章的本地化爬虫工具,通过命令行接收文章URL,自动抓取正文内容,并将所有图片下载到本地 images/ 目录,最终生成引用相对路径的 Markdown 文件。工具基于 Python 构建,依赖 requests、BeautifulSoup4 和 lxml 实现页面请求与 HTML 解析,支持自定义输出目录,采用哈希命名策略避免图片重复下载。
显著优点
- 本地化归档:将依赖外部 CDN 的微信文章转为完全离线的文档,防止链接失效
- 格式友好:输出标准 Markdown,便于后续导入 Notion、Obsidian 等知识库工具
- 轻量易用:单脚本设计,无复杂配置,命令行一键执行
- 图片去重:哈希值命名机制节省存储空间
潜在缺点与局限性
- 反爬风险:微信存在 IP 限制、验证码等反爬机制,稳定性受平台策略影响
- 动态内容受限:SPA 渲染或懒加载的图片可能无法捕获
- 无增量更新:不支持已抓取文章的变更检测与同步
- 命令行门槛:非技术用户需要配置 Python 环境
适合人群
内容创作者、知识管理爱好者、需要批量备份公众号文章的研究人员,以及具备基础命令行操作能力的技术用户。
常规风险
- 法律合规:批量抓取可能违反微信《服务协议》及版权法
- 账号安全:高频请求可能导致 IP 被封或微信账号异常
- 隐私泄露:文章可能包含个人信息,本地存储需加密管理