核心用法
wechat-article 是一个专注于微信公众号内容抓取的 CLI 工具。用户只需提供公众号文章链接,即可自动提取文章标题、发布时间、公众号名称及正文内容,并输出为标准 Markdown 格式,便于后续存档、编辑或知识管理。
使用方法极为简洁:
python3 skills/wechat-article/scripts/wechat_article.py '<文章链接>'
提取策略优先级
该技能采用三级 fallback 机制,最大限度提升成功率:
1. r.jina.ai(推荐):借助第三方内容提取服务,规避微信反爬限制
2. web_fetch:直接 HTTP 请求抓取,轻量化但易被拦截
3. agent-browser:浏览器自动化方案,可应对动态渲染,但需处理验证码
显著优点
- 多策略容错:三种提取方式层层降级,适应不同防护等级的文章
- 标准输出格式:自动生成包含元信息(发布时间、公众号名)的结构化 Markdown
- 轻量依赖:仅需 Python3 环境,无复杂运行时要求
- 命令行友好:支持管道重定向,便于集成到自动化工作流
潜在缺点与局限性
- 反爬不确定性:微信持续更新防护策略,部分文章仍可能获取失败
- 验证码瓶颈:需要人工验证的文章无法全自动处理
- 第三方服务依赖:r.jina.ai 的稳定性与速率限制影响体验
- 仅支持公开文章:付费/私密内容不在支持范围
适合人群
- 知识管理爱好者:将优质公众号文章归档至个人笔记系统(Obsidian、Notion 等)
- 内容创作者:批量收集参考资料,进行合规的二次创作
- 研究人员:整理行业资讯,构建可检索的本地文献库
- 自动化工程师:集成至 CI/CD 或定时任务,实现内容监控
常规风险
| 风险类型 | 说明 |
|---------|------|
| 账号风险 | 高频抓取可能触发微信风控,建议控制请求频率 |
| 版权合规 | 抓取的 Markdown 仅供个人学习,禁止商用传播 |
| 隐私泄露 | 避免抓取含敏感信息的内部分享链接 |
| 服务中断 | r.jina.ai 等第三方服务存在不可用可能 |
建议始终优先使用 r.jina.ai 策略,并在生产环境中添加重试与日志机制。