wechat-article

✨ 公众号文章一键转 Markdown

一键抓取微信公众号文章,自动提取标题、正文并转为 Markdown,支持三种提取策略应对反爬机制。

收藏
11.6k
安装
3.3k
版本
1.0.0
CLS 安全性认证2026-08-03
点击查看完整报告 >

使用说明

核心用法

wechat-article 是一个专注于微信公众号内容抓取的 CLI 工具。用户只需提供公众号文章链接,即可自动提取文章标题、发布时间、公众号名称及正文内容,并输出为标准 Markdown 格式,便于后续存档、编辑或知识管理。

使用方法极为简洁:

python3 skills/wechat-article/scripts/wechat_article.py '<文章链接>'

提取策略优先级

该技能采用三级 fallback 机制,最大限度提升成功率:

1. r.jina.ai(推荐):借助第三方内容提取服务,规避微信反爬限制
2. web_fetch:直接 HTTP 请求抓取,轻量化但易被拦截

3. agent-browser:浏览器自动化方案,可应对动态渲染,但需处理验证码

显著优点

  • 多策略容错:三种提取方式层层降级,适应不同防护等级的文章
  • 标准输出格式:自动生成包含元信息(发布时间、公众号名)的结构化 Markdown
  • 轻量依赖:仅需 Python3 环境,无复杂运行时要求
  • 命令行友好:支持管道重定向,便于集成到自动化工作流

潜在缺点与局限性

  • 反爬不确定性:微信持续更新防护策略,部分文章仍可能获取失败
  • 验证码瓶颈:需要人工验证的文章无法全自动处理
  • 第三方服务依赖:r.jina.ai 的稳定性与速率限制影响体验
  • 仅支持公开文章:付费/私密内容不在支持范围

适合人群

  • 知识管理爱好者:将优质公众号文章归档至个人笔记系统(Obsidian、Notion 等)
  • 内容创作者:批量收集参考资料,进行合规的二次创作
  • 研究人员:整理行业资讯,构建可检索的本地文献库
  • 自动化工程师:集成至 CI/CD 或定时任务,实现内容监控

常规风险

| 风险类型 | 说明 |
|---------|------|
| 账号风险 | 高频抓取可能触发微信风控,建议控制请求频率 |
| 版权合规 | 抓取的 Markdown 仅供个人学习,禁止商用传播 |
| 隐私泄露 | 避免抓取含敏感信息的内部分享链接 |
| 服务中断 | r.jina.ai 等第三方服务存在不可用可能 |

建议始终优先使用 r.jina.ai 策略,并在生产环境中添加重试与日志机制。

安全解读

核心用法

wechat-article 是一款专门用于微信公众号文章采集的实用工具,用户只需提供公众号文章链接,即可自动提取标题、发布时间、公众号名称及正文内容,并输出为标准 Markdown 格式。该技能支持三种提取策略的自动降级:优先调用第三方服务 r.jina.ai 进行高效解析,失败后尝试直接 HTTP 抓取,最后启用浏览器自动化模式,以应对微信的反爬虫机制。

使用方法极为简洁,通过命令行传入文章 URL 即可:python3 skills/wechat-article/scripts/wechat_article.py 'https://mp.weixin.qq.com/s/xxx',输出可直接重定向到文件保存。工具内置基础 URL 验证,确保链接来自微信公众号域名。

显著优点

多策略容错设计是该技能的核心竞争力。面对微信公众号严密的反爬体系,三重降级机制显著提升了采集成功率。r.jina.ai 作为推荐的提取方式,能够有效绕过微信的访问限制,返回干净的正文内容。

输出格式标准化,直接生成带有元信息(发布时间、公众号来源)的 Markdown 文档,便于后续导入知识库、笔记软件或进行内容分析。对于需要批量归档公众号文章的内容运营者、研究人员而言,这一特性大幅降低了后期处理成本。

代码轻量化,仅 242 行 Python 代码,依赖仅限于标准库和 requests,无复杂环境配置要求,部署门槛低。

潜在缺点与局限性

第三方服务依赖构成主要短板。r.jina.ai 作为外部 API,存在服务可用性、速率限制、API 变更等不确定性,且直接抓取模式成功率较低,浏览器自动化模式则需要额外处理验证码,体验不连贯。

数据隐私风险不容忽视。用户提供的 URL 及文章内容将被发送至 Jina AI 服务器,对于包含敏感信息或内部资料的链接,存在数据外泄隐患。该技能未提供纯本地模式选项,用户无法完全控制数据流向。

功能边界有限,仅支持单篇文章抓取,缺乏批量队列、增量同步、自动去重等进阶功能,难以满足大规模内容运营场景。

适合的目标群体

  • 内容运营人员:需要定期备份、整理特定公众号历史文章
  • 知识管理用户:将优质公众号内容纳入个人知识库(Obsidian、Notion 等)
  • 研究人员:采集行业分析、政策解读类公开文章进行文本分析
  • 开发者:作为内容采集 pipeline 的组件,进行二次开发集成

使用风险说明

数据合规风险:使用该技能即意味着将目标 URL 共享给第三方服务,建议严格限定于公开可访问的非敏感文章,避免用于企业内部分享链接、含个人信息的内容或付费文章。

服务稳定性风险:r.jina.ai 为免费/增值服务,可能出现访问限制或调整,建议关注服务状态并保留手动备份方案。

法律合规边界:微信服务条款对自动化采集有明确限制,过度频繁使用可能导致账号或 IP 受限,建议控制使用频率,尊重原创内容版权。

wechat-article 内容

scripts文件夹
手动下载zip · 4.6 kB
wechat_article.pytext/plain
请选择文件