核心功能
news-to-markdown-skill 是一款专业的新闻文章提取与转换工具,专为内容采集和归档设计。它采用双引擎内容提取(Readability + news-extractor-node),兼顾正文完整性与元数据准确性,能够智能识别标题、作者、发布时间等关键信息。
显著优点
平台覆盖全面:内置10个主流平台的专项优化,包括头条、微信公众号、掘金、简书、CSDN、人人都是产品经理、开源中国、B站专栏、SegmentFault、博客园。每个平台都有定制的预处理规则,显著提升提取准确率。
抓取策略稳健:采用 curl → wget → Playwright 的三层自动降级策略,静态页面快速抓取(1-3秒),动态页面自动启用浏览器渲染(5-10秒),整体成功率达95%以上。
图片处理完善:支持远程图片下载到本地,避免URL签名过期和防盗链问题;智能封面图选择优先使用 og:image/twitter:image,并可配合 wechat-md-publisher 实现公众号一键发布。
输出质量高:基于 html-to-markdown-node 的高质量转换引擎,保留标题层级、正确处理列表和代码块,图片保护机制避免纯图片段落被误过滤。
潜在局限
- 需要 Node.js 18+ 环境,首次使用 Playwright 需额外安装 Chromium
- 对于需要登录、严格反爬虫或有付费墙的网站支持有限
- 特殊布局网站可能需要手动指定 CSS 选择器
- 文本密度算法在极端复杂的页面布局上可能需人工校验
适合人群
- 内容运营者:批量采集文章、构建内容库
- 自媒体创作者:跨平台内容迁移与二次整理
- 开发者/研究者:信息归档、知识管理自动化
- 需要离线阅读或本地备份网络文章的用户
常规风险
- 版权合规:工具默认仅用于个人学习和授权范围内的整理,用户需自行确认来源站点的转载政策
- 网络依赖:目标网站的反爬虫策略可能导致抓取失败
- 内容准确性:建议对关键内容进行人工复核