核心功能
news-to-markdown-skill 是一款专为中国主流内容生态设计的文章提取与转换工具,通过 npx 动态执行 news-to-markdown 核心库,实现从 URL 到可发布 Markdown 的一站式转换。
技术架构亮点
双引擎内容提取:同时运行 Mozilla Readability 与自研 news-extractor-node,前者保障正文完整性,后者精准提取标题、作者、发布时间等元数据,自动选择最优结果。
三层 HTML 抓取策略:curl → wget → Playwright 智能降级,静态页面 1-3 秒极速响应,动态 SPA 自动启用浏览器渲染,整体成功率 95%+。
图片本地化机制:智能识别封面图(优先 og:image/twitter:image),支持批量下载到本地并转为相对路径,解决头条、微信等平台的签名过期与防盗链问题,完美衔接公众号发布流程。
13 平台专项适配:内置头条、微信公众号、36kr、知乎、掘金、简书、CSDN、人人都是产品经理、开源中国、B 站专栏、SegmentFault、博客园、小红书等平台的 DOM 预处理与反爬策略(如 36kr 自动转移动端 URL)。
显著优点
- 零安装成本:npx 即拉即执行,无需全局安装依赖
- 内容保真度高:图片段落保护机制避免误过滤,代码块、列表、标题层级完整保留
- 可扩展架构:支持自定义平台适配器注册,便于持续扩展新站点
- 输出即发布:生成的 Markdown 质量可直接用于公众号、博客等二次发布场景
潜在局限与风险
供应链安全风险:通过 npx 动态拉取第三方 npm 包,存在潜在的代码注入与依赖劫持风险。项目已明确标注 riskLevel: moderate,建议生产使用前审计源码(入口:https://github.com/sipingme/news-to-markdown/blob/main/src/index.ts)。
Playwright 首次使用成本:需额外下载 Chromium 浏览器(约 100MB+),对磁盘与网络有要求。
反爬与合规边界:对于需登录、有付费墙、或明确禁止抓取的版权内容,工具无法突破;用户需自行确认转载授权与版权政策。
特殊布局适配:极端自定义布局站点可能需要手动指定 --selector 或调整 --noise 规则。
适合人群
- 内容运营者:批量采集行业资讯、建立知识库
- 自媒体作者:快速整理参考文章、制作素材包
- 开发者/技术博主:迁移历史文章、多平台同步
- 研究人员:网络文本数据的合规采集与归档
常规风险提示
- 网络依赖:需能直接访问目标 URL,代理环境需提前配置
- 版权合规:默认仅适用于个人学习与授权范围内的二次整理
- 版本锁定:
^3.1.3语义化范围可能自动拉取补丁版本,关键场景建议固定精确版本