核心功能
clean-content-fetch 是一款专为现代网页设计的智能内容提取工具,能够自动识别文章正文、清洗 HTML 噪音并输出干净的 Markdown 格式。该技能基于 scrapling 框架构建,通过智能选择器优先级(article → main → .post-content → [class*="body"] → body)精准定位正文区域,再经 html2text 转换为结构化 Markdown。
显著优势
1. 智能去噪:针对现代网页复杂的 DOM 结构,自动过滤导航栏、广告、侧边栏等干扰元素
2. 多场景适配:专门优化了博客、新闻站点、公告页面及微信公众号文章的抓取效果
3. 小红书支持:内置 xhslink.com 短链解析能力,可直接提取小红书笔记正文
4. 抗反爬机制:基于 curl_cffi 和 playwright 的浏览器指纹模拟,有效应对动态渲染和基础反爬
5. 灵活输出:支持纯 Markdown 和结构化 JSON 两种输出模式
局限性
- 非交互式场景:无法处理需要登录、点击、翻页等复杂浏览器交互的页面
- 深度动态内容:对于重度 JavaScript 渲染(如无限滚动、懒加载瀑布流)的页面,可能需要配合浏览器自动化
- 选择器依赖:虽然预设了常见正文选择器,但极度非标准的网页结构可能导致提取偏差
- API 场景不适用:纯粹的数据 API 调用建议直接使用 HTTP 请求,而非此工具
适合人群
- 需要快速提取网页正文进行 AI 总结、知识库建设的知识工作者
- 运营人员抓取公众号文章、小红书笔记进行内容分析
- 开发者构建内容聚合、舆情监测类应用的抓取模块
- 研究人员需要批量转换网页文献为 Markdown 格式
常规风险
- 依赖维护:
playwright浏览器需要定期更新,虚拟环境需独立管理 - 网络波动:目标网站的反爬策略变化可能导致抓取失败
- 内容完整性:自动截断(max_chars 限制)可能导致长文末尾丢失
- 版权合规:抓取内容需注意目标网站的 robots.txt 及版权声明,避免违规使用