Clean Content Fetch

🕸️ 智能网页正文提取与 Markdown 转换

智能提取网页正文内容,自动去噪转 Markdown,支持现代网页、公众号及小红书抓取

收藏
4k
安装
1.3k
版本
1.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

clean-content-fetch 是一款专为现代网页设计的智能内容提取工具,能够自动识别文章正文、清洗 HTML 噪音并输出干净的 Markdown 格式。该技能基于 scrapling 框架构建,通过智能选择器优先级(article → main → .post-content → [class*="body"] → body)精准定位正文区域,再经 html2text 转换为结构化 Markdown。

显著优势

1. 智能去噪:针对现代网页复杂的 DOM 结构,自动过滤导航栏、广告、侧边栏等干扰元素
2. 多场景适配:专门优化了博客、新闻站点、公告页面及微信公众号文章的抓取效果

3. 小红书支持:内置 xhslink.com 短链解析能力,可直接提取小红书笔记正文

4. 抗反爬机制:基于 curl_cffiplaywright 的浏览器指纹模拟,有效应对动态渲染和基础反爬

5. 灵活输出:支持纯 Markdown 和结构化 JSON 两种输出模式

局限性

  • 非交互式场景:无法处理需要登录、点击、翻页等复杂浏览器交互的页面
  • 深度动态内容:对于重度 JavaScript 渲染(如无限滚动、懒加载瀑布流)的页面,可能需要配合浏览器自动化
  • 选择器依赖:虽然预设了常见正文选择器,但极度非标准的网页结构可能导致提取偏差
  • API 场景不适用:纯粹的数据 API 调用建议直接使用 HTTP 请求,而非此工具

适合人群

  • 需要快速提取网页正文进行 AI 总结、知识库建设的知识工作者
  • 运营人员抓取公众号文章、小红书笔记进行内容分析
  • 开发者构建内容聚合、舆情监测类应用的抓取模块
  • 研究人员需要批量转换网页文献为 Markdown 格式

常规风险

  • 依赖维护playwright 浏览器需要定期更新,虚拟环境需独立管理
  • 网络波动:目标网站的反爬策略变化可能导致抓取失败
  • 内容完整性:自动截断(max_chars 限制)可能导致长文末尾丢失
  • 版权合规:抓取内容需注意目标网站的 robots.txt 及版权声明,避免违规使用

Clean Content Fetch 内容

手动下载zip · 1.8 kB
SKILL.mdtext/markdown
请选择文件