Clean Content Fetch

🕸️ 智能网页正文一键提取

智能网页正文提取工具,专为现代网页设计,支持微信公众号内容抓取与自动清洗,输出干净 Markdown,显著减少 token 消耗与噪音干扰。

收藏
3.8k
安装
1.3k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

clean-web-fetch(Scrapling Web Fetch)是一款面向现代网页的智能内容提取技能,核心定位是解决传统网页抓取中常见的反爬干扰、动态渲染失效及内容噪音过多等问题。

核心用法

  • 命令行调用python3 scripts/scrapling_fetch.py <url> <max_chars>
  • 智能选择器:按 articlemain.post-content[class*="body"]body 的优先级自动命中正文区域
  • 输出格式:默认输出 Markdown 正文,支持 --json 结构化输出及 stderr 调试信息
  • 微信专项优化:针对微信公众号文章的特殊 DOM 结构进行尾部噪音清洗

显著优点

1. 高稳定性:基于 Scrapling 引擎,对反爬机制和现代动态网页具有较强适应能力
2. Token 友好:精准提取正文,过滤导航栏、广告、侧边栏等无关内容,大幅降低后续 LLM 处理成本

3. 批处理能力:支持批量 URL 抓取

4. 可扩展性:允许通过选择器覆盖(selector overrides)自定义提取规则

潜在局限

  • 非浏览器方案:无法处理需要完整浏览器交互、登录态、点击翻页等复杂场景
  • API 非最优:纯数据接口场景下,直接请求 API 效率更高
  • 依赖管理:需确保 Python 环境中已安装 scraplinghtml2text

适合人群

  • 内容研究者、新闻摘要开发者、知识库构建者
  • 需要将网页快速转换为干净 Markdown 供 LLM 处理的工作流
  • 受困于常规 fetch 不稳定、反爬干扰的自动化场景

常规风险

  • 网页结构变更可能导致选择器失效,需定期维护
  • 高频抓取需遵守目标站点的 robots.txt 及速率限制
  • 依赖第三方库的安全更新,建议锁定版本

Clean Content Fetch 内容

手动下载zip · 1.5 kB
SKILL.mdtext/markdown
请选择文件