核心功能
clean-web-fetch(Scrapling Web Fetch)是一款面向现代网页的智能内容提取技能,核心定位是解决传统网页抓取中常见的反爬干扰、动态渲染失效及内容噪音过多等问题。
核心用法
- 命令行调用:
python3 scripts/scrapling_fetch.py <url> <max_chars> - 智能选择器:按
article→main→.post-content→[class*="body"]→body的优先级自动命中正文区域 - 输出格式:默认输出 Markdown 正文,支持
--json结构化输出及 stderr 调试信息 - 微信专项优化:针对微信公众号文章的特殊 DOM 结构进行尾部噪音清洗
显著优点
1. 高稳定性:基于 Scrapling 引擎,对反爬机制和现代动态网页具有较强适应能力
2. Token 友好:精准提取正文,过滤导航栏、广告、侧边栏等无关内容,大幅降低后续 LLM 处理成本
3. 批处理能力:支持批量 URL 抓取
4. 可扩展性:允许通过选择器覆盖(selector overrides)自定义提取规则
潜在局限
- 非浏览器方案:无法处理需要完整浏览器交互、登录态、点击翻页等复杂场景
- API 非最优:纯数据接口场景下,直接请求 API 效率更高
- 依赖管理:需确保 Python 环境中已安装
scrapling与html2text
适合人群
- 内容研究者、新闻摘要开发者、知识库构建者
- 需要将网页快速转换为干净 Markdown 供 LLM 处理的工作流
- 受困于常规
fetch不稳定、反爬干扰的自动化场景
常规风险
- 网页结构变更可能导致选择器失效,需定期维护
- 高频抓取需遵守目标站点的 robots.txt 及速率限制
- 依赖第三方库的安全更新,建议锁定版本