核心用法
desearch-crawl 是一款由 Desearch 提供的网页爬取技能,专用于从任意 URL 提取网页内容。该工具通过命令行接口调用,支持两种输出格式:纯净文本(默认)和原始 HTML,满足不同场景下的内容获取需求。
基本调用方式
scripts/desearch.py crawl "https://example.com/page"
通过 --crawl-format 参数可切换输出格式,适合开发者快速获取网页内容进行二次处理。
---
显著优点
1. 输出格式灵活:默认返回清洗后的文本,去除标签干扰;可选原始 HTML 保留完整结构
2. 使用门槛低:仅需配置 DESEARCH_API_KEY 环境变量即可调用
3. 场景覆盖广:适用于技术文档抓取、竞品监控、内容聚合、AI 训练数据收集等
---
潜在缺点与局限性
- 依赖第三方服务:内容提取质量受 Desearch 服务器状态影响,存在单点故障风险
- 反爬策略限制:目标网站的反爬虫机制可能导致部分页面抓取失败
- 格式控制能力有限:不支持自定义 CSS 选择器、XPath 等精细化提取规则
- 无内置速率控制:高频调用可能触发 API 限流或被封禁
---
适合人群
- 开发者/数据工程师:需要批量获取网页内容进行处理
- AI 应用构建者:为 RAG 系统、知识库等提供原始内容源
- 内容研究者:快速提取长文档、技术手册等文本资料
---
常规风险提示
⚠️ 合规风险:爬取前需确认目标网站的 robots.txt 协议及服务条款,避免侵犯版权或违反 ToS
⚠️ 隐私敏感:勿用于抓取包含个人隐私信息的页面
⚠️ API 成本:Desearch 为商业服务,高频调用将产生费用,建议实施调用配额管理