核心用法
desearch-crawl 是 Desearch AI 官方提供的网页抓取技能,面向需要读取完整网页内容的场景。用户通过 scripts/desearch.py crawl <URL> 即可快速获取页面内容,默认返回清洗后的纯文本,避免 HTML 标签冗余;如需分析页面结构,可追加 --crawl-format html 获取原始 HTML。
显著优点
- 官方背书:直接对接 Desearch API,数据源稳定、响应结构规范,减少自建爬虫的维护成本。
- 双模式输出:
text模式自动过滤脚本、样式等噪音,适合 LLM 上下文注入;html模式保留完整 DOM,便于结构解析。 - 即开即用:仅需配置
DESEARCH_API_KEY环境变量,无需处理反爬、IP 轮换、请求头等复杂逻辑。 - CLI 友好:命令行调用简洁,易于集成到自动化工作流或脚本管道中。
潜在缺点与局限性
- 付费门槛:依赖 Desearch 账户余额,余额耗尽时返回 402 错误,需持续充值。
- 网络依赖:完全依赖 Desearch 服务端,若其服务中断或限流,本地无降级方案。
- 内容不可控:无法自定义请求头(如 User-Agent、Cookie),对需要登录或反爬严格的站点可能抓取失败。
- 无增量/缓存机制:每次调用均为实时爬取,重复 URL 无法本地缓存,高频调用成本累积。
适合人群
- AI Agent 开发者:需要为 RAG 流程快速注入网页内容。
- 数据分析师:批量采集公开页面文本进行 NLP 处理。
- 自动化运维:监控文档站点更新,提取 changelog 或 API 文档。
常规风险
- API Key 泄露:
DESEARCH_API_KEY若硬编码或误提交至仓库,可能导致账户被盗刷。 - 合规风险:抓取受版权保护或含隐私信息的页面时,需确保符合 robots.txt 及当地法规。
- 成本失控:无请求频率限制说明,高频调用易触发计费上限,建议配合调用计数与告警。
- 内容安全:返回内容未经消毒,若页面被植入恶意脚本(XSS payload),
html模式可能将危险标记带入下游系统。