Crawl By Desearch

🕷️ 官方网页抓取,一键提取全文

Desearch 官方网页爬虫工具,一键提取任意网页内容,支持 clean text 与 raw HTML 双模式,需 API Key。

收藏
5.8k
安装
1.4k
版本
1.0.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

desearch-crawl 是 Desearch AI 官方提供的网页抓取技能,面向需要读取完整网页内容的场景。用户通过 scripts/desearch.py crawl <URL> 即可快速获取页面内容,默认返回清洗后的纯文本,避免 HTML 标签冗余;如需分析页面结构,可追加 --crawl-format html 获取原始 HTML。

显著优点

  • 官方背书:直接对接 Desearch API,数据源稳定、响应结构规范,减少自建爬虫的维护成本。
  • 双模式输出text 模式自动过滤脚本、样式等噪音,适合 LLM 上下文注入;html 模式保留完整 DOM,便于结构解析。
  • 即开即用:仅需配置 DESEARCH_API_KEY 环境变量,无需处理反爬、IP 轮换、请求头等复杂逻辑。
  • CLI 友好:命令行调用简洁,易于集成到自动化工作流或脚本管道中。

潜在缺点与局限性

  • 付费门槛:依赖 Desearch 账户余额,余额耗尽时返回 402 错误,需持续充值。
  • 网络依赖:完全依赖 Desearch 服务端,若其服务中断或限流,本地无降级方案。
  • 内容不可控:无法自定义请求头(如 User-Agent、Cookie),对需要登录或反爬严格的站点可能抓取失败。
  • 无增量/缓存机制:每次调用均为实时爬取,重复 URL 无法本地缓存,高频调用成本累积。

适合人群

  • AI Agent 开发者:需要为 RAG 流程快速注入网页内容。
  • 数据分析师:批量采集公开页面文本进行 NLP 处理。
  • 自动化运维:监控文档站点更新,提取 changelog 或 API 文档。

常规风险

  • API Key 泄露DESEARCH_API_KEY 若硬编码或误提交至仓库,可能导致账户被盗刷。
  • 合规风险:抓取受版权保护或含隐私信息的页面时,需确保符合 robots.txt 及当地法规。
  • 成本失控:无请求频率限制说明,高频调用易触发计费上限,建议配合调用计数与告警。
  • 内容安全:返回内容未经消毒,若页面被植入恶意脚本(XSS payload),html 模式可能将危险标记带入下游系统。

Crawl By Desearch 内容

scripts文件夹
手动下载zip · 3.9 kB
desearch.pytext/plain
请选择文件