Distil the web & PDFs into markdown

🔍 网页转 Markdown,节省 80% Token

Distil 将任意网页转换为干净 Markdown,支持搜索、截图和渲染,为 LLM 节省 60-80% token,需 API key 订阅使用。

收藏
3.6k
安装
1.4k
版本
1.0.4
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Distil 是一个网页内容提取与搜索代理工具,通过 distil-mcp npm 包提供 CLI 接口。主要功能包括:

  • fetch:将任意 URL 转换为结构化 Markdown,去除广告、导航等冗余内容
  • search:执行网络搜索并返回带摘要的 Markdown 结果
  • screenshot:捕获网页截图
  • render:执行 JavaScript 后提取动态内容
  • raw/nocache:获取原始内容或强制刷新缓存

显著优点

1. Token 效率:官方声称可节省 60-80% 的 LLM 处理 token,显著降低 API 成本
2. 标准化输出:统一的 Markdown 格式,避免处理各种网站的异构 HTML 结构

3. 动态内容支持render 命令可处理 SPA 等 JavaScript 渲染页面

4. 缓存机制:默认启用缓存加速重复访问,nocache 可强制刷新

5. MCP 原生集成:作为 Model Context Protocol 技能,与 OpenClaw 等框架无缝协作

潜在缺点与局限性

1. 依赖外部服务:核心功能完全依赖 distil.net 代理服务,存在单点故障风险
2. 订阅成本:需要有效的 API key,非免费服务

3. 隐私顾虑:所有网页访问需经第三方代理,敏感内容存在泄露风险

4. 内容准确性:自动化提取可能遗漏重要格式信息(表格、代码块缩进等)

5. 网络延迟:代理架构增加额外请求跳转,高并发场景下延迟明显

适合人群

  • 需要频繁获取网页内容供 LLM 分析的 AI 应用开发者
  • 构建研究 agent、知识库自动化的技术团队
  • 对 token 成本敏感且愿意接受代理架构的企业用户
  • 处理大量动态网页(SPA)的内容聚合场景

常规风险

| 风险类型 | 说明 |
|---------|------|
| 密钥管理 | `DISTIL_API_KEY` 需妥善保管,避免硬编码或日志泄露 |
| 速率限制 | 代理服务通常存在 API 调用配额,需实现退避重试 |
| 内容合规 | 抓取受版权保护或条款限制的网站可能引发法律问题 |
| 服务可用性 | 代理服务中断将直接导致技能失效,建议实现降级方案(如文档中的 curl 备选) |
| 数据驻留 | 网页内容经第三方服务器处理,敏感数据需评估合规性 |

Distil the web & PDFs into markdown 内容

手动下载zip · 3.7 kB
LICENSE.mdtext/markdown
请选择文件