核心用法
Distil 是一个网页内容抓取与搜索代理工具,专为 LLM 工作流设计。通过 distil-proxy CLI,用户可将任意网页转换为结构化的 Markdown 格式,显著降低 token 消耗(官方声称节省 60-80%)。核心命令包括:
- `distil fetch <url>` — 抓取网页并输出清洁 Markdown
- `distil search "query"` — 执行网络搜索,返回带摘要的 Markdown 结果
- `distil screenshot <url>` — 网页截图(图像输出)
- `distil render <url>` — 先渲染 JavaScript 动态页面再提取内容
- `distil raw <url>` — 获取原始 HTML,跳过 Markdown 转换
- `distil nocache <url>` — 强制绕过缓存获取最新内容
显著优点
1. Token 效率:Markdown 转换大幅压缩冗余 HTML/CSS,降低 LLM 上下文成本
2. 动态渲染支持:render 命令可处理 SPA 单页应用,突破传统爬虫限制
3. 多模态输出:支持文本(Markdown/HTML)与图像(截图)混合
4. 缓存控制:灵活的缓存策略平衡成本与实时性
5. 自托管友好:DISTIL_PROXY_URL 支持私有化部署
潜在局限
- 依赖外部服务:核心功能依赖 distil.net 代理,离线不可用
- API Key 门槛:需注册获取密钥,存在使用门槛与潜在费用
- JavaScript 渲染开销:动态页面渲染增加延迟与资源消耗
- 内容完整性风险:自动化提取可能遗漏复杂布局中的关键信息
- 服务连续性:第三方代理服务的稳定性与长期可用性存疑
适合人群
- 构建 RAG(检索增强生成)系统的 AI 开发者
- 需要批量处理网页内容的自动化工作流工程师
- 研究竞品分析、市场调研的知识工作者
- 希望降低 LLM 上下文成本的团队
常规风险
- 数据隐私:网页内容经第三方代理传输,敏感信息需谨慎评估
- 速率限制:API 调用存在配额限制,高并发场景需容错设计
- 法律合规:抓取行为需遵守目标网站的 robots.txt 及服务条款
- 输出质量波动:非标准网页的 Markdown 转换效果可能不稳定