核心用法
Distil 是一个网页内容提取与搜索代理工具,通过 distil-mcp npm 包提供 CLI 接口。主要功能包括:
- fetch:将任意 URL 转换为结构化 Markdown,去除广告、导航等冗余内容
- search:执行网络搜索并返回带摘要的 Markdown 结果
- screenshot:捕获网页截图
- render:执行 JavaScript 后提取动态内容
- raw/nocache:获取原始内容或强制刷新缓存
显著优点
1. Token 效率:官方声称可节省 60-80% 的 LLM 处理 token,显著降低 API 成本
2. 标准化输出:统一的 Markdown 格式,避免处理各种网站的异构 HTML 结构
3. 动态内容支持:render 命令可处理 SPA 等 JavaScript 渲染页面
4. 缓存机制:默认启用缓存加速重复访问,nocache 可强制刷新
5. MCP 原生集成:作为 Model Context Protocol 技能,与 OpenClaw 等框架无缝协作
潜在缺点与局限性
1. 依赖外部服务:核心功能完全依赖 distil.net 代理服务,存在单点故障风险
2. 订阅成本:需要有效的 API key,非免费服务
3. 隐私顾虑:所有网页访问需经第三方代理,敏感内容存在泄露风险
4. 内容准确性:自动化提取可能遗漏重要格式信息(表格、代码块缩进等)
5. 网络延迟:代理架构增加额外请求跳转,高并发场景下延迟明显
适合人群
- 需要频繁获取网页内容供 LLM 分析的 AI 应用开发者
- 构建研究 agent、知识库自动化的技术团队
- 对 token 成本敏感且愿意接受代理架构的企业用户
- 处理大量动态网页(SPA)的内容聚合场景
常规风险
| 风险类型 | 说明 |
|---------|------|
| 密钥管理 | `DISTIL_API_KEY` 需妥善保管,避免硬编码或日志泄露 |
| 速率限制 | 代理服务通常存在 API 调用配额,需实现退避重试 |
| 内容合规 | 抓取受版权保护或条款限制的网站可能引发法律问题 |
| 服务可用性 | 代理服务中断将直接导致技能失效,建议实现降级方案(如文档中的 curl 备选) |
| 数据驻留 | 网页内容经第三方服务器处理,敏感数据需评估合规性 |