核心用法
Curated Search Skill 是一种域受限的精搜工具,专门面向技术开发者设计。它通过预配置的权威域名白名单(如 MDN、Python 官方文档、Linux man pages 等),构建本地索引并提供 BM25 算法的全文检索能力。用户可通过自然语言查询快速定位技术文档,支持按域名过滤、相关性分数阈值筛选、分页偏移等高级参数,确保结果高度相关且来源可信。
显著优点
1. 权威性保障:仅搜索人工审核过的技术文档源,彻底屏蔽 SEO 农场、内容农场和低质量博客。
2. 结果干净:无广告、无追踪脚本、无干扰性弹窗, snippet 直接提取自正文,阅读体验清爽。
3. 开发者友好:支持 domain 过滤(如限定仅搜索 developer.mozilla.org),min_score 阈值剔除低相关结果,limit 与 offset 实现分页,契合技术查询的精准需求。
4. 离线可用:索引本地存储,无需实时联网即可秒级响应,适合内网环境或网络不稳定场景。
潜在缺点与局限性
- 覆盖范围有限:仅包含白名单内的域名,无法回答 Stack Overflow、GitHub Issues、技术博客等社区内容,可能错过最新实践或边缘案例讨论。
- 索引滞后:内容需预先爬取,若源站更新频繁而爬取周期较长,可能存在数小时至数天的信息延迟。
- 配置门槛:首次使用需编辑
config.yaml定义域名白名单、爬取深度、文档长度限制等,对非技术用户不够零门槛。 - 无语义理解:基于 BM25 的词袋模型,缺乏向量语义检索能力,对自然语言同义词、意图推理支持较弱。
适合人群
- 需要快速查证 API 用法、语法规范的软件工程师
- 对搜索结果质量敏感、厌恶广告干扰的专业开发者
- 处于网络受限环境(企业内网、离线环境)仍需查阅技术文档的团队
- 希望自主掌控数据源、避免依赖商业搜索引擎的技术组织
常规风险
1. 索引过期风险:若长期未重新爬取,索引中的链接可能 404,或文档内容已过时,导致用户获取错误信息。
2. 配置泄露风险:config.yaml 中可能包含内网域名或 seeds URL,若权限配置不当,可能暴露内部文档结构。
3. BM25 分数误读:score 非归一化 0–1 值,跨查询比较无意义,用户可能因误解分数而忽略有效结果。
4. 工具调用失败:索引未构建、查询超长、域名格式错误等情况会触发非零退出,Agent 需妥善处理 stderr 中的 JSON 错误对象,避免流程中断。