核心用法
Curated Search Skill 是一种域限制型全文搜索工具,专为技术文档检索设计。它通过预先配置的白名单域名(如 MDN、Python 官方文档等),构建本地索引并提供结构化搜索服务。
主要调用方式:
- 基础搜索:
search CuratedSearch for "query" - 高级过滤:支持
domain限定特定文档站点、min_score设置相关性阈值、limit/offset控制结果数量与分页
典型工作流:
1. 配置 config.yaml 定义允许抓取的域名与种子 URL
2. 运行爬虫构建本地索引(npm run crawl)
3. 通过工具接口执行 BM25 算法驱动的全文检索
4. 获取包含标题、摘要、相关性评分的结构化结果
显著优点
- 权威性保障:仅索引经过筛选的官方技术文档,彻底规避 Stack Overflow 过时答案、博客营销内容等噪声
- 响应速度快:本地 BM25 索引无需实时网络请求,延迟可控
- 结果结构化:返回包含
score、snippet、crawled_at等元数据的标准 JSON,便于下游处理 - 灵活过滤:支持按域名、相关性分数精准筛选,满足专业检索需求
- 离线可用:索引构建后可完全脱机使用
潜在缺点与局限性
- 覆盖范围受限:严格依赖白名单配置,小众技术、最新框架文档可能缺失
- 索引维护成本:需定期重新爬虫以同步文档更新,否则内容陈旧
- 冷启动问题:首次使用需完成配置与索引构建,无法即开即用
- 无语义理解:基于关键词的 BM25 算法,对自然语言意图的捕捉弱于向量检索
- 英文内容为主:主流技术文档以英文源站居多,中文支持取决于白名单配置
适合人群
- 需要快速查阅权威 API 文档的开发者
- 构建编程助手、代码生成 Agent 的技术团队
- 对搜索结果可信度要求高于覆盖广度的企业场景
- 希望规避网络搜索延迟与不稳定的离线开发环境
常规风险
| 风险类别 | 说明 | 缓释建议 |
|---------|------|---------|
| 索引过期风险 | 文档更新后本地索引未同步 | 配置定时任务重新爬虫,或设置 `crawled_at` 阈值过滤旧结果 |
| 配置错误风险 | `config.yaml` 语法错误导致服务启动失败 | 使用 YAML 校验工具,参考详细错误码排查 |
| 查询注入风险 | 虽为本地搜索,仍需注意超长查询(>1000字符)触发的 `query_too_long` 错误 |
| 权限风险 | 索引文件路径权限不足导致 `index_init_failed` | 确保运行用户对 `index.path` 有读写权限 |
该技能本质上是一个专业领域的垂直搜索引擎,其价值在于质量过滤而非通用覆盖,适合作为通用网页搜索的可信替代方案。