核心用法
Curated Search Skill 是一种领域受限的全文搜索工具,专用于在人工精选的技术文档白名单(如 MDN、Python 官方文档等)中进行检索。与通用搜索引擎不同,它完全屏蔽了商业内容、论坛噪音和 SEO 垃圾信息,返回经过清洗的权威结果。
主要功能:
- 精准检索:支持关键词搜索,可设置相关性阈值(
min_score)过滤低质量匹配 - 域名过滤:可限定特定文档源(如
docs.python.org),避免跨域干扰 - 分页控制:通过
offset和limit实现结果翻页 - 结构化输出:返回包含标题、URL、摘要、相关性评分、爬取时间的完整元数据
典型调用场景:
- 快速查找 Python 官方教程中的特定概念
- 检索 MDN 上关于 async/await 的权威解释
- 获取 Linux man page 的标准文档
显著优点
1. 权威性保障:仅索引官方技术文档,杜绝 Stack Overflow 过时回答、博客转载等不可信来源
2. 零广告干扰:无商业推广、无追踪脚本,结果页面干净纯粹
3. 相关性算法:采用 BM25 评分机制,结果按实际内容匹配度排序
4. 实时性可控:crawled_at 时间戳让用户判断信息时效性
5. 轻量集成:RESTful JSON 接口,易于嵌入开发工作流
潜在局限
- 覆盖范围窄:仅限配置的白名单域名,小众技术栈可能缺失
- 索引滞后:需定期运行
npm run crawl更新,非实时同步官方文档 - 无自然语言理解:基于关键词匹配,复杂语义查询效果有限
- 配置门槛:需手动维护
config.yaml的域名白名单和爬取策略
适合人群
- 追求信息可信度的开发者(避免被过时博客误导)
- 需要快速查证 API 用法的工程团队
- 构建技术问答机器人的 AI 应用开发者
- 对搜索结果纯净度有洁癖的效率工具用户
常规风险
- 配置错误风险:
index_not_found等错误需熟悉 Node.js 构建流程才能修复 - 评分阈值误设:
min_score过高可能导致漏检,过低则引入噪声 - 域名漂移:官方文档 URL 结构变更后,白名单需手动更新
- 非安全扫描声明:根据认证报告,本技能未经过完整安全审计,建议在内网或受信环境使用