核心用法
internet-search 是一个基于自托管 SearXNG 实例的聚合搜索工具,可同时查询 Brave、Bing、DuckDuckGo、Google Scholar、Reddit 等多个引擎。使用时需根据查询性质选择分类路由:
- `general`(默认):通用事实、操作指南、产品信息、人物检索
- `news`:时效性新闻事件,需附加时间锚点(如 "2025")
- `academic`:研究论文、医学文献、预印本,需使用领域术语
- `social`:社区观点、用户推荐、口碑 sentiment
查询应采用关键词组合而非完整句子,例如用 "rust async runtime benchmarks 2025" 替代 "what is the fastest async runtime"。支持 SearXNG 原生语法如 !wp(指定引擎)、:fr(语言过滤)。
显著优点
1. 多引擎聚合:单次调用即可覆盖通用搜索、学术数据库与社交平台,减少信息盲区
2. 分类精准路由:避免用通用搜索查找学术论文,或用学术分类查实时新闻的效率损耗
3. 查询优化指导:内置反模式提示(如避免 count=20 查简单事实),降低无效调用
4. 组合策略支持:推荐 "general + social" 双轨搜索,兼顾事实准确性与 sentiment 覆盖
潜在缺点与局限
- 依赖外部实例:SearXNG 自建实例的稳定性、索引更新频率直接影响结果质量
- 无结果相关性排序控制:相比原生 Google/Bing API,缺少细粒度排序参数
- 社交数据局限:Reddit 作为唯一社交源,可能存在样本偏差,无法覆盖 Twitter/X、Hacker News 等平台
- 语言过滤非强制:
:lang语法依赖引擎支持,部分源可能忽略该参数
适合人群
- 需要实时信息补充训练数据截止日期的研究者
- 进行技术选型时需对比 benchmark 数据与社区真实反馈的工程师
- 需要多源验证(学术+社交+新闻)的媒体、投资、政策分析人员
- 构建 RAG 系统时需外部检索增强的 AI 应用开发者
常规风险
| 风险类型 | 说明 | 缓释建议 |
|---------|------|---------|
| 信息时效性 | 索引非实时,突发新闻可能存在分钟级延迟 | 对关键时效信息交叉验证官方源 |
| 来源可信度参差 | 聚合引擎包含 User-Generated Content(Reddit、部分论坛) | academic 分类优先用于关键事实 |
| 隐私泄露 | 查询内容发送至自托管服务器,但仍暴露检索意图 | 避免搜索个人敏感信息 |
| 结果漂移 | 不同引擎对同一关键词返回差异显著 | 重要决策时执行 multi-search 策略 |