核心用法
schoolar-search 是一个 Python 命令行脚本封装的学术研究工具,整合 arXiv 预印本库与 Semantic Scholar 学术图谱 API,提供统一检索入口。核心功能包括:
1. 双引擎联合检索
- arXiv 引擎:追踪最新预印本,支持
search_query多字段语法(ti:,au:,cat:,abs:),id_list精确拉取,时间范围过滤submittedDate:[...TO...] - Semantic Scholar 引擎:高影响力论文检索,支持引用计数排序、开放获取 PDF 判断、引用网络扩展(
citations/references)、作者轨迹分析(author/{id}/papers)
2. 结构化输出与质量管控
- 内置相关性分层(高/中/弱相关)、多轮检索策略(自动改写 query、跨源补充)
- 强制输出格式:独立分隔线、固定元数据字段(来源、日期、引用数、开放获取、PDF 链接)、TL;DR 摘要、研究内容 1-2 句概括、2-4 条关键点
- 字段真实性校验:禁止补写未返回数据,缺失标注"未知"
3. 工作流设计
- 需求标准化 → 引擎选择 → 参数编码 → 结果质量检查 → 相关性分层 → 终止条件判定 → 格式化输出
- 终止触发:达标数量、重复率>70%、3轮上限、领域过新信号、用户明确停止
显著优点
- 双源互补:arXiv 覆盖最新预印本(无时滞),S2 覆盖已发表高影响力论文(含引用网络)
- 学术场景深度优化:支持 DOI/arXiv ID/S2 Paper ID 多 ID 体系互跳,引用链扩展便于文献综述
- 输出格式严格规范:适合直接用于学术报告、文献综述引用,无需二次整理
- 智能检索策略:自动改写 query、跨源补充、相关性分层,降低"搜不到"概率
潜在缺点与局限性
- S2 API 需密钥:
S2_API_KEY为必需依赖,无密钥时仅能用 arXiv(功能减半) - 限流约束:arXiv 3秒/请求;S2 各端点 limit/offset 上限不一(search 限 1000 条累计),大规模系统性检索需分页策略
- 字段覆盖不均:TL;DR 仅 S2 部分论文提供;arXiv 无内置引用计数(需跳 S2)
- 中文内容薄弱:两源均为英文学术库,中文论文覆盖极少
适合人群
- 科研人员:文献综述、前沿追踪、引用网络分析
- 学生:课程论文背景调研、快速获取 PDF 与核心信息
- 技术写作者:需要规范引用格式与结构化论文摘要
常规风险
- API 稳定性:arXiv 偶有维护窗口,S2 需关注配额与速率限制
- 版权与开放获取:
openAccessPdf字段判断可能滞后,需人工复核出版商政策 - 数据时效:arXiv 预印本未经同行评审,S2 数据更新有 1-7 天延迟