Scholar Search

🎓 学术论文双源检索与引用分析

统一检索 arXiv 与 Semantic Scholar 学术论文,支持主题/作者/引用网络分析及结构化输出

收藏
4.5k
安装
1.4k
版本
1.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

schoolar-search 是一个 Python 命令行脚本封装的学术研究工具,整合 arXiv 预印本库与 Semantic Scholar 学术图谱 API,提供统一检索入口。核心功能包括:

1. 双引擎联合检索

  • arXiv 引擎:追踪最新预印本,支持 search_query 多字段语法(ti:, au:, cat:, abs:),id_list 精确拉取,时间范围过滤 submittedDate:[...TO...]
  • Semantic Scholar 引擎:高影响力论文检索,支持引用计数排序、开放获取 PDF 判断、引用网络扩展(citations/references)、作者轨迹分析(author/{id}/papers

2. 结构化输出与质量管控

  • 内置相关性分层(高/中/弱相关)、多轮检索策略(自动改写 query、跨源补充)
  • 强制输出格式:独立分隔线、固定元数据字段(来源、日期、引用数、开放获取、PDF 链接)、TL;DR 摘要、研究内容 1-2 句概括、2-4 条关键点
  • 字段真实性校验:禁止补写未返回数据,缺失标注"未知"

3. 工作流设计

  • 需求标准化 → 引擎选择 → 参数编码 → 结果质量检查 → 相关性分层 → 终止条件判定 → 格式化输出
  • 终止触发:达标数量、重复率>70%、3轮上限、领域过新信号、用户明确停止

显著优点

  • 双源互补:arXiv 覆盖最新预印本(无时滞),S2 覆盖已发表高影响力论文(含引用网络)
  • 学术场景深度优化:支持 DOI/arXiv ID/S2 Paper ID 多 ID 体系互跳,引用链扩展便于文献综述
  • 输出格式严格规范:适合直接用于学术报告、文献综述引用,无需二次整理
  • 智能检索策略:自动改写 query、跨源补充、相关性分层,降低"搜不到"概率

潜在缺点与局限性

  • S2 API 需密钥S2_API_KEY 为必需依赖,无密钥时仅能用 arXiv(功能减半)
  • 限流约束:arXiv 3秒/请求;S2 各端点 limit/offset 上限不一(search 限 1000 条累计),大规模系统性检索需分页策略
  • 字段覆盖不均:TL;DR 仅 S2 部分论文提供;arXiv 无内置引用计数(需跳 S2)
  • 中文内容薄弱:两源均为英文学术库,中文论文覆盖极少

适合人群

  • 科研人员:文献综述、前沿追踪、引用网络分析
  • 学生:课程论文背景调研、快速获取 PDF 与核心信息
  • 技术写作者:需要规范引用格式与结构化论文摘要

常规风险

  • API 稳定性:arXiv 偶有维护窗口,S2 需关注配额与速率限制
  • 版权与开放获取openAccessPdf 字段判断可能滞后,需人工复核出版商政策
  • 数据时效:arXiv 预印本未经同行评审,S2 数据更新有 1-7 天延迟

Scholar Search 内容

references文件夹
scripts文件夹
手动下载zip · 20.1 kB
arxiv-api-reference.mdtext/markdown
请选择文件