核心用法
scholar-search 是一个 Python 命令行工具,整合 arXiv 预印本平台与 Semantic Scholar 学术图谱数据库,提供一站式学术文献检索能力。
主要功能模块:
1. 双引擎检索:
- arXiv 引擎:支持按关键词、作者、分类、时间区间检索预印本,可精确拉取 ID,支持排序(相关性/提交时间/更新时间)
- Semantic Scholar 引擎:支持论文搜索、标题精确匹配、单篇详情、引用网络扩展(被引/参考文献)、作者轨迹分析
2. 灵活过滤:年份范围、会议期刊限定、最低引用数、研究领域、发表类型等多维度筛选
3. 结构化输出:统一 Markdown 格式,包含论文标题、TL;DR、元数据(来源/日期/引用数/开放获取)、链接、作者、领域标签、研究内容简述、摘要关键点
4. 智能检索策略:内置结果质量检查机制,自动触发多轮检索与跨源补充,避免信息遗漏
显著优点
- 数据源互补:arXiv 覆盖最新预印本,Semantic Scholar 覆盖正式发表文献与引用数据,双源交叉验证
- 引用网络分析:可直接扩展被引文献或参考文献,适合文献综述与影响力追踪
- 开放获取识别:自动标注 PDF 可用性,降低获取成本
- 输出规范严格:固定格式模板,便于后续整理或导入文献管理工具
- 作者级分析:支持按作者 ID 拉取完整发文轨迹,便于学术画像构建
潜在局限
- API 依赖性强:Semantic Scholar 需申请 API Key,存在速率限制(默认 100 请求/5分钟)
- arXiv 无引用数据:仅能获取预印本元数据,无法直接分析其学术影响力
- 覆盖盲区:部分人文社科、非英语文献收录不全
- TL;DR 质量参差:Semantic Scholar 自动生成的 TL;DR 可能存在偏差,需人工复核
- 无全文分析能力:不支持 PDF 内容解析,仅能处理摘要级信息
适合人群
- 计算机科学、人工智能、物理学、数学等 arXiv 重度使用领域的科研人员
- 需要快速追踪特定作者或研究主题发文学术动态的用户
- 撰写文献综述、需要批量获取结构化文献信息的研究生与学者
- 对开放获取有偏好、希望降低文献获取成本的研究者
常规风险
- API 配额耗尽:Semantic Scholar 免费层级有请求上限,高频检索可能触发 429 错误
- 检索结果漂移:跨源检索时因收录范围差异,可能出现同一主题结果集不一致
- 元数据缺失:早期文献或冷门领域可能存在摘要、TL;DR、引用数等字段缺失
- 时间精度问题:预印本提交时间与正式发表时间可能存在显著差异,需注意区分
- 自动推断风险:技能文档明确要求"严禁基于 abstract/TL;DR 之外臆测",但实际执行中若偏离此约束,可能产生幻觉式总结