核心用法
scholar-search 是一款面向学术研究的统一检索技能,通过单一脚本封装 arXiv 预印本库与 Semantic Scholar 学术图谱 API,覆盖论文检索、详情拉取、引用网络扩展与作者轨迹分析四大场景。
典型工作流:
1. 需求解析 → 提取查询实体(关键词/paper_id/author_id/DOI/arXiv ID)、时间过滤(year/venue)、规模目标与输出语言偏好
2. 引擎选择 → arXiv 适合追踪最新预印本(sortBy=submittedDate),Semantic Scholar 适合高影响力论文检索与引用分析(带 citationCount 排序)
3. 联合检索 → 通过 scripts/scholar-search.py 执行参数化查询,支持 ID 精确拉取、分页、字段白名单过滤
4. 质量检查 → 基于相关性分层(高/中/弱)、去重率与引用数阈值判定是否继续检索(最多 3 轮)
5. 结构化输出 → 严格按固定格式输出:论文标题、TL;DR、元数据(来源/日期/引用数/开放获取)、链接、作者、领域、研究内容摘要、关键点提取
显著优点:
- 双源互补:arXiv 覆盖最新预印本,Semantic Scholar 提供权威引用数据与作者图谱
- 结构化输出:强制字段校验,避免信息缺失,直接可用于文献综述
- 灵活过滤:支持时间区间、会议期刊、引用阈值、学科分类等多维约束
- 引用网络:可沿
citations/references端点扩展,追踪学术影响力传播
潜在局限:
- API 依赖:Semantic Scholar 需
S2_API_KEY,存在速率限制(429)与配额风险;arXiv 限流 3秒/请求 - 字段覆盖不均:部分预印本无 TL;DR,旧论文可能缺失 PDF 链接
- 语义匹配限制:相关性分层基于标题/摘要匹配,无深层语义模型支撑
- 中文支持有限:论文元数据多为英文,输出语言控制仅影响分析描述
适合人群:
- 科研人员快速扫描领域前沿
- 学生撰写文献综述需批量获取规范格式论文信息
- 需要追踪特定作者研究轨迹或某篇论文引用网络的用户
常规风险:
- 配额耗尽:Semantic Scholar 免费 tier 有请求上限,高频率检索易触发 429
- 结果漂移:query 改写或跨源补充可能引入相关性下降论文
- 预印本质量参差:arXiv 未经同行评审,需额外甄别研究可靠性