核心用法
Scholar Search Skills 是一套面向学术研究者的自动化文献调研工具链,支持从 arXiv、ICLR、ICML、NeurIPS 等权威来源搜索、筛选、下载论文,并自动生成结构化摘要与 BibTeX 引用。用户通过提供研究主题与英文关键词即可触发完整工作流:创建标准化目录结构 → 多源检索(优先 arxiv-search,备选 web_fetch)→ PDF 批量下载 → 使用 docling 提取标题、摘要、方法、实验结果等结构化信息 → 基于模糊匹配与 TF-IDF 算法计算相关性分数 → 生成 PAPER_LIST.md、PAPER_SUMMARIES.md、references.bib 及文献综述大纲。
显著优点
- 来源权威性高:直接对接 arXiv 及顶级机器学习会议(ICLR/ICML/NeurIPS),预印本与正式发表兼顾
- 自动化程度高:从搜索到引用生成全流程自动化,内置关键词相关性评分脚本(score_papers.py),支持加权自定义
- 结构化输出规范:标准化 Markdown 表格、BibTeX 引用、文献综述框架,便于后续学术写作
- 增量更新机制:支持在现有文献库基础上仅搜索新增论文,避免重复劳动
潜在缺点与局限性
- 版权边界模糊:仅声明"用于研究",未明确处理出版社版权限制(如 ACM/IEEE 付费论文)
- Google Scholar 依赖 web_fetch:引用追踪功能依赖非 API 方式访问 Google Scholar,存在反爬限制与稳定性风险
- docling 依赖外部安装:需通过 npx 动态安装,环境依赖管理复杂度增加
- 评分算法局限:TF-IDF+模糊匹配对跨语义相似度(如 synonymy)识别能力有限,可能漏检相关文献
适合人群
- 需快速完成文献综述的研究生与科研人员
- 关注 AI/ML 领域前沿进展的技术团队
- 需批量管理 BibTeX 引用的 LaTeX 论文作者
常规风险
- 合规风险:大规模下载 arXiv PDF 需遵守其 Terms of Use,高频请求可能导致 IP 受限
- 数据质量风险:预印本未经同行评审,实验结果可能存在可复现性问题
- 工具链耦合风险:arxiv-search、docling 等依赖技能若失效,主功能将降级为手动模式