核心用法
Paper Fetcher 是一款针对学术研究的自动化文献获取工具,通过 Sci-Hub 平台实现开放获取(Open Access)论文的批量下载。用户仅需提供 DOI(数字对象标识符),工具即可自动完成:解析 DOI 格式 → 访问 Sci-Hub 镜像站点 → 定位 PDF 下载链接 → 保存至标准化目录。支持单篇与批量模式,文件名自动清理(将 DOI 中的斜杠替换为下划线),输出路径固定为 workspace/research/papers/。
显著优点
1. 零配置门槛:无需 API 密钥或机构订阅,直接利用 Sci-Hub 的公开资源池
2. 批量处理效率:可同时提交多个 DOI,适合系统综述或文献计量研究的前期数据收集
3. 结构化归档:自动命名与目录管理,便于与 Obsidian 等知识库工具联动
4. 格式容错性:兼容 https://doi.org/ 前缀有无两种 DOI 写法
潜在缺点与局限性
- 法律与合规风险:Sci-Hub 的运营在多数司法管辖区存在版权争议,使用者可能面临:出版商 DMCA 通知、机构网络封禁、部分地区法律追责
- 单点故障依赖:硬编码单一 Sci-Hub 镜像域名(sci-hub.su),该域名可能随时被封禁或更换,导致服务中断
- 无元数据抓取:仅下载 PDF,不提取标题、作者、摘要等结构化信息,需额外工具处理
- 无去重机制:重复 DOI 会产生覆盖或冗余文件
- 缺乏访问控制:下载内容未做版权状态校验,可能误下载非 OA 论文
适合人群
- 个人研究者:无机构订阅访问权限的独立学者、自由职业科研人员
- 文献管理者:需要快速建立本地 PDF 库的知识工作者
- 教育场景:发展中国家资源受限的教学机构(需充分告知法律风险)
常规风险
| 风险类别 | 具体描述 | 缓解建议 |
|---------|---------|---------|
| 版权侵权 | 下载受版权保护的非 OA 论文 | 优先使用 Unpaywall、PubMed Central 等合法渠道 |
| 域名失效 | Sci-Hub 镜像频繁更换 | 实现域名轮询或提供手动备用配置 |
| 恶意文件 | PDF 载体可能被植入漏洞利用代码 | 下载后使用隔离环境或 PDF 沙箱扫描 |
| 隐私泄露 | DOI 查询可能记录用户 IP 与研究兴趣 | 配合 VPN/Tor 使用,避免敏感领域直接查询 |
建议改进方向:增加 --check-oa 模式优先查询合法 OA 版本,集成 DOI 元数据补全,支持用户自定义 Sci-Hub 镜像列表。