arXiv Source Reader

📄 AI学术研究的论文解析利器

从arXiv直接获取论文LaTeX源文件,智能解析摘要、章节结构与全文内容,助力AI驱动的学术研究

收藏
4.9k
安装
1.1k
版本
1.0.4
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

arxiv-reader是一款专为学术研究设计的论文获取与解析工具,支持直接从arXiv数字图书馆下载论文的LaTeX源代码,并将其转换为干净、结构化的文本格式,便于大型语言模型(LLM)进行深度分析。

显著优点

1. 双模式架构:默认独立模式(Standalone)仅依赖Node.js内置功能,无需Docker或Python环境即可运行;容器模式(Container)则可对接专用服务端口(8082)以提升处理速度,灵活适应不同部署场景。

2. 三层递进式阅读:提供arxiv_abstract(快速获取摘要)、arxiv_sections(浏览章节结构)、arxiv_fetch(完整拉取全文)三种工具,支持研究者按需分层探索论文内容。

3. 智能LaTeX处理:自动扁平化LaTeX文件包含关系,支持可选移除注释、附录及将图表替换为路径标记,输出纯净文本以减少Token消耗并提升LLM理解效率。

4. 本地缓存机制:独立模式缓存于~/.cache/arxiv-reader/,容器模式缓存于/workspace/.cache/arxiv/,重复访问可实现瞬时响应,显著优化研究效率。

潜在局限

  • 首载延迟:大型论文(如百页综述)首次获取可能需要10-30秒,虽可接受但影响即时体验。
  • 版本敏感性:虽支持版本后缀(如v2),但未明确处理版本差异对比功能。
  • LaTeX依赖:若论文源码存在非标准宏包或编译错误,解析质量可能下降。
  • 离线限制:无本地镜像时需联网访问arXiv服务器,网络不稳定时可用性受限。

适合人群

  • AI/ML研究者:需批量获取预印本论文进行文献综述或模型训练数据准备
  • 学术写作辅助:快速提取参考文献结构或对比多论文方法论章节
  • 科研机构:构建私有论文知识库,结合LLM实现智能问答系统

常规风险

  • 内容准确性:arXiv预印本未经同行评审,结论可能存在争议或错误,不宜直接作为最终权威来源引用。
  • 版权合规:arXiv论文通常遵循开放获取协议,但商业大规模爬取仍需遵守其使用条款
  • 缓存隐私:本地缓存可能包含敏感研究方向的论文痕迹,共享环境需关注数据隔离。

arXiv Source Reader 内容

手动下载zip · 1.5 kB
SKILL.mdtext/markdown
请选择文件