arxivkb

🧪 本地 arXiv 论文语义知识库

本地 arXiv 论文知识库,基于 Ollama 嵌入与 FAISS 实现全文语义检索,无需云 API 密钥,适合科研人员离线管理学术文献。

收藏
4.9k
安装
1.3k
版本
1.0.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

ArXivKB 是一款完全本地运行的学术文献管理工具,专为需要离线检索 arXiv 论文的研究者设计。系统通过 arXiv 官方 API 抓取指定类别的论文元数据与 PDF 全文,利用 Ollama 本地嵌入模型(nomic-embed-text)将论文内容转换为 768 维向量,并存储于 FAISS 索引与 SQLite 数据库中,实现基于语义的内容检索而非仅依赖标题或摘要关键词。

显著优点

  • 零云成本:无需 OpenAI、Anthropic 等第三方 API 密钥,完全依赖本地 Ollama 服务与开源工具链
  • 全文语义检索:突破传统基于元数据的搜索限制,FAISS 索引 PDF 分块内容,支持"找论文讲什么"而非"论文标题含什么"
  • 官方分类体系:内置 155 个 arXiv 官方类别代码,支持按学科群组(cs、q-bio、stat 等)精细化订阅
  • 自动化工作流:支持定时抓取、PDF 自动清理、分块过期管理,降低存储负担
  • 开源透明:Python 实现,数据存储于本地 SQLite + FAISS,用户完全掌控数据主权

潜在局限

  • 硬件依赖:Ollama 嵌入需本地 GPU/CPU 推理,大规模论文库(万级以上)对内存与磁盘 I/O 要求较高
  • 仅支持 arXiv:无法扩展至 IEEE、ACM、PubMed 等其他学术数据库
  • 无多模态能力:不支持论文图表、公式的向量化检索
  • 维护成本:需自行管理 Python 环境、Ollama 服务及数据备份

适合人群

  • 注重数据隐私、需在离线环境工作的 AI/ML 研究人员
  • 希望构建个人文献知识库、避免商业订阅成本的研究生与博士生
  • 需要语义检索但预算有限的中小型研究团队

常规风险

  • 嵌入模型质量直接决定检索效果,nomic-embed-text 在部分专业领域(如医学、法律)表现可能弱于商业模型
  • PDF 解析依赖 pdfplumber,复杂排版论文可能出现分块错位
  • 默认 90 天过期策略可能导致重要历史文献被误删,需根据研究周期调整
  • 无内置访问控制,多用户共享环境需注意文件权限配置

arxivkb 内容

scripts文件夹
手动下载zip · 25.0 kB
arxiv_crawler.pytext/plain
请选择文件