核心功能
ArXivKB 是一款完全本地运行的学术文献管理工具,专为需要离线检索 arXiv 论文的研究者设计。系统通过 arXiv 官方 API 抓取指定类别的论文元数据与 PDF 全文,利用 Ollama 本地嵌入模型(nomic-embed-text)将论文内容转换为 768 维向量,并存储于 FAISS 索引与 SQLite 数据库中,实现基于语义的内容检索而非仅依赖标题或摘要关键词。
显著优点
- 零云成本:无需 OpenAI、Anthropic 等第三方 API 密钥,完全依赖本地 Ollama 服务与开源工具链
- 全文语义检索:突破传统基于元数据的搜索限制,FAISS 索引 PDF 分块内容,支持"找论文讲什么"而非"论文标题含什么"
- 官方分类体系:内置 155 个 arXiv 官方类别代码,支持按学科群组(cs、q-bio、stat 等)精细化订阅
- 自动化工作流:支持定时抓取、PDF 自动清理、分块过期管理,降低存储负担
- 开源透明:Python 实现,数据存储于本地 SQLite + FAISS,用户完全掌控数据主权
潜在局限
- 硬件依赖:Ollama 嵌入需本地 GPU/CPU 推理,大规模论文库(万级以上)对内存与磁盘 I/O 要求较高
- 仅支持 arXiv:无法扩展至 IEEE、ACM、PubMed 等其他学术数据库
- 无多模态能力:不支持论文图表、公式的向量化检索
- 维护成本:需自行管理 Python 环境、Ollama 服务及数据备份
适合人群
- 注重数据隐私、需在离线环境工作的 AI/ML 研究人员
- 希望构建个人文献知识库、避免商业订阅成本的研究生与博士生
- 需要语义检索但预算有限的中小型研究团队
常规风险
- 嵌入模型质量直接决定检索效果,nomic-embed-text 在部分专业领域(如医学、法律)表现可能弱于商业模型
- PDF 解析依赖 pdfplumber,复杂排版论文可能出现分块错位
- 默认 90 天过期策略可能导致重要历史文献被误删,需根据研究周期调整
- 无内置访问控制,多用户共享环境需注意文件权限配置