arxivkb

📚 本地 arXiv 论文库,语义搜索零成本

本地 arXiv 论文管理工具,支持语义搜索、PDF 全文索引,完全离线运行无需云 API

收藏
2.6k
安装
1.3k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

ArXivKB 评估报告

核心用法

ArXivKB 是一款面向学术研究者的本地 arXiv 论文管理工具,通过 CLI 工具链实现论文的自动化采集、存储与语义检索。用户通过 akb categories add 订阅感兴趣的 arXiv 学科分类(共 155 个官方分类),系统定期爬取新增论文 PDF,使用 pdfplumber 提取正文文本,经 tiktoken 分块(500 tokens,50 token 重叠)后,通过 Ollama 本地部署的 nomic-embed-text 模型生成 768 维向量,最终写入 FAISS 向量索引与 SQLite 关系数据库。检索时支持语义相似度搜索,返回包含匹配片段的论文列表。

显著优点

  • 完全本地化:零云 API 依赖,数据存储于 ~/workspace/arxivkb,无订阅成本与隐私泄露风险
  • 全文语义检索:区别于仅索引摘要的工具,FAISS 索引覆盖 PDF 正文内容,召回率更高
  • 官方分类体系:内置 155 个 arXiv 学科分类,支持按学科精准订阅
  • 自动化运维:支持 --dry-run 预览、--days 参数控制回溯窗口、expire 命令自动清理过期论文
  • 配套生态完善:提供 PWA Dashboard 可视化界面,支持翻译、在线 PDF 阅读

潜在缺点与局限性

  • 硬件门槛:FAISS CPU 索引 + Ollama 嵌入模型需持续占用内存,大规模数据集会显著消耗本地资源
  • 索引延迟:新论文需完整执行下载→提取→嵌入流程,实时性不及直接访问 arXiv API
  • 模型锁定:强制使用 nomic-embed-text,无法切换其他嵌入方案
  • 单节点架构:无分布式支持,多设备同步需手动处理数据目录
  • 英文内容为主:翻译功能依赖外部 LLM 调用,非本地能力

适合人群

  • 关注数据隐私、希望完全离线管理文献的研究人员
  • 需要跨论文全文检索而非仅标题/摘要匹配的深度阅读者
  • 已部署 Ollama 本地推理环境的 AI/ML 从业者
  • 拥有充足本地存储与计算资源的个人学术工作者

常规风险

  • 存储膨胀:PDF 原文 + 向量索引 + 文本块多重存储,长期运行可能占用数十 GB 磁盘
  • 依赖稳定性:Ollama 服务中断将导致嵌入流程失败,需监控本地服务状态
  • FAISS 兼容性:CPU 版 FAISS 在部分 Linux 发行版存在编译依赖问题
  • 版权合规:自动下载 arXiv 论文需遵守 arXiv 机器人访问政策,高频爬取可能触发 IP 限制

arxivkb 内容

scripts文件夹
手动下载zip · 23.7 kB
arxiv_crawler.pytext/plain
请选择文件