核心功能
Document Workflow 是一套面向学术研究者的自动化文献处理工具链,实现「搜索→下载→提取→摘要」全链路闭环。
搜索层:默认调用 Tavily 检索 arXiv 文献(PDF 可用率约 100%),失败时自动回退至 Semantic Scholar(元数据更丰富,但 PDF 可用率约 30%)。支持按年份、引用量筛选。
下载层:支持从搜索结果管道输入或直接 URL 下载,自动按主题归档并生成 metadata.json,默认 120 秒超时保护。
提取层:PDF 文本按页分块提取(默认 10 页/块),避免大文件超出上下文窗口,输出 JSON 格式便于跨会话复用。
摘要层:基于结构化 Schema 生成学术摘要,涵盖任务定义(领域、问题、贡献)、实验设置(数据集、基线、指标、结果)等关键字段,可直接用于文献综述。
一键工作流:research.py 脚本串联全流程,单条命令完成从关键词到结构化摘要的输出。
显著优点
- 高可用性:Tavily 优先策略确保几乎 100% 的 PDF 获取率,解决学术搜索的「有元数据无全文」痛点
- 模块化设计:四个子命令可独立调用,灵活适配不同场景(仅搜索、仅下载、仅摘要)
- 学术友好:结构化输出 Schema 专为论文综述设计,自动对比「本文方法 vs 最佳基线」
- 跨平台:Windows 路径兼容,支持 UTF-8 编码修复
潜在局限
- 依赖外部 API:Tavily 和 Semantic Scholar 的稳定性与速率限制影响大批量任务
- PDF 解析质量:扫描版 PDF 或复杂排版可能导致提取乱码
- 摘要深度依赖 LLM:结构化摘要的质量受底层模型能力制约,公式、图表无法直接解析
- Windows 默认路径:
C:\Users\Lenovo\Desktop\papers为硬编码默认值,Linux/Mac 用户需显式指定
适合人群
- 需要快速批量获取最新论文的研究生与科研人员
- 构建文献综述知识库的学术团队
- 自动化科研信息收集的 AI Agent 开发者
常规风险
- 版权合规:批量下载需遵守 arXiv 及出版商的合理使用政策
- API 密钥泄露:
SEMANTIC_SCHOLAR_API_KEY若硬编码存在泄露风险 - 存储管理:默认不清理中间文件,长期运行可能累积大量 PDF 与 JSON