Document Workflow

📄 学术论文一键式搜索·下载·摘要工作流

一键式学术论文研究工作流,支持从搜索、下载到结构化摘要的完整流程,Tavily与Semantic Scholar双源检索确保文献获取率。

收藏
2.8k
安装
1.2k
版本
1.0.3
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

Document Workflow 是一套面向学术研究者的自动化文献处理工具链,实现「搜索→下载→提取→摘要」全链路闭环。

搜索层:默认调用 Tavily 检索 arXiv 文献(PDF 可用率约 100%),失败时自动回退至 Semantic Scholar(元数据更丰富,但 PDF 可用率约 30%)。支持按年份、引用量筛选。

下载层:支持从搜索结果管道输入或直接 URL 下载,自动按主题归档并生成 metadata.json,默认 120 秒超时保护。

提取层:PDF 文本按页分块提取(默认 10 页/块),避免大文件超出上下文窗口,输出 JSON 格式便于跨会话复用。

摘要层:基于结构化 Schema 生成学术摘要,涵盖任务定义(领域、问题、贡献)、实验设置(数据集、基线、指标、结果)等关键字段,可直接用于文献综述。

一键工作流research.py 脚本串联全流程,单条命令完成从关键词到结构化摘要的输出。

显著优点

  • 高可用性:Tavily 优先策略确保几乎 100% 的 PDF 获取率,解决学术搜索的「有元数据无全文」痛点
  • 模块化设计:四个子命令可独立调用,灵活适配不同场景(仅搜索、仅下载、仅摘要)
  • 学术友好:结构化输出 Schema 专为论文综述设计,自动对比「本文方法 vs 最佳基线」
  • 跨平台:Windows 路径兼容,支持 UTF-8 编码修复

潜在局限

  • 依赖外部 API:Tavily 和 Semantic Scholar 的稳定性与速率限制影响大批量任务
  • PDF 解析质量:扫描版 PDF 或复杂排版可能导致提取乱码
  • 摘要深度依赖 LLM:结构化摘要的质量受底层模型能力制约,公式、图表无法直接解析
  • Windows 默认路径C:\Users\Lenovo\Desktop\papers 为硬编码默认值,Linux/Mac 用户需显式指定

适合人群

  • 需要快速批量获取最新论文的研究生与科研人员
  • 构建文献综述知识库的学术团队
  • 自动化科研信息收集的 AI Agent 开发者

常规风险

  • 版权合规:批量下载需遵守 arXiv 及出版商的合理使用政策
  • API 密钥泄露SEMANTIC_SCHOLAR_API_KEY 若硬编码存在泄露风险
  • 存储管理:默认不清理中间文件,长期运行可能累积大量 PDF 与 JSON

Document Workflow 内容

references文件夹
scripts文件夹
手动下载zip · 16.5 kB
output_schema.jsonapplication/json
请选择文件