Arxiv Batch Reporter

📊 批量论文报告自动化生成器

自动化批量生成 ArXiv 论文集合报告,通过模板+数据注入分离模型与脚本职责,确保结论文本零改写、可复现。

收藏
5.1k
安装
1.6k
版本
0.1.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

arxiv-batch-reporter 是 ArXiv 论文分析工作流中的终态报告生成器,采用「模型写结构、脚本填数据」的分层架构:

1. 模板阶段:LLM 根据 references/report-format.md 撰写 collection_report_template.md,使用 {{ARXIV_BRIEF:2602.12276}} 占位符标记每篇论文位置
2. 注入阶段:Python 脚本 render_collection_report.py 从各论文的 summary.md 中提取 ## 10. Brief Conclusion 内容及 abs URL,替换占位符生成最终报告

关键命令链:

# 聚合所有论文摘要为模型上下文
python3 scripts/collect_summaries_bundle.py --base-dir /path/to/run-dir --language English
# 模型撰写模板后,执行渲染
python3 scripts/render_collection_report.py --base-dir ... --template-file ... --output-file ...

支持多语言(English/Chinese/zh/...),自动本地化标签与提示词。

显著优点

  • 严格的数据完整性约束:通过「占位符+脚本注入」机制,彻底杜绝模型对原始论文结论的幻觉改写或语义漂移,满足科研审计要求
  • 清晰的责任分离:模型专注于叙事结构与学术评价,脚本负责精确的数据搬运,降低复合错误概率
  • 可复现流水线:模板文件可版本控制、人工审核后再渲染,支持报告生成的二次校验
  • 灵活的回退机制:若 ## 10. Brief Conclusion 缺失,自动取用最后一个 ## 标题下的内容,增强容错性

潜在缺点与局限性

  • 前置依赖严格:要求 arxiv-paper-processor 已生成标准化的 summary.md,且必须包含第 10 节,否则触发回退可能引入非预期内容
  • 占位符语法刚性:仅支持独立一行的 {{ARXIV_BRIEF:<id>}} 格式,任何排版偏差(如多余空格、嵌套 markdown)将导致注入失败
  • 单语言批次处理--language 参数需手动指定,同一批次无法混合多语言论文的报告生成
  • 无实时重试机制:若某论文 summary.md 损坏或 ID 不匹配,渲染将中断或产生空内容,需人工排查

适合人群

  • 需要批量产出结构化文献综述的科研人员、技术调研团队
  • 运行 arxiv-summarizer-orchestrator 完整工作流的用户(本 skill 为其子组件)
  • 结论文本准确性有强一致性要求的场景(如政策参考报告、投资决策文档)

常规风险

  • 数据溯源风险:脚本注入环节若遭遇文件系统篡改或中间人攻击,可能植入错误 URL 或结论文本
  • 模板注入漏洞:占位符语法未来若扩展表达式能力,需防范命令注入(当前版本仅支持固定前缀的 ID 替换,风险可控)
  • 版本漂移references/report-format.md 或示例文件更新后,旧模板可能不再符合最新格式规范,建议锁定引用版本

Arxiv Batch Reporter 内容

agents文件夹
references文件夹
scripts文件夹
手动下载zip · 13.9 kB
openai.yamltext/plain
请选择文件