核心用法
arxiv-batch-reporter 是 ArXiv 论文分析工作流中的终态报告生成器,采用「模型写结构、脚本填数据」的分层架构:
1. 模板阶段:LLM 根据 references/report-format.md 撰写 collection_report_template.md,使用 {{ARXIV_BRIEF:2602.12276}} 占位符标记每篇论文位置
2. 注入阶段:Python 脚本 render_collection_report.py 从各论文的 summary.md 中提取 ## 10. Brief Conclusion 内容及 abs URL,替换占位符生成最终报告
关键命令链:
# 聚合所有论文摘要为模型上下文 python3 scripts/collect_summaries_bundle.py --base-dir /path/to/run-dir --language English # 模型撰写模板后,执行渲染 python3 scripts/render_collection_report.py --base-dir ... --template-file ... --output-file ...
支持多语言(English/Chinese/zh/...),自动本地化标签与提示词。
显著优点
- 严格的数据完整性约束:通过「占位符+脚本注入」机制,彻底杜绝模型对原始论文结论的幻觉改写或语义漂移,满足科研审计要求
- 清晰的责任分离:模型专注于叙事结构与学术评价,脚本负责精确的数据搬运,降低复合错误概率
- 可复现流水线:模板文件可版本控制、人工审核后再渲染,支持报告生成的二次校验
- 灵活的回退机制:若
## 10. Brief Conclusion缺失,自动取用最后一个##标题下的内容,增强容错性
潜在缺点与局限性
- 前置依赖严格:要求
arxiv-paper-processor已生成标准化的summary.md,且必须包含第 10 节,否则触发回退可能引入非预期内容 - 占位符语法刚性:仅支持独立一行的
{{ARXIV_BRIEF:<id>}}格式,任何排版偏差(如多余空格、嵌套 markdown)将导致注入失败 - 单语言批次处理:
--language参数需手动指定,同一批次无法混合多语言论文的报告生成 - 无实时重试机制:若某论文
summary.md损坏或 ID 不匹配,渲染将中断或产生空内容,需人工排查
适合人群
- 需要批量产出结构化文献综述的科研人员、技术调研团队
- 运行
arxiv-summarizer-orchestrator完整工作流的用户(本 skill 为其子组件) - 对结论文本准确性有强一致性要求的场景(如政策参考报告、投资决策文档)
常规风险
- 数据溯源风险:脚本注入环节若遭遇文件系统篡改或中间人攻击,可能植入错误 URL 或结论文本
- 模板注入漏洞:占位符语法未来若扩展表达式能力,需防范命令注入(当前版本仅支持固定前缀的 ID 替换,风险可控)
- 版本漂移:
references/report-format.md或示例文件更新后,旧模板可能不再符合最新格式规范,建议锁定引用版本