large-document-reader

📚 长文档智能拆解与知识库构建

智能拆分长文档为章节,生成结构化JSON摘要并构建全局索引,突破上下文窗口限制,实现"概览+按需深入"的高效AI阅读工作流。

收藏
2.5k
安装
1.1k
版本
1.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Large Document Reader 是一套专为突破大语言模型上下文窗口限制而设计的文档处理系统。其核心工作流分为三个阶段:智能拆分摘要生成与结构化全局索引构建

Phase 1:智能拆分 —— 自动分析文档的标题层级(#、##、1.、1.1等)识别章节边界,将长文档拆分为独立的纯文本文件,按 {序号}_{章节标题}.md 命名规范存储于 ./chapters/ 目录。

Phase 2:摘要生成 —— 为每个章节生成机器可读的JSON摘要,包含章节ID、标题、200-300字核心摘要、关键词、关键要点及相关章节引用,存储于 ./summaries/ 目录。

Phase 3:全局索引 —— 聚合所有JSON摘要,生成 MASTER_INDEX.md 导航文件,提供鸟瞰式概览,支持快速定位与跨章节查询。

显著优点

1. 突破上下文限制:通过"摘要+按需加载"机制,使超长文档(书籍、论文、技术报告)可被当前上下文受限的AI有效处理
2. 结构化知识库:JSON格式的标准化摘要便于机器解析、检索和后续分析

3. 双模式查询:支持全局概览(MASTER_INDEX.md)与深度钻取(单章节文件)两种查询场景

4. 可复用架构:生成的文件系统可作为持久的、可查询的知识库重复使用

潜在局限

  • 自动章节识别依赖文档格式的规范性,扫描版PDF或非结构化文本可能需预处理
  • JSON字段固定,对高度专业化文档(如法律文书、医学病历)可能需要自定义扩展
  • 摘要质量受底层模型能力制约,复杂论证结构可能出现要点遗漏

适合人群

  • 研究人员处理长篇学术论文或技术文档
  • 知识管理需求者构建可检索的个人/企业知识库
  • 需要AI辅助阅读书籍、报告、手册等长文本的用户
  • 开发RAG(检索增强生成)系统的工程师

常规风险

  • 数据隐私:处理敏感文档时需确保本地执行环境安全
  • 摘要偏差:自动生成的摘要可能反映模型偏见或理解偏差,关键决策场景建议人工复核
  • 版本管理:文档更新后需重新执行完整工作流以保持一致性

large-document-reader 内容

scripts文件夹
手动下载zip · 5.7 kB
extract_chapters.pytext/plain
请选择文件