thu-thesis

📜 清华论文 Word 一键转官方 PDF

清华毕业论文 Word 转 PDF 自动化工具,一键提取章节、图表、参考文献并生成符合官方 LaTeX 模板规范的 PDF,支持 MBA/学硕/专硕全学位类型。

收藏
6k
安装
1.2k
版本
1.6.0
CLS 安全性认证2026-08-03
点击查看完整报告 >

使用说明

核心功能

thu-thesis 是一款专为清华大学学位论文设计的格式转换与规范化工具,解决 Word 文档向符合 thuthesis 官方 LaTeX 模板标准 PDF 转换的痛点。

核心用法:通过三层 AI-native 流程实现全自动转换——机械提取层(python-docx 解析文档骨架)→ AI 理解层(识别章节结构、摘要范围、参考文献位置)→ Python 组装层(生成 parsed JSON 并渲染 LaTeX)。用户仅需执行 extractbuild 两条命令,即可获得完整编译的 PDF 及 LaTeX 工程。

显著优点

  • 权威性保障:严格遵循 thuthesis.cls 官方模板,所有格式决策以 assets/databk/ 中的官方示例为黄金标准,不擅自"改进"格式
  • 智能参考文献处理:自动生成 BibTeX,支持数字引用转 \cite,首创 author-year 行文引用自动补全(如"张三(2024)"自动关联 \cite{zhang2024}
  • 图表完整提取:普通图片、Office 图表对象(matplotlib 重绘)、三线表格式自动转换,生成插图/附表清单
  • 缩略语智能管理:自动生成符号说明表,检测"孤儿缩略语"并自动在正文首次出现处补写全称
  • 评测驱动修复:38 项 Rubric 评测体系,编译后自动识别可修复问题并循环优化(最多 3 次)

潜在局限

  • SVG 图片暂不支持直接转换
  • committee/comments/resolution 等答辩后内容需手工填写占位
  • 旧版 .doc 格式需预先转换为 .docx
  • Author-year 引用匹配依赖姓名简称规则,复杂情况可能匹配失败
  • 表格/图片无 caption 时无法无中生有(Word 原文限制)

适合人群:清华大学 MBA、学术硕士、专业硕士等所有学位论文撰写者,尤其适用于需快速规范化格式、已有 Word 草稿需转为官方 PDF 模板的场景。

常规风险:依赖 TeX Live 环境,首次使用需从 GitHub 克隆 thuthesis;Python 脚本不调用 LLM,AI 仅在"阅读理解"步骤介入,降低了 API 成本与延迟,但要求用户环境具备完整 LaTeX 编译链。

安全解读

核心用法

thu-thesis 采用三层 AI-native 架构实现 Word 到 LaTeX/PDF 的自动化转换:第一层通过 extract_raw.py 纯机械提取文档段落、表格、图片等原始数据;第二层由 AI 阅读理解生成结构化骨架 struct.json,识别章节层级、摘要范围、参考文献位置等语义信息;第三层通过 build_parsed.pyrender.py 纯 Python 组装渲染,填充 Jinja2 模板生成完整 LaTeX 项目,最终经 xelatex+bibtex 编译输出 PDF。整个流程中 Python 脚本不调用任何 LLM,AI 仅介入中间的结构理解环节,确保可控性与可复现性。

用户只需一条命令即可完成转换:先执行 extract 生成文档骨架供 AI 阅读,AI 输出 struct.json 后,再执行 build 自动完成组装、渲染、编译及 Rubric 评测。输出路径遵循与原 .docx 同目录的 <原文件名>-latex/ 规范,最终交付含 thesis.pdf 的完整工程目录。

显著优点

权威性保障:严格遵循清华大学官方 thuthesis LaTeX 模板,所有格式决策以 assets/databk/ 中的官方示例为黄金标准,封面、页眉、目录、参考文献样式等均由 thuthesis.cls 自动生成,杜绝人为格式漂移。

智能内容提取:自动识别并提取中英文摘要、章节结构、三线表、图片 caption、致谢、个人简历等完整论文要素;独创缩略语孤儿检测机制,自动在正文首次出现处补写说明,并生成符号清单。

参考文献自动化:Word 原文参考文献列表自动解析为 BibTeX 格式,支持数字编号 [1-3] 与 author-year 行文引用自动补全 ie,未被引用文献通过关键词匹配或 `
ocite` 兜底。

质量闭环评测:内置 38 项 Rubric 评测体系(满分 90 分),涵盖元信息、正文结构、参考文献、图表、缩略语、编译质量六大维度;评测后支持最多 3 轮自动修复循环,无需用户确认即可修复 BibTeX 字段缺失、转义错误等问题。

潜在缺点与局限性

格式依赖严格:仅支持 .docx 格式,旧版 .doc 需预先转换;SVG 图片因 LaTeX 原生支持限制被跳过;committee/comments/resolution 等答辩后内容仍为占位符,需手工填写。

AI 理解边界:章节结构识别依赖 AI 对文档骨架的语义理解,极端复杂的排版或非标准样式可能导致章节划分偏差;author-year 引用匹配失败时会保留原文,需人工核对。

环境依赖较重:需预装完整 TeX Live 环境(xelatex/bibtex),setup.sh 会从 GitHub 拉取 thuthesis 模板,离线环境或网络受限场景需提前准备。

修复能力有限:自动修复仅覆盖工具层问题(如转义、解析逻辑),Word 原文缺失的表格 caption、未引用文献等根源性问题无法无中生有。

适合的目标群体

主要面向清华大学 MBA、学术硕士、专业硕士等学位论文撰写者,尤其适合已用 Word 完成内容写作、需快速转换为规范 PDF 格式的毕业年级学生;同样适用于导师团队批量处理学生论文格式,或图书馆、教务部门进行论文格式预审。对 LaTeX 技术细节不熟悉但需输出符合官方模板标准的用户最为友好。

使用风险

性能风险:大体积 Word 文档(如含大量高清图片)解析时内存占用较高,建议添加文件大小限制或分批处理。

依赖项风险:TeX Live 版本差异可能导致编译行为不一致,建议使用最新稳定版;python-docx、jinja2 等依赖库需及时更新以规避潜在解析 bug。

数据安全:工具仅本地处理文档,不上传敏感内容至第三方;但 GitHub 模板拉取环节需确保网络可信,防止中间人攻击替换模板代码。

结果核验:尽管有 Rubric 评测,最终 PDF 仍需人工核对目录结构、页码连续性、特殊符号显示等细节,尤其关注 AI 可能误判的复杂表格跨页、长公式断行等问题。

thu-thesis 内容

output文件夹
scripts文件夹
手动下载zip · 137.5 kB
parsed_2023211588-黄杰-肖勇波.jsonapplication/json
请选择文件