核心功能
thu-thesis 是一款专为清华大学学位论文设计的格式转换与规范化工具,解决 Word 文档向符合 thuthesis 官方 LaTeX 模板标准 PDF 转换的痛点。
核心用法:通过三层 AI-native 流程实现全自动转换——机械提取层(python-docx 解析文档骨架)→ AI 理解层(识别章节结构、摘要范围、参考文献位置)→ Python 组装层(生成 parsed JSON 并渲染 LaTeX)。用户仅需执行 extract 和 build 两条命令,即可获得完整编译的 PDF 及 LaTeX 工程。
显著优点:
- 权威性保障:严格遵循 thuthesis.cls 官方模板,所有格式决策以
assets/databk/中的官方示例为黄金标准,不擅自"改进"格式 - 智能参考文献处理:自动生成 BibTeX,支持数字引用转
\cite,首创 author-year 行文引用自动补全(如"张三(2024)"自动关联\cite{zhang2024}) - 图表完整提取:普通图片、Office 图表对象(matplotlib 重绘)、三线表格式自动转换,生成插图/附表清单
- 缩略语智能管理:自动生成符号说明表,检测"孤儿缩略语"并自动在正文首次出现处补写全称
- 评测驱动修复:38 项 Rubric 评测体系,编译后自动识别可修复问题并循环优化(最多 3 次)
潜在局限:
- SVG 图片暂不支持直接转换
- committee/comments/resolution 等答辩后内容需手工填写占位
- 旧版
.doc格式需预先转换为.docx - Author-year 引用匹配依赖姓名简称规则,复杂情况可能匹配失败
- 表格/图片无 caption 时无法无中生有(Word 原文限制)
适合人群:清华大学 MBA、学术硕士、专业硕士等所有学位论文撰写者,尤其适用于需快速规范化格式、已有 Word 草稿需转为官方 PDF 模板的场景。
常规风险:依赖 TeX Live 环境,首次使用需从 GitHub 克隆 thuthesis;Python 脚本不调用 LLM,AI 仅在"阅读理解"步骤介入,降低了 API 成本与延迟,但要求用户环境具备完整 LaTeX 编译链。