核心用法
douyin-transcribe 是一套面向抖音(Douyin/TikTok 中国版)视频的完整转录解决方案,通过浏览器 DOM 提取、ffmpeg 音频处理和 Whisper ASR 模型,实现从视频链接到结构化文本的全自动 workflow。
标准工作流程:
1. 输入识别 — 自动区分视频链接(/video/)、图文笔记(/note/)、本地文件或纯文本
2. 视频获取 — 解析短链 → 浏览器打开 → 通过 Performance API 提取 CDN 直链 → curl 下载(需 Referer 头防 403)
3. 音频提取 — ffmpeg 转码为 16kHz 单声道 PCM,支持 MP4/DASH 格式合并
4. 语音转写 — 调用 Docker 化的 Whisper 服务(推荐 small 模型,466MB,3 分钟处理 5 分钟视频)或本地 Python 运行
5. 内容分析 — 自动纠错、分段、提取要点、生成标签
6. 输出保存 — Markdown 格式,含标题、作者、摘要、正文、要点、标签
技术亮点:采用浏览器 DOM 提取而非逆向破解,规避反爬风险;模块化架构支持单独调用 fetcher/transcriber/analyzer。
显著优点
- 全流程自动化:从短链到结构化文档,无需手动下载 App
- 多格式兼容:视频、图文笔记、本地文件统一处理
- 模型可配置:tiny/base/small/medium 四级精度,平衡速度与准确率
- Docker 化部署:一键启动 Whisper 服务,隔离依赖环境
- 合规提取:通过浏览器 Performance API 获取资源,非协议破解
潜在局限
- 时效性依赖:CDN 直链易过期,失败需重新抓取
- 平台限制:仅支持抖音,其他平台需 yt-dlp 扩展
- 性能瓶颈:CPU 转录 10 分钟视频需 15-20 分钟,无 GPU 加速方案
- 图文笔记:仅快照提取,无 OCR 文字识别能力
- 直播不支持:仅限点播视频
适合人群
- 播客/知识类视频创作者的内容归档
- 研究人员采集短视频口述资料
- 自媒体运营者批量整理竞品账号内容
- 需要中文语音转写且重视隐私(本地部署)的用户
常规风险
- 反爬对抗:抖音 CDN 可能封禁 IP,建议控制请求频率
- 版权合规:转录内容仅限个人学习研究,禁止商用分发
- 模型幻觉:Whisper 可能产生幻听字幕,需人工校对关键信息
- 浏览器依赖:需 OpenClaw 浏览器 profile,环境配置较复杂
- 存储占用:medium 模型 1.5GB,长视频临时文件可能达数 GB