Douyin Video Transcribe

🎬 抖音视频一键转录与智能分析

抖音视频转录套件,支持链接抓取、Whisper语音转写、智能内容分析,适合播客整理与资料归档

收藏
4.4k
安装
1k
版本
2.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

douyin-transcribe 是一套面向抖音(Douyin/TikTok 中国版)视频的完整转录解决方案,通过浏览器 DOM 提取、ffmpeg 音频处理和 Whisper ASR 模型,实现从视频链接到结构化文本的全自动 workflow。

标准工作流程
1. 输入识别 — 自动区分视频链接(/video/)、图文笔记(/note/)、本地文件或纯文本

2. 视频获取 — 解析短链 → 浏览器打开 → 通过 Performance API 提取 CDN 直链 → curl 下载(需 Referer 头防 403)

3. 音频提取 — ffmpeg 转码为 16kHz 单声道 PCM,支持 MP4/DASH 格式合并

4. 语音转写 — 调用 Docker 化的 Whisper 服务(推荐 small 模型,466MB,3 分钟处理 5 分钟视频)或本地 Python 运行

5. 内容分析 — 自动纠错、分段、提取要点、生成标签

6. 输出保存 — Markdown 格式,含标题、作者、摘要、正文、要点、标签

技术亮点:采用浏览器 DOM 提取而非逆向破解,规避反爬风险;模块化架构支持单独调用 fetcher/transcriber/analyzer。

显著优点

  • 全流程自动化:从短链到结构化文档,无需手动下载 App
  • 多格式兼容:视频、图文笔记、本地文件统一处理
  • 模型可配置:tiny/base/small/medium 四级精度,平衡速度与准确率
  • Docker 化部署:一键启动 Whisper 服务,隔离依赖环境
  • 合规提取:通过浏览器 Performance API 获取资源,非协议破解

潜在局限

  • 时效性依赖:CDN 直链易过期,失败需重新抓取
  • 平台限制:仅支持抖音,其他平台需 yt-dlp 扩展
  • 性能瓶颈:CPU 转录 10 分钟视频需 15-20 分钟,无 GPU 加速方案
  • 图文笔记:仅快照提取,无 OCR 文字识别能力
  • 直播不支持:仅限点播视频

适合人群

  • 播客/知识类视频创作者的内容归档
  • 研究人员采集短视频口述资料
  • 自媒体运营者批量整理竞品账号内容
  • 需要中文语音转写且重视隐私(本地部署)的用户

常规风险

  • 反爬对抗:抖音 CDN 可能封禁 IP,建议控制请求频率
  • 版权合规:转录内容仅限个人学习研究,禁止商用分发
  • 模型幻觉:Whisper 可能产生幻听字幕,需人工校对关键信息
  • 浏览器依赖:需 OpenClaw 浏览器 profile,环境配置较复杂
  • 存储占用:medium 模型 1.5GB,长视频临时文件可能达数 GB

Douyin Video Transcribe 内容

scripts文件夹
手动下载zip · 11.5 kB
transcriber.pytext/plain
请选择文件