Douyin Video Transcribe

🎙️ 抖音视频语音转文字神器

抖音视频语音转文字工具,基于Whisper模型实现高精度中文/英文语音识别,需浏览器配合绕过反爬机制

收藏
3k
安装
1k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

Douyin Transcribe 是一款针对抖音(TikTok 中国版)视频的语音转文字工具,通过浏览器自动化+Whisper AI模型实现视频内容提取。

显著优点

1. 高准确率转录:基于 OpenAI Whisper 开源模型,small 模型在中文场景下识别准确率优秀,支持中英双语自动切换
2. 完整的反爬解决方案:针对抖音严格的反爬虫机制,提供了浏览器渲染→提取CDN直链→Referer伪造的完整链路

3. 跨平台支持:覆盖 Windows/macOS/Linux 三大桌面系统,提供对应平台的命令行指令

4. 灵活输出格式:除纯文本外,自动生成 SRT 字幕文件和 JSON 时间戳数据,满足字幕制作、内容分析等多元需求

5. 模型可降级:从 tiny 到 medium 四级模型可选,低端设备可选用轻量方案

潜在缺点与局限性

1. 操作门槛较高:必须配合浏览器手动执行 JavaScript,无法纯自动化完成
2. 实时性受限:CDN URL 约2小时过期,超时需重新提取;5分钟视频转录耗时约3分钟(CPU)

3. 硬件资源消耗:small 模型需 466MB 显存/内存,medium 模型达 1.5GB,首次下载模型耗时较长

4. 依赖外部工具链:需同时安装 ffmpeg、Python、whisper、curl,环境配置复杂

5. 仅限抖音平台:明确不支持 YouTube、Bilibili 等其他平台

适合人群

  • 自媒体运营者:批量提取抖音口播文案进行二次创作
  • 研究人员:分析短视频舆情、整理访谈内容
  • 听障人士:获取视频文字信息
  • 字幕组成员:快速生成字幕时间轴草稿

常规风险

  • 版权合规:提取他人视频内容需注意著作权,建议仅用于个人学习或已获授权场景
  • 平台风控:频繁请求可能导致 IP 限流,建议控制调用频率
  • 隐私泄露:处理含个人信息视频时需脱敏处理
  • 模型偏见:Whisper 在方言、专业术语、嘈杂环境场景下识别率下降

技术原理概要

通过模拟浏览器环境获取真实视频流地址,规避抖音的 URL 签名验证,最终调用本地 Whisper 模型完成离线语音识别,全程无需上传敏感数据至第三方。

Douyin Video Transcribe 内容

scripts文件夹
手动下载zip · 6.2 kB
get_video_url.jstext/javascript
请选择文件