抖音视频转文字

🎬 抖音视频秒转可编辑文字

抖音视频一键转文字,免费调用Groq Whisper极速识别,带智能标点分段,适合内容创作者整理素材

收藏
7.6k
安装
1.5k
版本
1.0.1
CLS 安全性认证2026-07-14
点击查看完整报告 >

使用说明

核心用法

douyin-transcribe 是一个将抖音视频内容自动转换为可编辑文本的实用工具。用户仅需提供抖音链接或本地视频文件,系统即可自动完成音频提取、语音识别、智能标点分段的全流程。

主要使用场景:

  • 链接转录:发送抖音短链接(如 https://v.douyin.com/xxxxx/),系统自动打开页面、提取音频流并转录
  • 文件转录:直接上传视频文件,跳过浏览器环节快速处理
  • 分享文本解析:从「复制打开抖音」类分享文本中自动提取有效链接

技术链路: 浏览器获取 DASH 音频流 → ffmpeg 下载音频(约1MB)→ Groq Whisper large-v3 语音识别(免费,3秒级响应)→ Groq LLM 智能标点分段 → 输出结构化 Markdown 文本。

显著优点

1. 零成本运营:全程依赖 Groq 免费 API,无需信用卡,无用量焦虑
2. 极速响应:Groq 推理速度比 OpenAI Whisper 快约10倍,短视频 5 秒内完成

3. 轻量设计:仅下载音频流(~1MB),较完整视频下载节省 20-50 倍流量与存储

4. 高兼容性:规避 yt-dlp 等工具对抖音反爬的依赖,通过浏览器模拟降低失效风险

5. 智能后处理:LLM 自动添加标点、分段,输出可直接用于笔记、剪辑脚本、字幕整理

潜在缺点与局限性

  • 时长限制:Groq Whisper 单文件上限 25MB,超长视频需分段处理或裁剪
  • 频率瓶颈:免费 API 存在速率限制(429 错误),高频批量处理需间隔等待
  • 登录依赖:部分抖音内容需网页版登录才能获取音频流,首次使用可能需人工介入
  • 网络波动:依赖海外 API 服务(Groq),国内网络环境可能出现不稳定
  • 隐私考量:音频数据需上传至 Groq 云端处理,敏感内容存在外发风险

适合人群

  • 内容创作者:快速提取爆款视频文案、整理口播脚本
  • 研究者/分析师:批量获取短视频文本数据进行内容研究
  • 听障用户:将无字幕视频内容转为可读文本
  • 多平台运营者:跨平台搬运时快速获取原视频文案参考

常规风险

| 风险类型 | 说明 |
|---------|------|
| API 服务稳定性 | Groq 免费策略可能调整,存在未来收费或降速可能 |
| 平台规则变动 | 抖音前端结构更新可能导致音频提取逻辑失效 |
| 版权合规 | 转录他人内容需注意著作权与平台使用条款,避免商用侵权 |
| 数据安全 | 音频片段上传至第三方云服务,机密内容不建议使用 |

安全解读

核心用法

用户发送抖音链接或视频文件,Skill 自动完成:浏览器提取音频流 → ffmpeg 下载音频 → Groq Whisper 语音识别 → LLM 智能标点分段 → 输出带格式的中文文本。全程无需手动下载视频,音频仅 ~1MB,处理速度 3-5 秒。

显著优点

1. 零成本高效能:Groq API 完全免费,速度比 OpenAI 快 10 倍,长视频也能快速处理
2. 轻量提取:只下载音频不下载视频,流量节省 20-50 倍

3. 智能后处理:自动添加标点、分段,输出可直接阅读的文字稿

4. 双模式支持:既支持抖音链接自动解析,也支持本地视频文件转录

潜在缺点与局限

1. 依赖外部 API:音频需上传至 Groq/OpenAI 服务器,存在隐私泄露风险,不适合处理敏感内容
2. 配置门槛:首次使用需手动配置 Groq API Key、安装 ffmpeg,对非技术用户不够友好

3. 来源可信度低:T3 级别个人开发者项目,代码未经大规模审计

4. 浏览器依赖:提取抖音音频流需 OpenClaw 浏览器支持,若未登录可能失败

5. 长度限制:音频文件超过 25MB 会报错,超长视频需分段处理

适合人群

  • 内容创作者快速提取抖音口播文案
  • 研究人员整理访谈、讲座视频文字资料
  • 需要批量处理短视频字幕的轻度用户

常规风险

  • 第三方 API 传输隐私数据(建议避免敏感内容)
  • child_process 执行系统命令存在潜在注入风险(已做引号防护)
  • API Key 明文存储于 .env 文件

抖音视频转文字 内容

scripts文件夹
手动下载zip · 15.1 kB
transcribe.jstext/javascript
请选择文件