Video To Text

🎬 视频一键转文字,字幕生成神器

基于 faster-whisper 的多平台视频转录工具,支持 B站/YouTube/本地文件一键生成字幕文本,模型可选轻量至高精度

收藏
2.4k
安装
979
版本
0.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

Video-to-Text 是一款开源视频转录工具,整合 bilibili-apiyt-dlp 实现多平台视频下载,采用 faster-whisper 引擎将音频转写为文本。支持 Bilibili(需登录态)、YouTube、TikTok/Douyin、Twitter/X 等主流平台,同时兼容本地音视频文件(mp4/wav/m4a/webm/mkv 等格式)。

显著优点

1. 多源兼容:覆盖国内外主流视频平台,通过 yt-dlp 持续扩展支持范围
2. 模型灵活:5 档 Whisper 模型(tiny→large),75MB-3GB 可选,兼顾速度与精度

3. 本地化优先:完全离线运行,转录过程无需联网,保护隐私

4. 中文优化:内置中文语言指定(-l zh),对 B站内容友好

5. 轻量依赖:纯 Python 实现,安装简单(pip + ffmpeg)

潜在局限

  • B站认证门槛:需手动提取浏览器 Cookie(SESSDATA/bili_jct/buvid3),存在凭证泄露风险
  • 模型体积:large 模型需 3GB 显存/内存,低配置设备受限
  • 无内置校对:输出文本无自动标点优化或语义校验
  • 维护依赖:yt-dlp 需跟随平台反爬策略更新

适合人群

  • 内容创作者:快速生成视频字幕稿
  • 研究人员:批量转录访谈/讲座素材
  • 无障碍需求用户:将视频内容转为可读文本
  • 多语言学习者:获取外语视频对照文本

常规风险

| 风险类型 | 说明 | 缓解建议 |
|---------|------|---------|
| 凭证安全 | B站 Cookie 包含登录态,命令行/配置文件残留风险 | 使用环境变量注入,脚本内避免硬编码 |
| 版权合规 | 下载受版权保护内容可能违规 | 仅限个人学习使用,遵守平台 ToS |
| 模型偏见 | Whisper 可能对特定口音/术语识别偏差 | 人工校对关键内容 |
| 依赖更新 | yt-dlp 失效导致下载失败 | 定期执行 `pip install -U yt-dlp` |

Video To Text 内容

scripts文件夹
手动下载zip · 5.5 kB
video_to_text.pytext/plain
请选择文件