vsum

🎬 视频字幕 AI 总结神器

自动化提取 YouTube/Bilibili 字幕并生成 AI 结构化摘要,一键输出 Markdown 文档

收藏
6.1k
安装
1.2k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Vsum 是一款命令行视频摘要工具,通过整合 yt-dlp 与多厂商 AI API,实现 YouTube 和 Bilibili 视频的字幕自动提取与智能总结。用户只需提供视频链接,系统自动识别平台、获取字幕(支持自动生成字幕与人工字幕)、调用 AI 生成结构化摘要,最终输出标准化的 Markdown 文档。

显著优点

  • 跨平台支持:同时覆盖 YouTube(国际)与 Bilibili(国内)两大主流平台
  • 自动化程度高:从链接识别、字幕下载到 AI 总结全流程自动化,无需手动干预
  • 输出标准化:固定 Markdown 模板包含视频元信息、总结正文、关键要点,便于存档与二次编辑
  • 灵活兼容:支持任意 OpenAI 格式 API(OpenAI、Anthropic、OpenRouter、jiekou.ai 等)
  • 长视频适配:内置分段处理逻辑,可预览后决定是否完整总结,避免 Token 超限

潜在缺点与局限性

  • 依赖外部字幕源:无字幕视频无法处理(不支持语音转文字)
  • B站需登录态:必须通过浏览器 Cookie 获取认证,配置门槛较高
  • 网络环境敏感:yt-dlp 与海外 AI API 均可能受地区网络限制
  • 语言覆盖有限:字幕语言依赖视频上传者或平台自动生成,小语种支持不稳定
  • 无视频画面分析:纯文本总结,无法识别 PPT、图表、演示画面信息

适合人群

  • 知识工作者:快速消化长视频课程、演讲、播客内容
  • 内容创作者:竞品分析、素材整理、脚本参考
  • 研究人员:学术讲座、会议录屏的文献化管理
  • 多语言用户:借助 AI 翻译总结外语文档

常规风险

  • 隐私泄露:B站 Cookie 读取涉及账号敏感信息,需确保本地环境可信
  • API 成本:长视频字幕 Token 消耗大,需注意 AI 调用费用
  • 版权边界:下载与再加工他人视频字幕需遵守平台 ToS 与著作权法规
  • 准确性偏差:AI 总结可能遗漏细节或误读语境,关键信息需人工复核

vsum 内容

scripts文件夹
手动下载zip · 3.6 kB
vsum.shtext/x-shellscript
请选择文件