核心用法
Vsum 是一款命令行视频摘要工具,通过整合 yt-dlp 与多厂商 AI API,实现 YouTube 和 Bilibili 视频的字幕自动提取与智能总结。用户只需提供视频链接,系统自动识别平台、获取字幕(支持自动生成字幕与人工字幕)、调用 AI 生成结构化摘要,最终输出标准化的 Markdown 文档。
显著优点
- 跨平台支持:同时覆盖 YouTube(国际)与 Bilibili(国内)两大主流平台
- 自动化程度高:从链接识别、字幕下载到 AI 总结全流程自动化,无需手动干预
- 输出标准化:固定 Markdown 模板包含视频元信息、总结正文、关键要点,便于存档与二次编辑
- 灵活兼容:支持任意 OpenAI 格式 API(OpenAI、Anthropic、OpenRouter、jiekou.ai 等)
- 长视频适配:内置分段处理逻辑,可预览后决定是否完整总结,避免 Token 超限
潜在缺点与局限性
- 依赖外部字幕源:无字幕视频无法处理(不支持语音转文字)
- B站需登录态:必须通过浏览器 Cookie 获取认证,配置门槛较高
- 网络环境敏感:yt-dlp 与海外 AI API 均可能受地区网络限制
- 语言覆盖有限:字幕语言依赖视频上传者或平台自动生成,小语种支持不稳定
- 无视频画面分析:纯文本总结,无法识别 PPT、图表、演示画面信息
适合人群
- 知识工作者:快速消化长视频课程、演讲、播客内容
- 内容创作者:竞品分析、素材整理、脚本参考
- 研究人员:学术讲座、会议录屏的文献化管理
- 多语言用户:借助 AI 翻译总结外语文档
常规风险
- 隐私泄露:B站 Cookie 读取涉及账号敏感信息,需确保本地环境可信
- API 成本:长视频字幕 Token 消耗大,需注意 AI 调用费用
- 版权边界:下载与再加工他人视频字幕需遵守平台 ToS 与著作权法规
- 准确性偏差:AI 总结可能遗漏细节或误读语境,关键信息需人工复核