Audio Summary

🎙️ 音视频一键转录总结

基于 Qwen3-ASR 的本地音视频转录总结工具,支持 5-8 分钟视频一键提取文本与分段摘要,需 ffmpeg 与百炼 API

收藏
4.3k
安装
1k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

audio-summary 是一款面向本地音视频文件的自动化转录总结工具,主要解决"视频太长懒得看"的场景痛点。用户通过命令行传入视频路径后,脚本自动调用 ffmpeg 提取 16kHz 单声道音频并压缩至 48k 码率,随后通过 Base64 编码将音频流发送至百炼平台的 qwen3-asr-flash 模型,完成语音识别与内容分段总结的双阶段处理。输出结果以 视频名_summary.txt 形式保存在原文件同级目录,便于后续检索或二次编辑。

显著优点

1. 端到端自动化:无需手动导出音频、切换多个工具,单条命令完成提取→转录→总结全流程。
2. 模型性能可靠:基于阿里百炼 Qwen3-ASR-Flash,在中文语音识别场景具备较好的准确率和上下文理解能力,且支持总结生成。

3. 本地隐私优先:视频文件不上传至云端存储,仅音频流通过 API 传输,降低敏感内容泄露风险。

4. 大文件友好:通过 48k 压缩策略,单次可处理 5-8 分钟视频,满足播客、会议录屏、短视频等常见场景。

潜在缺点与局限性

1. 时长硬限制:Base64 转录单请求上限 6MB,超过 10 分钟的长视频需手动切分或进一步降码率,无法原生支持长音视频。
2. 外部依赖重:强依赖 ffmpeg 系统安装与百炼 API 密钥配置,跨平台部署(如 macOS/Linux)需额外适配。

3. 成本不可控:按模型实际调用时长计费,高频使用或误操作大文件可能导致意外账单。

4. 无交互式编辑:输出为纯文本文件,不支持在线校对、时间轴对齐或发言人区分,后期整理成本较高。

5. 硬编码密钥风险:报告中提及 API KEY 以 sk-76735... 形式硬编码于脚本,存在泄露隐患。

适合人群

  • 需要快速抓取短视频、会议录屏、播客片段核心信息的效率型用户
  • 已有 ffmpeg 环境、熟悉命令行操作的开发者或技术工作者
  • 对数据隐私敏感、倾向本地处理+云端仅走 API 的保守型用户

常规风险

  • 密钥泄露:硬编码 API Key 若随代码仓库分享,可能导致百炼账号被盗用或产生异常费用。
  • 误传大文件:未注意 6MB 限制时直接提交长视频,可能触发 API 报错或高额计费。
  • 输出覆盖:同名文件重复运行将直接覆盖历史总结,无版本控制机制。
  • 网络依赖:转录阶段必须保持百炼 API 可用,离线环境无法使用。

Audio Summary 内容

手动下载zip · 3.8 kB
audio_summary_skill.pytext/plain
请选择文件