核心用法
Audio skill 是一套基于 FFmpeg 生态的专业音频处理解决方案,覆盖从基础格式转换到复杂播客制作的全场景需求。
执行流程:
1. 明确目标 — 确定输出格式、目标平台响度标准、用途
2. 源码分析 — 使用 ffprobe 提取编码器、采样率、声道、时长等元数据
3. 音频处理 — 调用 FFmpeg/SoX 执行转换、降噪、标准化、变速等操作
4. 质量验证 — 检查输出文件可播放性、规格符合度、主观听感
5. 交付归档 — 向用户提供处理后的文件
典型应用场景:
- 格式转换:WAV/FLAC/MP3/AAC/Opus 互转,支持
-acodec精细控制 - 降噪处理:FFmpeg 滤镜或 SoX 实现高通/低通滤波、专用降噪算法
- 响度标准化:集成
ffmpeg-normalize,支持 Spotify (-16 LUFS)、Apple Podcasts (-19 LUFS) 等平台标准 - AI 转写:调用 Whisper 模型输出 TXT/SRT/VTT 字幕文件
- 音轨分离:Demucs 实现人声/鼓/贝斯/伴奏四轨分离
- 播客制作:完整 workflow 支持从录制到发布的全流程
显著优点
- 工业级工具链:基于 FFmpeg(开源多媒体事实标准),20+ 年生态积累,兼容性极广
- 平台标准化:内置主流平台响度规范,避免反复调试
- 模块化扩展:核心依赖仅 ffmpeg/ffprobe,SoX/Whisper/Demucs 按需加载
- 透明可控:纯本地执行,不上传云端,用户完全掌控数据
潜在局限
- 环境依赖:需预装 FFmpeg,进阶功能依赖额外二进制文件
- 学习曲线:FFmpeg 参数语法复杂,需参考
commands.md速查表 - 无持久存储:不缓存处理结果,重复任务需重新执行
- 本地算力限制:Whisper/Demucs 大模型运行依赖本地 GPU/CPU 性能
适合人群
- 播客创作者、音频后期制作人员
- 内容转写、字幕制作工作者
- 需要批量格式转换的媒体库管理者
- 追求数据隐私的敏感场景用户(纯本地处理)
常规风险
- 格式兼容性:FFmpeg 虽强大,但部分专有编码器需确认专利授权
- 音质损失:重复编解码或过度压缩(如 96k MP3)导致不可逆音质劣化
- 响度误判:自动化标准化可能不符合特定艺术意图,建议保留原始母带
- 转写准确性:Whisper 对专业术语、多说话人场景识别准确率有限
- 资源占用:大文件处理或模型推理时高 CPU/内存占用