acestep-lyrics-transcription

🎤 AI 歌词转录,精准时间轴一键生成

基于 OpenAI Whisper 或 ElevenLabs Scribe API 的音频歌词转录工具,支持 LRC/SRT/JSON 多格式输出与词级时间戳,适合 MV 字幕生成。

收藏
4.6k
安装
1.6k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能与用法

本技能提供一站式音频歌词转录解决方案,通过调用 OpenAI Whisper 或 ElevenLabs Scribe API,将歌曲音频转换为带时间戳的歌词文件。支持三种输出格式:LRC(卡拉 OK 格式)、SRT(字幕格式)和 JSON(结构化数据)。核心工作流包括:前置 API 密钥检查 → 音频转录 → 后处理人工校正。

典型使用流程
1. 检查 API 密钥配置(config --check-key

2. 配置目标服务商密钥(OpenAI 或 ElevenLabs)

3. 执行转录命令,指定音频路径、语言代码和输出格式

4. 读取生成的 LRC 文件,对照原始歌词进行人工修正

5. 输出最终校正版 LRC 用于 MV 渲染

转录参数支持语言代码(zh/en/ja 等)、输出格式覆盖和自定义输出路径。默认输出目录为 acestep_output/,时间戳精度可达单词级别。

显著优势

  • 双服务商冗余:OpenAI Whisper 与 ElevenLabs Scribe 双引擎,可根据成本、质量需求切换
  • 多格式兼容:原生支持 LRC(逐行)、SRT(字幕)、JSON(开发友好)三种输出
  • 词级时间戳:两种 API 均支持细粒度时间对齐,满足精准字幕需求
  • 配置管理规范:通过专用脚本统一管理密钥,内置密钥掩码保护,避免敏感信息泄露
  • 后置校正机制:强制要求人工校验环节,明确标注常见转录错误类型(专有名词、谐音词、分词错误),提升最终输出质量

潜在局限与风险

转录质量固有缺陷

  • 语音识别模型对歌曲转录效果逊于朗读语音,专有名词(如 "ACE-Step"→"AC step")、谐音词("arrives"→"eyes")、连读分词错误频发
  • 强制依赖人工校正环节,无法全自动流水线作业

成本与依赖

  • OpenAI Whisper 定价 $0.006/分钟,ElevenLabs 按套餐计费,批量处理需预算规划
  • 完全依赖第三方 API,存在服务中断、速率限制、定价调整风险

技术门槛

  • 需用户自行申请 API 密钥并完成账户计费设置
  • 命令行操作模式对非技术用户不够友好

适合人群

  • 音乐视频(MV)制作者,需要快速生成时间轴对齐的歌词字幕
  • 音乐平台运营者,批量生产卡拉 OK 格式歌词文件
  • 音乐研究者或歌词网站维护者,需结构化歌词数据
  • 具备基础命令行操作能力、能接受 API 成本的内容创作者

常规风险提示

| 风险类别 | 具体表现 | 缓解措施 |
|---------|---------|---------|
| API 成本失控 | 长音频或批量任务产生意外费用 | 转录前估算时长,设置用量监控 |
| 隐私泄露 | 音频文件上传至第三方云 API | 避免处理敏感或未发布作品,阅读服务商隐私条款 |
| 转录错误未校正 | 直接用于 MV 导致字幕与演唱错位 | 严格执行 Post-Transcription Correction 流程 |
| 密钥管理不当 | API key 硬编码或意外暴露 | 使用技能提供的 `config --set` 机制,禁止直接读取密钥文件 |

acestep-lyrics-transcription 内容

scripts文件夹
手动下载zip · 8.1 kB
acestep-lyrics-transcription.shtext/x-shellscript
请选择文件