ANY WHISPER API

☁️ API 驱动的智能语音识别

通过 API 调用 Whisper 进行语音识别,支持本地兼容服务器与自定义配置,适合需要批量转录的开发者和专业用户。

收藏
2.2k
安装
1.1k
版本
1.2.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

any-whisper-api 是一个基于 curl 的命令行工具,用于调用 OpenAI Whisper API 或兼容的本地服务器进行语音转文字。用户只需指定音频文件路径即可快速获得转录结果,支持 m4aogg 等常见格式。

显著优点

1. 灵活性高:支持自定义 WHISPER_API_HOST,可对接官方 API 或自建兼容服务(如 faster-whisper-serverwhisper.cpp 等),避免 vendor lock-in
2. 参数丰富:可指定模型版本、输出语言、提示词(prompt)优化专有名词识别,支持 JSON 格式输出便于后续处理

3. 配置便捷:支持环境变量或 JSON 配置文件双模式管理密钥,符合 12-factor 应用原则

4. 轻量无依赖:仅需 curl,无需安装 Python 或 PyTorch 等重型运行时

潜在缺点与局限性

  • 网络依赖:必须保持 API 端点可达,离线场景需额外部署本地服务
  • 成本敏感:按音频时长计费,长音频转录成本累积明显
  • 隐私风险:上传敏感音频至第三方服务存在数据泄露可能,医疗、法律等场景需谨慎
  • 无实时能力:仅支持文件级批处理,不支持流式语音识别

适合人群

  • 开发者/运维人员需要自动化音频处理流水线
  • 播客、会议记录团队进行批量内容转录
  • 已自建 Whisper 服务的用户寻求标准化 CLI 接口

常规风险

  • API 密钥泄露可能导致账户被盗刷
  • 非官方端点兼容性未经充分验证,存在输出格式差异风险
  • 大文件上传可能触发超时或中断,建议分片处理

使用示例

# 基础转录
./transcribe.sh interview.m4a

# 指定语言并输出 JSON
./transcribe.sh meeting.ogg --language zh --json --out result.json

# 使用提示词优化人名识别
./transcribe.sh podcast.mp3 --prompt "嘉宾:张三、李四"

ANY WHISPER API 内容

scripts文件夹
手动下载zip · 1.6 kB
transcribe.shtext/x-shellscript
请选择文件