ANY WHISPER API

☁️ API 语音转录,兼容本地部署

通过 OpenAI Whisper API 实现音频转录,兼容本地自托管服务器,curl 轻量调用,适合开发者快速集成语音转文字功能。

收藏
4.4k
安装
1.1k
版本
1.3.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

any-whisper-api 技能封装了对 OpenAI /v1/audio/transcriptions 端点的调用,支持通过 curl 命令行工具完成音频文件的语音转文字任务。用户可通过环境变量 WHISPER_API_KEYWHISPER_API_HOST 灵活配置 API 凭证,或在 ~/.clawdbot/clawdbot.json 中进行持久化配置。脚本提供简洁的命令行接口,支持指定模型、输出路径、语言、提示词及 JSON 格式输出等参数,满足多样化的转录需求。

显著优点

1. 协议兼容性:不仅支持官方 OpenAI API,还可无缝对接任何兼容 OpenAI API 格式的本地或自托管服务(如 whisper.cpp 的 server 模式),极大扩展了部署灵活性。
2. 轻量依赖:仅需 curl 作为外部依赖,无需复杂的 SDK 或运行时环境,适合容器化或资源受限场景。

3. 参数丰富:支持语言指定、提示词注入、VAD(语音活动检测)等高级功能,可通过 whisper.cpp 示例中的 --vad 等参数实现更精确的转录控制。

4. 输出灵活:默认输出纯文本,可选 JSON 格式便于后续结构化处理。

潜在缺点与局限性

1. 网络依赖:API 调用依赖网络连接,本地服务器方案虽可缓解,但仍需维护服务端资源。
2. 隐私风险:若使用官方 OpenAI API,音频数据需上传至第三方服务器,存在数据隐私泄露风险;本地部署虽可规避,但配置复杂度提升。

3. 音频格式限制:需确保输入音频格式受目标端点支持(如 m4a、ogg、mp3 等),否则需额外转码。

4. 无实时流式支持:当前示例为文件级批处理,未展示 WebSocket 或 SSE 流式转录能力。

适合人群

  • 开发者需在脚本或自动化流程中快速集成语音转文字功能
  • 注重隐私、倾向本地部署 Whisper 模型的技术用户
  • 已具备 OpenAI API 访问权限或自托管 API 基础设施的团队

常规风险

  • 凭证泄露:API Key 若硬编码或日志记录不当,可能导致未授权访问
  • 数据合规:涉及敏感语音内容时,需评估跨境数据传输合规性
  • 服务可用性:依赖外部 API 时存在速率限制、服务中断或计费异常风险

ANY WHISPER API 内容

scripts文件夹
手动下载zip · 2.8 kB
transcribe.shtext/x-shellscript
请选择文件