语音转文字 ElevenLabs STT

🎙️ 高精度语音转文字,智能分离说话人

ElevenLabs 高精度语音转文字工具,支持自动语言检测与说话人分离,适合字幕生成、会议记录等场景。

收藏
2.5k
安装
966
版本
1.2.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

dlazy-elevenlabs-stt 是一个基于 ElevenLabs Scribe v1 模型的语音转文字 CLI 工具,通过 dLazy 托管 API 提供服务。用户通过 dlazy elevenlabs-stt 命令调用,支持本地音频文件路径或 URL 作为输入,自动识别语言(中文/英文),并可选择启用说话人分离(diarization)功能。

主要参数

  • --audio_url: 音频文件路径或 URL
  • --language_code: 指定语言(zh/en,默认中文)
  • --diarize: 启用说话人分离(默认关闭)
  • --dry-run: 预演模式,显示请求体与费用估算
  • --no-wait: 异步模式,立即返回任务 ID

认证方式:支持设备码流式登录(dlazy login)或手动设置 API key(dlazy auth set),密钥存储于本地配置文件并受 OS 级权限保护。

显著优点

1. 高精度转录:基于 ElevenLabs Scribe v1,业界领先的语音识别准确率
2. 智能语言检测:支持中文、英文自动识别,减少手动配置

3. 说话人分离:可选 diarization,自动区分不同说话人,适合会议场景

4. 灵活调用模式:支持同步等待与异步轮询(--no-wait + dlazy status

5. 透明计费--dry-run 模式可预估费用,避免意外消耗

6. 便捷认证:设备码流式登录,无需复制粘贴,支持远程 shell

潜在缺点与局限性

1. 依赖云服务:所有音频需上传至 dLazy 服务器(files.dlazy.com),存在数据传输延迟与隐私顾虑
2. 语言支持有限:目前仅明确支持 zh/en,其他语言可能不稳定

3. 需要付费:基于 API 调用计费,余额不足时任务中断(错误码 503)

4. 网络依赖:无离线能力,需稳定连接 api.dlazy.com

5. 第三方封装:实际模型为 ElevenLabs,dLazy 为代理层,服务连续性依赖 dLazy 运营

适合人群

  • 内容创作者:快速生成视频字幕,支持说话人分离便于访谈整理
  • 会议记录员:自动转录会议音频,区分发言人生成结构化纪要
  • 播客/媒体工作者:批量处理音频内容,提取文字稿
  • 企业用户:需集成 CLI 工作流的团队,可通过 npm/npx 快速部署

常规风险

| 风险类别 | 说明 |
|---------|------|
| **数据隐私** | 音频文件上传至第三方服务器,敏感内容需谨慎评估 |
| **服务可用性** | 依赖 dLazy API 与 ElevenLabs 上游,存在单点故障风险 |
| **计费失控** | 大文件或批量处理可能产生意外费用,建议先用 `--dry-run` 估算 |
| **API 密钥泄露** | 密钥存储于本地 `~/.dlazy/config.json`,共享环境需额外防护 |
| **合规性** | 语音数据可能涉及个人信息处理,需遵守 GDPR/个保法等法规 |

语音转文字 ElevenLabs STT 内容

手动下载zip · 7.7 kB
skill-card.mdtext/markdown
请选择文件