语音转文字 ElevenLabs STT

🎙️ ElevenLabs 高精度语音转文字

ElevenLabs Scribe STT 语音转文字,支持自动语种识别与说话人分离,适合字幕、转录与会议记录

收藏
4k
安装
966
版本
1.2.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

dlazy-elevenlabs-stt 是 dLazy 平台提供的 ElevenLabs Scribe v1 语音转文字服务封装,通过 CLI 工具调用云端 API 实现高质量语音识别。核心功能包括:

  • 自动语种识别:默认中文(zh),支持英文(en),可自动检测或手动指定
  • 说话人分离(Diarization):可选启用多说话人区分,适合会议记录场景
  • 灵活输入:支持本地音频文件路径或 URL 直接传入
  • 异步任务--no-wait 模式支持大文件后台处理,通过 generateId 轮询状态

基础调用:

dlazy elevenlabs-stt --audio_url /path/to/audio.mp3 --language_code zh --diarize true

高级特性:支持管道引用(-, @N, @N.path 等)实现工作流串联;--dry-run 可预估费用不实际调用。

显著优点

1. ElevenLabs 底层质量:基于 Scribe v1 模型,语音识别准确率在业界处于第一梯队
2. 零本地算力依赖:纯云端推理,终端设备仅需 Node.js 环境

3. 说话人分离实用:会议、访谈、播客等多人场景自动标注发言人

4. CLI 体验统一:与 dLazy 生态其他技能一致的认证流(dlazy login 设备码授权,无需手动复制 key)

5. 输出结构化:JSON 格式包含完整元数据,便于下游自动化处理

潜在缺点与局限性

  • 网络依赖:必须连接 dLazy API,无法离线使用
  • 文件上传成本:本地文件需上传至 files.dlazy.com,大文件受带宽和存储限制
  • 商业 API 计费:按调用量计费,无免费额度说明;余额不足时任务失败(错误码 503)
  • 语种覆盖有限:目前仅明确支持 zh/en,其他语种需验证
  • speaker diarization 准确率波动:多人重叠、口音、噪声场景下分离效果可能下降
  • vendor lock-in:绑定 dLazy 平台,无法直接对接原生 ElevenLabs API 或其他厂商

适合人群

  • 内容创作者(自动生成字幕、播客转录稿)
  • 企业会议记录整理(需说话人分离)
  • 翻译/本地化团队(音频转写后进入下游流程)
  • 已有 dLazy 账号、追求一体化 CLI 工作流的技术用户

常规风险

| 风险类别 | 具体说明 |
|---------|---------|
| **认证安全** | API key 存储于 `~/.dlazy/config.json`,文件权限限制为 OS 用户级,但仍需防范设备丢失/多用户环境 |
| **数据隐私** | 音频文件上传至 dLazy 云端处理,敏感内容需评估服务商数据条款 |
| **计费失控** | 无内置预算上限,大文件/高频调用可能导致意外扣费;建议结合 `--dry-run` 预估 |
| **服务可用性** | 依赖 dLazy 平台稳定性,错误码 504 提示异步任务可能失败,需人工重试或状态轮询 |
| **CLI 供应链** | 通过 npm/npx 安装 `@dlazy/cli`,需信任 dlazyai 发布的包及依赖树 |

语音转文字 ElevenLabs STT 内容

手动下载zip · 8.1 kB
skill-card.mdtext/markdown
请选择文件