语音转文字 ElevenLabs STT

🎙️ ElevenLabs 企业级语音转文字

ElevenLabs Scribe_v1 语音识别引擎的 CLI 封装,支持 99 种语言自动检测与说话人分离,适合字幕生成与会议转录。

收藏
3.8k
安装
966
版本
1.3.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

dlazy-elevenlabs-stt 是 dLazy AI 平台对 ElevenLabs Scribe_v1 语音转文字模型的封装技能,通过命令行界面提供企业级语音识别能力。

主要功能

  • 自动语种识别:支持 99 种语言,无需手动指定
  • 说话人分离(Diarization):可选开启多说话人识别,适合会议记录
  • 灵活输入:支持音频 URL 或本地文件路径
  • 异步任务:支持 --no-wait 模式处理长音频

典型工作流

# 基础转录
dlazy elevenlabs-stt --audio_url ./meeting.mp3

# 带说话人分离的会议记录
dlazy elevenlabs-stt --audio_url ./interview.wav --diarize true

# 指定语言(或自动检测)
dlazy elevenlabs-stt --audio_url ./podcast.mp3 --language_code en

显著优点

1. ElevenLabs 技术背书:Scribe_v1 是当前业界领先的语音识别模型之一,准确率对标 Whisper Large v3
2. 零本地计算:纯云端推理,无需 GPU,任何设备均可使用

3. 企业级安全:API Key 存储于 ~/.dlazy/config.json,权限隔离至 OS 用户级别

4. 成本可控--dry-run 预估算费用,避免意外扣款

5. 管道友好:支持 stdin/stdout 管道引用(-@N@stdin 等)

潜在缺点与局限性

| 问题 | 说明 |
|------|------|
| **网络依赖** | 必须连接 `api.dlazy.com` 和 `files.dlazy.com`,无法离线使用 |
| **隐私顾虑** | 音频文件上传至第三方云存储,敏感内容需谨慎 |
| **计费不透明** | 按用量计费,但具体单价需查阅 dlazy.com 定价页 |
| **语言限制** | 虽然支持 99 种语言,但小语种准确率可能低于英语/中文 |
| **CLI 依赖** | 需要 Node.js 环境(`npm`/`npx`),增加了部署复杂度 |

适合人群

  • 内容创作者:快速生成视频字幕,支持多说话人场景
  • 企业会议记录员:批量处理会议录音,自动区分发言人
  • 播客/访谈制作人:高精度转录长篇音频内容
  • 开发者/自动化工作流:通过管道集成到 CI/CD 或数据处理管道

常规风险

1. 余额不足(503):需预充值 credits,余额耗尽时任务失败
2. 认证失效(401):API Key 可能被撤销或过期,需重新 dlazy login

3. 内容安全拦截:违反平台安全政策的音频会被拒绝处理

4. 长音频超时:默认 1800 秒超时,超长文件需使用 --no-wait 异步模式

5. 供应商锁定:深度依赖 dLazy 平台,迁移成本较高

语音转文字 ElevenLabs STT 内容

手动下载zip · 8.1 kB
skill-card.mdtext/markdown
请选择文件