核心用法
dlazy-elevenlabs-stt 是一个基于 ElevenLabs Scribe v1 模型的语音转文字 CLI 工具,通过 dLazy 托管 API 提供服务。用户通过 dlazy elevenlabs-stt 命令调用,支持本地音频文件路径或 URL 作为输入,自动识别语言(中文/英文),并可选择启用说话人分离(diarization)功能。
主要参数:
--audio_url: 音频文件路径或 URL--language_code: 指定语言(zh/en,默认中文)--diarize: 启用说话人分离(默认关闭)--dry-run: 预演模式,显示请求体与费用估算--no-wait: 异步模式,立即返回任务 ID
认证方式:支持设备码流式登录(dlazy login)或手动设置 API key(dlazy auth set),密钥存储于本地配置文件并受 OS 级权限保护。
显著优点
1. 高精度转录:基于 ElevenLabs Scribe v1,业界领先的语音识别准确率
2. 智能语言检测:支持中文、英文自动识别,减少手动配置
3. 说话人分离:可选 diarization,自动区分不同说话人,适合会议场景
4. 灵活调用模式:支持同步等待与异步轮询(--no-wait + dlazy status)
5. 透明计费:--dry-run 模式可预估费用,避免意外消耗
6. 便捷认证:设备码流式登录,无需复制粘贴,支持远程 shell
潜在缺点与局限性
1. 依赖云服务:所有音频需上传至 dLazy 服务器(files.dlazy.com),存在数据传输延迟与隐私顾虑
2. 语言支持有限:目前仅明确支持 zh/en,其他语言可能不稳定
3. 需要付费:基于 API 调用计费,余额不足时任务中断(错误码 503)
4. 网络依赖:无离线能力,需稳定连接 api.dlazy.com
5. 第三方封装:实际模型为 ElevenLabs,dLazy 为代理层,服务连续性依赖 dLazy 运营
适合人群
- 内容创作者:快速生成视频字幕,支持说话人分离便于访谈整理
- 会议记录员:自动转录会议音频,区分发言人生成结构化纪要
- 播客/媒体工作者:批量处理音频内容,提取文字稿
- 企业用户:需集成 CLI 工作流的团队,可通过 npm/npx 快速部署
常规风险
| 风险类别 | 说明 |
|---------|------|
| **数据隐私** | 音频文件上传至第三方服务器,敏感内容需谨慎评估 |
| **服务可用性** | 依赖 dLazy API 与 ElevenLabs 上游,存在单点故障风险 |
| **计费失控** | 大文件或批量处理可能产生意外费用,建议先用 `--dry-run` 估算 |
| **API 密钥泄露** | 密钥存储于本地 `~/.dlazy/config.json`,共享环境需额外防护 |
| **合规性** | 语音数据可能涉及个人信息处理,需遵守 GDPR/个保法等法规 |