Zhipu Asr

🎙️ 中文语音转写专家,智能热词增强

基于智谱AI的GLM-ASR模型,实现中文语音转文字,支持上下文提示和热词增强,适合会议、访谈等场景。

收藏
5.2k
安装
1.5k
版本
1.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Zhipu ASR 是智谱AI(BigModel)推出的自动语音识别技能,专为中国用户设计,可将音频文件转录为文本。核心工作流为:上传音频 → 调用 GLM-ASR 模型 → 获取结构化 JSON 输出。

主要功能:

  • 基础转录:支持 WAV、MP3 直接上传,其他格式(OGG、M4A、FLAC 等)自动经 ffmpeg 转换为 MP3
  • 上下文提示:可传入前序转录文本(最多 8000 字符),提升长对话连贯性与领域术语识别准确度
  • 热词增强:支持自定义词汇表(最多 100 个词),强化人名、地名、专业术语的识别率
  • 批量处理:可通过 shell 循环批量处理多个文件

典型场景:

  • 会议纪要与访谈转录
  • 讲座/课堂内容数字化
  • 医疗、法律等专业领域口述记录

显著优点

1. 中文优化:基于 GLM-ASR 模型,对中文语音识别准确率高
2. 灵活增强:上下文提示 + 热词双重机制,有效解决专业场景识别难题

3. 格式兼容强:内置 ffmpeg 转换,支持绝大多数常见音频格式

4. 响应迅速:典型转录时间 1-3 秒,接近实时处理

5. 输出结构化:标准 JSON 格式,便于后续自动化处理

潜在缺点与局限性

  • 时长限制严苛:单次仅支持 30 秒音频,长内容必须切割分段
  • 文件大小上限:25MB 限制,高质量长音频需预处理压缩
  • 语言局限:最佳性能仅限中文,多语言混合场景效果下降
  • 外部依赖:需智谱AI API 密钥,存在服务商可用性风险
  • 无说话人分离:不支持 diarization,多人场景需人工标注

适合人群

  • 会议记录员、访谈记者、自媒体创作者
  • 医疗、法律、教育等行业需口述转文字的专业人士
  • 中文内容创作者、播客运营者
  • 需快速将音频资产数字化的中小企业

常规风险

  • API 密钥泄露ZHIPU_API_KEY 环境变量需妥善保管,避免硬编码提交
  • 数据隐私:音频内容上传至智谱AI云端,敏感信息需评估合规性
  • ffmpeg 安全风险:自动转换依赖本地 ffmpeg,需确保来源可信、版本更新
  • 服务质量波动:依赖第三方 API,存在限流、延迟或服务中断可能
  • 转录误差:专有名词、方言、嘈杂环境可能导致识别错误,关键场景建议人工复核

Zhipu Asr 内容

scripts文件夹
手动下载zip · 7.6 kB
speech_to_text.shtext/x-shellscript
请选择文件