Zhipu Asr

🎙️ 智谱AI驱动的精准中文语音转录

基于智谱AI GLM-ASR模型的中文语音识别技能,支持多格式音频转录、上下文提示和热词自定义,适用于会议记录、讲座转写等场景

收藏
6k
安装
1.5k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

Zhipu AI ASR 语音识别技能评估

核心用法

Zhipu ASR 是一款基于智谱AI GLM-ASR 模型的中文自动语音识别技能,通过 Shell 脚本封装实现音频到文本的转录。核心工作流为:用户上传音频文件(WAV/MP3 为主,其他格式自动 ffmpeg 转码)→ 调用智谱 API → 返回 JSON 格式转录结果。支持三大增强功能:上下文提示(最长8000字符,用于多段对话连续性)、热词自定义(最多100个术语,提升专业名词识别率)、以及多格式兼容(OGG/M4A/AAC/FLAC/WMA 自动转 MP3)。

显著优点

1. 中文优化:GLM-ASR 针对中文场景训练,方言和专业术语识别能力强于通用模型
2. 轻量集成:单脚本部署,依赖仅 jq 和 ffmpeg,无复杂运行时

3. 成本可控:智谱 API 定价在国内大模型中属中低水平,适合高频调用

4. 热词机制:允许注入业务专有词汇(人名、地名、行业术语),显著提升垂直场景准确率

5. 上下文连续性:支持长会议分段转录时传递前文,保持语义连贯

潜在缺点与局限性

  • 时长限制严格:单次仅30秒,长音频需手动切片,增加流程复杂度
  • 文件大小限制:25MB 上限对高清录音较紧张
  • 中文为主:非中文音频识别效果未明确保障
  • 网络依赖:纯云端 API,无离线能力,延迟受网络影响
  • 错误处理简单:脚本层异常捕获有限,需用户自行验证输出

适合人群

  • 需要批量处理中文会议录音、访谈、讲座的行政/研究助理
  • 法律、医疗、金融等垂直领域需热词定制的专业转录场景
  • 已有智谱账号、追求性价比的中小企业技术团队

常规风险

1. API 密钥泄露:ZHIPU_API_KEY 以环境变量方式管理,共享环境或多用户场景存在误配置风险
2. 数据隐私:音频上传至智谱云端,敏感内容需评估合规性

3. 转码依赖:自动 ffmpeg 转码可能引入质量损失,极端格式可能失败

4. API 可用性:依赖第三方服务稳定性,无 SLA 保障时需设计重试机制

Zhipu Asr 内容

scripts文件夹
手动下载zip · 6.2 kB
speech_to_text.shtext/x-shellscript
请选择文件