Funasr Transcribe Skill

🎙️ 本地中文语音识别专家

基于阿里 FunASR 的本地语音识别工具,支持多语言音频转录,零 API 费用,适合会议记录与语音整理。

收藏
5.3k
安装
1.3k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

funasr-transcribe 是一款基于阿里巴巴 FunASR 开源模型的本地语音识别工具,专为中文场景优化。用户通过两条命令即可完成环境部署与音频转录:先执行 install.sh 创建虚拟环境并安装依赖,再使用 transcribe.sh <音频路径> 生成带标点的文本文件。支持 .wav.ogg.mp3.flac.m4a 等主流格式,输出为同目录下的 .txt 文件。

显著优点

1. 完全本地运行:无需调用云端 API,杜绝网络延迟与数据外传风险,敏感会议内容可离线处理。
2. 零使用成本:无按量计费或订阅费用,仅需承担一次性硬件资源消耗。

3. 中文优化领先:采用 Paraformer-large、FSMN-VAD、CT-Transformer 三模型级联架构,在普通话及方言场景下准确率优于 Whisper。

4. 硬件门槛低:CPU 推理 RTF 仅 0.05-0.2,普通办公电脑即可流畅运行;支持 GPU 加速(需手动修改配置)。

5. 语言覆盖广:支持中文、英文及中英混合识别,自动恢复标点符号。

潜在缺点与局限性

  • 首次启动成本高:需 5-10 分钟安装环境,首次转录下载 1-2GB 模型文件,对网络与磁盘空间(约 4GB)有要求。
  • 配置灵活性受限:GPU 加速需手动编辑 Python 脚本,非技术用户门槛较高。
  • 生态依赖:核心模型托管于 ModelScope,若阿里云服务波动可能影响模型下载。
  • 长音频处理:虽内置 VAD 切分,但极长文件(数小时)可能面临内存峰值压力,需分段处理。

适合人群

  • 频繁进行中文会议记录、访谈整理的办公用户
  • 注重数据隐私、需离线处理敏感音频的企业法务/医疗/金融从业者
  • 预算有限、希望替代 Whisper API 或讯飞等付费方案的个人开发者
  • 有基础命令行操作能力的技术爱好者

常规风险

  • 环境隔离:脚本自动创建虚拟环境,但与其他 Python 项目共用系统 Python 时可能存在依赖冲突(建议容器化部署)。
  • 模型热更新:FunASR 模型版本迭代可能导致行为变化,需关注官方更新日志。
  • 识别偏差:专业术语、极快语速或强背景噪音场景下准确率下降,建议人工校对关键内容。

Funasr Transcribe Skill 内容

scripts文件夹
手动下载zip · 4.4 kB
install.shtext/x-shellscript
请选择文件