speech-recognition

🎙️ 多格式语音一键转文字

基于硅基流动 SenseVoice 的通用语音识别工具,支持多格式音频转文字,中文识别效果优异

收藏
11.8k
安装
4.4k
版本
1.0.0
CLS 安全性认证2026-06-23
点击查看完整报告 >

使用说明

核心用法

通用语音识别 Skill 基于硅基流动(SiliconFlow)的 SenseVoice API,支持将多种音频格式(OGG、MP3、WAV、M4A、FLAC)转换为文字。主要面向两类使用场景:一是处理用户发送的语音消息文件,二是响应主动转录请求如"转录这个音频"。

使用方法有两种路径:直接调用 REST API 进行程序化转录,或通过 Kuro 内置流程自动处理。对于非 MP3 格式(如 Telegram 常用的 OGG),需先用 FFmpeg 转换为 16kHz 单声道 MP3 以优化识别效果。

显著优点

1. 中文识别精准:采用阿里达摩院开源的 SenseVoice 模型,针对中文语音优化,识别准确率高
2. 格式兼容广泛:覆盖主流音频格式,通过 FFmpeg 预处理可处理几乎所有音频输入

3. 集成成本低:标准 OpenAI 格式的 API 端点,易于接入现有工作流

4. 国内服务稳定:硅基流动为国内厂商,API 访问延迟低、可用性高

潜在缺点与局限

  • 隐私敏感:音频需上传至第三方服务器处理,不适合涉密内容
  • 文件限制:建议控制在 10MB/5 分钟以内,长音频需手动分割
  • 语言局限:虽支持英文,但中文以外的多语种效果未明确说明
  • 依赖外部服务:API Key 和配额管理增加维护成本

适合人群

  • 需要快速转录会议录音、播客、访谈的内容创作者
  • 处理即时通讯语音消息的自动化工作流开发者
  • 中文为主的语音识别需求用户

常规风险

  • API Key 泄露可能导致配额被盗用
  • 敏感语音内容存在云端留存风险
  • 网络不稳定时可能出现超时失败
  • 需自行处理格式转换和错误重试逻辑

安全解读

核心用法

speech-recognition 是一款纯文档型 Skill,为用户提供通过硅基流动 SenseVoice API 进行语音转文字的完整指南。支持 MP3、OGG、WAV、M4A、FLAC 等主流音频格式,通过 FFmpeg 完成格式转换与采样率标准化(16kHz 单声道)。用户可通过两种方式调用:直接编写 Python 脚本调用 REST API,或在 Kuro 框架内处理用户发送的语音消息。

显著优点

格式兼容性强:覆盖 Telegram/Signal 语音(OGG)、iOS 录音(M4A)、通用 MP3 等多种场景,内置 FFmpeg 转换方案解决格式壁垒。

中文识别精准:采用阿里达摩院开源的 SenseVoice 模型,针对中文语音优化,支持普通话及多方言识别。

零依赖轻量化:Skill 本身无可执行代码,仅提供标准化调用文档,避免依赖冲突和供应链攻击风险。

安全透明度高:明确披露音频数据将上传至硅基流动服务器,符合 GDPR/CCPA 用户知情权要求;全链路 HTTPS 加密传输。

潜在缺点与局限性

数据隐私敏感:音频文件需上传至第三方云服务处理,不适合处理机密语音内容;缺乏本地离线识别能力。

功能边界明确:仅提供转录功能,不支持说话人分离、情感识别、时间戳对齐等高级特性。

时长与大小限制:建议音频 < 5 分钟、< 10MB,长音频需人工分割处理。

来源可信度限制:维护者为个人开发者(T3 级别),社区生态尚处于早期,长期维护稳定性待观察。

适合人群

  • 需要快速集成中文语音识别的开发者
  • 处理日常语音消息、播客转录、会议记录的个人用户
  • 对云 API 接受度较高的轻量级应用场景
  • 不适合:金融/医疗/政务等敏感语音处理场景

常规风险

1. API 服务可用性:依赖硅基流动商业服务,存在接口变更、限流或停运风险
2. 数据驻留合规:音频数据存储于中国大陆服务器,跨境使用需评估合规性

3. API Key 泄露:示例代码存在硬编码风险提示,实际部署需采用环境变量或密钥管理服务

4. 误识别风险:嘈杂环境、口音浓重或专业术语可能导致转录准确率下降

speech-recognition 内容

手动下载zip · 2.6 kB
skill.jsonapplication/json
请选择文件