Smart Audio Analyzer

🎙️ 跨会话声纹识别 · 智能场景纪要

跨会话声纹识别的全能录音分析工具,支持多引擎转写、场景自动检测与结构化纪要生成

收藏
2.6k
安装
1k
版本
1.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

Smart Audio Analyzer 综合评估

核心用法

Audio Analyzer 是一款端到端的录音分析技能,覆盖从音频转写、说话人识别到场景纪要生成的完整工作流。用户只需提供音频文件(支持 m4a/mp3/wav/ogg/flac),系统即自动完成:多引擎转写(AssemblyAI/Gemini/Whisper 三选一)→ 声纹分离与跨会话档案匹配 → 场景智能检测(会议/访谈/培训/讲座/泛用)→ 加载对应模板生成结构化纪要 → 更新持久化音色档案。

其独特价值在于声纹档案持久化——首次识别并确认的说话人会在 voice-profiles.md 中建档,后续录音无需重复标注即可自动匹配身份,实现"一次标注,长期复用"。

显著优点

1. 多引擎冗余:AssemblyAI(推荐,质量最优)、Gemini、本地 Whisper 三级降级,兼顾精度与可用性
2. 跨会话声纹匹配:目前唯一支持持久化 voice profile 的开源音频技能,解决"每次都要重标说话人"的痛点

3. 场景感知输出:内置 5 类场景模板,自动触发对应纪要结构(如赛艇训练抓关键词"stroke rate/pace",会议聚焦"deadline/action items")

4. 零配置 fallback:未配置 API key 时自动尝试本地 Whisper,降低上手门槛

5. 可扩展架构:新增场景仅需在 references/scenes/ 添加 Markdown 模板

潜在缺点与局限

  • 隐私敏感:音频上传至 AssemblyAI/Gemini 等第三方服务,敏感场景需本地 Whisper 方案
  • 声纹精度边界:同一人变声(感冒/情绪激动)或音质极差时匹配可能失效
  • 中文声纹库局限:开源声纹模型对中文说话人区分度弱于英文
  • 大文件处理瓶颈:>100MB 文件处理需 5-10 分钟,无流式处理
  • 依赖 Node.js 生态:环境配置对非技术用户有门槛

适合人群

  • 会议/访谈密集的知识工作者:需批量产出结构化纪要
  • 播客/内容创作者:自动分角色生成节目 timecode
  • 科研/田野调查者:长期跟踪同一批受访者的语音档案
  • 赛艇/健身爱好者:内置 Rowing 场景模板,自动提取训练数据

常规风险

| 风险类型 | 说明 | 缓解建议 |
|---------|------|---------|
| API 配额耗尽 | AssemblyAI/Gemini 有调用限制 | 本地 Whisper 备份,或监控用量 |
| 声纹误匹配 | 相似音色导致身份混淆 | 人工复核机制,置信度阈值提示 |
| 数据泄露 | 音频上传云端服务 | 敏感内容强制使用 Whisper 本地模式 |
| 档案膨胀 | 长期积累大量 voice profiles | 定期归档清理机制需自建 |

Smart Audio Analyzer 内容

references文件夹
scenes文件夹
scripts文件夹
手动下载zip · 23.3 kB
general.mdtext/markdown
请选择文件