Smart Audio Analyzer

🎙️ 跨录音认人·多引擎转写·智能出纪要

跨录音声纹匹配的 AI 音频分析器,支持多引擎转写、说话人识别与智能场景纪要生成,适合会议、采访等高频语音处理场景。

收藏
2.6k
安装
1k
版本
1.2.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能与架构

Smart Audio Analyzer 是一款面向专业用户的 AI 音频处理工具,采用「转写-声纹识别-场景判断-结构化输出」四级流水线设计。其核心创新在于持久化声纹档案(voice profile)系统——通过文本模式分析与可选的 ONNX 神经网络嵌入(WeSpeaker),实现跨录音的说话人身份追踪,而非单次会话的临时标签。

显著优点

1. 多引擎容错设计:支持 AssemblyAI(云端高精度)、Gemini(Google 多模态)、Whisper(本地隐私优先)三级回退,兼顾质量、成本与数据安全。
2. 声纹档案持久化voice-profiles.md + voice-db.json 双轨存储,结合文本特征与可选的 256 维声纹嵌入,实现「认人」而非「认声纹段」。

3. 场景自适应模板:内置会议、采访、讲座、赛艇训练、通用五类场景,通过关键词自动触发,输出结构化的 action items 与 insights。

4. 隐私优先的本地计算:可选的 Python voiceprint.py 模块完全离线运行,声纹嵌入仅存本地,需用户显式确认后才更新档案。

潜在局限与风险

  • 依赖外部 API 配额:AssemblyAI 等云服务存在调用成本与速率限制,大文件(>100MB)处理耗时 5-10 分钟。
  • 声纹识别准确率边界:文本模式匹配受限于内容多样性,ONNX 模型对短语音(<3s)或噪声环境敏感,可能出现误匹配。
  • 权限面较宽:需 shell_exec(ffmpeg、whisper)、network(多云端 API)、filesystem 读写,恶意构造的音频文件名或路径存在注入风险。
  • 跨 session 数据累积:长期运行的 voice-db.json 可能形成可关联的声纹数据库,需用户定期审计或手动删除。

适合人群

  • 高频会议记录者、用户研究员、记者、播客制作人
  • 需跨文件追踪特定说话人的团队协作场景
  • 对「谁说了什么」有强追溯需求的知识管理者

常规风险管控建议

  • 敏感录音优先使用 Whisper 本地模式,关闭云端上传
  • 定期清理 references/voice-db.jsonvoice-profiles.md
  • 对不可信来源的音频文件,先隔离扫描再处理

Smart Audio Analyzer 内容

references文件夹
scenes文件夹
scripts文件夹
手动下载zip · 24.2 kB
general.mdtext/markdown
请选择文件