核心功能与架构
Smart Audio Analyzer 是一款面向专业用户的 AI 音频处理工具,采用「转写-声纹识别-场景判断-结构化输出」四级流水线设计。其核心创新在于持久化声纹档案(voice profile)系统——通过文本模式分析与可选的 ONNX 神经网络嵌入(WeSpeaker),实现跨录音的说话人身份追踪,而非单次会话的临时标签。
显著优点
1. 多引擎容错设计:支持 AssemblyAI(云端高精度)、Gemini(Google 多模态)、Whisper(本地隐私优先)三级回退,兼顾质量、成本与数据安全。
2. 声纹档案持久化:voice-profiles.md + voice-db.json 双轨存储,结合文本特征与可选的 256 维声纹嵌入,实现「认人」而非「认声纹段」。
3. 场景自适应模板:内置会议、采访、讲座、赛艇训练、通用五类场景,通过关键词自动触发,输出结构化的 action items 与 insights。
4. 隐私优先的本地计算:可选的 Python voiceprint.py 模块完全离线运行,声纹嵌入仅存本地,需用户显式确认后才更新档案。
潜在局限与风险
- 依赖外部 API 配额:AssemblyAI 等云服务存在调用成本与速率限制,大文件(>100MB)处理耗时 5-10 分钟。
- 声纹识别准确率边界:文本模式匹配受限于内容多样性,ONNX 模型对短语音(<3s)或噪声环境敏感,可能出现误匹配。
- 权限面较宽:需 shell_exec(ffmpeg、whisper)、network(多云端 API)、filesystem 读写,恶意构造的音频文件名或路径存在注入风险。
- 跨 session 数据累积:长期运行的 voice-db.json 可能形成可关联的声纹数据库,需用户定期审计或手动删除。
适合人群
- 高频会议记录者、用户研究员、记者、播客制作人
- 需跨文件追踪特定说话人的团队协作场景
- 对「谁说了什么」有强追溯需求的知识管理者
常规风险管控建议
- 敏感录音优先使用 Whisper 本地模式,关闭云端上传
- 定期清理
references/voice-db.json与voice-profiles.md - 对不可信来源的音频文件,先隔离扫描再处理