核心用法
Browser Audio Capture 是一套双组件解决方案,通过 Chrome 扩展捕获浏览器标签页音频,经 Python 服务中转后流式传输至任意 AI 智能体。
两种工作模式:
1. CLI 模式:依赖 Chrome 远程调试协议(--remote-debugging-port=9222),通过 Python 脚本列出标签页、自动检测会议、持续监听(15秒轮询)
2. Chrome 扩展模式:一键式持久化捕获,后台运行不受弹窗关闭影响,支持所有主流 Web 会议平台
输出规格:PCM16 格式音频,16kHz 采样率,Base64 编码,通过 HTTP POST 推送至本地端点(默认 127.0.0.1:8900/audio/browser),可直接对接 Whisper、Deepgram、NVIDIA Riva 等转录服务。
显著优点
- 零认证负担:无需 API 密钥、OAuth 或平台专用集成,规避了传统会议转录服务的账户体系和费率限制
- 架构通用性:输出为标准 HTTP + JSON,与 Claude、ChatGPT、LangChain、CrewAI 等任意框架兼容
- 平台覆盖广:原生支持 Google Meet、Zoom Web、Teams、Webex、Discord 等 12+ 平台,理论上覆盖所有浏览器音频源
- 本地优先设计:音频流不出本机即可处理,满足敏感会议数据的隐私诉求
潜在缺点与局限性
- 浏览器锁定:强制依赖 Chrome 远程调试或扩展安装,Firefox/Safari 用户无法使用
- 安装摩擦:CLI 模式需命令行启动 Chrome 特殊实例;扩展模式需手动加载未打包扩展(非 Chrome Web Store 分发)
- 无内置转录:仅提供原始音频流,需自行搭建或对接转录服务,完整 pipeline 工程成本较高
- MV3 缓存问题:扩展需频繁重装以规避 Manifest V3 的 aggressive caching
- 无持久化存储:报告未提及本地音频存档或回放机制
适合人群
- 需要跨平台会议摘要的远程工作者(避免为每个平台购买转录服务)
- 构建语音 AI 工作流的开发者(需要标准化音频输入源)
- 对云端转录有隐私顾虑的企业用户(可本地部署 Whisper 等)
- 播客/课程学习者希望自动化生成结构化笔记
常规风险
| 风险类别 | 具体说明 |
|---------|---------|
| 浏览器安全 | 远程调试端口(9222)若暴露于公网,可能遭未授权访问;需在本地防火墙限制 |
| 扩展权限 | 扩展需访问所有标签页音频,存在被恶意利用的潜在攻击面;建议仅从可信源码安装 |
| 隐私合规 | 捕获他人参与的会议音频可能违反企业政策或地区法律(如 GDPR 通话录音告知义务) |
| 数据流安全 | HTTP 明文传输(非 HTTPS),本地回环虽低风险,但多用户共享机器时存在嗅探可能 |
| 维护风险 | 非 Chrome Web Store 官方分发,Chrome 更新可能破坏扩展兼容性 |