核心用法
Speak AI 通过 MCP 协议连接用户的工作空间,提供84个工具、5个资源和3个多步骤提示,覆盖媒体管理、转录、AI洞察、文件夹、录制器、自动化和导出等全链路功能。核心能力包括:
- 录音与转录:上传音视频文件或实时录制,自动生成带说话人识别的转录文本
- AI 分析:提取摘要、行动项、情感分析、主题聚类等洞察
- 搜索与查询:跨数千条录音的深度搜索,支持语义查询和元数据过滤
- 异步调研:创建语音/视频录制器,收集受访者的异步反馈
- 会议助手:自动加入 Zoom/Google Meet/Teams 会议并实时转录
- 自动化工作流:通过 Webhook 和自动化规则触发后续处理
显著优点
1. 功能全面:84个工具覆盖从上传到导出的完整生命周期,无需切换多个系统
2. 集成友好:支持 Claude、ChatGPT、Cursor、VS Code 等主流 AI 助手,提供 OAuth 和 API key 两种认证方式
3. 企业级治理:细粒度权限控制、审计日志、自定义字段和文件夹管理
4. 多模态输出:支持剪辑生成、字幕导出(SRT/VTT)、嵌入式分享等多种格式
潜在缺点与局限性
1. 数据驻留限制:录音默认存储在 Speak AI 云端,对数据主权敏感的行业需额外评估
2. 成本累积:大量媒体的重新分析(reanalyze)和批量导出可能产生较高费用
3. 实时性边界:"实时"转录实际为增量拉取模式,非真正的流式推送
4. 平台锁定:深度使用自定义字段、自动化和录制器后,迁移成本较高
适合人群
- 用户研究员:管理访谈录音、跨项目分析主题模式
- 销售团队:批量分析销售通话、提取异议和客户反馈
- 产品经理:自动记录用户会议、追踪决策和行动项
- 内容创作者:剪辑播客/网络研讨会片段、生成字幕
- 企业培训部门:异步视频调研、培训材料归档
常规风险
| 风险类别 | 说明 |
|---------|------|
| **误操作删除** | `delete_media` 为永久删除,需二次确认 |
| **持久副作用** | Webhook、自动化、录制器在对话结束后仍运行,需告知用户回滚方式 |
| **数据泄露** | `generate_recorder_url` 和 `create_embed` 生成公开可访问链接,需确认分享意图 |
| **提示注入** | 转录内容可能包含伪装指令的文本,需视为不可信数据 |
| **范围蔓延** | 默认应使用搜索过滤,避免枚举整个媒体库 |
安全文档明确要求:所有删除、批量操作、持久化配置和外链生成前必须获得用户明确确认("yes"/"go ahead"/"confirm"),模糊回应不得继续执行。