核心用法
抖音视频智能助手(douyin-transcribe)是一套端到端的视频内容处理方案,支持三类触发方式:抖音官方链接(v.douyin.com)、本地视频文件、含链接的分享文本。系统通过浏览器自动化捕获 DASH 音频流,经 ffmpeg 下载后调用 Groq Whisper large-v3 完成语音识别(约3秒),再由 LLM 进行智能标点与分段,最终根据用户意图输出结构化结果。
五种处理模式:
- 默认模式:自动总结视频要点(3-7条)+ 一句话概括,适合快速了解内容
- 逐字稿模式:输出完整转录文本,超长内容自动截断并提示文件路径
- 总结模式:深度结构化总结,含核心观点、关键要点、适用场景
- 归档模式:保存至
douyin-knowledge/目录,格式为 Markdown,含元数据与全文 - 讨论模式:基于内容给出 AI 分析、质疑点及与用户场景的关联建议
显著优点
1. 零成本运行:依赖 Groq 免费层(Whisper + LLM),无额外云服务费用
2. 多模态触发:链接、文件、分享文本均可识别,覆盖移动端主流分享场景
3. 智能意图识别:无需显式指令,自动匹配最适合的输出模式
4. 持续对话能力:转录结果驻留上下文,后续追问无需重复转录
5. 开放架构:ffmpeg + Node.js 脚本,可本地部署或集成至 OpenClaw 工作流
潜在缺点与局限性
- 依赖 Groq 服务稳定性:免费层存在 429 限流,高峰期可能延迟
- 音频质量敏感:背景音乐、方言、专业术语识别准确率下降
- 25MB 文件上限:长视频需分段处理或用户自行剪辑
- 网页版登录状态:部分视频需登录抖音网页版才能获取音频流
- 隐私边界:用户视频内容流经 Groq 云端,敏感信息需本地 Whisper 替代方案
适合人群
- 信息焦虑型用户:快速筛选海量短视频,提取可执行知识
- 内容创作者:追踪竞品动态、整理选题素材、归档爆款文案
- 研究人员:访谈视频、讲座内容的批量转录与结构化
- 团队协作者:飞书/Notion 知识库建设,支持一键同步
常规风险
- API Key 泄露:
.env文件需加入.gitignore,避免意外提交 - 版权内容处理:转录他人视频需注意合理使用范围,商用建议获取授权
- 依赖管理:ffmpeg 需用户自行安装,Windows 环境配置门槛较高
- 服务连续性:Groq 免费政策可能调整,建议预留备选 TTS/ASR 方案