Gemini Yt Video Transcript

📝 AI 一键转录 YouTube 视频

通过 Google Gemini AI 为 YouTube 视频生成逐字转录文本,自动识别说话人并分段,适合快速获取无时间戳的纯净字幕稿。

收藏
17k
安装
3.5k
版本
1.0.1
CLS 安全性认证2026-06-25
点击查看完整报告 >

使用说明

核心用法

本技能调用 Google Gemini 大语言模型,为指定的 YouTube URL 生成完整的逐字转录文本。用户只需提供视频链接,脚本会自动提取音频并提交给 Gemini 处理,输出格式简洁规范:首行为视频标题,随后每行以 "Speaker: text" 的形式呈现对话内容。

显著优点

  • AI 驱动的说话人分离:自动识别不同说话人并添加标签,比传统字幕更便于阅读
  • 纯净输出:去除时间码和冗余信息,直接获得可编辑的文本稿
  • 灵活导出:支持 --out 参数指定输出路径,方便批量处理
  • 无需本地 ASR 依赖:转录由云端 Gemini 完成,不依赖本地语音识别模型

潜在缺点与局限性

  • 依赖外部 API:需要有效的 GEMINI_API_KEY,存在配额和费用风险
  • 网络与隐私:视频音频需上传至 Google 处理,敏感内容需谨慎
  • 无时间戳:设计初衷为阅读友好,但无法用于精准定位视频片段
  • 语言支持受限:实际效果取决于 Gemini 对视频语言的支持程度
  • 长视频分段:未明确说明超长视频的处理策略,可能存在截断风险

适合人群

  • 播客/访谈创作者需要快速生成文字稿
  • 研究人员整理视频访谈资料
  • 内容创作者提取视频脚本进行二次编辑
  • 听力障碍用户获取视频文字内容

常规风险

  • API 密钥泄露可能导致滥用或额外费用
  • 云端处理涉及数据跨境传输合规问题
  • AI 转录可能存在识别错误,重要场景需人工校对
  • 依赖 YouTube 视频可访问性,区域限制内容无法处理

安全解读

核心功能

Gemini YouTube Video Transcript 是一款基于 Python 标准库构建的 YouTube 视频转录工具。它通过调用 Google Gemini 3 Pro 大语言模型,将视频内容转换为结构化的逐字文本,自动标注说话人身份,并智能分段排版。整个流程无需时间戳干扰,输出格式干净专业。

显著优势

零依赖架构是该 Skill 的最大亮点。仅使用 Python 内置模块(argparse、json、urllib、pathlib),彻底规避了供应链攻击风险。对比需要安装 ffmpeg、yt-dlp 等重型依赖的传统方案,部署极其轻量。

输出质量方面,Gemini 3 Pro 对长上下文的支持使转录完整性远超 Whisper 等本地模型,尤其适合会议记录、播客、访谈等多人对话场景。说话人标签自动生成,省去后期人工校对。

安全设计贯彻最小权限原则:API 密钥仅通过环境变量读取,无硬编码;网络通信强制 HTTPS;文件写入路径完全由用户控制。

潜在局限

来源可信度 T3 是最主要顾虑。维护者 odrobnik 为个人开发者,虽代码经审计无恶意,但长期维护能力和响应速度存疑。建议用户 fork 后自主维护或关注更新动态。

成本与延迟方面,Gemini 3 Pro 按 token 计费,长视频可能产生较高费用;15 分钟超时设置虽保障完整性,但网络波动时体验不佳。

功能边界清晰:不支持实时转录、无多语言自动识别配置、不提供 SRT/VTT 等字幕格式导出。

适合人群

  • 研究人员、记者需要快速获取视频文字稿
  • 播客制作者整理访谈内容
  • 企业培训部门归档线上会议
  • 对供应链安全敏感的技术团队

常规风险

需妥善保管 GEMINI_API_KEY,避免泄露导致账户被盗刷;转录内容可能涉及版权视频,用户需自行确保合法使用;输出文件默认写入当前目录,注意避免覆盖现有文件。

Gemini Yt Video Transcript 内容

scripts文件夹
手动下载zip · 3.4 kB
youtube_transcript.pytext/plain
请选择文件