Video Understanding

🎬 AI 看懂视频,一键生成结构化洞察

基于 Google Gemini 多模态 AI 的智能视频分析工具,支持 1000+ 网站视频下载,自动生成带时间戳的文字记录、视觉描述和结构化摘要。

收藏
8.5k
安装
1.9k
版本
1.1.0
CLS 安全性认证2026-08-05
点击查看完整报告 >

使用说明

核心功能

Video Understanding 是一款集成 Google Gemini 多模态能力的视频分析工具,专为内容创作者、研究人员和知识工作者设计。该 skill 通过 yt-dlp 支持从 1000+ 视频网站(包括 YouTube、TikTok、Instagram、Twitter/X、Vimeo、Loom 等)下载内容,并利用 Gemini 的视觉理解能力进行深度分析。

显著优点

1. 多模态分析能力:不仅能提取语音转录文本,还能识别视频中的视觉元素(人物、场景、UI 界面、屏幕文字、流程演示等),实现真正的"看懂"视频
2. 结构化输出:自动生成包含时间戳的文字记录、视觉描述、2-3 句话摘要、演讲者识别和时长估计的标准化 JSON 格式

3. 智能问答交互:支持针对视频内容提出具体问题,Gemini 会基于视觉+音频信息进行精准回答

4. 源覆盖极广:依托 yt-dlp 的庞大生态系统,兼容几乎所有主流视频平台

5. YouTube 原生优化:YouTube 链接无需下载,直接调用 Gemini 分析,速度最快

技术实现与使用方式

  • 下载流程:非 YouTube 视频通过 yt-dlp 下载 → 上传至 Gemini File API → 轮询处理完成 → 执行分析
  • 模型配置:默认使用 gemini-2.5-flash,可通过 -m 参数切换
  • 灵活输出:支持纯下载模式(--download-only)、自定义提示覆盖(-p)、针对性问答(-q)以及原始文本输出(--raw

潜在局限与注意事项

1. 依赖外部工具:必须预先安装 yt-dlp 和 ffmpeg,且需配置 GEMINI_API_KEY
2. 文件大小限制:免费版 Gemini File API 限制 2GB,付费版 20GB;脚本默认限制 500MB

3. 长视频处理成本:10 分钟以上视频虽技术上可行,但 token 消耗和处理时间显著增加

4. 隐私合规风险:下载并上传第三方视频至 Google 服务,需确保符合目标平台 TOS 及数据隐私法规

5. 网络稳定性依赖:下载大文件和 File API 上传对网络质量要求较高

适合人群

  • 内容创作者快速提炼视频素材要点
  • 研究人员批量处理访谈、讲座、会议录像
  • 产品经理分析竞品演示视频
  • 教育工作者生成视频课程的文字辅助材料
  • 媒体记者核实视频内容真实性

常规风险提示

  • API 密钥安全:GEMINI_API_KEY 需妥善保管,避免泄露
  • 版权合规:下载受版权保护内容可能违反平台服务条款
  • 数据留存:上传至 Gemini File API 的文件按 Google 数据政策处理
  • 成本控制:大量长视频分析可能产生显著的 API 调用费用

安全解读

核心用法

Video Understanding (Gemini) 是一款面向多场景的视频智能分析技能,核心能力围绕「下载-理解-输出」三环节构建。用户只需提供任意视频 URL(YouTube、TikTok、Twitter/X、Instagram、Loom 等 1000+ 平台),系统即可自动完成:转录文本生成(带 [MM:SS] 时间戳)、视觉内容描述(人物、场景、UI、屏幕文字、流程)、2-3 句精炼摘要、时长估算及说话人识别。支持两种交互模式:直接获取结构化 JSON 完整分析,或通过 -q 参数针对特定问题进行精准问答。

技术实现上,YouTube 链接可直接透传至 Gemini API 免下载,其他平台则通过 yt-dlp 获取视频后上传至 Gemini File API 异步处理。提供丰富的命令行选项:模型选择(默认 gemini-2.5-flash)、输出文件保存、文件大小限制(默认 500MB)、仅下载模式、保留临时文件等,满足不同使用场景需求。

显著优点

平台兼容性极强:依托 yt-dlp 覆盖全球主流视频站点,无需适配单个平台 API,极大扩展可用范围。处理效率优化:YouTube 零下载链路最快响应,大文件(10 分钟+)支持最高 2GB(免费)/ 20GB(付费)上传,满足长视频分析需求。输出结构化:JSON 格式包含转录、描述、摘要、时长、说话人等多维信息,便于下游自动化集成。灵活问答增强:在完整分析基础上叠加 -q 参数,实现「先全景理解、再精准提问」的渐进式交互。自动清理机制:临时文件与 Gemini 上传内容自动销毁,降低存储与隐私残留风险。

潜在缺点与局限性

外部依赖较重:必须安装 yt-dlp、ffmpeg 并配置 GEMINI_API_KEY,环境准备门槛对非技术用户存在一定挑战。网络与存储开销:非 YouTube 视频需完整下载再上传,大文件场景消耗本地带宽与临时磁盘空间。隐私外发不可回避:视频内容(尤其非 YouTube)需上传至 Google 云服务处理,机密、敏感或受监管内容存在合规风险。实时性受限:Gemini File API 异步处理需轮询等待,大视频分析耗时较长,非即时响应。定制化受限:prompt 覆盖模式(--raw)虽开放,但缺乏细粒度模板配置,深度定制需修改源码。

适合的目标群体

内容创作者与运营人员:批量提取视频文案、生成摘要用于多平台分发。市场研究与竞品分析:快速理解竞品视频内容、用户反馈视频,提炼关键信息。教育与学术用户:课程视频转录、讲座内容结构化归档。开发工程师与自动化场景:作为 pipeline 环节,将视频理解能力嵌入数据处理工作流。多语言内容处理者:Gemini 原生多语言能力,助力跨语言视频分析。

常规使用风险

性能风险:yt-dlp 下载大文件或遭遇慢速源时可能长时间阻塞,当前未内置超时机制,极端情况导致任务挂起。依赖可用性:yt-dlp 需跟随视频平台反爬策略持续更新,版本滞后可能导致特定站点下载失败。API 配额与成本:Gemini API 调用受 Google 速率限制与计费策略约束,高频或大文件场景需关注配额消耗。隐私合规风险:尽管已明确披露数据外发,用户仍需自行评估上传内容是否涉及个人信息、商业机密或地域合规要求(如 GDPR、数据出境等)。环境变量安全:GEMINI_API_KEY 需安全存储,避免泄露导致滥用或配额盗刷。

Video Understanding 内容

scripts文件夹
手动下载zip · 6.0 kB
analyze_video.pytext/plain
请选择文件