核心用法
GLMV-Grounding 是智谱 AI GLM-V 多模态大模型的原生 grounding 能力封装,可将自然语言描述的目标转化为图像/视频中的精确空间坐标。核心功能覆盖三大场景:
1. 图像空间定位
- 2D 边界框(默认):
[[x1,y1,x2,y2], ...]格式 - 2D 关键点:
[[x,y], ...]点序列 - 2D 多边形:
[[x1,y1],[x2,y2],...]轮廓顶点 - 3D 边界框:包含中心点、尺寸、旋转角度的 8 参数格式
2. 视频时序追踪
输出按帧索引组织的追踪结果:{0:[{label:'car-1',bbox_2d:[...]},...], 1:[...]},支持多目标跨帧关联。
3. 工具链生态
- 坐标解析:从模型自然语言响应中提取结构化坐标
- 归一化转换:像素坐标 ↔ 0-1000 相对坐标互转
- 可视化渲染:2D/3D 框、点集、视频追踪轨迹的图像标注
坐标系统统一采用左上角原点,归一化公式 x=round(x_pixel/W*1000) 确保跨分辨率一致性。
显著优点
- 原生模型能力:直接调用 GLM-V API,无需额外训练或微调
- 多模态统一:单模型同时处理图像 grounding 与视频 MOT(多目标追踪)
- 格式灵活:支持从简单坐标到复杂 3D 框的 6 种输出格式
- 开箱即用:提供 CLI 工具与 Python API 双层接口,含完整的可视化流水线
- 动态提示适配:未指定格式时自动默认 2D 边界框,降低使用门槛
潜在局限
- 坐标范围约束:强制 0-1000 整数归一化,对超高精度需求场景(如医学影像)可能损失亚像素精度
- API 依赖:完全依赖智谱官方服务,存在速率限制与可用性风险
- 提示敏感性:坐标值可能受提示词影响而脱离归一化范围,需二次校验
- 3D 可视化简化:当前 3D 框投影为简化实现,复杂相机参数场景需额外验证
适合人群
- 需要快速构建视觉定位 Demo 的 AI 开发者
- 研究多模态大模型空间理解能力的科研人员
- 构建视频分析、智能标注工具的产品团队
- 已有智谱 API 接入基础的技术组织
常规风险
- 数据隐私:图像/视频内容需上传至智谱云端处理
- API 密钥管理:
ZHIPU_API_KEY硬编码或泄露风险 - 超时处理:默认 60 秒超时,大视频文件可能中断
- 归一化误解:用户可能混淆相对坐标与像素坐标,导致可视化错位
- 追踪 ID 漂移:视频长序列下目标 ID 一致性依赖模型稳定性