核心用法
human_test() 是一款将真人可用性测试自动化、结构化的技能。开发者只需提供产品URL或描述,系统即自动生成测试计划,招募真实人类测试者完成15分钟屏幕录制+语音反馈,最终由Gemini AI分析视频帧与音频转录,输出标准化可用性报告。
调用流程简洁:POST任务创建 → 测试者认领执行 → AI聚合分析 → 返回Markdown格式报告。支持Webhook异步通知,可选配GitHub仓库实现代码级自动修复PR。
显著优点
1. 真人验证弥补AI盲区:AI无法判断人类情感、认知负荷与真实使用场景,该技能填补了这一关键缺口
2. 结构化输出便于机器解析:报告严格遵循固定格式(Metadata → Executive Summary → Issues [CRITICAL/MAJOR/MINOR] → Recommendations [P0-P3]),AI代理可直接读取并自动创建Issue或PR
3. 闭环自动化:配合repoUrl参数,系统可自动克隆仓库、分析代码、生成diff并提交PR,实现"测试-发现-修复"全自动流水线
4. 零门槛托管模式:提供https://human-test.work托管服务,无需部署即可使用;同时支持本地自托管,自动检测环境API密钥
5. 多语言支持:支持英文/中文报告输出
潜在局限与风险
1. 成本与规模限制:真人测试者招募存在边际成本,maxTesters上限50人,不适合大规模A/B测试
2. 时延不可控:依赖真人完成任务,无法像纯AI测试即时返回结果,需轮询或Webhook等待
3. 测试者质量方差:虽有多轮筛选,真人理解与执行仍可能存在偏差,需结合视频复核关键发现
4. 代码修复权限风险:Mode 2需向平台GitHub账号授予写权限,虽便利但引入第三方代码提交信任假设
5. 隐私合规:屏幕录制含用户真实操作,需确保测试产品无敏感数据暴露,且符合GDPR等录屏同意规范
适合人群
- AI产品团队需验证人机交互设计
- 独立开发者缺乏专职UX研究员
- 追求DevUXOps自动化的技术团队
- 多语言产品需跨文化可用性验证
常规风险提示
- API密钥安全:自托管模式依赖环境变量中的大模型API密钥,需确保
.env文件不被泄露 - Webhook验证:接收端需校验请求来源,防止伪造报告注入
- 代码审查义务:自动生成的PR仍需人工审查,不建议直接合并至生产分支