核心用法
human_test() 是一个人机协作测试技能,允许AI代理调用真实人类测试任意URL并获取结构化反馈。核心流程为:提交产品URL → AI自动生成测试计划 → 真实测试者在Web平台认领任务 → 完成三步引导反馈(初印象、任务步骤、NPS评分)→ AI聚合生成包含严重度分级的问题报告。
调用方式:支持Hosted零部署版本(https://human-test.work)或本地自托管(npm安装)。通过REST API创建任务,轮询状态或接收Webhook获取结果。
显著优点
1. 真实人类反馈:弥补AI无法判断人类感知、情绪和可用性体验的短板
2. 结构化输出:报告采用机器可解析的固定格式,含Metadata表格、严重度分级问题(CRITICAL/MAJOR/MINOR)、优先级建议(P0-P3),便于AI代理自动处理
3. 代码修复闭环:可选传入repoUrl,平台可克隆仓库、分析代码、生成统一差异补丁,甚至自动创建PR
4. 双Webhook机制:报告完成和代码修复分别推送,支持异步工作流
5. 低门槛部署:Hosted版本零配置;自托管版本自动检测环境API密钥,一键启动
潜在局限
- 依赖人工测试者:测试质量和响应速度受真实人类参与意愿影响,无法保证实时性
- 成本不透明:未说明测试者报酬或平台收费模式
- 安全边界模糊:代码修复功能需授予GitHub仓库访问权限(
avivahe326用户),存在供应链安全风险 - N=1-50样本量:小规模测试可能缺乏统计显著性,重大决策需谨慎
- 自动代码修复风险:AI生成的代码修复建议未经人工审核直接创建PR,可能引入新Bug
适合人群
- 独立开发者/MVP快速验证:低成本获取真实用户反馈
- AI原生产品团队:需要闭环自动化测试→修复流程
- UX研究员:需要结构化可用性数据补充传统方法
常规风险
- 数据泄露风险:测试URL暴露给外部测试者,敏感环境需谨慎
- 权限过度授予:Mode 2写权限模式若被滥用可修改生产代码
- Webhook安全:未提及Webhook签名验证,存在伪造回调风险
- 依赖服务可用性:Hosted版本依赖第三方平台持续运营