Human Test

🧪 真人测试你的产品,AI 自动修复

调用真人测试产品,生成结构化可用性报告与 NPS 评分,支持代码修复建议,实现 AI 驱动的人机协作测试闭环。

收藏
2.3k
安装
987
版本
1.5.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

human_test() 是一个将真人测试与 AI 分析深度结合的可用性研究工具。开发者只需提供产品 URL,系统即可自动创建结构化测试任务,招募真人测试者完成 3 步引导式反馈流程(第一印象、任务步骤、NPS 评分),最终由 AI 聚合生成包含严重度分级的综合报告。

该技能支持两种部署模式:托管版(https://human-test.work,零配置)与 自托管版(npm 全局安装,本地 SQLite + 自动检测 AI API 密钥)。核心调用方式为 POST 请求创建任务,随后通过轮询或 webhook 接收报告。

显著优点

1. 结构化输出专为 AI 设计:报告采用机器可解析的固定格式(Metadata → Executive Summary → Issues → Recommendations),每个问题标注 [CRITICAL]/[MAJOR]/[MINOR] 严重度与 P0-P3 优先级,便于 AI 代理直接读取并触发自动化修复。

2. 闭环自动化能力:支持 repoUrl 参数,测试完成后自动克隆仓库、分析问题代码、生成 unified diff 级别的修复建议,甚至可自动创建 PR(需授予 GitHub 写入权限)。

3. 人机协同验证:弥补纯 AI 评估在感知、情感、真实用户场景中的盲区,NPS 量化指标与定性反馈结合,提供比纯自动化测试更可信的 UX 洞察。

4. 异步 webhook 架构:测试报告与代码修复分阶段推送,支持长时任务的无阻塞集成。

潜在缺点与局限性

  • 真人测试者质量波动:尽管流程标准化,测试者背景差异可能影响反馈一致性,需足够样本量(默认 5 人,上限 50)稀释个体偏差。
  • 时延不可控:真人参与意味着任务完成时间从分钟级到小时级不等,不适合需要即时反馈的场景。
  • 代码修复准确性依赖 AI 推理:Repo-aware 模式虽能定位文件并生成 diff,但复杂架构问题的修复建议仍需人工复核,自动 PR 存在引入 regression 的风险。
  • 托管版依赖外部服务:自托管版虽可私有化,但需维护 Node.js 环境与 AI API 配额。

适合人群

  • AI 代理开发者:需构建"测试-分析-修复-验证"闭环的自动化工作流
  • 独立开发者/小团队:缺乏专职 UX 研究员,需快速获取可执行的可用性洞察
  • 持续交付团队:将真人可用性测试集成进 CI/CD,作为发布前的质量 gate

常规风险

  • 数据隐私:测试产品 URL 可能对真人暴露未发布功能,敏感环境需使用自托管版并控制测试者招募。
  • GitHub 权限管理:Mode 2 的自动 PR 功能需授予第三方用户写入权限,存在供应链安全风险,建议仅在私有沙盒仓库启用。
  • 成本累积:AI 聚合分析与代码修复生成消耗 LLM token,高频调用需监控配额。

Human Test 内容

手动下载zip · 3.7 kB
SKILL.mdtext/markdown
请选择文件