modelshow

🕶️ 双盲AI模型竞技场 · 客观评判每一句回答

双盲AI模型评估框架,通过密码学随机匿名化和独立裁判机制,消除偏见地比较多模型响应质量,适合客观基准测试与选型决策。

收藏
4.9k
安装
1k
版本
1.0.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

ModelShow 是一个专业级多模型比较框架,通过双盲评估机制确保评判的客观性。用户以 mdlsmodelshow 开头触发指令,系统并行调用配置的多个模型(如 Claude、GPT-4、Grok、Kimi 等),使用 secrets.SystemRandom() 进行密码学安全的响应顺序随机化,将匿名化后的结果提交给独立的裁判模型评分,最后自动脱敏还原并输出排名结果。

完整流程包括:配置加载 → 并行模型调用 → 智能轮询收集 → 密码学匿名化 → 裁判评估与自动脱敏 → 格式化输出 → 强制结果持久化。系统会提取裁判的「Overall Assessment」 holistic 分析,生成包含分数、评语和模型响应全文的专业报告,并以 JSON 和 Markdown 格式保存到指定目录。

显著优点

1. 架构级去匿名化保证:裁判子代理在返回前自动完成脱敏,编排器始终只接触真实模型名称,从根本上杜绝标签偏见
2. 密码学安全随机化:采用 Python secrets 模块的加密安全随机数,而非伪随机,确保响应顺序不可预测

3. Holistic 评判维度:裁判不仅给出 1-10 分数排名,还提供跨模型模式的「Overall Assessment」综合分析

4. 智能轮询机制:20 秒间隔自动检测完成状态,避免空等,同时保证最少 3 次轮询和最大超时控制

5. 强制持久化设计:Step 8 为强制性步骤,结果必须经 save_results.py 确认 {"success": true} 才算任务完成,防止数据丢失

6. 可扩展架构:支持自定义模型列表、裁判模型、输出目录,可选 update_modelshow_index.py 生成 Web 索引

潜在缺点与局限性

1. 成本倍增效应:每次调用至少触发 N+1 次模型请求(N 个参评模型 + 1 个裁判),高频使用成本显著
2. 裁判模型依赖:最终评判质量完全取决于 config.judgeModel 的能力,若裁判本身存在偏见,系统性偏差难以消除

3. 超时与失败处理:单模型 360 秒默认超时,若 minSuccessful 未满足则整体中止,长任务可能频繁失败

4. 无实时反馈:并行查询期间仅显示「⏳ Models responding...」等无内容状态更新,用户需等待完整流程结束

5. 配置维护成本:需手动维护 config.json 中的模型别名列表,与平台实际可用模型同步

适合人群

  • AI 研究人员与产品经理:需要客观基准测试对比多模型性能
  • 企业选型决策者:评估不同模型在特定业务场景下的表现差异
  • 提示工程师:验证提示词在不同模型间的迁移效果
  • 技术内容创作者:生成可复现的模型能力对比报告
  • 自动化运维:结合 Cron 定时执行回归测试,追踪模型版本迭代表现

常规风险

1. 数据隐私:用户提示和模型响应会流经裁判模型,敏感信息可能暴露给第三方模型提供商
2. 成本失控:并行调用多个高端模型(如 GPT-4、Claude 3 Opus)费用高昂,缺乏内置预算限制机制

3. 文件系统安全save_results.py 接收 JSON 管道输入,若配置中的 outputDir 指向可写系统目录,存在路径遍历风险(尽管通常受限用户权限)

4. 裁判一致性:同一提示多次运行可能因裁判模型温度设置或随机性导致评分波动,未内置统计显著性检验

5. 网络依赖:全流程依赖外部模型 API,任一服务商故障均可能导致任务失败或超时

modelshow 内容

手动下载zip · 23.5 kB
blind_judge_manager.pytext/plain
请选择文件