核心用法
Disco 是一款假设无偏的模式发现引擎,专为探索性数据分析设计。用户上传表格数据(CSV/Excel/Parquet 等,最大 5GB),指定目标列后,系统自动执行:
1. 系统性搜索:遍历特征交互、非线性阈值、子群效应,不依赖预设假设
2. 统计验证:在留出集上用 FDR 校正 p 值检验,避免过拟合
3. 新颖性评估:对照学术文献库,标记为"novel"(未报道)或"confirmatory"(已知),附引用和解释
4. 结构化输出:返回包含条件、效应量、支持度、置信度的可解释模式
集成方式灵活:远程 MCP 服务器(零安装)、Python SDK(本地大文件流式处理)、REST API(任意语言)。
显著优点
- 发现人力难以察觉的模式:自动搜索高阶交互和条件关系,突破分析师的认知盲区
- 统计严谨性:多重检验校正、留出验证,结果可信度高于常规探索性分析
- 学术对齐:每个"novel"发现附带文献比对说明,降低"重新发现已知结论"的风险
- 工程完整:异步执行不阻塞、成本预估透明、支持从免费公开分析到企业级私有部署
- 输出友好:生成交互式 Web 报告,可直接用于论文或业务决策
潜在局限
- 数据格式限制:仅支持扁平表格,不支持图像、文本文档、嵌套 JSON
- 成本门槛:深度分析和私有运行需消耗积分($0.10/积分),大文件高深度分析可能较贵
- 黑箱成分:核心搜索算法未完全开源,依赖 Leap Labs 的云服务
- 解释深度依赖 LLM:关闭 LLM 时,模式描述泛化、缺乏文献引用和新颖性评估
- 目标列依赖:必须有明确的单目标列,不适合无监督探索
适合人群
- 科研人员:假设生成、文献空白识别、临床/农业/社会科学数据挖掘
- 数据科学家:特征工程前的自动化 EDA、交互效应发现
- 分析师团队:快速定位数据中的"意外"驱动因素,避免确认偏误
- MCP/Agent 开发者:为 AI 工作流添加结构化发现能力,替代手写探索代码
常规风险
- 数据泄露:公开分析免费但结果公开发布;私有分析需妥善保管 API key
- 成本失控:未预估即运行大深度分析可能消耗大量积分
- 误读模式:"novel"仅表示文献未报道该具体组合,不保证因果或普适性
- 前置处理关键:若未排除标识符、泄露列或同义反复列,会产生"伪发现"