核心用法
Disco 是一款假设无关的自动化发现引擎,专为识别表格数据中的隐藏模式而生。用户只需提供数据集和目标列,系统即可自动搜索特征交互、子群效应和条件关系,无需预先假设或人工探索。
标准工作流:上传数据 → 选择目标列 → 排除标识符/泄露列/同义反复列 → 选择公开/私有分析 → 运行深度分析 → 获取结构化结果。支持 MCP Server、Python SDK 和 REST API 三种集成方式,最大支持 5GB 数据。
显著优点
1. 真正的自动化发现:不同于传统分析工具需要用户知道问什么,Disco 主动寻找"没人想到要问"的模式,覆盖非线性阈值、多特征交互和特定子群效应。
2. 严格的统计验证:所有发现均经过 FDR 校正 p 值检验,并在 hold-out 数据上验证,避免过拟合和假阳性。
3. 文献 novelty 评估:自动对比学术文献数据库,区分"确认已知发现"与"真正 novel 发现",附带引用和 novelty 解释。
4. 结构化可解释输出:每个模式包含自然语言描述、精确条件范围(如"湿度 72-89% 且风速 <12km/h")、效应量、p 值、支持度和学术引用。
5. 灵活的访问层级:公开分析免费(深度锁定为 2,结果公开);私有分析按需付费(深度可调),适合敏感数据。
潜在局限
- 仅支持表格数据:不支持图像、原始文本文档、嵌套 JSON 或多表关联分析。
- 需要目标列:必须指定明确的预测目标,不适合纯探索性无监督分析。
- 成本随深度指数增长:深度 3+ 分析对宽数据集可能消耗大量 credits。
- 黑箱搜索机制:虽然输出可解释,但搜索策略本身不透明,用户无法干预搜索方向。
- 延迟:深度分析可能需要数分钟至数小时,非实时响应。
适合人群
- 研究人员:寻找数据集 hidden gems,验证或挑战现有理论
- 数据科学家:探索阶段的假设生成,或作为 EDA 的补充
- 行业分析师:客户细分、异常检测、因果因素挖掘
- 生物信息学/医疗研究:复杂表型-基因型关联发现
常规风险
- 同义反复污染:若不排除与目标定义相关的列(如用
serious预测death,而death是serious的一个类别),会产生显然为真的伪发现。系统强制要求用户主动排除此类列。 - 多重比较问题:虽已 FDR 校正,但在极高深度下仍可能产生边缘显著的模式。
- 可解释性风险:模式描述由 LLM 生成(可选),可能存在语义偏差;深度分析结果需领域专家解读。
- 数据隐私:公开分析结果完全公开;私有分析数据虽经处理,但仍需信任 Leap Labs 的安全承诺。