Discovery

🔬 自动发现数据中隐藏的规律与关联

AI驱动的自动化数据模式发现引擎,通过统计验证和文献对比识别隐藏的数据规律与关联

收藏
10.6k
安装
2.2k
版本
0.2.133
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Disco 是一款假设无关的自动化发现引擎,专为识别表格数据中的隐藏模式而生。用户只需提供数据集和目标列,系统即可自动搜索特征交互、子群效应和条件关系,无需预先假设或人工探索。

标准工作流:上传数据 → 选择目标列 → 排除标识符/泄露列/同义反复列 → 选择公开/私有分析 → 运行深度分析 → 获取结构化结果。支持 MCP Server、Python SDK 和 REST API 三种集成方式,最大支持 5GB 数据。

显著优点

1. 真正的自动化发现:不同于传统分析工具需要用户知道问什么,Disco 主动寻找"没人想到要问"的模式,覆盖非线性阈值、多特征交互和特定子群效应。

2. 严格的统计验证:所有发现均经过 FDR 校正 p 值检验,并在 hold-out 数据上验证,避免过拟合和假阳性。

3. 文献 novelty 评估:自动对比学术文献数据库,区分"确认已知发现"与"真正 novel 发现",附带引用和 novelty 解释。

4. 结构化可解释输出:每个模式包含自然语言描述、精确条件范围(如"湿度 72-89% 且风速 <12km/h")、效应量、p 值、支持度和学术引用。

5. 灵活的访问层级:公开分析免费(深度锁定为 2,结果公开);私有分析按需付费(深度可调),适合敏感数据。

潜在局限

  • 仅支持表格数据:不支持图像、原始文本文档、嵌套 JSON 或多表关联分析。
  • 需要目标列:必须指定明确的预测目标,不适合纯探索性无监督分析。
  • 成本随深度指数增长:深度 3+ 分析对宽数据集可能消耗大量 credits。
  • 黑箱搜索机制:虽然输出可解释,但搜索策略本身不透明,用户无法干预搜索方向。
  • 延迟:深度分析可能需要数分钟至数小时,非实时响应。

适合人群

  • 研究人员:寻找数据集 hidden gems,验证或挑战现有理论
  • 数据科学家:探索阶段的假设生成,或作为 EDA 的补充
  • 行业分析师:客户细分、异常检测、因果因素挖掘
  • 生物信息学/医疗研究:复杂表型-基因型关联发现

常规风险

  • 同义反复污染:若不排除与目标定义相关的列(如用 serious 预测 death,而 deathserious 的一个类别),会产生显然为真的伪发现。系统强制要求用户主动排除此类列。
  • 多重比较问题:虽已 FDR 校正,但在极高深度下仍可能产生边缘显著的模式。
  • 可解释性风险:模式描述由 LLM 生成(可选),可能存在语义偏差;深度分析结果需领域专家解读。
  • 数据隐私:公开分析结果完全公开;私有分析数据虽经处理,但仍需信任 Leap Labs 的安全承诺。

Discovery 内容

docs文件夹
integrations文件夹
submissions文件夹
手动下载zip · 67.8 kB
openapi.jsonapplication/json
请选择文件