Discovery

🔬 自动发现数据中隐藏的新奇模式

自动发现表格数据中隐藏的统计显著模式,通过FDR校正p值验证、文献查新评估,输出带效应量、引用和新颖性评分的结构化发现,远超人工探索效率。

收藏
4.9k
安装
2.2k
版本
0.2.137
CLS 安全扫描中
预计需要 3 分钟...

使用说明

Disco:自动化模式发现引擎

Disco 是一款面向表格数据的假设生成型分析工具,核心定位是发现用户不会主动寻找的统计显著模式——包括特征交互、子群效应和条件关系——而非回答预设问题。其技术 pipeline 涵盖:系统性搜索、基于留出数据的FDR校正p值验证、学术文献比对评估新颖性,最终返回结构化结果(条件定义、效应量、引用、新颖性评分)。

核心用法

1. 数据上传:支持 CSV/Excel/Parquet 等格式,URL直传、本地文件(Python SDK)或 MCP 服务器
2. 目标列指定:定义待解释/预测的结果变量

3. 列排除:关键步骤,需剔除标识符、数据泄露列、同义反复列(如目标的重编码或组成部分)

4. 深度分析:默认深度2,可调更高以发现更深层的非显著交互

5. 公私选择:公开版免费(结果公开、深度锁2);私有版消耗积分,结果保密

显著优点

  • 无偏发现:不依赖先验假设,系统探索高阶交互和非线性阈值
  • 统计严谨:FDR校正多重检验,留出数据验证,避免过拟合
  • 新颖性量化:自动比对学术文献,区分"验证已知"与"真实新发现"
  • 结构化输出:预渲染自然语言描述、精确条件范围、支持样本量、学术引用
  • 多接入方式:MCP远程服务器(零安装)、Python SDK(本地大文件流式处理)

局限与风险

  • 成本敏感:私有分析按数据规模、深度计费($0.10/积分),深度>2时成本显著上升
  • 格式限制:仅扁平表格,不支持图像、嵌套JSON、多表关联
  • 同义反复陷阱:若未正确排除目标的重编码列,会产生"正确但无价值"的平凡模式
  • LLM依赖权衡:关闭LLM则丧失文献查新、智能描述生成,可能误分类变量类型
  • 队列等待:分析可能耗时,需异步轮询

适合人群

  • 研究者:假设生成阶段,探索性数据分析,寻找文献空白
  • 数据科学家:高维数据中的交互效应发现,特征工程前置步骤
  • 领域专家:农业、医疗、金融等场景,需发现非显而易见的驱动因素

常规风险

| 风险类型 | 说明 | 缓解 |
|---------|------|------|
| 数据泄露输入 | 目标的重编码列导致伪发现 | 严格遵循排除列指南 |
| 成本超支 | 高深度私有分析积分消耗快 | 先用`discovery_estimate`预估,公开版试用 |
| 结果误读 | 统计显著≠因果/可行动 | 结合领域知识解释,区分相关性与机制 |
| 隐私泄露 | 公开版结果完全公开 | 敏感数据强制选私有 |
| 过度拟合幻觉 | 即使FDR校正,极深探索仍可能产生假阳性 | 关注效应量和支持样本比例,独立验证 |

认证评估

  • 来源可信度 T2:Leap Labs 出品,有明确技术文档、Python SDK、学术引用机制,但非同行评审发表
  • 安全等级 A:API密钥认证、Stripe支付隔离(Disco不触卡号)、支持私有运行;主要风险在于用户配置(数据泄露列排除)而非系统安全架构

Discovery 内容

docs文件夹
integrations文件夹
submissions文件夹
手动下载zip · 67.6 kB
openapi.jsonapplication/json
请选择文件