Discovery

🔍 自动挖掘隐藏规律,验证后附文献

自动发现表格数据中隐藏的统计规律,FDR校正验证后返回交互特征与条件关系,附学术文献对比与新颖性评分

收藏
10.5k
安装
2.2k
版本
0.2.144
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Disco 是一个假设无关的自动发现引擎,专为表格数据设计。用户只需提供数据集和目标列,系统即自动搜索特征交互、子群效应及条件关系——这些模式通常超出人工假设检验的范围。支持 CSV、Parquet、Excel 等格式,最大 5GB。

关键操作步骤
1. 上传数据(URL/本地文件/SDK)

2. 选择目标列(需≥2个不同值)

3. 排除标识符、数据泄漏及同义列(至关重要)

4. 选择公开(免费,深度锁定为2)或私有(付费,深度可调)分析

5. 运行分析并获取结构化结果

输出包含:经FDR校正p值验证的模式、条件范围、效应量、学术文献对比、新颖性评分(novel/confirmatory)、交互式报告链接。

显著优点

  • 无假设探索:不依赖预设假设,发现人工难以想象的复杂交互(如"湿度72-89%且风速<12km/h时产量+34%")
  • 统计严谨性:所有发现均在hold-out数据上验证,FDR多重检验校正,避免假阳性
  • 新颖性评估:自动比对学术文献,标注novel(新发现)或confirmatory(验证已知),附DOI引用
  • 深度可控:analysis_depth参数调节搜索深度,深度越高发现越多非显然模式
  • 多接入方式:MCP Server(零安装)、Python SDK(本地大文件)、REST API灵活适配
  • 透明可解释:每个模式包含自然语言描述、条件阈值、支持度、效应方向与幅度

潜在局限

  • 仅限结构化数据:不支持图像、原始文本、嵌套JSON或多表关联分析
  • 成本门槛:私有分析需付费($0.10/积分),深度分析消耗积分随数据量与深度增加
  • 目标列必需:必须指定单一目标列,无法做无监督纯探索
  • 英文文献为主:新颖性比对依赖英语学术数据库,非英语领域可能存在遗漏
  • LLM成本权衡:启用LLM可提升解释质量与文献比对,但增加成本与时间;公开分析强制启用LLM
  • 黑盒搜索:具体算法细节(树搜索/贝叶斯优化等)未公开,难以复现搜索路径

适合人群

| 场景 | 典型用户 |
|------|---------|
| 科研假设生成 | 生物信息学、社会科学、农业研究者 |
| 特征工程 | 机器学习工程师寻找高价值交互特征 |
| 因果线索挖掘 | 医疗、金融分析师探索非显然驱动因素 |
| 数据审计 | 风控、合规团队发现隐藏风险模式 |
| 快速探索 | 有结构化数据但缺乏明确假设的业务分析师 |

常规风险

| 风险类型 | 说明 | 缓解建议 |
|---------|------|---------|
| 同义列污染 | 包含与目标定义相关的列(如BMI与身高+体重)会产生显然"发现" | 严格使用excluded_columns排除派生列与分类同义项 |
| 数据泄漏 | 目标信息以变形存在于其他列中 | 人工审核列含义,排除诊断文本-代码对等泄漏源 |
| 统计显著≠因果 | FDR校正保证模式非随机,但不保证因果方向 | 将Disco输出作为假设生成工具,需后续实验验证 |
| 公开隐私风险 | 公开分析将数据与结果发布至公共画廊 | 敏感数据务必选择私有分析 |
| 过度拟合深度 | 过高depth可能产生过拟合的复杂交互 | 从depth=2开始,逐步增加并交叉验证 |
| 积分超支 | 未estimate直接运行大额分析 | 始终先调用discovery_estimate确认成本 |

安全与可信度

  • 数据安全:本地文件通过预签名URL直传云存储,不经过模型上下文;支持5GB大文件
  • API安全:采用OTP邮箱验证,无密码存储;Stripe托管支付,Disco不接触卡号
  • 结果可信度:T1级别——学术文献比对机制、hold-out验证、FDR校正构成三重质量控制

Discovery 内容

docs文件夹
integrations文件夹
submissions文件夹
手动下载zip · 67.9 kB
openapi.jsonapplication/json
请选择文件