核心用法
Disco 是一个假设无关的自动发现引擎,专为表格数据设计。用户只需提供数据集和目标列,系统即自动搜索特征交互、子群效应及条件关系——这些模式通常超出人工假设检验的范围。支持 CSV、Parquet、Excel 等格式,最大 5GB。
关键操作步骤:
1. 上传数据(URL/本地文件/SDK)
2. 选择目标列(需≥2个不同值)
3. 排除标识符、数据泄漏及同义列(至关重要)
4. 选择公开(免费,深度锁定为2)或私有(付费,深度可调)分析
5. 运行分析并获取结构化结果
输出包含:经FDR校正p值验证的模式、条件范围、效应量、学术文献对比、新颖性评分(novel/confirmatory)、交互式报告链接。
显著优点
- 无假设探索:不依赖预设假设,发现人工难以想象的复杂交互(如"湿度72-89%且风速<12km/h时产量+34%")
- 统计严谨性:所有发现均在hold-out数据上验证,FDR多重检验校正,避免假阳性
- 新颖性评估:自动比对学术文献,标注novel(新发现)或confirmatory(验证已知),附DOI引用
- 深度可控:analysis_depth参数调节搜索深度,深度越高发现越多非显然模式
- 多接入方式:MCP Server(零安装)、Python SDK(本地大文件)、REST API灵活适配
- 透明可解释:每个模式包含自然语言描述、条件阈值、支持度、效应方向与幅度
潜在局限
- 仅限结构化数据:不支持图像、原始文本、嵌套JSON或多表关联分析
- 成本门槛:私有分析需付费($0.10/积分),深度分析消耗积分随数据量与深度增加
- 目标列必需:必须指定单一目标列,无法做无监督纯探索
- 英文文献为主:新颖性比对依赖英语学术数据库,非英语领域可能存在遗漏
- LLM成本权衡:启用LLM可提升解释质量与文献比对,但增加成本与时间;公开分析强制启用LLM
- 黑盒搜索:具体算法细节(树搜索/贝叶斯优化等)未公开,难以复现搜索路径
适合人群
| 场景 | 典型用户 |
|------|---------|
| 科研假设生成 | 生物信息学、社会科学、农业研究者 |
| 特征工程 | 机器学习工程师寻找高价值交互特征 |
| 因果线索挖掘 | 医疗、金融分析师探索非显然驱动因素 |
| 数据审计 | 风控、合规团队发现隐藏风险模式 |
| 快速探索 | 有结构化数据但缺乏明确假设的业务分析师 |
常规风险
| 风险类型 | 说明 | 缓解建议 |
|---------|------|---------|
| 同义列污染 | 包含与目标定义相关的列(如BMI与身高+体重)会产生显然"发现" | 严格使用excluded_columns排除派生列与分类同义项 |
| 数据泄漏 | 目标信息以变形存在于其他列中 | 人工审核列含义,排除诊断文本-代码对等泄漏源 |
| 统计显著≠因果 | FDR校正保证模式非随机,但不保证因果方向 | 将Disco输出作为假设生成工具,需后续实验验证 |
| 公开隐私风险 | 公开分析将数据与结果发布至公共画廊 | 敏感数据务必选择私有分析 |
| 过度拟合深度 | 过高depth可能产生过拟合的复杂交互 | 从depth=2开始,逐步增加并交叉验证 |
| 积分超支 | 未estimate直接运行大额分析 | 始终先调用discovery_estimate确认成本 |
安全与可信度
- 数据安全:本地文件通过预签名URL直传云存储,不经过模型上下文;支持5GB大文件
- API安全:采用OTP邮箱验证,无密码存储;Stripe托管支付,Disco不接触卡号
- 结果可信度:T1级别——学术文献比对机制、hold-out验证、FDR校正构成三重质量控制