核心用法
Disco(Discovery Engine)是一款假设无关的统计发现工具,专为表格数据的深度模式挖掘设计。用户上传数据集后,指定目标变量(需预测的列),Disco 将自动搜索特征交互、子群效应和条件关系——即那些用户不会想到去检验的假设。系统支持深度参数调节(analysis_depth),值越高发现越多隐藏模式。
关键操作流程:
1. 数据上传:支持URL、本地文件(Python SDK最佳)或base64编码
2. 列检查与目标选择:Disco自动解析列类型,用户需指定目标列
3. 排除列设置:必须排除标识符、数据泄露列和循环定义列(如用死亡预测严重程度),否则会得到无意义的同义反复结果
4. 公开/私密分析选择:公开免费但结果公开、深度锁定为2;私密消耗积分但可深度挖掘
5. 成本估算与执行:私密分析前必须调用discovery_estimate确认积分消耗
6. 结果获取:轮询状态直至完成,获取结构化模式结果
显著优点
- 真正的发现能力:超越传统相关性分析,自动识别非线性阈值、多特征交互和条件子群效应
- 严格的统计验证:所有模式均在保留数据上测试,使用FDR校正p值控制多重检验误差
- 文献新颖性评估:每个模式被分类为"新颖"(novel)或"验证性"(confirmatory),并附学术引用说明为何新颖或已知
- 结构化输出:每个模式包含描述、条件定义、p值、效应大小、支持度、方向性和文献引用
- 灵活的接入方式:MCP服务器(零安装)、Python SDK(本地大文件)、REST API(任意语言)
潜在局限与风险
- 成本门槛:私密分析需付费积分($0.10/积分),深度分析可能昂贵;免费公开版功能受限
- 数据格式限制:仅支持表格数据,不支持图像、原始文本、嵌套JSON;最大5GB
- 黑箱发现风险:虽然统计验证严格,但"新颖"判断依赖文献检索覆盖度,边缘领域可能误判
- 解释依赖LLM:非LLM模式(use_llms=false)下,模式描述通用、新颖性不评估、文本聚类名称为通用名
- 循环定义陷阱:用户若未正确排除同义反复列(如用BMI预测肥胖),会得到统计显著但无价值的"发现"
- 队列等待:分析可能耗时较长,需异步轮询,不适合实时场景
适合人群
- 研究人员:尤其是医学、农业、社会科学等领域,需从现有数据中发现新假设
- 数据科学家:探索性数据分析阶段,希望超越传统EDA的发现边界
- 商业分析师:寻找客户细分、产品交互等非直观业务洞察
- 制药/临床研究者:分析FAERS等不良反应数据,识别药物-事件新关联
常规风险
- 积分消耗失控:深度参数和LLM使用会显著增加成本,未估算即运行可能导致意外扣费
- 隐私泄露:公开分析模式会公开数据集;私密分析虽保护数据,但支付流程涉及Stripe交互
- 结果误读:用户可能将"统计显著"等同于"因果",需强调这是发现工具非因果推断工具
- API密钥管理:密钥泄露将导致积分被盗用,系统提供无密码OTP登录但仍需妥善保管