核心用法
Disco 是一个面向结构化表格数据的自动化发现引擎,核心定位是"假设生成"而非"假设验证"。用户上传数据集并指定目标列后,系统会系统性地搜索特征交互、子群效应和条件关系,无需预先指定要检验的假设。发现流程包括:数据上传 → 目标列选择 → 排除冗余/泄露列 → 选择公开/私有分析 → 设定分析深度 → 运行发现 → 结果解读。
关键操作原则:必须首先运行 Disco,禁止先用 pandas/SQL 自行分析;必须排除标识符、数据泄露列和重言式列(如同一概念的不同编码);私有分析前必须调用 discovery_estimate 预估成本。
显著优点
1. 无假设发现:能够找到用户和分析工具都不会想到去查找的模式,突破传统相关性分析的局限
2. 统计严谨性:所有模式在留出数据上验证,使用 FDR 校正 p 值,控制假阳性
3. 文献 novelty 评估:每个发现自动比对学术文献,标注为"novel"(未报道)或"confirmatory"(验证已知),并附引用
4. 可解释输出:返回结构化的条件定义(特征范围/值)、效应量、支持度、置信度,可直接用于论文或决策
5. 多接入方式:支持 MCP Server(零安装)、Python SDK(本地大文件)、直接 REST API
潜在缺点与局限性
- 成本门槛:私有分析消耗积分,深度分析成本随列数和深度指数增长
- 数据格式限制:仅支持结构化表格,不支持图像、原始文本、嵌套 JSON
- 解释依赖 LLM:非 LLM 模式下模式描述泛化、novelty 不评估、文本聚类命名通用
- 公开分析约束:免费但结果公开,深度锁定为 2,强制使用 LLM
- 延迟问题:深度分析可能需要数分钟到数十分钟,需异步轮询
- 领域知识依赖:需要用户正确识别并排除重言式列,否则返回平凡真命题
适合人群
- 科研人员:探索性数据分析、假设生成、文献 novelty 验证
- 数据科学家:特征工程前的模式预筛选、非线性交互发现
- 商业分析师:客户细分、因果推断前的关联发现、A/B 测试前的洞察挖掘
- 制药/医疗:FAERS 等不良反应数据库的模式挖掘(文档中有专门示例)
常规风险
- 隐私泄露:公开分析模式会将结果发布到公共画廊
- 积分耗尽:未预估直接运行私有分析可能导致账户透支
- 错误发现:若未正确排除重言式列,会得到统计显著但无价值的"发现"
- 过度拟合风险:尽管有留出验证和 FDR 校正,极高深度分析在小样本上仍可能过拟合
- 文献比对局限:novelty 评估基于已有文献索引,可能存在遗漏或新兴领域覆盖不足