Discovery

🔍 AI自动发现数据中隐藏的新颖模式

AI驱动的统计发现引擎,自动在表格数据中挖掘新颖、统计验证的模式,输出FDR校正p值、效应量和文献引用。

收藏
10.8k
安装
2.2k
版本
0.2.136
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Disco(Discovery Engine)是一款假设无关的统计发现工具,专为表格数据的深度模式挖掘设计。用户上传数据集后,指定目标变量(需预测的列),Disco 将自动搜索特征交互、子群效应和条件关系——即那些用户不会想到去检验的假设。系统支持深度参数调节(analysis_depth),值越高发现越多隐藏模式。

关键操作流程:
1. 数据上传:支持URL、本地文件(Python SDK最佳)或base64编码

2. 列检查与目标选择:Disco自动解析列类型,用户需指定目标列

3. 排除列设置:必须排除标识符、数据泄露列和循环定义列(如用死亡预测严重程度),否则会得到无意义的同义反复结果

4. 公开/私密分析选择:公开免费但结果公开、深度锁定为2;私密消耗积分但可深度挖掘

5. 成本估算与执行:私密分析前必须调用discovery_estimate确认积分消耗

6. 结果获取:轮询状态直至完成,获取结构化模式结果

显著优点

  • 真正的发现能力:超越传统相关性分析,自动识别非线性阈值、多特征交互和条件子群效应
  • 严格的统计验证:所有模式均在保留数据上测试,使用FDR校正p值控制多重检验误差
  • 文献新颖性评估:每个模式被分类为"新颖"(novel)或"验证性"(confirmatory),并附学术引用说明为何新颖或已知
  • 结构化输出:每个模式包含描述、条件定义、p值、效应大小、支持度、方向性和文献引用
  • 灵活的接入方式:MCP服务器(零安装)、Python SDK(本地大文件)、REST API(任意语言)

潜在局限与风险

  • 成本门槛:私密分析需付费积分($0.10/积分),深度分析可能昂贵;免费公开版功能受限
  • 数据格式限制:仅支持表格数据,不支持图像、原始文本、嵌套JSON;最大5GB
  • 黑箱发现风险:虽然统计验证严格,但"新颖"判断依赖文献检索覆盖度,边缘领域可能误判
  • 解释依赖LLM:非LLM模式(use_llms=false)下,模式描述通用、新颖性不评估、文本聚类名称为通用名
  • 循环定义陷阱:用户若未正确排除同义反复列(如用BMI预测肥胖),会得到统计显著但无价值的"发现"
  • 队列等待:分析可能耗时较长,需异步轮询,不适合实时场景

适合人群

  • 研究人员:尤其是医学、农业、社会科学等领域,需从现有数据中发现新假设
  • 数据科学家:探索性数据分析阶段,希望超越传统EDA的发现边界
  • 商业分析师:寻找客户细分、产品交互等非直观业务洞察
  • 制药/临床研究者:分析FAERS等不良反应数据,识别药物-事件新关联

常规风险

  • 积分消耗失控:深度参数和LLM使用会显著增加成本,未估算即运行可能导致意外扣费
  • 隐私泄露:公开分析模式会公开数据集;私密分析虽保护数据,但支付流程涉及Stripe交互
  • 结果误读:用户可能将"统计显著"等同于"因果",需强调这是发现工具非因果推断工具
  • API密钥管理:密钥泄露将导致积分被盗用,系统提供无密码OTP登录但仍需妥善保管

Discovery 内容

docs文件夹
integrations文件夹
submissions文件夹
手动下载zip · 67.7 kB
openapi.jsonapplication/json
请选择文件