Discovery

🔍 AI 驱动的科学发现引擎

自动发现表格数据中统计显著的新颖模式,验证特征交互与亚组效应,经学术文献查重标注创新性,比人工或传统分析更快、更彻底地挖掘隐藏洞察。

收藏
7k
安装
2.2k
版本
0.2.143
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Disco 是一款面向表格数据的自动化发现引擎,而非传统意义上的 AI 数据分析工具。用户上传 CSV/Excel/Parquet 等格式的数据集后,指定目标列(需预测的变量),系统即启动系统化搜索流程:遍历特征交互、非线性阈值、有意义亚组等人工难以预设的模式;对每个候选模式在留出数据上计算 FDR 校正后的 p 值;随后与学术文献比对,标注“novel(新颖)”或“confirmatory(验证已知)”,并附引用。结果以结构化 Pattern 列表返回,包含条件范围、效应量、支持度、 novelty 解释及交互式报告链接。

显著优点

1. 假设无关的发现能力:不依赖用户预设假设,能找出“连问都不会问”的隐藏模式,如湿度与风速的特定交互阈值。
2. 统计严谨性:所有发现均经留出集验证、多重检验校正(FDR),降低假阳性。

3. 文献级 novelty 评估:自动检索并引用学术文献,明确区分真正的新发现与已知结论,对科研与商业洞察极具价值。

4. 多层级分析深度:支持 depth 参数(默认 2,最大列数-2),深度越高发现越复杂、越非显而易见。

5. 灵活的接入方式:提供远程 MCP Server(零安装)、Python SDK(本地大文件流式上传)、REST API 等多种集成路径。

潜在缺点与局限性

1. 仅限表格数据:不支持图像、原始文本文档、嵌套 JSON 或多表 Excel,需预先展平为宽表。
2. 目标列要求:必须有明确的单一目标列,且至少 2 个不同值;无监督探索受限。

3. 成本门槛:私有分析按量计费(约 $0.10/信用点),深度分析或大数据集成本上升;免费层级仅限公开分析(结果公开、深度锁死)。

4. 数据准备敏感:若未正确排除标识符、数据泄漏列或同义反复列(tautological),会产生“定义上为真”的无效发现,需用户具备领域知识进行预处理。

5. 运行时长:深度分析可能耗时数分钟至数十分钟,需异步轮询,不适合实时交互场景。

适合人群

  • 科研人员:需从实验或观测数据中发现新假设、验证文献空白。
  • 数据科学家/分析师:在探索性数据分析(EDA)阶段快速定位高价值信号,替代繁琐的手动交叉分析。
  • 生物统计/流行病学者:处理 FAERS、临床试验等数据,寻找不良反应亚组或疗效异质性。
  • 商业分析师:客户分群、转化驱动因素挖掘,寻找非直觉的业务增长杠杆。

常规风险

  • 隐私与合规:公开分析结果将被发布至公共画廊,敏感数据务必选择私有分析并确认 API 密钥权限。
  • 过度解读:尽管有统计校正,小样本亚组仍可能产生偶然显著性,建议结合领域知识判断因果。
  • 模型依赖风险: novelty 评估依赖文献数据库覆盖度,边缘领域可能漏检已有研究。
  • API 密钥管理:密钥泄露可能导致信用点被盗用,需遵循最小权限原则存储。

Discovery 内容

docs文件夹
integrations文件夹
submissions文件夹
手动下载zip · 67.6 kB
openapi.jsonapplication/json
请选择文件