Discovery

🔬 AI驱动的科学模式发现引擎

自动发现表格数据中新颖、统计验证的模式,识别特征交互与亚组效应,经FDR校正p值验证,对照学术文献评估创新性,返回结构化洞察报告。

收藏
6.1k
安装
2.2k
版本
0.2.141
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Disco 是一个自动化模式发现引擎,专为表格数据设计。用户上传数据集(CSV、Excel、Parquet 等,最大5GB),指定目标列,系统即自动执行深度搜索:识别特征交互、非线性阈值、亚组效应等复杂模式,每个发现均在留出数据上经FDR校正p值统计验证,并与学术文献比对评估创新性。

关键工作流程
1. 数据上传(支持URL、本地文件、Python SDK)

2. 列检查与目标列选择

3. 排除标识符/数据泄漏/同义反复列(关键步骤)

4. 选择公开(免费)或私有(付费)分析

5. 设置分析深度(默认2,可调更高以发现更隐蔽模式)

6. 提交分析并轮询结果

7. 获取结构化报告:模式描述、条件、效应量、p值、创新性分类、引用文献

输出亮点

  • 新颖模式:未在现有文献中报告的发现,附创新性解释与对比引用
  • 确认性模式:验证已知科学结论
  • 特征重要性:全局驱动因素排序
  • 交互式报告:可视化探索的网页仪表板

显著优点

  • 假设无关发现:不依赖用户预设假设,能发现人工分析遗漏的复杂交互
  • 严格统计验证:FDR校正p值 + 留出数据验证,避免过拟合
  • 学术创新性评估:自动检索文献,区分"真正新发现"与"已知结论"
  • 多深度分析:depth参数控制搜索深度,越高越能发现非显而易见的模式
  • 灵活集成:MCP远程服务器免安装、Python SDK支持大文件流式上传、REST API全功能覆盖
  • 透明可解释:每个模式附带清晰的条件定义、效应量、支持度统计

潜在缺点与局限性

  • 仅支持表格数据:图像、原始文本、嵌套JSON、多表关联不支持
  • 目标列必需:必须明确指定单一目标列进行分析
  • 深度与成本权衡:高深度分析显著增加计算成本与等待时间
  • LLM增强功能额外付费:智能预处理、文献上下文、创新性评估需启用LLM(更慢更贵)
  • 同义反复列风险:若未正确排除定义性相关列,会产生" humidity高时作物产量高"式的空洞发现
  • 公开分析限制:免费公开分析锁定depth=2且结果公开发布

适合人群

  • 科研人员:假设生成、文献空白识别、跨学科模式发现
  • 数据科学家:探索性数据分析、特征工程灵感、模型可解释性补充
  • 行业分析师:用户行为细分、风险因素识别、运营优化洞察
  • 生物信息学/医学研究:基因-环境交互、药物反应亚组、临床试验数据挖掘
  • 农业/环境科学:气候-土壤-产量复杂关系、可持续实践优化

常规风险

  • 隐私与数据安全:公开分析将数据集与结果完全公开;私有分析数据经加密传输存储,但用户需评估云端处理敏感度
  • 统计显著≠因果:发现的是关联模式,建立因果需实验设计验证
  • 过度依赖自动化:可能忽视领域知识中的关键变量或产生不可操作的抽象模式
  • 成本管理:私有分析按数据量、深度、LLM使用计费,大深度分析可能消耗大量credits
  • API密钥管理:需安全存储disco_前缀密钥,避免泄露导致未授权消费
  • 文献比对局限:创新性评估依赖现有文献数据库覆盖度,极新领域可能存在盲区

Discovery 内容

docs文件夹
integrations文件夹
submissions文件夹
手动下载zip · 67.7 kB
openapi.jsonapplication/json
请选择文件