universal-data-analyst

📊 智能识别数据本体,一键生成专业分析

基于大模型推理的智能数据分析专家,自动识别数据本体、匹配分析框架、生成可执行脚本,支持经济与非经济数据的全流程自动化分析。

收藏
3.7k
安装
1.1k
版本
1.0.1
CLS 安全性认证2026-07-19
点击查看完整报告 >

使用说明

核心用法

通用数据分析专家(Universal Data Analyst)是一款基于数据本体论的智能分析技能,用户仅需上传数据文件(CSV、Excel、Parquet、JSON等)或发送自然语言指令即可触发完整分析流程。系统采用四层分析框架:数据本体论识别→问题类型学判定→方法论映射匹配→验证与输出,全程由大模型动态推理,零硬编码规则。

7步自动化流程:数据加载→本体识别→质量校验→方案规划→脚本生成→执行分析→综合报告。每个步骤配备状态监控与错误处理,前置步骤失败时自动阻断后续执行,并提供清晰的修复建议。

智能类型识别:针对经济型数据(零售、订阅、金融、劳动力市场等6大类)自动匹配RFM、LTV、漏斗分析、AARRR等专业框架;针对非经济型数据(传感器、社交网络、地理空间、文本、生物医学等)自动适配时间序列分解、社区发现、主题模型等方法。

输出交付物:每次分析生成可复用的提示词文件、JSON格式数据质量报告、数据清洗建议、HTML与Markdown双格式综合分析报告,以及完整图表集。

显著优点

1. 零门槛自动化:无需统计学背景或编程知识,自然语言交互即可完成专业级数据分析
2. 本体驱动智能:突破传统关键词匹配,通过LLM理解数据的生成机制与实体类型,选择真正适配的分析框架

3. 全流程可追溯:每个决策节点(本体判断、方案规划、脚本生成)均输出可复用的提示词文件,便于审计与迭代

4. 强鲁棒性设计:编码自动检测(支持utf-8/gbk/latin1等)、引擎智能回退(C引擎失败转Python引擎)、步骤依赖阻断,大幅降低文件兼容性失败率

5. 跨域通用性:单一技能覆盖经济决策、科学研究、社交分析等多元场景,避免碎片化工具切换

潜在局限

1. LLM依赖风险:核心推理完全依赖大模型能力,复杂因果推断或前沿统计方法可能存在幻觉或过时知识
2. 计算成本敏感:7步流程多次调用LLM,大规模数据集或高频分析场景下Token消耗较高

3. 脚本可解释性:自动生成的Python脚本虽可执行,但复杂分析逻辑的注释完整度与人工编写相比仍有差距

4. 实时性限制:时序预测类任务依赖历史数据模式,对突发结构性变化(如疫情、政策突变)的适应性未经充分验证

5. 隐私合规边界:数据上传至LLM进行推理,敏感数据需用户自行评估脱敏处理

适合人群

  • 业务决策者:快速获取数据洞察,支撑战略判断,无需等待数据团队排期
  • 数据分析师:自动化处理标准化分析环节,释放精力聚焦深度建模与业务解读
  • 研究人员:跨学科数据探索,自动匹配领域公认分析框架(如生存分析、差异表达)
  • 产品经理/运营:用户行为漏斗、留存曲线、RFM分层等常规需求自助化
  • 学生与自学者:通过输出的提示词与分析脚本,学习专业数据分析方法论

常规风险

  • 数据泄露风险:分析过程需将数据结构及部分样本送至LLM,含PII或商业机密的数据应预处理脱敏
  • 结果误读风险:自动化生成的图表与结论需结合业务语境人工校验,避免机械套用统计显著性
  • 模型幻觉风险:极端分布或小样本场景下,LLM可能选择不恰当的统计检验或产生错误的方法论引用
  • 执行安全风险:自动生成的Python脚本在本地执行,虽经过LLM生成但未经人工审计,建议沙箱环境运行
  • 版本漂移风险:依赖库(pandas/numpy等)版本差异可能导致脚本兼容性问题,建议锁定虚拟环境

安全解读

核心用法

通用数据分析专家采用「四层分析框架」实现智能化数据处理:

1. 数据本体论 — 通过 LLM 推理自动判断数据实体类型(零售经济、订阅经济、科学测量等)
2. 问题类型学 — 识别分析目标为描述型、诊断型、预测型或因果型

3. 方法论映射 — 匹配领域公认框架(RFM、ABC-XYZ、漏斗分析、时间序列分解等)

4. 验证与输出 — 生成 Python 脚本、执行分析并输出 HTML/Markdown 双格式报告

使用方式:上传 CSV/Excel/Parquet/JSON 文件,或用自然语言描述分析需求即可触发。

显著优点

  • 零配置智能化:无需用户指定数据类型或分析方法,LLM 自动推理决策
  • 多领域覆盖:内置 10+ 经济型数据框架(零售、订阅、金融、劳动力市场等)与 5+ 非经济型框架(传感器、社交网络、文本、生物医学等)
  • 流程透明可复现:保存每步提示词、清洗报告、执行脚本,便于审计和复用
  • 编码容错增强:自动检测 utf-8/gbk/latin1 等编码,C 引擎失败时回退 Python 引擎
  • 流程健康监控:步骤依赖检查、清晰错误提示、完整执行状态追踪

潜在局限性

  • 大文件内存消耗:基于 pandas 加载,GB 级文件可能占用大量内存
  • LLM 推理成本:每次分析需多次调用大模型进行本体识别与方案规划,复杂任务成本较高
  • 离线环境依赖:首次使用需安装 pandas/numpy/scipy 等数据科学生态库
  • SQL 连接用户可控:数据库连接功能需用户主动提供连接字符串,无内置连接池管理

适合人群

  • 业务分析师:快速探索数据集规律,无需编程基础
  • 数据产品经理:验证假设、生成分析原型
  • 科研人员:处理实验数据、时序观测记录
  • 中小企业:替代部分 BI 工具的基础分析需求

常规风险

| 风险项 | 等级 | 说明 |
|--------|------|------|
| 数据外泄 | 极低 | 纯本地处理,无主动网络请求 |
| 代码注入 | 极低 | 无 eval/exec,脚本由 LLM 生成后用户可控执行 |
| 敏感信息泄露 | 低 | 报告默认保存本地,建议确认输出目录权限 |
| 数据库安全 | 低 | 仅连接用户指定的数据库,需自行确认数据源可信 |

universal-data-analyst 内容

layers文件夹
手动下载zip · 66.3 kB
data_loader.pytext/plain
请选择文件