核心用法
OpenClaw R Stats 是一个企业级统计分析技能,通过 JSON 规范驱动执行 82 种 R 统计方法。用户只需提供数据集路径、分析类型和研究假设,系统自动完成环境配置、数据检验、统计建模和标准化报告生成。
标准工作流程:
1. 预检:确认数据集可读性,报告样本量、变量类型、缺失值比例
2. 环境配置:按需动态安装 R 包(分 Core/Survival/Bayes/Causal 等 11 个模块)
3. 规格构建:填写 JSON 分析规范(outcome/predictors/hypothesis/alpha)
4. 执行分析:调用 run-rstats.sh analyze 生成结果
5. 结果呈现:按「摘要→统计量→解释→图表→假设检验→局限性」六段式输出
覆盖方法类别:
- 基础推断:t检验、ANOVA、卡方、相关分析、非参数检验
- 回归建模:线性/逻辑/泊松/负二项、LASSO、分位数回归、GAM
- 生存分析:Kaplan-Meier、Cox回归、竞争风险、RMST
- 纵向与层次数据:混合效应模型(LMM/GLMM)、GEE、ICC
- 因果推断:倾向得分匹配(PSM)、逆概率加权(IPTW)、双重差分(DiD)、断点回归(RDD)、TMLE
- 贝叶斯方法:brms 建模、贝叶斯因子、可信区间
- 元分析:固定/随机效应模型、网络Meta分析
- 测量与诊断:IRT、SEM/CFA、ROC/AUC、Kappa、Cronbach α
- 试验设计:序贯设计、功效与样本量计算
---
显著优点
| 维度 | 特性 |
|------|------|
| **方法全面性** | 82种方法覆盖从基础到前沿的统计需求,包括零膨胀模型、竞争风险、网络Meta等进阶技术 |
| **智能自适应** | 自动方法切换:非正态小样本→Wilcoxon;期望频数<5→Fisher精确检验;异方差→稳健标准误 |
| **报告规范性** | 强制包含效应量(Cohen's d、η²、R²、OR、HR)、置信区间、假设检验结果,杜绝p值滥用 |
| **可复现性** | JSON规格驱动、固定随机种子、完整代码溯源,满足学术发表与监管审计要求 |
| **风险管控** | 明确禁止从观察性数据断言因果,强制使用"associated with"表述;小样本(n<30)和高缺失率(>5%)自动预警 |
| **多语言触发** | 支持英/中/日/韩/德/法/西/葡/俄/阿等10种语言关键词识别 |
---
潜在局限
- 学习曲线:需理解JSON规格字段含义,新手可能需参考 METHOD_TABLE.md
- R环境依赖:首次运行需下载安装R包(Core约500MB,全模块>2GB),离线环境受限
- 大数据性能:R内存限制,千万级行数据可能需预处理采样
- 定制化局限:复杂模型需手动调整默认spec,自动生成的代码可读性一般
- 因果推断边界:虽内置多种因果方法,但仍需用户自行满足识别假设(无未观测混杂)
---
适合人群
- 临床研究者:需规范报告效应量和CI,满足CONSORT/STROBE指南
- 流行病学家:因果推断模块支持观察性研究的效应估计
- 生物统计师:Meta分析、生存分析、序贯试验设计等专业需求
- 数据科学家:需可复现、可审计的统计流水线
- 学生与教师:学习标准化统计报告范式,避免常见错误
---
常规风险
| 风险类型 | 说明 | 缓解措施 |
|----------|------|----------|
| **统计误用** | 用户可能误解自动方法选择逻辑 | 报告明确标注方法选择理由 |
| **因果过度推断** | 尽管有语言约束,用户可能截断警告 | 强制在报告头部重复"关联而非因果"声明 |
| **隐私泄露** | 分析过程可能暴露敏感数据分布 | 建议预处理脱敏,schema检查仅报告元数据 |
| **软件供应链** | R包更新可能导致结果微变 | 锁定版本或容器化部署 |