autoresearch

🔬 AI自主实验协议 · 系统化优化任何可度量目标

让AI代理自主运行系统化实验:单变量控制、假设验证、Git追踪结果,自动优化超参数、消融研究和配置搜索,适合ML训练、编译器调优等可度量优化任务。

收藏
12.5k
安装
3.3k
版本
1.0.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Autoresearch 是一种自主实验协议,让 AI 代理像人类研究员一样系统性地探索优化空间。用户通过三个命令触发:/autoresearch setup 交互式配置实验参数(目标、指标、可修改文件、运行命令等),生成 autoresearch.config.md/autoresearch run 启动自主实验循环;/autoresearch analyze 分析结果并生成报告。

实验循环遵循严格纪律:每次只改一个变量 → 形成假设 → 运行实验 → 测量指标 → 根据结果决定保留(keep)或回滚(discard)。Git 提交作为实验笔记本,results.tsv 记录所有实验数据。代理会自动回顾历史、避免重复尝试、在陷入停滞时切换策略。

显著优点

1. 系统性探索:强制单变量控制,确保因果可解释,避免"改了三个东西不知道哪个有效"的混乱
2. 无限耐心:代理不会像人类那样疲劳或失去兴趣,会持续迭代直到用户叫停

3. 创意发散:鼓励尝试人类想不到的非传统组合,将"随机性"转化为优势

4. 完整记忆:Git + TSV 双轨记录,实验历史可追溯、可复现、可分析

5. 领域通用:不仅限于机器学习,编译器优化、Web 性能、数据库调优、Prompt 工程等任何"可度量+可修改"场景都适用

6. 自动简化倾向:偏好删除代码而非增加复杂性的改进,符合"简单即美"的工程哲学

潜在缺点与局限性

1. 配置门槛高:首次使用需要详细定义 9 项参数(目标、指标、提取命令、文件边界等),对新手不够友好
2. 时间成本不可控:虽然设置了 time budget,但"永不停止"的默认行为可能导致资源消耗超出预期

3. 局部最优陷阱:单变量控制保证可解释性,但可能错过需要协同调整多个参数才能发现的更优解

4. 指标作弊风险:代理被明确禁止修改评估代码,但复杂场景下仍可能意外"优化"到测量工具而非真实目标

5. Git 污染:自动生成大量实验分支和提交,需要定期清理

6. 回滚依赖git reset --hard 的广泛使用要求用户确保工作目录干净,否则可能丢失未保存的更改

适合人群

  • ML 工程师:超参数搜索、消融研究、训练配置优化
  • 系统性能工程师:编译器标志调优、数据库配置优化
  • 全栈开发者:Webpack/Lighthouse 评分优化、CSS 渲染性能调优
  • 研究者:算法变体比较、Prompt 工程系统化探索
  • 任何有明确度量指标、需要迭代优化配置文件的开发者

常规风险

| 风险类型 | 说明 | 缓解措施 |
|---------|------|---------|
| 资源耗尽 | 无限循环消耗计算资源 | 设置严格的 time budget,监控执行 |
| 数据丢失 | `git reset --hard` 误删用户代码 | 确保在干净分支运行,避免直接操作主分支 |
| 指标误读 | 提取命令错误导致错误决策 | 在 setup 阶段手动验证提取命令 |
| 过度拟合 | 代理针对特定测试集优化 | 明确约束评估文件为只读,使用 held-out 验证 |
| 安全边界突破 | 修改了应只读的关键文件 | 仔细配置 TARGET FILES 与 READ-ONLY FILES 清单 |

autoresearch 内容

手动下载zip · 7.9 kB
reference.mdtext/markdown
请选择文件