核心用法
Chaos Lab 是一个用于研究 AI 对齐问题的实验框架,通过创建具有冲突目标的多个 Gemini 智能体来观察涌现行为。框架预置三个典型角色:Gemini Gremlin(效率优化器,倾向于删除和压缩文件)、Gemini Goblin(安全分析师,倾向于标记一切为威胁)、以及 Gemini Gopher(归档员,倾向于无限备份)。用户可通过运行 run-duo.py(双代理冲突)或 run-trio.py(三代理冲突)脚本,在 /tmp/chaos-sandbox/ 沙箱目录中模拟多智能体交互场景,实验日志自动保存供后续分析。
显著优点
该框架的最大价值在于将对齐问题具象化——抽象的 AI 安全概念转化为可观察的实验现象。研究发现尤其具有启发性:更强大的模型(Gemini 3 Pro)并未减少混乱,反而因"更擅长为疯狂决策提供合理辩护"而加剧了冲突。框架设计简洁,仅需标准 Python 库和 requests 即可运行,支持自定义 agent 人格和 sandbox 场景,适合教学演示和.prompt 工程研究。沙箱机制完善,默认配置下 agents 仅生成文本建议,不实际修改文件系统。
潜在缺点与局限性
首先,依赖外部 API 产生成本与隐私顾虑——每次实验需 4-6 次 Gemini API 调用,Pro 模型成本较高,且提示词内容会被发送至 Google。其次,T3 来源可信度意味着长期维护和安全更新存在不确定性。文档中 tool-access.md 包含的危险功能示例虽仅为说明,但存在被误用的风险。此外,实验结果受模型版本影响较大,Flash 与 Pro 的行为差异可能导致研究发现难以复现。框架功能单一,仅限于文本生成实验,不支持实际的工具调用或多模态交互。
适合的目标群体
主要面向三类用户:AI 安全研究人员(用于验证对齐理论、生成可发表的发现)、教育工作者(以 hands-on 方式向非技术受众展示 AI 价值观冲突)、以及 prompt 工程师(学习系统提示如何塑造模型行为)。对 AI 伦理感兴趣的产品经理、政策制定者也可借此理解"智能放大混乱"的 counter-intuitive 现象。不适合寻求生产级工具的用户,或期望无需 API 密钥即可离线运行的场景。
使用风险
API 成本风险:Pro 模型实验成本累积较快,建议先用 Flash 验证配置。数据隐私风险:实验内容通过 HTTPS 发送至 Google,敏感信息不应出现在 sandbox 中。文件系统风险:脚本读取 ~/.config/chaos-lab/.env 和 /tmp/chaos-sandbox/ 文件,若 .env 包含其他密钥会被一并读取。误用风险:用户可能根据 tool-access.md 启用实际文件修改功能,导致数据丢失。依赖风险:项目为"Saturday night experiment"性质,长期维护承诺不明确,关键功能建议自行 Fork 维护。