Clawd Cursor 综合评估
Clawd Cursor 是一款专为 AI Agent 设计的桌面自动化工具,通过 REST API 赋予大语言模型"看见"屏幕并"操作"电脑的能力。它填补了 API 集成缺失的最后一块拼图——当目标应用没有开放接口时,Agent 可以直接操控其图形界面。
核心用法
技能采用四层执行管道优化性能:Layer 0 浏览器层直接导航(免费瞬时),Layer 1 正则路由即时响应,Layer 2 辅助功能树推理(低成本),Layer 3 视觉模型仅作最后手段(高成本)。开发者可通过 POST /task 发送自然语言指令,轮询 /status 获取结果,必要时通过 /confirm 处理需用户审批的高危操作。
显著优点
- 架构创新:4层管道设计将80%+任务分流至免费/低成本层级,实测截图延迟从850ms优化至57ms
- 隐私优先:本地Ollama支持完全离线运行;云端场景下数据仅流向用户指定的API端点,作者无权限获取任何信息
- 安全分层:🟢自动/🟡预览/🔴确认三级机制,敏感操作(发邮件、删除、支付)强制暂停等待人工授权
- 网络隔离:API严格绑定127.0.0.1,截图不落盘,无遥测无埋点
- 性能优化:11项专项优化包括截图哈希缓存(减少90%重复LLM调用)、并行采集、流式响应等
潜在局限
- 平台限制:仅支持Windows/macOS,无Linux版本
- 环境依赖:需Node.js运行时,Chrome CDP功能需特定启动参数
- 异步复杂度:任务非阻塞,开发者必须实现轮询逻辑
- 视觉模型成本:复杂场景仍可能触发高价的Vision API调用
- 权限门槛:macOS需手动授予终端辅助功能权限
适合人群
- OpenClaw等Agent框架的开发者与高级用户
- 需要跨应用自动化但目标系统无API的企业RPA场景
- 注重隐私、倾向本地运行的个人自动化用户
- 测试工程师(UI自动化验证)
常规风险
- 误操作风险:自然语言指令解析偏差可能导致意外点击/输入,建议配合🟡🔴安全层使用
- 凭证暴露:任务文本会被记录,严禁在指令中包含密码
- 模型幻觉:视觉模型可能误判界面元素位置
- 长时间任务阻塞:60秒无响应需手动中断重试
- CDP端口冲突:9222端口可能被其他工具占用