核心用法
Stella Selfie 是一款专为 AI Agent 设计的图像生成工具,可将文本描述转化为角色一致性的自拍图片并直接发送至指定通讯频道。核心工作流包含:用户意图识别 → 场景上下文收集 → 智能提示词组装 → 多提供商图像生成 → OpenClaw 频道投递。
提示词模式:支持 mirror(镜拍,适合全身/穿搭展示)和 direct(直拍,适合特写/场景记录)两种模式,系统通过关键词自动选择或根据时间轴连续性状态智能切换。
提供商支持:
- Gemini(默认):本地头像文件上传,支持多图融合
- fal:需配置公开 URL 头像,不支持本地文件
- laozhang.ai:国内 Gemini 代理,base64 编码上传本地头像
分辨率选项:1K/2K/4K,通过用户关键词自动映射。
显著优点
1. 角色一致性保障:通过 Avatar/AvatarsDir 多参考图融合,确保生成人物外观稳定
2. 智能场景补全:集成 timeline_resolve 能力,无显式场景时自动提取当前活动、地点、情绪等上下文
3. 多平台投递:原生支持 Discord、Telegram、WhatsApp、Slack 等 OpenClaw 兼容频道
4. 灵活提供商切换:三提供商 failover 设计,可根据网络环境选择最优路径
5. 安全清理机制:Gemini/laozhang 生成文件在成功发送后立即删除
潜在缺点与局限性
1. 配置门槛较高:需预先准备 IDENTITY.md、SOUL.md、头像目录等多层配置
2. 提供商差异限制:fal 仅支持 HTTP 头像 URL,无法使用本地文件;Gemini 对部分地区网络要求严格
3. 依赖外部服务:图像生成完全依赖第三方 API(Google/fal/laozhang),存在单点故障风险
4. 时间轴可选依赖:timeline_resolve 为最佳-effort,无回退时可能生成中性/通用场景
5. Token 成本:4K 分辨率 + 多图融合可能产生较高 API 费用
适合人群
- 运营虚拟角色账号的内容创作者(Vtuber、AI 角色账号)
- 需要为 Agent 构建视觉人格的开发者
- 多平台社群运营者,希望自动化角色互动内容生产
- 对角色一致性有要求的叙事/游戏化 AI 应用开发者
常规风险
- 隐私泄露:本地头像文件上传至第三方 API(Gemini/laozhang),虽官方声明不保留训练,但敏感图片需谨慎
- API 密钥管理:需配置
GEMINI_API_KEY/FAL_KEY/LAOZHANG_API_KEY,泄露可能导致额度盗刷 - 内容合规:图像生成存在不可控性,可能产生违反平台政策或用户预期的内容
- 服务商稳定性:laozhang.ai 为第三方代理,服务连续性无 Google 官方 SLA 保障