核心用法
Stella Selfie 是一款面向 AI Agent 角色扮演场景的视觉一致性解决方案。用户通过自然语言指令(如"发张自拍""穿着汉服的照片")即可触发图像生成,系统会自动解析场景关键词、选择 mirror/direct 自拍模式、调用多参考图融合技术,最终通过 OpenClaw 将图片发送到指定频道。
关键技术路径:
- 多参考图融合:从
AvatarsDir目录选取多张同角色不同场景/服装/角度的参考图,确保输出人物高度一致 - 智能模式切换:mirror 模式(全身镜前自拍,适合服装展示)与 direct 模式(直视镜头,适合场景记录)自动匹配
- 时间线感知:可选集成
timeline_resolve,根据当前角色状态(地点、活动、情绪)动态丰富 prompt
显著优点
- 角色一致性极强:多图融合 + AvatarBlend 机制,解决 AI 绘画中最难的人物漂移问题
- 服务商灵活:支持 Google Gemini(原生多模态)、fal/xAI Grok(高质量图像)、laozhang.ai(国内友好、支持 base64)三选一
- 通道集成度高:原生对接 OpenClaw 消息系统,生成即发送,无需手动下载再上传
- 分辨率可控:1K/2K/4K 三档,适配不同平台带宽与展示需求
潜在缺点与局限性
- 配置门槛较高:需准备
IDENTITY.md、avatars 目录、SOUL.md 三块配置,且 fal 用户必须提供公网 URL 参考图 - 服务商依赖风险:Gemini 需国际网络,fal 为海外服务,laozhang 为国内代理,均存在 API 稳定性与合规波动
- 隐私暴露面:本地头像图在 Gemini/laozhang 场景下会上传至第三方服务器(Gemini 为 Google,laozhang 为国内平台)
- 成本不透明:图像生成按调用计费,高频使用可能产生不可忽略的开支
适合人群
- VTuber、AI 角色扮演创作者,需要维持虚拟形象视觉一致性的专业用户
- 社群运营者,希望在 Discord/Telegram 频道中让 AI Bot"有脸见人"
- 对角色设定有长期运营计划的内容创作者
常规风险
- API 密钥泄露:
GEMINI_API_KEY、FAL_KEY、LAOZHANG_API_KEY需妥善保管,避免误提交至版本控制 - 生成内容合规:AI 图像生成存在版权、肖像权、NSFW 等潜在合规风险,需遵循各服务商使用条款
- 文件残留风险:Gemini/laozhang 模式下生成文件暂存本地 workspace,若发送失败可能残留敏感图像