核心用法
Stella Selfie 是一款专为 AI Agent 设计的图像生成技能,能够将角色身份(Persona)转化为视觉一致的自拍图像。用户通过自然语言描述场景、着装或活动,系统即可生成符合角色设定的高质量图像,并自动发送至指定的消息频道(Discord、Telegram、Slack 等)。
技能支持三种图像提供商:Google Gemini(默认)、fal.ai(xAI Grok Imagine)以及 laozhang.ai。核心亮点在于多参考头像融合(Avatar Blending)——通过读取 IDENTITY.md 中配置的本地头像目录或公开 URL,在生成时保持角色外观的高度一致性。
显著优点
1. Persona 一致性保障:通过多参考图融合技术,确保生成的自拍与预设角色形象保持连贯,避免"换脸"问题
2. 智能场景推断:内置时间线解析能力(timeline_resolve),可自动推断角色当前活动、位置、情绪状态,减少用户输入负担
3. 双模式自适应:Mirror(对镜自拍,适合全身/穿搭展示)与 Direct(直拍,适合特写/场景)两种模式自动切换
4. 多平台投递:原生集成 OpenClaw 协议,支持一键发送至 Discord、Telegram、WhatsApp、Slack 等主流频道
5. 分辨率分级:支持 1K/2K/4K 三档分辨率,适应不同带宽与质量需求
潜在局限
- 配置门槛较高:需手动准备
IDENTITY.md、头像目录、SOUL.md能力声明,对非技术用户不够友好 - 提供商依赖差异:fal.ai 仅支持公开 URL 引用,无法直接使用本地头像文件;Gemini 和 laozhang 支持本地文件但涉及隐私上传
- 时间线功能非强制:若 timeline_resolve 不可用,生成质量可能下降为"通用提示词"模式
- 本地网关限制:HTTP fallback 仅限 localhost,无法直接投递至远程服务
- 多语言提示词未明确:文档示例以英文为主,非英语场景的效果一致性待验证
适合人群
- 运营虚拟角色账号的创作者(VTuber、AI 角色扮演账号)
- 需要为 AI Agent 添加"视觉存在感"的开发者
- 跨平台社群运营者,希望统一角色形象输出
- 对角色一致性有严格要求的叙事型 AI 项目
常规风险
| 风险类别 | 说明 |
|---------|------|
| API 密钥泄露 | GEMINI_API_KEY、FAL_KEY 等以环境变量形式存储,需确保 `.env` 文件不被提交至版本控制 |
| 头像隐私暴露 | 本地头像文件上传至第三方 API(Gemini/laozhang),虽按文档删除,但仍存在短暂驻留风险 |
| 生成内容合规 | 依赖底层模型(Gemini/Grok)的内容安全策略,可能因提示词触发过滤 |
| 渠道发送失败 | OpenClaw Gateway 配置错误或令牌失效时,图像可能滞留本地或发送失败 |