核心用法
baoyu-slide-deck 是一套结构化工作流,将文本内容转化为专业级静态幻灯片图像。用户可通过自然语言指令(如"创建幻灯片"、"生成演示文稿")触发,系统依次完成内容分析→风格确认→大纲生成→提示词编写→图像批量渲染→格式合并九步流程。
关键决策点:
- 风格系统:17种预设(blueprint/chalkboard/corporate等),或自定义四维组合(texture/mood/typography/density)
- 受众分级:beginners/intermediate/experts/executives/general 五档,直接影响信息密度与术语深度
- 批量策略:默认并行4张,支持原生批处理接口或运行时并行调用
- 输出格式:PNG单页 + PPTX/PDF合并文件
独特定位:专为「阅读与分享」设计——自解释布局、逻辑滚动流、社交媒体友好,区别于传统演讲型PPT。
显著优点
1. 工程化完整度极高:九步工作流、严格的文件备份规则、会话ID一致性机制、失败重试策略,体现生产级健壮性
2. 风格系统精细化:17种预设覆盖技术/教育/生活方式/编辑四大场景,四维自定义支持无限扩展
3. 多运行时兼容:Codex(imagegen)、Cursor(GenerateImage)、Hermes及回退方案,自动探测最优后端
4. 可审计与可复现:强制prompt文件先行写入、版本化备份、EXTEND.md配置继承,满足团队协作需求
5. 修改工作流完备:支持单页重生成、增删改操作,且通过slug稳定性保证引用完整性
潜在缺点与局限性
- 依赖外部图像后端:若无可用后端(Codex/Cursor/baoyu-image-gen等),技能无法独立运行,需用户介入
- 静态输出限制:仅生成位图PNG,不支持原生矢量或动画;文本渲染质量完全依赖图像生成模型,存在乱码风险
- 无实时协作:基于本地文件系统,无多用户并发编辑机制
- 中文排版未明确优化:typography维度以西方字体分类(geometric/humanist/handwritten等),中文适配程度存疑
- 确认流程较重:默认强制两轮确认,追求效率的场景需显式跳过
适合人群
- 技术写作者/开发者:需要快速将文档转为视觉化技术演示
- 教育工作者/培训师:hand-drawn-edu、chalkboard等教育风格匹配度高
- 产品/运营人员:Notion、Corporate、Bold-editorial等风格适合SaaS演示与营销材料
- 独立创作者:Watercolor、Vintage等艺术风格支持生活方式与叙事内容
常规风险
| 风险类型 | 说明 |
|---------|------|
| **文本渲染失败** | AI图像模型可能生成乱码、错别字或难以辨认的文字,规范要求「不得用代码修复位图」,只能通过重生成解决 |
| **后端可用性波动** | 依赖Codex/Cursor等运行时内置工具,若后端服务变更或限额,可能影响生成 |
| **版权与肖像** | 对敏感公众人物建议采用风格化处理,避免 likeness 争议 |
| **输出体积** | 高页数(>30张)或高分辨率生成可能导致存储与传输成本上升 |
| **风格漂移** | 跨会话或未使用session ID时,同主题多批次生成可能出现视觉不一致 |
---
评估依据:SKILL.md v1.117.4 完整规范文档,涵盖架构设计、策略规则、参考体系与运行时兼容说明。