核心用法
火一五文生图提示词 v2.3 是一套完整的 T2I/T2V 提示词工程解决方案,包含六大功能模块:
1. 文生图增强 (`enhance_prompt.py`) — 核心引擎,支持88种风格预设(摄影、动漫、3D、设计、艺术史、游戏、东方传统等七大类),提供混合预设(-p A+B --mix 0.6)、三档质量(basic/pro/master)、自动意图识别(从描述中自动提取logo/产品/微距等意图)、四锁一致性机制(camera/lighting/palette/aspect 锁定保证系列图风格统一)、角色设定图(T-pose多视图)等功能。
2. 视频提示词 (`enhance_video.py`) — 适配9大视频模型(Sora/Kling/Runway/Pika/Luma/Hailuo/即梦/Wan),输出三段式关键帧、30种镜头运动参数、六锁一致性(增加motion锁)。
3. 参考图反解 (`reverse_prompt.py`) — 自动识别A1111/ComfyUI/NovelAI元数据,无metadata时VLM fallback生成提示词。
4. 直出图片 (`render_prompt.py`) — 支持ComfyUI/SD-WebUI/DALL-E三后端,纯urllib实现零依赖。
5. Claude智能润色 (`claude_polish.py`) ⭐v2.3 — 调用Claude API将粗糙描述转为专业摄影/绘画术语,集成Prompt caching、Prefill JSON、XML思维链优化,token成本降低90%。
6. 平台合规润色 (`safety_lint.py`) ⭐v2.3 — 识别SD/MJ/DALL-E易误判的艺术词汇(血→crimson splash、裸→classical figure study),设红线拒答CSAM/武器教程/自残诱导,仅服务合法艺术创作。
显著优点
技术架构精简:纯Python标准库实现(urllib/json/sys/os),零第三方依赖,供应链攻击面为零,企业扫描器友好。
多模型生态覆盖:Midjourney/SD/SDXL/Flux/DALL-E/通用六大输出格式自动适配,权重语法、负面词、参数差异化处理。
一致性工程领先:四锁/六锁机制解决系列图风格漂移,seed哈希生成保证可复现,混合预设实现风格融合创新。
AI协作深度集成:Claude API润色替代人工prompt engineering,safety_lint规避平台误判,形成「粗描述→智能润色→合规重写→预设增强→直出」完整流水线。
隐私安全设计:核心功能完全离线,外部API仅可选触发且需用户环境变量配置,无数据私自外泄。
潜在缺点与局限性
外部API依赖:Claude润色和DALL-E直出需用户自备API Key,Claude API按token计费增加使用成本,国内网络可能不稳定。
本地后端配置门槛:ComfyUI/SD-WebUI直出需用户本地部署Stable Diffusion生态,对非技术用户有一定门槛。
风格预设固化:88种预设虽覆盖主流场景,但新兴风格(如最新AI绘画趋势)需等待版本更新,自定义预设扩展需修改源码。
合规边界模糊:safety_lint仅处理艺术词汇误判,不保证100%过审,极端场景下平台政策变化可能导致策略失效。
T3来源可信度:个人开发者维护,无知名组织/GitHub公开仓库背书,长期更新稳定性依赖单一维护者。
适合的目标群体
AI绘画重度用户:Midjourney/SD玩家追求提示词工程效率,厌倦手动调试风格参数。
内容创作者与设计师:需要批量生成品牌视觉、角色设定图、产品渲染图,对一致性有高要求。
AI视频工作者:使用Sora/Kling/Runway等工具,需要专业镜头语言与关键帧提示词。
提示词工程师:研究T2I/T2V prompt结构,需要系统化、可复现的提示词生成方法论。
企业私有化部署:零依赖特性适合内网环境,标准库实现便于安全审计。
使用风险
性能风险:Claude API调用存在网络延迟(通常1-3秒),批量处理时建议开启Prompt caching;本地SD后端生成大图时显存占用高。
依赖项风险:虽声明零第三方依赖,但可选功能依赖用户本地配置的ComfyUI/SD-WebUI服务稳定性。
成本风险:Claude API按input/output token计费,复杂提示词单次润色约$0.001-0.003,高频使用需关注账单。
合规风险:safety_lint策略基于公开平台规则,私有部署或政策更新可能导致误判,关键项目建议人工复核。
供应链风险:T3来源需关注版本更新完整性,建议校验文件哈希或等待社区二次审计。