Anima

🎬 AI 语音驱动·一键生成数字人视频

基于 Fish Audio 的交互式视频生成引擎,支持动态角色表情、同步语音与文本叠加,一键生成 16:9 专业视频并直传飞书。

收藏
9.1k
安装
2.3k
版本
3.3.2
CLS 安全性认证2026-08-10
点击查看完整报告 >

使用说明

核心用法

Anima Avatar 是一个面向内容创作者与自动化工作流的交互式视频生成引擎。用户通过 JSON 脚本定义台词与情绪,系统自动完成:语音合成(Fish Audio)→ 表情精灵图智能匹配 → FFmpeg 视频合成 → 飞书原生视频直传。

典型工作流
1. 准备角色立绘与背景图,通过 Gemini AI 或简单叠加生成基础精灵

2. 运行批量生成器,基于情绪提示词自动生成 30+ 表情变体

3. 编写脚本(文本+情绪标签),执行 run.js 生成视频

4. 预览或直传飞书,视频时长、封面、播放体验均为原生级别

显著优点

  • 端到端自动化:从文本到可播放视频仅需一条命令,无需人工剪辑
  • AI 驱动的表情系统:Gemini 图像生成实现"参考图+提示词"的变体生产,表情自然且风格一致
  • 专业级输出:1920×1080 分辨率、音频口型同步、SVG 文字渲染、飞书原生流式上传
  • 模块化设计:TTS、图像生成、视频渲染、上传交付四层解耦,便于替换供应商

潜在缺点与局限性

  • sprites 缺失:安装后需自行准备角色图、背景图,并调用 Gemini API 生成全套表情素材,首次配置门槛高
  • 外部依赖重:Fish Audio(语音)、Gemini(图像)、Feishu(上传)均需独立申请 API Key,任一服务故障将导致流程中断
  • 平台锁定风险:飞书上传模块深度耦合 Lark SDK,迁移至其他 IM 需重写 send_video_pro.js
  • 生成成本不可控:Gemini 图像生成与 Fish Audio TTS 均为按需计费,批量生产时费用累积较快
  • 情绪标签有限:仅 7 种预设情绪(Happy/Angry/Shy/Think/Sad/Action/Base),复杂微表情需手动扩展 CSV 并重新生成

适合人群

  • 需要批量生成虚拟主播/数字人视频的 MCN 机构与自媒体团队
  • 希望将 AI 对话自动转化为视频内容的自动化工作流开发者
  • 已在使用飞书生态、需要富媒体消息增强的企业内部工具搭建者
  • 具备 Node.js 与 API 集成经验的技术型用户

常规风险

  • API Key 泄露.env 文件若误提交至版本控制,将导致第三方服务被盗刷
  • 内容合规:Gemini 生成的角色图像可能涉及版权或形象权争议,商业使用前需确认授权
  • 服务可用性:Fish Audio 与 Gemini 均为境外服务,存在网络延迟、配额限制或政策波动风险
  • 依赖维护sharpffmpeg 的跨平台二进制兼容性虽成熟,但极端环境(如 Alpine Linux)仍需额外配置

安全解读

Anima Avatar是一款专注于AI虚拟角色互动视频生成的专业工具,能够将文本脚本转化为带有动态表情、手势和语音的高质量视频内容。其核心架构由三大模块组成:导演引擎(director.js)负责协调语音合成、图像渲染与视频合成;批量生成器(batch_generator.js)利用Gemini API基于参考图生成多种表情变体;投递模块(send_video_pro.js)则处理视频转码并上传至飞书平台。

核心用法

用户需首先准备角色立绘(透明背景PNG)与场景背景图,通过Gemini的图生图能力融合生成基础精灵图。随后在production_plan.csv中定义所需的表情变体(如Happy、Angry、Shy等30余种),运行批量生成器即可自动产出完整精灵库。视频生成时,用户通过JSON脚本指定每句台词与对应情绪标签,系统会自动匹配精灵图、调用Fish Audio合成语音、同步时间轴,最终经FFmpeg渲染为16:9视频。支持--preview本地预览模式与--target飞书投递模式两种工作流。

显著优点

该技能的最大亮点在于端到端的自动化制片流程——从文本到成品视频无需人工介入关键帧绘制或音频剪辑。Fish Audio提供的TTS质量接近真人发声,支持情感韵律控制;Gemini的参考图生成模式能确保角色一致性,避免传统AI绘图的角色漂移问题;飞书原生投递则保证了视频时长准确识别与直接播放体验。此外,模块化的架构设计使得TTS引擎、图像生成后端均可灵活替换,具备良好的扩展性。

潜在缺点与局限性

首先,资产准备门槛较高:用户需自行准备高质量的角色立绘与背景素材,且Gemini生成过程存在API调用成本与10秒/图的速率限制。其次,外部依赖强:核心功能依赖Fish Audio、Gemini、飞书三项外部服务,任一服务故障或政策变更都会影响可用性;离线运行能力缺失。第三,安全风险需关注:代码中多处使用execSync拼接命令字符串调用curl与FFmpeg,存在命令注入隐患;路径解析未做严格白名单限制。最后,精灵库需手动维护CSV清单,批量生成后的文件管理缺乏自动化校验机制。

适合的目标群体

本产品主要面向内容创作者与营销运营团队,特别是需要在飞书生态内快速产出IP角色视频的企业号运营者;虚拟主播与VTuber从业者,可利用该工具批量生成短视频素材或直播切片;以及教育培训机构,用于制作带有人物讲解的微课视频。技术团队也可将其作为AI视频合成的参考实现进行二次开发。

使用风险说明

性能方面,视频渲染依赖FFmpeg,长脚本或高分辨率输出时可能产生显著的CPU/内存负载;依赖项方面,sharp图像处理库虽提供预编译二进制,但在部分Linux环境仍需满足系统库依赖。安全风险包括:命令注入(用户文本未完全过滤时可能触发)、API密钥泄露(.env文件需严格设置600权限)、以及数据出境(语音与图像数据需传输至Fish Audio与Google服务器)。建议生产环境部署前进行输入过滤加固,并建立API配额监控机制。

Anima 内容

assets文件夹
src文件夹
手动下载zip · 21.4 kB
manifest.jsonapplication/json
请选择文件