AI 动画流水线:一个人做一集卡通的完整流程与真实成本

AI 动画流水线:一个人做一集卡通的完整流程与真实成本

2026/08/2123 分钟
分类:技术分享
标签:#AI#AI视频#视频生成#工作流#成本

先给结论:一个人现在确实能做完一集卡通,但它绝不是“写一句提示词,等十五秒,片子就出来了”。

如果目标是一集 4 分钟、40 个有效镜头的卡通,我按当前官方 API 价目表做了一个可复算模型:在 2.5 倍重来系数下,总共要生成约 600 秒视频。省钱档的现金成本约 245 元,均衡档约 547 元,高质量无声档约 958 元;如果全程使用高价的原生有声模型,上限会接近 1822 元。这还没算人的时间。

不买套餐也能开工。ComfyUI、FLUX.1-schnell、LTX-Video/Wan2.2、Qwen3-TTS、Whisper、ACE-Step 和 DaVinci Resolve 可以拼出一条本地开源流水线,把软件与 API 现金支出压到接近零。但“免订阅”不等于“零成本”:硬件、电费、下载、排队、筛选和返工一项都不会自动消失。

首集真正要准备的,是角色、场景、道具、声音和一套能重复工作的命名规则。按工作量估算,第一集大约需要 35—70 小时。后续如果复用同一批资产,才可能压到 25—50 小时。

这里有个重要口径:这不是本机实测报告。一部分流程来自 Sanji Nai-Chien 于 2026 年 8 月 11 日发布的 原始演示视频,价格读取于 2026 年 8 月 21 日的官方页面;时间和重来系数是公开假设,目的是让你换模型、换时长后能自己重算,而不是假装有一个适用于所有人的“真实单价”。

这不是一条提示词,而是一座微型制片厂

原视频的工具不少:设计灵感网站、图像模型、Higgsfield 的 Cinema Studio、Claude Skill、声音生成、视频生成。表面上像“模型全家桶”,真正有用的却是一个很老派的制片逻辑:先建资产,再拍镜头。

电影在开拍前要选角、定妆、勘景;游戏要先做好角色模型、场景和动作库。AI 动画也一样。生成模型每次调用都是一次新的采样。你不把“主角是谁、客厅是哪一个、声音用哪条”钉死,它就会替你现场发挥。

01:45 · 原片先从艺术方向和视觉语言开始。截图来源:Sanji Nai-Chien 原视频。

原片实际演示了十个动作。把它们归并后,可以看成六个环节,但真开工时最好不要跳步:

AI 动画流水线总图
AI 动画流水线总图
  1. 收集艺术参考,先定画风、配色和世界质感。
  2. 像选演员一样挑主角,锁定发型、衣着、配饰和颜色。
  3. 做角色设定表,在同一张图里放正面、侧面、背面和关键表情。
  4. 从定稿图派生配角、道具和动物,并把满意结果存入资产库。
  5. 为反复出现的场景生成主视图和多个机位,一次性过场则不必过度建库。
  6. 为主要角色挑选声音,用同一句台词生成多版对比。
  7. 把定下来的音色存入资产库,起一个不会让未来的自己骂人的名字。
  8. 用 Claude Skill 把一句故事梳概扩展成带时码、景别、机位、动作和台词的分镜计划。
  9. 把分镜里的每个占位符显式指向角色表、场景、道具和音色。
  10. 开始生成,坏哪个镜头就修哪个,不把整场戏推倒重来。

第一到第三步是在“建工厂”;第四到第六步才是每一集的边际工作。首集慢、续集快,原因就在这里。

角色一致性的解法,不是把提示词写到两千字

很多人第一次做 AI 动画,会把角色描述越写越长:年龄、发型、衣服、鞋、眼睛颜色、脸型,一股脑塞进每个镜头。结果文字变长了,人还是会漂。

因为文字只定义了特征,没有定义“这个人”。角色设定表才是跨镜头的视觉身份证:正面、侧面、背面、全身比例、几个关键表情,最好在同一张图里解决。

角色设定表
角色设定表

02:15 · 原片展示的角色设定表:同一角色的多角度与表情被放在一起。

场景同理。一个会反复出现的客厅,不能每个镜头临时生成。先做主视图,再做朝沙发、朝窗户、俯视、贴地等机位。原片的做法很务实:只有会反复使用的地点才值得建多机位,一次性过场镜头不要把资产库修成宫殿。

道具和声音也要进资产库,而且要用人能读懂的名字:MainCharacter_SheetLivingRoom_View1TimeRemoteMainCharacter_Voice。选音色时最好用同一句台词反复生成,否则你比较的不只是声音,还混进了语气和文本差异。定下来后再上传、命名,从此它就和一张角色表一样,是可被分镜引用的资产。

资产库不是图库,而是可引用的生产资料
资产库不是图库,而是可引用的生产资料

09:15 · 原片把角色表、场景和关键道具组织成可复用资产。

这一步看起来最笨,却最值钱。它和桌面出版、非线性剪辑的历史很像:工具把“做一次”的门槛打下来了,新的瓶颈就转移到选择、整理和复用。生成更便宜,不等于管理更便宜。

当年桌面出版没有消灭编辑,只是把铅字和制版换成了屏幕上的判断;当年数字剪辑也没有消灭剪辑师,只是让“多拍一点”变得太容易。AI 动画正在重复同一个转移:原先花在画每一帧上的劳动,挪到了定义、挑选、命名和淘汰上。

每一集真正重复的,只有分镜、绑定和局部迭代

资产齐了之后,新一集可以从一句故事梗概开始。原视频把一个 cartoon-scene-builder.skill 交给 Claude,让它把“角色在沙发缝里找到一个时间遥控器”扩写成 15 秒的制作计划。Skill 里预先知道角色、场景和声音的命名,所以它交付的不是一段“很有画面感”的文字,而是一份能继续往下传的生产单。

Claude 生成的分镜计划
Claude 生成的分镜计划

10:15 · 输出里同时出现时码、景别、机位、动作、台词和资产占位符。

一份可用的分镜,不是文学描写,而是机器和人都能执行的清单:

  • 00:00—00:04:广角、平视、固定机位;角色在沙发里翻找。
  • 00:04—00:08:特写、慢推;手拿出遥控器。
  • 00:08—00:12:低机位广角;客厅切到史前世界。
  • 每句台词末尾绑定角色音色,每个具体物件用资产名占位。

然后进入最容易被忽略的一步:绑定。 上传参考图不等于模型知道每张图是什么。要明确告诉它,哪个占位符对应角色表,哪个对应客厅,哪个对应遥控器,哪一条音频是主角声音。

分镜中的资产绑定
分镜中的资产绑定

10:45 · 角色、场景、道具和音色被逐项写进同一份生产提示。

这背后其实只有一句原则:凡是你没有定义和绑定的细节,模型都会替你编。

生成阶段也别追求“一次完美”。动作错了就改动作,构图太复杂就换简单关键帧,开头或结尾的小瑕疵能剪掉就剪掉。资产已经锁住,局部重做才便宜;每次从空白页重来,等于重新交一次学费。

现金成本:最贵的不是图,而是失败的视频秒数

为了让账能复算,我先固定一集:

  • 成片 4 分钟,即 240 秒。
  • 40 个有效镜头,平均每个 6 秒。
  • 2.5 倍重来系数,即总生成量 600 秒。
  • 60 张中间图,用于角色表、场景、道具和关键帧。
  • 旁白和台词合计约 1000 个字符。
  • 汇率只为方便展示,按 1 美元 = 7.2 元计算。

Runway API 官方价目表显示,1 credit 为 0.01 美元;Gen-4 Turbo 为每秒 5 credits,Gen-4.5 为每秒 12 credits,Veo 3.1 无声为每秒 20 credits、有声为 40 credits。GPT Image 2 的 1K/2K 中等质量为每张 5 credits,高质量为 20 credits。

由此得到:

路线600 秒视频60 张图片音频约数合计人民币
省钱档:Gen-4 Turbo$30$3$1约 ¥245
均衡档:Gen-4.5$72$3$1约 ¥547
高质档:Veo 3.1 无声$120$12$1约 ¥958
有声高质档:Veo 3.1 有声$240$12$1约 ¥1822
4 分钟 AI 卡通现金成本模型
4 分钟 AI 卡通现金成本模型

声音不是大头。ElevenLabs 官方 API 价目表给出的 Eleven v3 参考价是每 1000 字符 0.10 美元,音乐约每分钟 0.15 美元,音效约每分钟 0.12 美元。哪怕留出重做空间,和视频相比仍是小数。

剪辑也不一定花软件钱。Blackmagic Design 官方页面显示,DaVinci Resolve 免费版可处理最高 60fps、Ultra HD 3840×2160 的常见 8-bit 格式;Studio 21 是可选的一次性升级,国内页面标价 2500 元。对这类 4 分钟卡通,免费版通常已经够用。

但上面的数字只是边际用量,不包含税、订阅里没用完的额度、电脑折旧、网盘、脚本工具订阅,也不包含人。更重要的是,2.5 倍并非自然常数。角色手崩、口型错、动作穿帮、参考绑定失效,都会把它推到 4 倍;资产做得好,也可能压到 1.5 倍。

同一条省钱档路线,1.5 倍重来约生成 360 秒,视频费是 18 美元;4 倍重来要生成 960 秒,视频费变成 48 美元。真正控制预算的旋钮不是套餐名,而是重来系数。

两份旧账合在一起后,钱应该怎么花

原片演示的是 Higgsfield Cinema Studio 这类一体化工作台:角色、场景、声音和生成界面都在同一处。优点是绑定和资产管理省事;缺点是订阅、每月额度和不同模型的消耗会一起变。所以它适合算“这个月能做几个镜头”,不适合直接拿来当全行业单价。

上面的主表改用 Runway API,就是为了把视频秒数、图片张数和音频字符拆开。它也让另一笔账更清楚:当前官方表中,Seedance 2.5 的 480p、720p、1080p 输出分别是每秒 20、30、68 credits;输入和参考视频还会按对应输出单价的一半计费,参考图和音频则免费,每次生成最低 80 credits。“参考越多越稳”有时候不只增加管理工作,还会直接进入账单。

真要省钱,比较务实的是混合路线:角色表、关键帧和试错尽量用低价或本地图像工具,配音和转写用本地模型,剪辑交给 DaVinci Resolve 免费版,只把真正难做的镜头交给高价视频模型。但在下结论之前,得先把“免费工具到底怎么接”说清楚。

不买套餐怎么做:三条免费替代路线

先给边界:下面的“免费”指不付软件订阅和 API 调用费,不包括你已有的电脑、电费和工时。我没有在本机上把这套组合连续跑完 4 分钟成片,所以下文的能力和硬件门槛来自官方文档,效果判断是基于各工具的控制方式做的制作分析,不是同一套提示词的横评数据。

路线 A:本地零订阅,用时间换现金

环节免费工具最小用法能得到什么,又会卡在哪里
故事与分镜Ollama + Qwen3运行 ollama run qwen3,喂给它角色、场景、道具的固定 ID,要求输出时码、景别、动作、台词和资产名可以先得到结构化制作单;节奏、笑点和连续性仍需人改,不能把首稿当定稿
角色表与关键帧ComfyUI + FLUX.1-schnell安装 ComfyUI Desktop,导入官方 FLUX 工作流;先生成角色设定表,再固定参考图、提示词骨架和种子生成场景帧FLUX.1-schnell 是 Apache 2.0 许可的 4 步快速模型,适合艺术方向、道具和关键帧;精确文字、手指和同一角色的细微面部仍可能漂
参考一致性ComfyUI 图像参考节点/IP-Adapter 类工作流每个镜头都输入同一张已定稿角色表,画面只改机位、动作和表情;不要同时更换画风、服装和镜头语言能让轮廓、配色和整体风格更接近,却不是“身份锁”;发型、配饰和五官仍要逐镜检查
镜头动画LTX-VideoWan2.2把通过检查的关键帧交给图生视频,每条只做 3—5 秒、一个主动作;先低分辨率试运动,再放大定稿镜头LTX 官方建议走 ComfyUI,并注明 macOS MPS 支持;Wan2.2 5B 可做 720p 24fps,官方命令行路线要约 24GB 显存。简单推镜、摇镜和单主体动作更容易留下;多人交互、手部特写和精确口型是高风险区
台词与旁白Qwen3-TTS用 0.6B/1.7B Base 模型导入授权的参考音频和对应文字,按句生成 WAV,同一角色始终复用同一份克隆提示官方模型支持 3 秒快速音色克隆、10 种主要语言和情绪/语速指令;长台词仍应拆句、统一音量。只能克隆本人或明确授权的声音
音乐与环境底噪ACE-Step 1.5在本地界面中先生成无人声、短结构的循环段,再在剪辑软件里裁切、淡入淡出官方项目支持 macOS、CUDA、AMD、Intel 和 CPU,基础路线可在低于 4GB 显存下本地运行;它适合做主题草案和氛围底音,不代替商用前的相似性、版权和人声检查
字幕与成片Whisper + DaVinci Resolve 免费版whisper final.wav --model turbo --language Chinese --output_format srt 生成字幕,再把镜头、WAV、SRT 导入 Resolve,完成剪辑、混音和导出Whisper 代码与权重是 MIT 许可,turbo 官方参考显存约 6GB;它能省掉字幕首轮听写,但人名、拟声词和断句还得人工校对

这套工具不要一上来就跑 4 分钟。最小闭环就是原片的思路:一个角色、一个客厅、一件道具、一段 15 秒剧情。先用 Qwen3 拆成 4 个镜头,在 ComfyUI 里做完角色表和 4 张关键帧,再用 LTX 或 Wan 逐条动起来。同时用 Qwen3-TTS 出台词,Whisper 出字幕,最后在 Resolve 里合成。只有这 15 秒里的发型、服装、道具、音色都能接上,才值得扩到 40 个镜头。

路线 B:免费云额度,只做 15 秒样片

Runway 当前官方套餐页给免费账户一次性 125 credits,官方直接换算为 25 秒 Gen-4 Turbo。这不是每月恢复的量。最合理的用法不是分摊到 4 分钟,而是把本地做好的关键帧上传,生成 3 条 5 秒镜头,把剩下的约 10 秒留给最容易穿帮的一条重做。它能让你看到付费云模型的运动效果,但不足以证明一整集的成本、一致性和成功率。

Hugging Face ZeroGPU 是另一种试错入口。官方文档显示,所有用户都可免费使用现有 ZeroGPU Spaces,登录后的免费账户每日有 5 分钟 GPU 配额、中等队列优先级。这 5 分钟是有效算力时间,不是能导出 5 分钟视频。你可以找 Wan/LTX 的官方或作者演示空间,上传一张已脱敏的关键帧试一条短镜头。队列、每日配额、演示是否在线都会变,私密角色资产也不应上传,所以它是学习场,不是制片后台。

路线 C:免费优先的混合流水线

真正适合一个人长期做的,通常不是“全本地”或“全云端”二选一。故事、角色表、场景、大多数关键帧、配音、音乐、字幕和剪辑留在本地;只把多人交互、复杂身体动作、高速运镜和必须有精确口型的镜头交给云模型。云端失败后也不从头来,而是回到已定稿的首帧、尾帧和音频继续修。

这条路线不是绝对零现金,却最容易把钱花在观众真能看到的地方。如果 40 个镜头中有 30 个是对话切换、道具特写和简单推拉,本地路线可以承担大部分试错;云额度留给剩下真正难的镜头。这比从第一秒开始就用最贵模型,更容易控制重来系数。

同一个项目,五种路线怎么选

路线现金与硬件预期效果最大问题最适合谁
Higgsfield 一体化工作台持续订阅,本地硬件压力低资产、声音和镜头管理集中,上手最快额度、模型单价和迁移成本都受平台控制先要产出,不想搭节点的创作者
Runway 全云 API按生成量付费,本地硬件压力低复杂运动和高质量镜头的上限高,易于规模化失败秒数也计费,角色和资产管理仍要自己做有预算、要稳定交付的项目
本地开源全流程软件/API 现金接近零,最吃硬件和时间关键帧、风格和数据控制强;简单短镜头可用安装、显存、速度、兼容和运动稳定性全由自己承担愿意折腾、重视隐私与可控性的人
免费云额度零或接近零现金,几乎不要本地显卡能快速判断某个模型值不值得投入一次性或每日配额、排队和隐私边界,无法支撑 4 分钟连续制作只做 15 秒概念样片的新手
免费优先的混合路线大部分环节零 API 费,难镜头少量付费本地锁资产,云端补运动上限,综合完成度最均衡需要先判断哪些镜头值得付费,流程比一体化平台多一层要连续做系列、又不想把预算交给返工的个人创作者

如果只看单个惊艳镜头,付费云模型更容易赢;如果看角色和场景能不能一直改、资产能不能继续复用,本地节点流程更可控。对一集 4 分钟的卡通,胜负往往不取决于最强模型出的那一条,而取决于第 37 个镜头坏掉时,你能不能只重做它。

商用前还有一道硬门槛:操作界面的开源许可,不会自动覆盖模型权重、LoRA、参考素材和生成内容的条款。ComfyUI 可以是免费的,装进去的某个模型却未必允许商用。每次更换权重时,都要重新看模型卡和许可,不要只看仓库首页上的“open”。

时间成本:AI 没消灭劳动,只把劳动搬了家

一集 4 分钟卡通的首集时间,可以这样估:

环节首集估算
故事、剧本、分镜计划3—6 小时
艺术方向、角色表、场景与道具资产8—14 小时
关键帧、视频生成、筛选与重做12—26 小时
配音、音乐、音效2—4 小时
剪辑、修补、字幕、导出与检查8—16 小时
命名、备份、项目整理2—4 小时
合计约 35—70 小时

最容易被宣传片藏起来的,是“筛选”。非线性剪辑让拍摄素材变便宜后,人们拍得更多,也要看更多;AI 生成让镜头变便宜后,同样会诱发更多尝试。模型供应商按生成秒数收费,失败镜头也计费。你越不愿意提前定义,平台越喜欢你在后面重来。

平台为什么现在做资产工作台,图什么?答案不只是生成效果。单个模型的差距会缩小,一旦创作者把整部剧的角色、场景、声音和分镜放进平台,迁移成本就上来了。平台既赚订阅,也赚每一次生成;创作者只有靠复用和降低重来率,才能把这套计费结构扳回一点。

谁赚、谁亏其实很清楚:连续量产的创作者和按秒计费的平台都可能获利;只做一次、又没有资产纪律的人最容易亏。最沉默的是“资产管理员”这份劳动——文件命名、版本确认、参考图清理、声音对应、坏镜头登记,没人会把它剪进炫酷演示,却决定了项目能不能做到第二集。

所以个人动画工作室最重要的能力,不是会不会写一条惊艳提示词,而是能不能维护一个干净的资产库、及时淘汰坏镜头、把满意结果固定成下一次的参考。游戏行业早在这波生成式 AI 之前,就用角色模型、场景和动作资产解决过同类问题;AI 只是把这套方法压缩到了一个人的桌面。

早在数字音频工作站普及时,录音轨道不再昂贵,创作者就可以无限叠轨,最后真正稀缺的反而是取舍。AI 动画的生成按钮就是新的“再来一轨”。便宜会鼓励更多尝试,但成片仍然需要有人说“够了,这个镜头留下”。

什么项目值得这样做

这条流水线特别适合三类项目:

  • 系列化内容:同一批角色和场景会反复出现,首集的投入能被后续集数摊薄。
  • 风格化角色:卡通、像素、纸拼贴的辨识度主要来自轮廓、配色和有限特征,比写实人脸更容易锁定。
  • 镜头切分明确的短叙事:5—15 秒一拍,局部坏了可以单独替换。

它不适合把“一次生成”当卖点的一次性短片,也不擅长高度写实的人脸连续表演和很长的连续镜头。只做一集时,建角色表和场景库可能比直接拍完还慢;准备做一季时,这些资产才开始像复利一样工作。

如果现在就开工,别先买最贵套餐。先用一个角色、一个客厅、一件道具、一个 15 秒场景做最小闭环。把角色表、场景视图、音色和命名规则跑通,再扩成 4 分钟。你要验证的不是“模型能不能偶尔出神图”,而是同一套资产能不能稳定地服务下一集

AI 确实把动画的设备门槛打下来了。但它没有取消导演、制片、剪辑和资产管理员,只是把这几个人的工作都塞给了同一个人。

这才是“一个人做一集卡通”的完整含义。


资料来源与口径

分享到:

相关文章

返回首页