先给结论:一个人现在确实能做完一集卡通,但它绝不是“写一句提示词,等十五秒,片子就出来了”。
如果目标是一集 4 分钟、40 个有效镜头的卡通,我按当前官方 API 价目表做了一个可复算模型:在 2.5 倍重来系数下,总共要生成约 600 秒视频。省钱档的现金成本约 245 元,均衡档约 547 元,高质量无声档约 958 元;如果全程使用高价的原生有声模型,上限会接近 1822 元。这还没算人的时间。
不买套餐也能开工。ComfyUI、FLUX.1-schnell、LTX-Video/Wan2.2、Qwen3-TTS、Whisper、ACE-Step 和 DaVinci Resolve 可以拼出一条本地开源流水线,把软件与 API 现金支出压到接近零。但“免订阅”不等于“零成本”:硬件、电费、下载、排队、筛选和返工一项都不会自动消失。
首集真正要准备的,是角色、场景、道具、声音和一套能重复工作的命名规则。按工作量估算,第一集大约需要 35—70 小时。后续如果复用同一批资产,才可能压到 25—50 小时。
这里有个重要口径:这不是本机实测报告。一部分流程来自 Sanji Nai-Chien 于 2026 年 8 月 11 日发布的 原始演示视频,价格读取于 2026 年 8 月 21 日的官方页面;时间和重来系数是公开假设,目的是让你换模型、换时长后能自己重算,而不是假装有一个适用于所有人的“真实单价”。
这不是一条提示词,而是一座微型制片厂
原视频的工具不少:设计灵感网站、图像模型、Higgsfield 的 Cinema Studio、Claude Skill、声音生成、视频生成。表面上像“模型全家桶”,真正有用的却是一个很老派的制片逻辑:先建资产,再拍镜头。
电影在开拍前要选角、定妆、勘景;游戏要先做好角色模型、场景和动作库。AI 动画也一样。生成模型每次调用都是一次新的采样。你不把“主角是谁、客厅是哪一个、声音用哪条”钉死,它就会替你现场发挥。
01:45 · 原片先从艺术方向和视觉语言开始。截图来源:Sanji Nai-Chien 原视频。
原片实际演示了十个动作。把它们归并后,可以看成六个环节,但真开工时最好不要跳步:

- 收集艺术参考,先定画风、配色和世界质感。
- 像选演员一样挑主角,锁定发型、衣着、配饰和颜色。
- 做角色设定表,在同一张图里放正面、侧面、背面和关键表情。
- 从定稿图派生配角、道具和动物,并把满意结果存入资产库。
- 为反复出现的场景生成主视图和多个机位,一次性过场则不必过度建库。
- 为主要角色挑选声音,用同一句台词生成多版对比。
- 把定下来的音色存入资产库,起一个不会让未来的自己骂人的名字。
- 用 Claude Skill 把一句故事梳概扩展成带时码、景别、机位、动作和台词的分镜计划。
- 把分镜里的每个占位符显式指向角色表、场景、道具和音色。
- 开始生成,坏哪个镜头就修哪个,不把整场戏推倒重来。
第一到第三步是在“建工厂”;第四到第六步才是每一集的边际工作。首集慢、续集快,原因就在这里。
角色一致性的解法,不是把提示词写到两千字
很多人第一次做 AI 动画,会把角色描述越写越长:年龄、发型、衣服、鞋、眼睛颜色、脸型,一股脑塞进每个镜头。结果文字变长了,人还是会漂。
因为文字只定义了特征,没有定义“这个人”。角色设定表才是跨镜头的视觉身份证:正面、侧面、背面、全身比例、几个关键表情,最好在同一张图里解决。

02:15 · 原片展示的角色设定表:同一角色的多角度与表情被放在一起。
场景同理。一个会反复出现的客厅,不能每个镜头临时生成。先做主视图,再做朝沙发、朝窗户、俯视、贴地等机位。原片的做法很务实:只有会反复使用的地点才值得建多机位,一次性过场镜头不要把资产库修成宫殿。
道具和声音也要进资产库,而且要用人能读懂的名字:MainCharacter_Sheet、LivingRoom_View1、TimeRemote、MainCharacter_Voice。选音色时最好用同一句台词反复生成,否则你比较的不只是声音,还混进了语气和文本差异。定下来后再上传、命名,从此它就和一张角色表一样,是可被分镜引用的资产。

09:15 · 原片把角色表、场景和关键道具组织成可复用资产。
这一步看起来最笨,却最值钱。它和桌面出版、非线性剪辑的历史很像:工具把“做一次”的门槛打下来了,新的瓶颈就转移到选择、整理和复用。生成更便宜,不等于管理更便宜。
当年桌面出版没有消灭编辑,只是把铅字和制版换成了屏幕上的判断;当年数字剪辑也没有消灭剪辑师,只是让“多拍一点”变得太容易。AI 动画正在重复同一个转移:原先花在画每一帧上的劳动,挪到了定义、挑选、命名和淘汰上。
每一集真正重复的,只有分镜、绑定和局部迭代
资产齐了之后,新一集可以从一句故事梗概开始。原视频把一个 cartoon-scene-builder.skill 交给 Claude,让它把“角色在沙发缝里找到一个时间遥控器”扩写成 15 秒的制作计划。Skill 里预先知道角色、场景和声音的命名,所以它交付的不是一段“很有画面感”的文字,而是一份能继续往下传的生产单。

10:15 · 输出里同时出现时码、景别、机位、动作、台词和资产占位符。
一份可用的分镜,不是文学描写,而是机器和人都能执行的清单:
00:00—00:04:广角、平视、固定机位;角色在沙发里翻找。00:04—00:08:特写、慢推;手拿出遥控器。00:08—00:12:低机位广角;客厅切到史前世界。- 每句台词末尾绑定角色音色,每个具体物件用资产名占位。
然后进入最容易被忽略的一步:绑定。 上传参考图不等于模型知道每张图是什么。要明确告诉它,哪个占位符对应角色表,哪个对应客厅,哪个对应遥控器,哪一条音频是主角声音。

10:45 · 角色、场景、道具和音色被逐项写进同一份生产提示。
这背后其实只有一句原则:凡是你没有定义和绑定的细节,模型都会替你编。
生成阶段也别追求“一次完美”。动作错了就改动作,构图太复杂就换简单关键帧,开头或结尾的小瑕疵能剪掉就剪掉。资产已经锁住,局部重做才便宜;每次从空白页重来,等于重新交一次学费。
现金成本:最贵的不是图,而是失败的视频秒数
为了让账能复算,我先固定一集:
- 成片 4 分钟,即 240 秒。
- 40 个有效镜头,平均每个 6 秒。
- 2.5 倍重来系数,即总生成量 600 秒。
- 60 张中间图,用于角色表、场景、道具和关键帧。
- 旁白和台词合计约 1000 个字符。
- 汇率只为方便展示,按 1 美元 = 7.2 元计算。
Runway API 官方价目表显示,1 credit 为 0.01 美元;Gen-4 Turbo 为每秒 5 credits,Gen-4.5 为每秒 12 credits,Veo 3.1 无声为每秒 20 credits、有声为 40 credits。GPT Image 2 的 1K/2K 中等质量为每张 5 credits,高质量为 20 credits。
由此得到:
| 路线 | 600 秒视频 | 60 张图片 | 音频约数 | 合计人民币 |
|---|---|---|---|---|
| 省钱档:Gen-4 Turbo | $30 | $3 | $1 | 约 ¥245 |
| 均衡档:Gen-4.5 | $72 | $3 | $1 | 约 ¥547 |
| 高质档:Veo 3.1 无声 | $120 | $12 | $1 | 约 ¥958 |
| 有声高质档:Veo 3.1 有声 | $240 | $12 | $1 | 约 ¥1822 |

声音不是大头。ElevenLabs 官方 API 价目表给出的 Eleven v3 参考价是每 1000 字符 0.10 美元,音乐约每分钟 0.15 美元,音效约每分钟 0.12 美元。哪怕留出重做空间,和视频相比仍是小数。
剪辑也不一定花软件钱。Blackmagic Design 官方页面显示,DaVinci Resolve 免费版可处理最高 60fps、Ultra HD 3840×2160 的常见 8-bit 格式;Studio 21 是可选的一次性升级,国内页面标价 2500 元。对这类 4 分钟卡通,免费版通常已经够用。
但上面的数字只是边际用量,不包含税、订阅里没用完的额度、电脑折旧、网盘、脚本工具订阅,也不包含人。更重要的是,2.5 倍并非自然常数。角色手崩、口型错、动作穿帮、参考绑定失效,都会把它推到 4 倍;资产做得好,也可能压到 1.5 倍。
同一条省钱档路线,1.5 倍重来约生成 360 秒,视频费是 18 美元;4 倍重来要生成 960 秒,视频费变成 48 美元。真正控制预算的旋钮不是套餐名,而是重来系数。
两份旧账合在一起后,钱应该怎么花
原片演示的是 Higgsfield Cinema Studio 这类一体化工作台:角色、场景、声音和生成界面都在同一处。优点是绑定和资产管理省事;缺点是订阅、每月额度和不同模型的消耗会一起变。所以它适合算“这个月能做几个镜头”,不适合直接拿来当全行业单价。
上面的主表改用 Runway API,就是为了把视频秒数、图片张数和音频字符拆开。它也让另一笔账更清楚:当前官方表中,Seedance 2.5 的 480p、720p、1080p 输出分别是每秒 20、30、68 credits;输入和参考视频还会按对应输出单价的一半计费,参考图和音频则免费,每次生成最低 80 credits。“参考越多越稳”有时候不只增加管理工作,还会直接进入账单。
真要省钱,比较务实的是混合路线:角色表、关键帧和试错尽量用低价或本地图像工具,配音和转写用本地模型,剪辑交给 DaVinci Resolve 免费版,只把真正难做的镜头交给高价视频模型。但在下结论之前,得先把“免费工具到底怎么接”说清楚。
不买套餐怎么做:三条免费替代路线
先给边界:下面的“免费”指不付软件订阅和 API 调用费,不包括你已有的电脑、电费和工时。我没有在本机上把这套组合连续跑完 4 分钟成片,所以下文的能力和硬件门槛来自官方文档,效果判断是基于各工具的控制方式做的制作分析,不是同一套提示词的横评数据。
路线 A:本地零订阅,用时间换现金
| 环节 | 免费工具 | 最小用法 | 能得到什么,又会卡在哪里 |
|---|---|---|---|
| 故事与分镜 | Ollama + Qwen3 | 运行 ollama run qwen3,喂给它角色、场景、道具的固定 ID,要求输出时码、景别、动作、台词和资产名 | 可以先得到结构化制作单;节奏、笑点和连续性仍需人改,不能把首稿当定稿 |
| 角色表与关键帧 | ComfyUI + FLUX.1-schnell | 安装 ComfyUI Desktop,导入官方 FLUX 工作流;先生成角色设定表,再固定参考图、提示词骨架和种子生成场景帧 | FLUX.1-schnell 是 Apache 2.0 许可的 4 步快速模型,适合艺术方向、道具和关键帧;精确文字、手指和同一角色的细微面部仍可能漂 |
| 参考一致性 | ComfyUI 图像参考节点/IP-Adapter 类工作流 | 每个镜头都输入同一张已定稿角色表,画面只改机位、动作和表情;不要同时更换画风、服装和镜头语言 | 能让轮廓、配色和整体风格更接近,却不是“身份锁”;发型、配饰和五官仍要逐镜检查 |
| 镜头动画 | LTX-Video 或 Wan2.2 | 把通过检查的关键帧交给图生视频,每条只做 3—5 秒、一个主动作;先低分辨率试运动,再放大定稿镜头 | LTX 官方建议走 ComfyUI,并注明 macOS MPS 支持;Wan2.2 5B 可做 720p 24fps,官方命令行路线要约 24GB 显存。简单推镜、摇镜和单主体动作更容易留下;多人交互、手部特写和精确口型是高风险区 |
| 台词与旁白 | Qwen3-TTS | 用 0.6B/1.7B Base 模型导入授权的参考音频和对应文字,按句生成 WAV,同一角色始终复用同一份克隆提示 | 官方模型支持 3 秒快速音色克隆、10 种主要语言和情绪/语速指令;长台词仍应拆句、统一音量。只能克隆本人或明确授权的声音 |
| 音乐与环境底噪 | ACE-Step 1.5 | 在本地界面中先生成无人声、短结构的循环段,再在剪辑软件里裁切、淡入淡出 | 官方项目支持 macOS、CUDA、AMD、Intel 和 CPU,基础路线可在低于 4GB 显存下本地运行;它适合做主题草案和氛围底音,不代替商用前的相似性、版权和人声检查 |
| 字幕与成片 | Whisper + DaVinci Resolve 免费版 | 用 whisper final.wav --model turbo --language Chinese --output_format srt 生成字幕,再把镜头、WAV、SRT 导入 Resolve,完成剪辑、混音和导出 | Whisper 代码与权重是 MIT 许可,turbo 官方参考显存约 6GB;它能省掉字幕首轮听写,但人名、拟声词和断句还得人工校对 |
这套工具不要一上来就跑 4 分钟。最小闭环就是原片的思路:一个角色、一个客厅、一件道具、一段 15 秒剧情。先用 Qwen3 拆成 4 个镜头,在 ComfyUI 里做完角色表和 4 张关键帧,再用 LTX 或 Wan 逐条动起来。同时用 Qwen3-TTS 出台词,Whisper 出字幕,最后在 Resolve 里合成。只有这 15 秒里的发型、服装、道具、音色都能接上,才值得扩到 40 个镜头。
路线 B:免费云额度,只做 15 秒样片
Runway 当前官方套餐页给免费账户一次性 125 credits,官方直接换算为 25 秒 Gen-4 Turbo。这不是每月恢复的量。最合理的用法不是分摊到 4 分钟,而是把本地做好的关键帧上传,生成 3 条 5 秒镜头,把剩下的约 10 秒留给最容易穿帮的一条重做。它能让你看到付费云模型的运动效果,但不足以证明一整集的成本、一致性和成功率。
Hugging Face ZeroGPU 是另一种试错入口。官方文档显示,所有用户都可免费使用现有 ZeroGPU Spaces,登录后的免费账户每日有 5 分钟 GPU 配额、中等队列优先级。这 5 分钟是有效算力时间,不是能导出 5 分钟视频。你可以找 Wan/LTX 的官方或作者演示空间,上传一张已脱敏的关键帧试一条短镜头。队列、每日配额、演示是否在线都会变,私密角色资产也不应上传,所以它是学习场,不是制片后台。
路线 C:免费优先的混合流水线
真正适合一个人长期做的,通常不是“全本地”或“全云端”二选一。故事、角色表、场景、大多数关键帧、配音、音乐、字幕和剪辑留在本地;只把多人交互、复杂身体动作、高速运镜和必须有精确口型的镜头交给云模型。云端失败后也不从头来,而是回到已定稿的首帧、尾帧和音频继续修。
这条路线不是绝对零现金,却最容易把钱花在观众真能看到的地方。如果 40 个镜头中有 30 个是对话切换、道具特写和简单推拉,本地路线可以承担大部分试错;云额度留给剩下真正难的镜头。这比从第一秒开始就用最贵模型,更容易控制重来系数。
同一个项目,五种路线怎么选
| 路线 | 现金与硬件 | 预期效果 | 最大问题 | 最适合谁 |
|---|---|---|---|---|
| Higgsfield 一体化工作台 | 持续订阅,本地硬件压力低 | 资产、声音和镜头管理集中,上手最快 | 额度、模型单价和迁移成本都受平台控制 | 先要产出,不想搭节点的创作者 |
| Runway 全云 API | 按生成量付费,本地硬件压力低 | 复杂运动和高质量镜头的上限高,易于规模化 | 失败秒数也计费,角色和资产管理仍要自己做 | 有预算、要稳定交付的项目 |
| 本地开源全流程 | 软件/API 现金接近零,最吃硬件和时间 | 关键帧、风格和数据控制强;简单短镜头可用 | 安装、显存、速度、兼容和运动稳定性全由自己承担 | 愿意折腾、重视隐私与可控性的人 |
| 免费云额度 | 零或接近零现金,几乎不要本地显卡 | 能快速判断某个模型值不值得投入 | 一次性或每日配额、排队和隐私边界,无法支撑 4 分钟连续制作 | 只做 15 秒概念样片的新手 |
| 免费优先的混合路线 | 大部分环节零 API 费,难镜头少量付费 | 本地锁资产,云端补运动上限,综合完成度最均衡 | 需要先判断哪些镜头值得付费,流程比一体化平台多一层 | 要连续做系列、又不想把预算交给返工的个人创作者 |
如果只看单个惊艳镜头,付费云模型更容易赢;如果看角色和场景能不能一直改、资产能不能继续复用,本地节点流程更可控。对一集 4 分钟的卡通,胜负往往不取决于最强模型出的那一条,而取决于第 37 个镜头坏掉时,你能不能只重做它。
商用前还有一道硬门槛:操作界面的开源许可,不会自动覆盖模型权重、LoRA、参考素材和生成内容的条款。ComfyUI 可以是免费的,装进去的某个模型却未必允许商用。每次更换权重时,都要重新看模型卡和许可,不要只看仓库首页上的“open”。
时间成本:AI 没消灭劳动,只把劳动搬了家
一集 4 分钟卡通的首集时间,可以这样估:
| 环节 | 首集估算 |
|---|---|
| 故事、剧本、分镜计划 | 3—6 小时 |
| 艺术方向、角色表、场景与道具资产 | 8—14 小时 |
| 关键帧、视频生成、筛选与重做 | 12—26 小时 |
| 配音、音乐、音效 | 2—4 小时 |
| 剪辑、修补、字幕、导出与检查 | 8—16 小时 |
| 命名、备份、项目整理 | 2—4 小时 |
| 合计 | 约 35—70 小时 |
最容易被宣传片藏起来的,是“筛选”。非线性剪辑让拍摄素材变便宜后,人们拍得更多,也要看更多;AI 生成让镜头变便宜后,同样会诱发更多尝试。模型供应商按生成秒数收费,失败镜头也计费。你越不愿意提前定义,平台越喜欢你在后面重来。
平台为什么现在做资产工作台,图什么?答案不只是生成效果。单个模型的差距会缩小,一旦创作者把整部剧的角色、场景、声音和分镜放进平台,迁移成本就上来了。平台既赚订阅,也赚每一次生成;创作者只有靠复用和降低重来率,才能把这套计费结构扳回一点。
谁赚、谁亏其实很清楚:连续量产的创作者和按秒计费的平台都可能获利;只做一次、又没有资产纪律的人最容易亏。最沉默的是“资产管理员”这份劳动——文件命名、版本确认、参考图清理、声音对应、坏镜头登记,没人会把它剪进炫酷演示,却决定了项目能不能做到第二集。
所以个人动画工作室最重要的能力,不是会不会写一条惊艳提示词,而是能不能维护一个干净的资产库、及时淘汰坏镜头、把满意结果固定成下一次的参考。游戏行业早在这波生成式 AI 之前,就用角色模型、场景和动作资产解决过同类问题;AI 只是把这套方法压缩到了一个人的桌面。
早在数字音频工作站普及时,录音轨道不再昂贵,创作者就可以无限叠轨,最后真正稀缺的反而是取舍。AI 动画的生成按钮就是新的“再来一轨”。便宜会鼓励更多尝试,但成片仍然需要有人说“够了,这个镜头留下”。
什么项目值得这样做
这条流水线特别适合三类项目:
- 系列化内容:同一批角色和场景会反复出现,首集的投入能被后续集数摊薄。
- 风格化角色:卡通、像素、纸拼贴的辨识度主要来自轮廓、配色和有限特征,比写实人脸更容易锁定。
- 镜头切分明确的短叙事:5—15 秒一拍,局部坏了可以单独替换。
它不适合把“一次生成”当卖点的一次性短片,也不擅长高度写实的人脸连续表演和很长的连续镜头。只做一集时,建角色表和场景库可能比直接拍完还慢;准备做一季时,这些资产才开始像复利一样工作。
如果现在就开工,别先买最贵套餐。先用一个角色、一个客厅、一件道具、一个 15 秒场景做最小闭环。把角色表、场景视图、音色和命名规则跑通,再扩成 4 分钟。你要验证的不是“模型能不能偶尔出神图”,而是同一套资产能不能稳定地服务下一集。
AI 确实把动画的设备门槛打下来了。但它没有取消导演、制片、剪辑和资产管理员,只是把这几个人的工作都塞给了同一个人。
这才是“一个人做一集卡通”的完整含义。
资料来源与口径
- Sanji Nai-Chien:AI Animation Pipeline: How I Make Cartoons 100% With AI,发布于 2026-08-11,时长 15:05。
- B站中文转载页,用于中文读者交叉定位原片。
- Runway API 官方价目表,读取于 2026-08-21。
- Higgsfield 官方定价页,用于核对原片所用一体化工作台的订阅与额度模式。
- ElevenLabs API 官方价目表,读取于 2026-08-21。
- DaVinci Resolve 官方中文页,读取于 2026-08-21。
- ComfyUI 官方仓库与 FLUX.1 官方工作流文档,用于核对本地安装、工作流与 FLUX.1-schnell 用法。
- FLUX.1-schnell 官方模型卡,用于核对 Apache 2.0 许可。
- LTX-Video 官方仓库与 Wan2.2 官方仓库,用于核对图生视频、ComfyUI/MPS 支持以及 5B 模型硬件参考。
- Qwen3-TTS 官方仓库,用于核对音色克隆、语言与指令控制。
- OpenAI Whisper 官方仓库,用于核对 turbo 模型、参考显存和 MIT 许可。
- ACE-Step 1.5 官方仓库,用于核对本地音乐生成、平台支持与许可边界。
- Runway 官方套餐页与 Hugging Face ZeroGPU 官方文档,用于核对免费额度的当前边界。
- 成本模型假设:4 分钟、40 个有效镜头、平均 6 秒、2.5 倍重来、60 张中间图、约 1000 字符音频、1 美元按 7.2 元换算。时间范围为制作计划估算,不是本机实测。
