3 天做完 18 个镜头:Higgsfield 动画团队怎样把 AI 放进传统动画流程

一支传统动画出身的团队,用 Blender 预演、Claude 写提示词、AI 生成视频,做出一段汽车追逐戏。他们把分镜分路、资产优先、五段式视频提示词和三次翻车都摊开讲了。

Higgsfield 有一支动画团队,成员全是做传统动画出身,加入公司之前没碰过 AI。他们正在做一部 5 分钟的动作喜剧短片《Passport Rush》:女孩赶到机场,才发现护照落在了城市另一头,只好跳上一辆出租车往回冲,路上的一切都开始跟她作对。

其中汽车追逐这一段有 18 个镜头,团队用了 3 天做完。他们开了一个新 YouTube 频道 Higgsfield Animation,第一期用 28 分钟把这一段从分镜到成片的做法摊开讲了一遍,包括踩过的坑、写提示词的固定结构,还有一个到现在都没做出来的镜头。

先看做出来的样子:

《Passport Rush》汽车追逐段成片节选,约 45 秒。点击播放。

这支团队的整体思路可以用主持人 Amina 的一句话概括:他们想把 AI 放进动画流程,但不丢掉手艺。下面按他们实际的制作顺序讲:先分镜,再做资产,然后测试,接着写视频提示词,复杂镜头先进 Blender,最后是三次翻车和各自的解法。

画分镜时就决定:哪些镜头自己动手做,哪些交给模型

前期和传统动画一样,从点子、剧本、分镜开始。这一段他们想试的是:在动作戏里,3D 预演和 AI 能怎样配合。所谓预演(previs),就是正式制作前,用很简单的三维模型把动作和机位先走一遍,类似实拍前的走位排练。

区别在于,他们在分镜阶段就给每个镜头分好了路线。分镜格子上标了橙色的,走 Blender 预演;留空的,直接用文字生成视频。

分镜格子上的橙色标记,旁边是 Blender 图标
分镜上的橙色圆点表示这个镜头要先进 Blender 做预演。

分的标准很朴素:动作很具体、机位很讲究,或者用文字跟模型解释要花很久的镜头,进 Blender;动作简单的镜头,直接生成。换句话说,如果自己动手做一遍比用文字讲清楚更快,就自己做。他们是视觉艺术家,有些东西画出来、动起来,比写一大段话描述要省事得多。

视频画面:two routes,复杂动作和机位走 Blender 预演,简单动作直接生成
两条路线:复杂动作和机位走 Blender 预演,简单动作直接生成。

另一个态度也值得一提:分镜只是参考,不是定死的。视频生成本身就难以预测,所以他们只锁住故事节点和主要场景,没有把每个镜头都规划到底,给意外留了空间,边做边调。

团队分工基本照搬传统动画管线,只是人少,每个人身兼数职。有一点比较特别:他们没有专职的提示词工程师。做角色的人写角色的提示词,做场景的人写场景的提示词,做动画的人写镜头的提示词,谁负责哪部分,谁就写那部分。

资产优先:参考图糊弄,整部片就糊弄

整条管线建立在一条规则上,他们叫它「资产优先」(asset-first approach):图像输入的质量,决定整部片的质量。图像输入模糊、潦草、前后不一致,最后的片子也会潦草。

这里的「图像输入」,指的是角色设定图、道具设定图、场景背景这些图。生成视频的时候,它们会作为参考图挂进去,告诉模型每样东西长什么样。为此他们专门设了一个「资产管理员」(asset manager)的角色,负责让角色、道具、背景看起来属于同一部片、同一个世界。这份工作相当于传统管线里的美术指导。

这部片的美术方向是:风格化的 3D 角色,配水彩背景。在传统管线里,让这两种质感和谐地放在一起本来就不容易,这也成了这个项目最大的挑战。

分镜、出租车司机角色设定图、水彩高速公路场景图和女主角全身设定图
这一段用到的资产:分镜、出租车司机设定图、水彩高速公路场景、女主角设定图。

角色:AI 出底稿,人来挑、来改

他们的项目周期通常很紧,有时只有一个月,所以角色设计是先用提示词生成几版初稿,再手工修改,以此节省时间。具体流程是这样的:

  1. 写一句短需求,交给 Claude 扩写成完整的角色设定图提示词,里面写清外貌、服装、姿势,还有构图和打光。他们平时用 Claude,主持人也说其他 AI 聊天工具都可以。短需求到底有多短?视频里给司机写的是这样一句:

    Write a prompt for this character: an elderly heavyset man, short, round kind face… big fluffy grey mustache, round glasses in a thin gold frame… Outfit: burgundy short-sleeve polo, light blue jeans, brown leather sandals.

    也就是「给这个角色写一段提示词」,后面跟一段外形、一段服装。女主角的需求也是同样两段:红色长直发、翘起一撮呆毛、大眼睛向上看;宽大的浅蓝拉链卫衣、胸前红色字母贴、米色百褶短裙、脖子上挂白色耳机。构图、打光、背景这些都交给 Claude 补全。

  2. 生成之前自己再过一遍,核对细节和设计是否一致,不对就改。这些选择直接影响出图结果,所以要把想要什么说清楚。

  3. 在 Higgsfield 的 Cinema Studio 里,模型选自家的图像模型 Soul 2.0,贴上提示词,设好画面比例,一次出 4 张。

  4. 挑图,并把几张里好的元素拼起来。

女主角的挑选过程很能说明问题。第一张好看,但有点太傻气,他们想要好笑,同时还得酷一点;第二张可爱,但太写实,他们要的是更夸张的五官和比例;第三张最接近,橙红头发在水彩背景前特别跳,可比例还要调,而且穿得太正式了,Amina 说自己去机场一般穿运动裤和最舒服的衣服。最终版把第一张的卫衣和运动鞋拿了回来,又加了一条短裙改善轮廓。

然后是手工修改,Amina 说这是「最好玩的部分」:

Photoshop 中的女主角设定图,旁边有手写批注
在 Photoshop 里调整女主角设定图:提亮配色,在轮廓周围加手绘笔触。