Pixar校友用AI训练模型学习个人画风
Dear Upstairs Neighbors: How Connie He Taught a Machine to See the Way She Draws.
Pixar校友Connie He将疫情期失眠经历转化为六分钟动画短片《Dear Upstairs Neighbors》,与Google DeepMind团队合作,用12张概念图微调Veo和Imagen模型,让AI学会自己的绘画风格。影片入围Sundance、Tribeca和SIGGRAPH,探索了艺术家与机器学习研究者协作的可能性。
深度解读
康妮·何(Connie He)用一部六分钟的短片证明,生成式AI在动画中的真正价值不是替代创作者,而是成为一面能反射创作者自身审美的镜子——前提是你愿意花力气去打磨这面镜子,而不是把它当成即插即用的按钮。
一个失眠故事如何变成AI电影的实验样本
《Dear Upstairs Neighbors》的主角Ada是一个被楼上邻居噪音折磨到无法入睡的女人,失眠催生出越来越疯狂、越来越美丽的幻觉,攻击她疲惫的大脑。这部短片2026年1月在圣丹斯预映,6月在翠贝卡电影节完成全球首映,7月又去了SIGGRAPH。但它的起点和所有这些光鲜的展映无关。
康妮在疫情期间经历了真实的失眠。某个周末她走进一家咖啡馆,把情绪写在纸上,画出了这个故事的分镜,完成了大约80%。然后她把它搁置了很久。直到她和几位皮克斯老同事开始讨论机器学习对艺术家意味着什么——他们既好奇又警惕,决定用一个故事来测试这套流程。康妮手上正好有一个几乎完成的故事,它就成了实验床。
这不是一个导演在追逐趋势,也不是一个工具从虚无中发明了一部电影。
这个起源故事同时驳斥了两种关于AI与动画的廉价叙事。康妮不是看到AI热潮才动手的人,Veo和Imagen也不是凭空生成了一部短片。真实情况是:一个人有非表达不可的情绪,而她恰好站在一种新型画笔出现的时间点上。
卧室里的真实物件,比任何模型微调都更早决定了影片的质感
Ada的卧室充满了书籍和各类小物件,每一件似乎都在讲述自己的故事。康妮告诉美术指导、同样出身皮克斯的辛颖宗(Yingzong Xin):把你自己的卧室、你自己的家放进去。房间里的大量物件就是辛颖宗家里真实存在的东西——书架上的书、客厅里的小细节。
这个决定发生在任何生成式工具接触这部影片之前。康妮和辛颖宗用最传统的方式——参考资料、审美判断、一个真实公寓里顽固的生活纹理——建立了一种真实的情感印记。这是整部影片美术哲学的根基,而它和AI毫无关系。
愤怒的表达同样来自生活。康妮从小看着父亲创作抽象艺术长大,她想验证这种艺术形式能否承载一个故事。她想到了杰克逊·波洛克(Jackson Pollock)——在她看来,波洛克的绘画是表达愤怒等强烈情绪的最佳代表。于是她把大量极度抽象的绘画带入情绪板。她坦言自己当时并不清楚如何将这些视觉化,但她知道那就是她想要的感觉。
十二张概念图,几百张分层图像,模型学会了没人教过它的规则
这部影片最值得注意的地方在于:工具被当作一件需要调音的乐器,而不是一个需要按下的按钮。
康妮和她的团队加入了Google DeepMind的研究员和工程师团队,基于康妮和辛颖宗自己的概念艺术,开发了Veo和Imagen模型的定制版本。执行制片人包括Doug Eck、Glenn Entis和David Salesin。起始素材很少——康妮说他们大约微调了12张概念艺术图,拆解成不同图层后,总共也就几百张不同的图像。
然后发生了那个让康妮至今说起来仍然惊叹的时刻。模型自己学会了一种低角度的两点透视(two-point perspective),团队在概念图中一直使用这个视角,但从未把它标记为一条规则。模型还学会了团队画的锯齿状地面接触线(zigzag ground-contact lines)——每当物体接触地面时他们就会画这种线,但没人告诉过模型这些线重要。
“我们当时就想,天哪,它捕捉到了所有那些我们自己都没意识到的模式。那是一个顿悟的时刻。我们想,好吧,我觉得我们想做的事情实际上是可能的。”
在镜头制作层面,团队构建了康妮称之为局部精修(localized refinement)的工具:可以编辑画面的特定区域,控制力度可调,而不是每次需要修改就重新生成整个镜头。当被问及这是否改变了她与镜头的关系时,她的回答几乎平淡得令人意外——如果你已经熟悉CG管线的话。
艺术家和研究员说同一种语言,这件事比任何技术突破都难
康妮没有假装艺术家和机器学习研究员之间的鸿沟不存在。她说得很直接:让动画师和研究员彼此理解,本身就是一项艰巨的工作。这不是一个“技术问题解决后一切自然顺畅”的故事,而是一个两种完全不同的思维方式被迫在同一张桌子上工作的故事。
Google对这一切持开放态度,并发布了自己的制作记录。但康妮讲述的是她自己的版本,一个她至今仍不确定答案的版本。她不确定生成式工具在动画制作中应该扮演什么角色,不确定这次实验的哪些部分可以复制,哪些部分只是特定条件下的产物。
这种不确定性本身才是最有价值的信息。在一个所有人都急于宣称AI将颠覆动画行业或AI对动画毫无用处的舆论环境里,一个真正用过这些工具、并且用出了成果的导演说“我还不确定”,这比任何一方的断言都更接近真相。
对从业者来说,这意味着什么
如果你是一个动画导演或美术指导,这部短片传递的核心信息不是“去学AI”,而是“你的审美判断比以往任何时候都更重要”。康妮和辛颖宗先用手绘概念图建立了完整的视觉语言——透视规则、笔触质感、地面接触线的处理方式——然后才让模型去学习这套语言。模型之所以能“自己发现”那些规则,恰恰是因为团队先有了足够一致、足够鲜明的视觉输出。
如果你是一个技术研究者,这部短片暗示的是:微调(fine-tuning)的质量取决于输入素材的审美密度,而不是数据量。12张概念图、几百张分层图像,这个规模小得令人惊讶。但每一张都承载了明确的创作意图和一致的视觉决策。模型学到的是风格,不是噪声。
如果你是一个在观望的从业者,康妮的路径提供了一个可操作的参照:先有非做不可的表达,再去找工具。不是反过来。
