返回行业情报

FLUX 3多模态模型登陆ComfyUI

FLUX 3 is now available via Partner Nodes

Black Forest Labs推出统一多模态模型FLUX 3,视频、音频、图像和动作预测联合训练于单一架构。当前支持20秒视频生成,原生音频输出,风格涵盖超写实到动画,支持文生视频、图生视频、视频续写、多场景及多语言对话。开源权重即将发布。

深度解读

FLUX 3以单一统一多模态架构杀入ComfyUI,彻底推翻了视频生成领域“各模态独立训练、推理时拼接”的既有路线,原生音频与20秒连续片段只是表象,真正的颠覆在于其“世界理解”能力被压缩进了一个模型。

Black Forest Labs这次拿出的不是又一个视频生成器,而是一个能同时处理视频、音频、图像和动作预测的通用世界模型。训练策略是核心变革:四个模态不再各自为政,而是在同一个架构里联合训练,让每个模态都成为其他模态的“老师”。这意味着模型对物理规律、声音来源、物体运动逻辑的学习是交织进行的,而非事后缝合。所以,生成的视频里,声音不是后期配上去的,而是与画面同时涌现——脚步踩在木地板上的吱呀声,和木地板的视觉纹理、人物踩踏的动作,在模型内部共享同一套关于“木地板”的知识表征。

20秒单次生成是技术上的一记重拳。此前主流视频模型(如Sora、Runway Gen-3)的单次生成时长普遍卡在5-10秒,超过这个长度,要么画面崩坏,要么语义断裂。FLUX 3直接把天花板抬到20秒,且这20秒内可以容纳多个场景和机位——这已经不是“生成一个镜头”,而是“生成一个完整的叙事段落”。对从业者而言,这意味着分镜脚本的编写逻辑将被改写:此前需要为每个镜头单独生成再剪辑拼接,现在可以一次性输出一个包含起承转合的长镜头序列,剪辑台上的“硬切”可能变成模型内部的“场景切换”。

风格多样性的碾压是FLUX 3对现有视频模型最致命的打击。当前所有头部视频模型都陷入“电影感”的同质化泥潭——无论你提示词里写“赛博朋克”还是“水墨动画”,出来都是同样的胶片颗粒、浅景深和好莱坞调色。FLUX 3从训练层面打破了这种审美垄断,因为它学习的不是“视频长什么样”,而是“世界在各种风格下看起来是什么样”。超写实、动画、电影感不再是模型内部的离散选项,而是同一个世界模型在不同采样条件下的连续光谱。这意味着商业广告、独立动画、游戏过场动画的制作门槛将进一步崩塌——你不需要为每种风格训练或微调专属模型,一个FLUX 3就能全包。

多语言对话和唇形同步被单独列为卖点,这暴露了Black Forest Labs的野心——他们瞄准的是全球化的叙事内容生产。目前视频模型的语音生成普遍是“英语中心主义”,换到其他语言,口型对不上、发音带着英语腔。FLUX 3声称能精准处理跨语言和口音的语音,且唇形同步“hold得住”。如果属实,这直接威胁到配音行业和字幕组的生存逻辑:未来一部日本动漫的英文版,可能不需要找英语声优重新配音,而是直接用FLUX 3对原始画面做“语音替换+唇形重绘”。更进一步,视频里的文字排版(Text and typography)——比如路牌、海报、书名——能自然嵌入场景而非后期贴图,这解决了AI视频最让人出戏的“文字乱码”问题,让广告TVC和产品演示视频的真实感跃升一个量级。

Agentic chaining是ComfyUI用户最该关注的杀手级特性。FLUX 3允许在ComfyUI里把多个生成片段链式串联,模型会继承前一片段的动量、构图和场景逻辑,生成一个连贯的长故事。这本质上把ComfyUI从“节点式图像生成工具”升级成了“程序化叙事引擎”——你不再需要手动控制每个镜头的一致性,而是设定一个“故事向量”,让模型自己推演后续发展。这对独立电影制作人、游戏过场动画设计师和短视频MCN机构是巨大利好,但对传统动画师和剪辑师而言,意味着“中间帧”和“转场设计”这两个工种的价值被进一步压缩

从产业格局看,FLUX 3的发布时机极其敏感。OpenAI的Sora至今未全面开放,Runway在烧钱换增长,而Black Forest Labs选择以开源权重(open weights)为诱饵,通过ComfyUI的开发者生态快速铺量。“Open weights are coming soon”这句话的杀伤力远超视频本身——它意味着社区可以自行微调、蒸馏、部署到私有服务器,这直接动摇了闭源API按量计费的商业模式。可以预见,接下来的半年内,基于FLUX 3微调的垂直领域视频模型(比如“动漫风格专用版”、“产品展示专用版”、“纪录片专用版”)会像雨后春笋般出现,而ComfyUI的节点市场将成为这些模型的集散地。

对普通创作者来说,最直接的变化是工作流范式的转移。以往“文生视频”是碰运气——写个提示词,抽卡,不行就换。FLUX 3的图像到视频(支持首帧、尾帧、关键帧序列)和视频续写能力,让创作者可以像导演一样精确控制——你先用Midjourney或FLUX生成一张满意的关键帧,然后让FLUX 3“动起来”;或者你先拍一段实拍素材,让FLUX 3延续它的风格和运动逻辑做成动画。这种“从控制到生成”的转变,会让AI视频从“玩具”真正变成“生产力工具”。

但必须泼一盆冷水:联合训练的多模态模型在学术上虽然优雅,但在工程上对算力的需求极其恐怖。Black Forest Labs敢在2026年8月推出,说明他们找到了某种训练效率的突破口,但推理成本依然是悬在头上的达摩克利斯之剑——20秒的1080p视频+同步音频,单次生成的算力消耗可能是现有视频模型的3-5倍。ComfyUI的用户大多依赖本地GPU,这意味着一张RTX 4090可能只能勉强跑个低分辨率版本,高端显卡的军备竞赛将进一步加剧。云服务商(如Comfy Cloud)会成为主要受益者,但订阅价格注定不会亲民。

最后,FLUX 3的“动作预测”(action-prediction)模态被藏在新闻稿的角落里,但这可能是最具想象力的功能。如果模型能预测“接下来会发生什么动作”,那么它不仅是生成器,更是世界模拟器——可以用于机器人训练、自动驾驶场景生成、甚至游戏NPC的行为建模。Black Forest Labs没有展开讲这个能力,但明眼人都知道,这是他们为下一阶段埋下的伏笔。当视频生成模型开始理解“行动”而非仅仅“像素”时,AI从“内容工具”到“物理引擎”的跨越就真正开始了。

一个能同时理解画面、声音、文字和动作的模型,不再是对某个媒介的模仿,而是对世界本身的重建。

对于ComfyUI用户,现在的行动指南很明确:更新到最新版本,下载那三个官方工作流(I2V、T2V、Storyboard),先跑通一个20秒的多场景片段,感受一下“一体生成”和“拼接生成”的体验代差。然后,思考你的业务链条里,哪些环节可以被这种“长叙事、多模态、风格自由”的能力重构——是广告提案的预演?是短视频的批量生产?还是交互式叙事的原型验证?FLUX 3不是终点,它是“通用世界模型”时代的发令枪,而ComfyUI恰好站在了赛道最前排。

AI前沿FLUX3多模态视频生成