Black Forest Labs借助多模态视频模型拓展到图像之外
Black Forest Labs推出了Flux 3,这是一款多模态基础模型。公司表示,它会同时从图像、视频和音频中学习,并且能够首次生成带原生声音的视频片段。这一发布对这家德国AI公司来说是一个值得注意的进展,因为它正将这个新系统定位为更大范围努力的一部分,即打造更能体现现实世界事件如何展开的模型。
根据公司的描述,Flux 3可以生成最长20秒、带同步音频的视频,并支持多种生成模式,包括文生视频、图生视频和视频转视频。它还包含基于关键帧的转场、多语言对话,以及将单个片段连接成更长的多镜头序列的工具。
这一功能组合使Flux 3处于AI市场中一个拥挤且快速变化的领域。模型厂商正竞相提升视觉连贯性、物理真实性和场景连续性。原生音频的加入尤其重要,因为许多视频系统仍然依赖独立流程来生成配乐、做声音设计或进行语音合成。如果质量在实际使用中能够站得住脚,那么一款能够一次性生成动态图像和声音的模型,可能会简化制作流程。
为什么Black Forest Labs强调多模态训练
公司将Flux 3定位为不只是一个视频生成器。它的观点是,图像、视频和音频各自捕捉了现实的不同部分,而在训练过程中将它们结合起来,可以帮助模型构建更丰富的事件表征。图像提供空间细节,视频加入时间变化,音频则能捕捉单帧中看不到的因果线索。
这种逻辑与行业内更广泛的趋势一致,即走向所谓的world models,也就是让系统跨越多种感官信息进行推理,而不是将每种媒介孤立处理。按照Black Forest Labs的表述,多模态训练是迈向其所谓“真实世界视觉智能”的一步,也就是能够在物理和数字环境中进行感知、预测和行动的模型。
在实际层面,公司表示Flux 3在人物面部表情以及将声音与可见物理事件相匹配方面尤其强。这两者在生成式视频中都很难。人脸往往很快暴露出伪影,而音画不同步即使只差一点点,也会破坏沉浸感。如果这些说法在内部测试之外也成立,那么它们将解决当前AI视频工具中最明显的两个短板。

基准测试的说法带有一个重要保留
Black Forest Labs还分享了针对720p、10秒片段的早期对比结果。在这些由公司发布的评估中,Flux 3在93%的对比中优于Luma Ray 3.2,优于Runway Gen-4.5的比例为77%,优于Grok Imagine Video的比例为69%。面对更强的竞争者时,优势要小得多:对Kling v3 Pro为60%,对Happy Horse v1为59%,对Happy Horse 1.1为57%,对Seedance 2.0和Gemini Omni Flash均为52%。
这些数字足以让此次发布值得关注,但不足以就竞争格局下定论。原始材料明确指出,这些结果是初步的,而且在发表时没有独立测试可用。这一点很重要,因为内部偏好研究虽然可以作为有用指标,但与第三方基准测试或更广泛的生产环境用户验证相比,可信度并不相同。
因此,这次发布应被视为一次严肃的产品动作,而不是Flux 3已经全面超越行业的最终证据。现有信息更有力地支持的说法是:Black Forest Labs带着一款在公司报告测试中看起来具有竞争力、并因集成音频生成而与众不同的系统,进入了顶级视频模型的讨论。
不只是媒体生成: 还有机器人方向
除了Flux 3,Black Forest Labs还推出了Flux-mimic,被描述为面向机器人应用的视频动作模型。公司表示,这套系统已经在Audi接受测试。这个细节扩大了此次发布的战略意义。
近期公众对生成式AI的很多关注集中在创意工具、娱乐和广告工作流上。通过将媒体生成模型与面向机器人的动作模型配对,Black Forest Labs表明,它认为多模态系统不仅对内容创作有用,也适用于具身或工业场景,因为在这些场景里,视觉理解和动作预测很重要。

这两个产品之间的联系既是概念上的,也是商业上的。一个被训练来关联运动、外观和声音的模型,可能比只用静态图像训练的模型更适合理解物理过程。它是否能转化为稳健的机器人表现还有待观察,但公司的表述显示,它希望在一个感知与控制开始重叠的类别中竞争。
这次发布现在改变了什么
对于创作者和开发者来说,最直接的影响是选择更多了。最长20秒的原生音频视频生成、多语言对话支持和片段串联,都指向更适合短篇叙事、原型制作,甚至广告制作的工作流。一个模型能吸收的步骤越多,在视频生成、配音、音效和剪辑工具之间就越少需要手工衔接。
对于市场来说,这一发布给竞争对手带来更大压力,要求他们提升多模态整合,而不是把音频当成事后补充。它也强化了这样一个观点:AI视频的下一轮竞争前沿,不只是更好看的画面,而是能够在运动、节奏、语音和物理事件之间保持一致性的系统。
与此同时,仍需谨慎。现有证据还不足以说明Flux 3在独立评估中的表现、它对不同提示词的泛化能力,或者在更长、更复杂场景中音频质量是否稳定。这些问题将决定它是成为行业中一个持久的竞争者,还是又一个短暂的基准测试头条。
更大的图景
即便有这些保留,Flux 3依然突出,因为它反映了市场正在前进的方向。视频生成不再只是把文字拼成无声片段。更雄心勃勃的目标,是一种足够连贯的多模态合成,能够支持叙事、交互,并最终支持对物理世界的推理。
Black Forest Labs认为,前进路径在于对图像、视频和音频进行联合训练。借助Flux 3,它把这一观点落实到了一款在当下具有实际功能、同时研究目标又超越媒体本身的产品上。结果还不是一场经过验证的、超越整个领域的飞跃,但它确实是在AI最具竞争力的赛道之一中的一次重要发布。
本文基于The Decoder的报道。阅读原文。
Originally published on the-decoder.com







