黑森林实验室发布FLUX 3:一个模型搞定视频、音频和机器人
多模态AI从拼接走向统一

生成式AI领域又迎来一个重量级选手。
7月23日,黑森林实验室正式发布FLUX 3多模态基础模型。这可不是FLUX系列的简单升级——它是这套模型家族第一次从纯图像生成,跨进了视频、音频和机器人动作预测的统一世界。
FLUX 3最核心的突破在于它的架构。它不再像过去那样为图像、视频、音频分别训练不同的模型再拼到一起,而是基于自研的Self-Flow架构,在同一套参数空间里同时学习三大模态。说白了,模型同时看图像学结构、看视频学运动、听音频学声音的因果关联——这些信息在训练过程中互相约束,最终生成出来的内容不会出现「物体撞了却没声音」这种违和感。
能力方面,FLUX 3可以单次生成最长20秒的720p视频,并且自带原生音频——对话、音效、背景音乐全部统一生成,不需要后期合成。它还支持文生视频、图生视频、视频续写、关键帧转视频和多镜头串联。在10秒有声视频的人工评测里,FLUX 3对比Grok Imagine Video胜率69%,对比Seedance 2.0胜率52%,对比Gemini Omni Flash胜率同样达到52%。多模态能力已不输甚至领先于当前主流的视频生成产品。
但比视频能力更值得关注的是机器人方向。黑森林实验室与Mimic Robotics合作推出了FLUX-mimic,把FLUX 3的视频预测能力延伸到物理世界——模型不仅能预测视频中下一帧的画面,还能预测一个机械动作的物理结果。目前在奥迪工厂的测试中,机器人只需30分钟的真实操作数据就能学会一项新的精密操控任务,而传统方法需要30小时以上。这60倍的效率差距,意味着具身智能的训练成本可能被大幅拉低。
图像方面,FLUX 3延续了FLUX家族的强项——支持多种风格、宽高比和分辨率的生成与编辑。从FLUX.1到FLUX.2再到今天的FLUX 3,这条迭代路线从一个纯粹的图像生成工具,一步一步变成了能理解图像、视频、声音和物理运动的多模态引擎。
从商业角度看,黑森林实验室目前的估值已达32.5亿美元,投资者包括Andreessen Horowitz等顶级风投。FLUX 3的Dev版本后续会开源——这对整个开源AI社区来说是个不小的礼物。
多模态AI正在从「分别训练再拼凑」走向「一个模型理解整个世界」——FLUX 3是这个方向目前走得最远的产品之一。